Vision Banana 是云端多模态模型,不提供本地安装包,仅支持通过 Google AI Studio、Gemini API(Vertex AI)或 StyleAi.art 调用;无开源权重、ONNX 版本或本地推理方案。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

Vision Banana 不提供传统意义上的“本地安装包”,它是一个云端托管的多模态基础模型,无法像 Stable Diffusion 那样下载权重文件后本地运行。它的部署方式本质是接入 API 服务,而非安装软件。
官方推荐接入路径
Google DeepMind 明确将 Vision Banana 定位为统一视觉接口,所有能力(生成、分割、深度估计、边缘检测、结构解析等)均通过同一套 API 调用,无需切换模型或加载不同任务头。
-
首选渠道:Google AI Studio —— 访问 https://www.php.cn/link/e3cbb2b5450e080ca960e2958f20e0ee,登录 Google 账号,选择模型
vision-banana-preview(2026年4月实测可用),直接在网页界面输入提示词或上传图像进行交互; -
开发者首选:Gemini API(Vertex AI) —— 在 Google Cloud 控制台启用 Vertex AI API,创建 API Key 或使用服务账号密钥,调用
gemini-3.1-flash-image-preview模型(Vision Banana 的底层服务 ID),支持文本+图像多模态输入; - 国内用户友好入口:StyleAi.art —— 无需代理,已集成 Vision Banana 推理后端,支持中文提示、结构化指令(如“输出爆炸图”“标出 PCB 主要模块”),适合快速验证效果。
不支持的部署方式
目前没有官方发布的 Vision Banana 开源权重、ONNX 导出版本或 Hugging Face 模型卡。社区也未出现可信的量化版或 llama.cpp 兼容分支。所谓“本地部署 Vision Banana”的教程均属误传,实际运行的是 Nano Banana Pro 或旧版 Imagen 模型。
- 无法通过
ollama pull或git lfs clone获取 Vision Banana 模型文件; - 不存在适用于消费级显卡(如 RTX 4090)的 FP16/INT4 本地推理方案;
- Banana Vision Studio 是另一款面向工业结构可视化的轻量工具,与 Vision Banana 无代码级关联,不可混为一谈。
调用示例(Python)
使用 Google GenAI SDK,一行提示即可触发理解+生成联合能力:
<!-- 示例:让 Vision Banana 同时完成分割与标注 -->from google import genai
client = genai.Client(api_key="YOUR_API_KEY")
<p>response = client.models.generate_content(
model="gemini-3.1-flash-image-preview",
contents=[
"请对这张图执行语义分割,并用不同颜色框出所有可移动部件,同时在图旁以文字列出每个部件名称和功能。",
PIL.Image.open("machine_part.jpg")
]
)
print(response.images[0]) # 返回带分割掩码的图像
print(response.text) # 返回结构化部件说明关键注意事项
- Vision Banana 默认启用零样本推理,无需微调数据或准备标注集;
- 输入提示词建议采用“动词+对象+约束条件”结构(如“分离手机主板上的射频模块,保持焊点可见,输出正视图”),比纯描述性语言更稳定;
- 当前仅支持单图输入+单图输出,暂不开放批量处理或视频帧序列理解;
- 价格按请求计费(非按 token),典型图文理解+生成请求约 $0.0672/次,与 Nano Banana 2 一致。


















