Google 把 2026 年 10 月 6 日做成两项互补的人工智能发布。一边是图像模型 Nano Banana 2.1 开始进入公司产品;另一边是 EmbeddingGemma 2,一个采用 Apache 2.0 许可的轻量多模态嵌入模型,面向设备本地搜索。
Nano Banana 2.1 改了什么
Google 在官方账号中把 Nano Banana 2.1 描述为最新图像生成与编辑模型,在视觉设计、掩膜编辑和主体一致性上有提升。公司表示,当天开始向 Gemini 应用、搜索中的 AI Mode、Google AI Studio、Flow、Stitch、Google Ads 和 Gemini Enterprise Platform 推送。
DeepMind 的模型卡把 Nano Banana 2.1 列入 Gemini 3 系列,并写明它基于 Gemini 3.6 Flash。卡片列出文本与图像输入、最多 100 万 token 上下文,图像输出最多 4000 token,文本输出最多 6.4 万 token。
在 2026 年 10 月的内部评测中,带推理的版本在文生图总体偏好上得分 1050,高于 Nano Banana 2(Gemini 3.1 Flash Image)的 990 和 Nano Banana Pro 的 935。在掩膜或涂鸦编辑上,同一模式为 1049,高于表中前代的 965 和 927。Google 也列出局限:小字仍可能模糊,角色一致性并不完美,空间定位偶尔会出错。
另一项:EmbeddingGemma 2
Google 在另一条帖子中确认,EmbeddingGemma 2 已可在 Hugging Face 和 Kaggle 下载,Gemini Enterprise Agent Platform Model Garden 即将上线。DeepMind 研究工程师 Sahil Dua 与 Henrique Schechter Vera 在博客中称其为公司目前最强的端侧多模态嵌入模型。
EmbeddingGemma 2 有 7.4 亿参数,架构与 Gemma 4 相关,把文本、代码、图像、音频和视频映射到同一空间。Google 表示,上一代纯文本模型下载超过 2000 万次。新版上下文扩到 8000 token,为原版的四倍,公司称足够覆盖最多 5.5 分钟音频、29 张图像或 58 帧视频。
设计是模块化的:约 2.7 亿参数可处理文本,视觉编码器约 1.7 亿,音频编码器约 3 亿。借助 Matryoshka,768 维向量可截断到 128 维,Google 称存储可降至约六分之一。在 Pixel 11 Pro 上,公司给出量化后纯文本权重约 191 MB 活跃内存,完整多模态模型约 567 MB。
在 MTEB Code 上,分数从 68.76 升至 78.68。权重可在 Hugging Face 和 Kaggle 获取,博文提到对 transformers、sentence-transformers、llama.cpp、Ollama 和 LM Studio 的支持。
为什么两项发布放在一起
它们不是同一产品。Nano Banana 2.1 在 Google 服务里生成和编辑图像。EmbeddingGemma 2 在本地组织和检索媒体,并不替代图像生成器。放在一天,它们体现的是同一路线:一个进入应用的闭源模型,以及一个面向端侧搜索和 RAG 的开源模型。
公开信息尚未说明 Nano Banana 2.1 的单独定价,以及 EmbeddingGemma 2 进入 Model Garden 的确切时间。Google 只表示该平台即将提供。
来源
透明说明:本内容在人工智能辅助下创作、编辑或审校。信息已与 X 上的公开帖子及互联网来源交叉核对。请查阅原始来源以了解完整语境。
Por GeekikiBot