Google convirtió el 6 de octubre de 2026 en un día de dos lanzamientos de inteligencia artificial que se complementan. Por un lado, el modelo de imagen Nano Banana 2.1 empieza a llegar a los productos de la empresa. Por el otro, EmbeddingGemma 2 abre un modelo ligero con licencia Apache 2.0 para búsqueda multimodal en el dispositivo.
Qué cambia en Nano Banana 2.1
En su cuenta oficial, Google describió Nano Banana 2.1 como la versión más reciente de generación y edición de imágenes, con avances en diseño visual, edición por máscara y consistencia del sujeto. La empresa informó que la distribución empieza el mismo día en la app Gemini, AI Mode de la Búsqueda, Google AI Studio, Flow, Stitch, Google Ads y Gemini Enterprise Platform.
La ficha de DeepMind sitúa Nano Banana 2.1 en la familia Gemini 3 y lo describe como basado en Gemini 3.6 Flash. Indica entrada de texto e imagen con una ventana de hasta 1 millón de tokens, salida de imagen de hasta 4.000 tokens y salida de texto de hasta 64.000 tokens.
En evaluaciones internas de octubre de 2026, la variante con razonamiento marca 1050 en preferencia general de texto a imagen, frente a 990 de Nano Banana 2 (Gemini 3.1 Flash Image) y 935 de Nano Banana Pro. En edición por máscara o dibujo, el mismo modo llega a 1049, por encima de 965 y 927 de las generaciones citadas. Google también registra límites: el texto pequeño puede salir borroso, la consistencia de personaje no es perfecta y hay fallos ocasionales de localización espacial.
EmbeddingGemma 2, el otro anuncio
En otra publicación, Google confirmó que EmbeddingGemma 2 ya se puede descargar en Hugging Face y Kaggle, con llegada prevista a Model Garden de Gemini Enterprise Agent Platform. El blog, firmado por Sahil Dua y Henrique Schechter Vera, de DeepMind, lo define como el modelo más capaz de la empresa para embeddings multimodales en el dispositivo.
EmbeddingGemma 2 tiene 740 millones de parámetros, arquitectura ligada a Gemma 4 y mapea texto, código, imagen, audio y vídeo en un espacio común. Google afirma que el predecesor de solo texto superó los 20 millones de descargas. La nueva versión amplía el contexto a 8.000 tokens, cuatro veces el EmbeddingGemma original, suficiente, según la empresa, para hasta 5,5 minutos de audio, 29 imágenes o 58 fotogramas de vídeo.
El diseño es modular: unos 270 millones de parámetros bastan para texto, con codificadores opcionales de visión (170 millones) y audio (300 millones). Con Matryoshka, los vectores de 768 dimensiones pueden recortarse hasta 128, lo que Google asocia a una reducción de almacenamiento de hasta seis veces. En un Pixel 11 Pro, la empresa cita unos 191 MB de RAM activa para los pesos solo de texto y unos 567 MB para el modelo multimodal completo tras la cuantización.
En MTEB Code, el salto informado es de 68,76 a 78,68. Los pesos están en Hugging Face y Kaggle, con soporte citado para transformers, sentence-transformers, llama.cpp, Ollama y LM Studio.
Por qué los dos anuncios conversan
No son el mismo producto. Nano Banana 2.1 genera y edita imágenes dentro de los servicios de Google. EmbeddingGemma 2 organiza y recupera medios en local y no sustituye a un generador de imágenes. Juntos, sin embargo, muestran la estrategia del día: un modelo cerrado distribuido en las apps y un modelo abierto pensado para búsqueda y RAG en el dispositivo.
Lo que el anuncio público no detalla es un precio aparte de Nano Banana 2.1 y el calendario exacto de Model Garden para EmbeddingGemma 2. Google solo dice que la disponibilidad en esa plataforma llega después.
Fuentes
- Publicación de Google sobre Nano Banana 2.1
- Publicación de Google sobre EmbeddingGemma 2
- Ficha del modelo Nano Banana 2.1
- Blog oficial de EmbeddingGemma 2
Transparencia: Este contenido fue creado, editado o revisado con ayuda de inteligencia artificial. La información se cruzó con publicaciones públicas en X y fuentes disponibles en internet. Consulta las fuentes originales para el contexto completo.
Por GeekikiBot