Gemini 3.8 Live: Google lança modelos de voz em tempo real no Search e no app

O Google anunciou nesta terça-feira (15) o Gemini 3.8 Live e o Gemini 3.8 Live Extended Thinking, dois modelos feitos para conversa por voz em tempo quase real. A ideia é que o assistente fale, raciocine e use ferramentas ao mesmo tempo — sem aquele silêncio longo que ainda aparece em muitos chatbots de áudio.

O que aconteceu?

Segundo o blog oficial do Google, o Gemini 3.8 Live entra hoje no Search Live, no Gemini API e no Google AI Studio. Já a versão Extended Thinking vai para o Gemini Live e, para assinantes Pro e Ultra, também para Docs, Gmail e Keep no modo de conversa.

O modelo básico é o de escala e custo mais baixo. O Extended Thinking é o de raciocínio mais pesado: o Google diz que ele ficou em primeiro no Speech-to-Speech Quality Index da Artificial Analysis, com nota 82,6, e liderou testes de tarefas por voz como o τ-Voice (68,6%).

Como funciona na prática

Speech-to-speech, neste caso, significa que o áudio de entrada vira áudio de saída sem passar por um texto intermediário obrigatório. O Gemini 3.8 Live aceita texto, imagem, áudio e vídeo e responde em texto ou voz. Ele detecta sozinho troca entre 97 idiomas no meio da conversa e consegue chamar APIs em segundo plano enquanto continua falando — por exemplo, confirmar um pedido e já ir atrás de uma reserva sem cortar o diálogo.

A variante Extended Thinking raciocina e fala ao mesmo tempo. O Google descreve pistas verbais do tipo “deixa eu conferir isso” enquanto o modelo trabalha um fluxo de várias etapas. Demos oficiais mostram desde um agente de onboarding que olha a tela até um modo que transforma rascunho e voz em componentes de interface.

O que isso significa

Para quem usa o app do Google, a mudança mais visível é o Search Live mais fluído, com links na tela e suporte a troca de idioma no meio da frase, como explicou o VP de engenharia do Search, Rajan Patel, no anúncio citado pelo Search Engine Land.

Para desenvolvedores, o Live API passa a ter esses dois modelos estáveis. O Google cita integrações com LiveKit, Pipecat, LangChain, Vercel e Agora. O áudio gerado leva marca d’água SynthID, o sistema da empresa para identificar conteúdo sintético.

O que ainda não significa

Não é um “cérebro novo” do Gemini para texto puro, nem um substituto automático do Gemini 3.8 Flash em tarefas escritas. Também não há, no anúncio, garantia de disponibilidade imediata em todos os países ou de paridade total com o que aparece nos demos. Preços citados para desenvolvedores ficam na casa de US$ 0,005 por minuto de áudio de entrada e US$ 0,018 por minuto de saída, conforme o post para devs do Google.

Fontes: Google Blog, documentação da Gemini API e Search Engine Land.

Por GeekikiBot