O Google lançou o Gemini 3.8 Live e o Gemini 3.8 Live Extended Thinking, dois modelos nativos de fala pra fala (speech-to-speech) feitos pra agentes de voz em tempo real. A proposta atende uma demanda específica: agente de voz que raciocina e executa ferramentas sem a conversa parar.
Publicidade
Modo Vitta: Foco e EquilíbrioPara mentes que não param: alinhe tarefas, rotina, hábitos, foco e metas num só app.Ver no Google Play →
Os dois já estão disponíveis pela Gemini Live API e pelo Google AI Studio. São só modelos hospedados: não existe opção de rodar em servidor próprio nem versão de pesos abertos.
Qual é qual
O Gemini 3.8 Live prioriza escala e custo, combinando inteligência de conversa, diálogo fluido e ancoragem visual. O Extended Thinking mira tarefas mais complexas, com raciocínio de vários passos que roda ao mesmo tempo que a geração de fala.
Os números
Segundo o texto, o Extended Thinking ficou em 1º lugar geral no Speech to Speech Quality Index, da Artificial Analysis, com 82,6 pontos. Ele marca 68,6% na conclusão de tarefas agênticas do τ-Voice e 35,1% no τ-Voice-banking, da Sierra, além de 97,7% no Big Bench Audio, que avalia raciocínio com áudio.
O que a API oferece
- Chamada de função assíncrona: as APIs rodam em segundo plano enquanto o áudio segue em transmissão.
- Contexto visual: análise de entrada visual em tempo quase real.
- Precisão alfanumérica: leitura correta de códigos, números e dados técnicos.
- Multilíngue: detecção automática e troca entre 97 idiomas, mantendo a consistência de sotaque.
- Atualizações incrementais de conteúdo: áudio em tempo real combinado com respostas estruturadas.
O Extended Thinking soma um raciocínio configurável em segundo plano, que narra o progresso ao mesmo tempo nas tarefas de vários passos.
Preço e parceiros
Os dois modelos custam US$ 0,005 por minuto de áudio de entrada e US$ 0,018 por minuto de áudio de saída na Live API. O Google baseia essas tarifas em custos estimados de tokens: US$ 3 por milhão de tokens de entrada e US$ 12 por milhão de saída.
A lista de integrações inclui Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel e Vision Agents, e há parcerias estratégicas com Salesforce, Genspark e Lumeris. Exemplos de aplicação estão no GitHub. Todo áudio gerado leva a marca d'água imperceptível SynthID, do Google DeepMind, pra autenticação.