OpenAI libera modo Voice Live com SearchGPT e API multimodal de tempo real
Em 21 de setembro de 2026, a OpenAI deu um dos passos mais esperados no ecossistema de inteligência artificial generativa: o modo Voice Live do ChatGPT agora está nativamente conectado ao SearchGPT, permitindo conversas por voz fluidas com dados ao vivo da internet. Ao mesmo tempo, a empresa abriu globalmente a Realtime Multimodal API, que processa áudio, visão e texto simultaneamente com latência reduzida para a faixa de 200 a 300 milissegundos. A novidade responde diretamente aos recentes avanços do Gemini Live da Google e do Claude 3.5 Sonnet com Model Context Protocol (MCP).
Resposta rápida: o que mudou no ChatGPT hoje?
O modo de voz avançado (Voice Live) agora consulta a web em segundo plano durante a fala, citando fontes instantâneas sem travar a conversa. Para desenvolvedores, a nova Realtime API elimina a necessidade de encadear modelos separados de transcrição (Whisper), raciocínio (GPT-4o/o1) e sintetização de voz (TTS): tudo roda em um pipeline único multimodal que aceita interrupções naturais e visão pela câmera.
Como funciona o Voice Live com SearchGPT
Até agora, conversar por voz com assistentes exigia um compromisso: ou o modelo respondia com rapidez estombando apenas seu treinamento congelado, ou precisava de pausas de 4 a 6 segundos para acionar motores de busca convencionais. Com a integração do SearchGPT ao pipeline de voz neural, a OpenAI implementou uma camada de pré-pesquisa preditiva:
- Navegação em segundo plano: enquanto o usuário formula a pergunta, o sistema gera buscas vetoriais antecipadas e extrai fatos verificados;
- Citações de áudio naturais: o modelo sintetiza a resposta atribuindo a informação ao veículo original (“segundo a Bloomberg…”) sem ler URLs confusas;
- Interrupção sem eco: cancelamento de ruído aprimorado que permite interromper o assistente instantaneamente, inclusive no viva-voz do celular.
Ficha técnica: Realtime Multimodal API vs Concorrência
| Recurso | OpenAI Realtime API | Google Gemini Live | Anthropic Claude (MCP) |
|---|---|---|---|
| Latência média | 210 ms a 290 ms | 260 ms a 340 ms | 450 ms a 650 ms (via API) |
| Modalidades nativas | Áudio bidirecional, visão, texto | Áudio, vídeo em tempo real, texto | Texto, código, visão (voz via terceiros) |
| Conexão à web ao vivo | SearchGPT integrado | Google Search integrado | Via servidores MCP externos |
| Suporte a interrupções | Nativo com detecção de fala | Nativo | Depende do client |
| Custo aproximado | US$ 0,06 / minuto de áudio | US$ 0,05 / minuto de áudio | Cobrança padrão por token |
Por que isso importa para você
No Brasil e no mundo, a interação por voz sempre esbarrou na lentidão robótica. Com latência abaixo de 300 ms, o ChatGPT se aproxima do ritmo de uma conversa humana real pelo telefone. Para o usuário comum, significa consultar resultados de jogos, cotações financeiras e notícias de trânsito em tempo real enquanto dirige ou cozinha. Para empresas e startups, a API permite criar agentes de atendimento por voz humanizados, tutores de idiomas interativos e assistentes operacionais sem construir infraestruturas complexas de telecomunicações.
Perguntas frequentes
Quem já pode usar o Voice Live com SearchGPT?
O recurso está sendo liberado a partir de 21 de setembro para assinantes ChatGPT Plus e Team nos aplicativos de iOS e Android, com chegada gradual aos usuários do plano gratuito nas próximas semanas.
A nova Realtime API funciona em português do Brasil?
Sim. O modelo foi treinado com suporte fonético avançado a mais de 50 idiomas, reconhecendo gírias, entonações regionais e sotaques do português brasileiro com naturalidade.
Quanto custa integrar a Realtime Multimodal API?
A OpenAI precifica a API por minuto de áudio processado (cerca de US$ 0,06 por minuto de entrada e saída combinados) mais o custo de tokens de contexto padrão da plataforma.
No DigitalRadar, acompanhamos o pulso da inteligência artificial minuto a minuto. Fique no radar.