Lar
A OpenAI apresenta três modelos de reconhecimento de fala em tempo real com capacidade de raciocínio comparável à do GPT-5

A OpenAI, gigante da IA, mais uma vez ampliou as fronteiras da tecnologia de voz com o lançamento oficial de três novos modelos de voz em tempo real: GPT-Realtime-2, GPT-Realtime-Translate e GPT-Realtime-Whisper. Esses modelos agora estão integrados à API Realtime para desenvolvedores, visando resolver desafios comuns na interação por voz, como alta latência, falta de tratamento natural de interrupções e problemas de suporte multilíngue.
O destaque deste lançamento é o GPT-Realtime-2, descrito como o modelo de voz de IA mais inteligente até o momento e a primeira ferramenta de voz com raciocínio no nível do GPT-5. Ao contrário dos assistentes de voz convencionais, ele permite conversas altamente naturais e fluidas, ao mesmo tempo em que realiza raciocínio lógico em tempo real, aciona ferramentas externas de maneira integrada e detecta e responde com precisão às interrupções ou correções do usuário. Esse avanço indica que os futuros assistentes de voz evoluirão além de simples executores de comandos, tornando-se parceiros colaborativos em tempo real, capazes de gerenciar tarefas complexas com várias etapas.
O preço do GPT-Realtime-2 está definido em US$ 32 por milhão de tokens para entrada de áudio (aproximadamente 218 RMB) e US$ 64 por milhão de tokens para saída (aproximadamente 436 RMB). Os custos de entrada em cache são significativamente mais baixos, custando apenas US$ 0,4 por milhão de tokens.
Além do modelo central de raciocínio, os outros dois modelos funcionais oferecem recursos distintos. O GPT-Realtime-Translate apresenta excelente desempenho em tradução, suportando conversão em tempo real entre 70 idiomas de entrada e 13 idiomas de saída. Sua velocidade de tradução quase acompanha o ritmo do locutor, tornando-o ideal para cenários de comunicação em tempo real de alta demanda, como reuniões internacionais. O GPT-Realtime-Whisper concentra-se na transcrição de streaming com latência ultrabaixa, proporcionando uma experiência em que “a voz acompanha a pessoa”, o que reduz significativamente os tempos de espera para anotações de reuniões e legendas ao vivo. Esses dois modelos utilizam um sistema de cobrança mais flexível, com tarifas por minuto de US$ 0,034 e US$ 0,017, respectivamente.
Analistas do setor veem as últimas iniciativas da OpenAI como uma mudança na interação de voz por IA, passando de “respostas simples” para “compreensão profunda em tempo real”, consolidando ainda mais a liderança tecnológica da empresa na era da inteligência.
Artigo relacionado
A Amazon lança nova organização FDE de US$ 1 bilhão após a OpenAI e a Anthropic
À medida que as empresas lidam com a integração da IA, elas estão recorrendo a especialistas externos, o que leva os provedores de serviços a criar equipes especializadas para garantir uma implementação bem-sucedida.Na terça-feira, a Amazon Web Serv
Casa Branca Abandona Rótulo de IA para “Super Inteligência”
Carregando o player…Esta semana, a Casa Branca reuniu quase todos os principais CEOs de tecnologia em uma única sala — incluindo Zuckerberg, Bezos, Musk e Dario Amodei, da Anthropic — para assinar um compromisso de segurança em IA, que o presidente
Amazon aposta na IA e na energia limpa para impulsionar a expansão de seus centros de dados
A Amazon utiliza IA, energia nuclear e veículos elétricos para ampliar sua infraestrutura e, ao mesmo tempo, reduzir a intensidade de carbono. Crédito: AmazonO Relatório de Sustentabilidade 2025 da Am
Recomendações de tópicos especiais relacionados
Comentários (0)

A OpenAI, gigante da IA, mais uma vez ampliou as fronteiras da tecnologia de voz com o lançamento oficial de três novos modelos de voz em tempo real: GPT-Realtime-2, GPT-Realtime-Translate e GPT-Realtime-Whisper. Esses modelos agora estão integrados à API Realtime para desenvolvedores, visando resolver desafios comuns na interação por voz, como alta latência, falta de tratamento natural de interrupções e problemas de suporte multilíngue.
O destaque deste lançamento é o GPT-Realtime-2, descrito como o modelo de voz de IA mais inteligente até o momento e a primeira ferramenta de voz com raciocínio no nível do GPT-5. Ao contrário dos assistentes de voz convencionais, ele permite conversas altamente naturais e fluidas, ao mesmo tempo em que realiza raciocínio lógico em tempo real, aciona ferramentas externas de maneira integrada e detecta e responde com precisão às interrupções ou correções do usuário. Esse avanço indica que os futuros assistentes de voz evoluirão além de simples executores de comandos, tornando-se parceiros colaborativos em tempo real, capazes de gerenciar tarefas complexas com várias etapas.
O preço do GPT-Realtime-2 está definido em US$ 32 por milhão de tokens para entrada de áudio (aproximadamente 218 RMB) e US$ 64 por milhão de tokens para saída (aproximadamente 436 RMB). Os custos de entrada em cache são significativamente mais baixos, custando apenas US$ 0,4 por milhão de tokens.
Além do modelo central de raciocínio, os outros dois modelos funcionais oferecem recursos distintos. O GPT-Realtime-Translate apresenta excelente desempenho em tradução, suportando conversão em tempo real entre 70 idiomas de entrada e 13 idiomas de saída. Sua velocidade de tradução quase acompanha o ritmo do locutor, tornando-o ideal para cenários de comunicação em tempo real de alta demanda, como reuniões internacionais. O GPT-Realtime-Whisper concentra-se na transcrição de streaming com latência ultrabaixa, proporcionando uma experiência em que “a voz acompanha a pessoa”, o que reduz significativamente os tempos de espera para anotações de reuniões e legendas ao vivo. Esses dois modelos utilizam um sistema de cobrança mais flexível, com tarifas por minuto de US$ 0,034 e US$ 0,017, respectivamente.
Analistas do setor veem as últimas iniciativas da OpenAI como uma mudança na interação de voz por IA, passando de “respostas simples” para “compreensão profunda em tempo real”, consolidando ainda mais a liderança tecnológica da empresa na era da inteligência.
A Amazon lança nova organização FDE de US$ 1 bilhão após a OpenAI e a Anthropic
À medida que as empresas lidam com a integração da IA, elas estão recorrendo a especialistas externos, o que leva os provedores de serviços a criar equipes especializadas para garantir uma implementação bem-sucedida.Na terça-feira, a Amazon Web Serv
Casa Branca Abandona Rótulo de IA para “Super Inteligência”
Carregando o player…Esta semana, a Casa Branca reuniu quase todos os principais CEOs de tecnologia em uma única sala — incluindo Zuckerberg, Bezos, Musk e Dario Amodei, da Anthropic — para assinar um compromisso de segurança em IA, que o presidente
Amazon aposta na IA e na energia limpa para impulsionar a expansão de seus centros de dados
A Amazon utiliza IA, energia nuclear e veículos elétricos para ampliar sua infraestrutura e, ao mesmo tempo, reduzir a intensidade de carbono. Crédito: AmazonO Relatório de Sustentabilidade 2025 da Am











