Maison
OpenAI dévoile trois modèles de synthèse vocale en temps réel dotés d'une capacité de raisonnement équivalente à celle de GPT-5

OpenAI, le géant de l'IA, a une nouvelle fois repoussé les limites de la technologie vocale avec le lancement officiel de trois nouveaux modèles vocaux en temps réel : GPT-Realtime-2, GPT-Realtime-Translate et GPT-Realtime-Whisper. Ces modèles sont désormais intégrés à l’API Realtime destinée aux développeurs, et visent à résoudre les défis courants liés aux interactions vocales, tels que la latence élevée, la gestion insuffisante des interruptions naturelles et les problèmes de prise en charge multilingue.
La fonctionnalité phare de cette version est GPT-Realtime-2, décrit comme le modèle vocal d’IA le plus intelligent à ce jour et le premier outil vocal doté d’un raisonnement de niveau GPT-5. Contrairement aux assistants vocaux classiques, il permet des conversations très naturelles et fluides tout en effectuant simultanément un raisonnement logique en temps réel, en appelant de manière transparente des outils externes et en détectant et en répondant avec précision aux interruptions ou corrections de l’utilisateur. Cette avancée majeure indique que les futurs assistants vocaux évolueront au-delà du simple rôle d’exécuteurs de commandes pour devenir des partenaires collaboratifs en temps réel, capables de gérer des tâches complexes en plusieurs étapes.
Le tarif de GPT-Realtime-2 est fixé à 32 dollars par million de jetons pour les entrées audio (environ 218 RMB) et à 64 dollars par million de jetons pour les sorties (environ 436 RMB). Les coûts liés aux entrées mises en cache sont nettement inférieurs, à seulement 0,4 dollar par million de jetons.
Au-delà du modèle de raisonnement principal, les deux autres modèles fonctionnels offrent des capacités distinctes. GPT-Realtime-Translate offre de solides performances de traduction, prenant en charge la conversion en temps réel entre 70 langues d’entrée et 13 langues de sortie. Sa vitesse de traduction suit presque le rythme de l’orateur, ce qui le rend idéal pour les scénarios de communication en temps réel très exigeants, tels que les réunions internationales. GPT-Realtime-Whisper se concentre sur la transcription en streaming à très faible latence, offrant une expérience où « la voix suit la personne », ce qui réduit considérablement les temps d’attente pour les comptes-rendus de réunion et les sous-titres en direct. Ces deux modèles utilisent une facturation plus flexible, à raison de 0,034 $ et 0,017 $ par minute respectivement.
Les analystes du secteur considèrent les dernières initiatives d’OpenAI comme une évolution de l’interaction vocale par IA, passant d’une « simple réponse » à une « compréhension approfondie en temps réel », ce qui renforce encore le leadership technologique de l’entreprise à l’ère de l’intelligence artificielle.
Article connexe
Amazon lance un nouveau département FDE de 1 milliard de dollars, à la suite d'OpenAI et d'Anthropic
Alors que les entreprises font face à l’intégration de l’IA, elles se tournent vers des experts externes, incitant les prestataires de services à créer des équipes spécialisées afin d’assurer une mise en œuvre réussie.Mardi, Amazon Web Services (AWS
La Maison-Blanche abandonne l’étiquette d’« intelligence supérieure » pour l’IA
Chargement du lecteur…Cette semaine, la Maison Blanche a réuni presque tous les principaux PDG de l’industrie technologique dans une même salle — parmi eux Mark Zuckerberg, Jeff Bezos, Elon Musk et Dario Amodei d’Anthropic — pour signer un engagemen
Amazon mise sur l'IA et les énergies propres pour alimenter l'expansion de ses centres de données
Amazon s'appuie sur l'IA, l'énergie nucléaire et les véhicules électriques pour développer ses infrastructures tout en réduisant son intensité carbone. Crédit : AmazonLe rapport de développement durab
Recommandations de sujets spéciaux liés
commentaires (0)

OpenAI, le géant de l'IA, a une nouvelle fois repoussé les limites de la technologie vocale avec le lancement officiel de trois nouveaux modèles vocaux en temps réel : GPT-Realtime-2, GPT-Realtime-Translate et GPT-Realtime-Whisper. Ces modèles sont désormais intégrés à l’API Realtime destinée aux développeurs, et visent à résoudre les défis courants liés aux interactions vocales, tels que la latence élevée, la gestion insuffisante des interruptions naturelles et les problèmes de prise en charge multilingue.
La fonctionnalité phare de cette version est GPT-Realtime-2, décrit comme le modèle vocal d’IA le plus intelligent à ce jour et le premier outil vocal doté d’un raisonnement de niveau GPT-5. Contrairement aux assistants vocaux classiques, il permet des conversations très naturelles et fluides tout en effectuant simultanément un raisonnement logique en temps réel, en appelant de manière transparente des outils externes et en détectant et en répondant avec précision aux interruptions ou corrections de l’utilisateur. Cette avancée majeure indique que les futurs assistants vocaux évolueront au-delà du simple rôle d’exécuteurs de commandes pour devenir des partenaires collaboratifs en temps réel, capables de gérer des tâches complexes en plusieurs étapes.
Le tarif de GPT-Realtime-2 est fixé à 32 dollars par million de jetons pour les entrées audio (environ 218 RMB) et à 64 dollars par million de jetons pour les sorties (environ 436 RMB). Les coûts liés aux entrées mises en cache sont nettement inférieurs, à seulement 0,4 dollar par million de jetons.
Au-delà du modèle de raisonnement principal, les deux autres modèles fonctionnels offrent des capacités distinctes. GPT-Realtime-Translate offre de solides performances de traduction, prenant en charge la conversion en temps réel entre 70 langues d’entrée et 13 langues de sortie. Sa vitesse de traduction suit presque le rythme de l’orateur, ce qui le rend idéal pour les scénarios de communication en temps réel très exigeants, tels que les réunions internationales. GPT-Realtime-Whisper se concentre sur la transcription en streaming à très faible latence, offrant une expérience où « la voix suit la personne », ce qui réduit considérablement les temps d’attente pour les comptes-rendus de réunion et les sous-titres en direct. Ces deux modèles utilisent une facturation plus flexible, à raison de 0,034 $ et 0,017 $ par minute respectivement.
Les analystes du secteur considèrent les dernières initiatives d’OpenAI comme une évolution de l’interaction vocale par IA, passant d’une « simple réponse » à une « compréhension approfondie en temps réel », ce qui renforce encore le leadership technologique de l’entreprise à l’ère de l’intelligence artificielle.
Amazon lance un nouveau département FDE de 1 milliard de dollars, à la suite d'OpenAI et d'Anthropic
Alors que les entreprises font face à l’intégration de l’IA, elles se tournent vers des experts externes, incitant les prestataires de services à créer des équipes spécialisées afin d’assurer une mise en œuvre réussie.Mardi, Amazon Web Services (AWS
La Maison-Blanche abandonne l’étiquette d’« intelligence supérieure » pour l’IA
Chargement du lecteur…Cette semaine, la Maison Blanche a réuni presque tous les principaux PDG de l’industrie technologique dans une même salle — parmi eux Mark Zuckerberg, Jeff Bezos, Elon Musk et Dario Amodei d’Anthropic — pour signer un engagemen
Amazon mise sur l'IA et les énergies propres pour alimenter l'expansion de ses centres de données
Amazon s'appuie sur l'IA, l'énergie nucléaire et les véhicules électriques pour développer ses infrastructures tout en réduisant son intensité carbone. Crédit : AmazonLe rapport de développement durab











