OpenAI prépare son nouveau modèle vocal bidirectionnel GPT-Bidi-1
OpenAI préparerait le lancement de GPT-Bidi-1, un modèle audio bidirectionnel de nouvelle génération conçu pour révolutionner les capacités vocales de ChatGPT. En adoptant une architecture bidirectionnelle, cette avancée élimine les limites de la communication unidirectionnelle traditionnelle, permettant au système d’écouter et de parler simultanément. Cela permet une capture en temps réel des interruptions de l’utilisateur et des ajustements sémantiques dynamiques sans hésitation, améliorant considérablement la fluidité naturelle des interactions vocales en direct.

Les progrès du développement indiquent qu’OpenAI a déjà intégré le code de base de ce modèle sur les plateformes web et mobiles. La nouvelle fonctionnalité coexistera avec le Mode Vocal Avancé existant, offrant aux utilisateurs la flexibilité de basculer vers le mode « Bidi » mis à jour selon leur convenance. De plus, le modèle introduit trois niveaux de performance distincts – Élevé, Moyen et Instantané – permettant aux utilisateurs d’équilibrer la profondeur de l’interaction contre la vitesse de réponse en fonction de leurs besoins spécifiques.

Cette avancée technologique va au-delà de simples améliorations de la qualité audio, servant de composant critique de la stratégie multimodale plus large d’OpenAI.
Alors que les modèles textuels d’OpenAI ont atteint GPT-5.5 avec des capacités de raisonnement améliorées, ses capacités vocales ont pris du retard, créant une disparité dans l’expérience multimodale globale. L’introduction de GPT-Bidi-1 comble cette lacune, soulignant la vision stratégique d’OpenAI visant à positionner la voix comme une interface principale pour l’IA de nouvelle génération. Cette avancée établit également une base technique essentielle pour les futurs appareils matériels axés sur l’audio et les outils de support vocal de niveau entreprise.
Article connexe
Le gouvernement américain soutient OpenAI dans son litige sur les droits d’auteur concernant l’entraînement des grands modèles de langage
L’administration Trump a déposé un mémoire de 20 pages soutenant OpenAI dans un procès en contrefaçon intenté par le New York Times, défendant la pratique de l’entreprise consistant à utiliser des œuvres protégées par le droit d’auteur sans licence p
Nvidia construit discrètement un géant de plusieurs milliards de dollars pour rivaliser avec l'activité des puces
Le PDG de Nvidia, Jensen Huang, a anticipé le marché de plus d’une décennie en lançant des travaux sur des puces spécifiques à l’intelligence artificielle en 2010, bien avant l’actuel boom de l’IA. Un mouvement stratégique parallèle en 2020, consista
La trio de DeepMind derrière l'IA de poker génère désormais des rendements pour les fonds spéculatifs quantitatifs
Trois anciens chercheurs de DeepMind, qui avaient précédemment développé une IA capable de vaincre des champions humains de poker, ont orienté cette technologie vers les marchés financiers, et la stratégie génère des rendements significatifs. Leur en
Recommandations de sujets spéciaux liés
commentaires (0)
OpenAI préparerait le lancement de GPT-Bidi-1, un modèle audio bidirectionnel de nouvelle génération conçu pour révolutionner les capacités vocales de ChatGPT. En adoptant une architecture bidirectionnelle, cette avancée élimine les limites de la communication unidirectionnelle traditionnelle, permettant au système d’écouter et de parler simultanément. Cela permet une capture en temps réel des interruptions de l’utilisateur et des ajustements sémantiques dynamiques sans hésitation, améliorant considérablement la fluidité naturelle des interactions vocales en direct.

Les progrès du développement indiquent qu’OpenAI a déjà intégré le code de base de ce modèle sur les plateformes web et mobiles. La nouvelle fonctionnalité coexistera avec le Mode Vocal Avancé existant, offrant aux utilisateurs la flexibilité de basculer vers le mode « Bidi » mis à jour selon leur convenance. De plus, le modèle introduit trois niveaux de performance distincts – Élevé, Moyen et Instantané – permettant aux utilisateurs d’équilibrer la profondeur de l’interaction contre la vitesse de réponse en fonction de leurs besoins spécifiques.

Cette avancée technologique va au-delà de simples améliorations de la qualité audio, servant de composant critique de la stratégie multimodale plus large d’OpenAI.
Alors que les modèles textuels d’OpenAI ont atteint GPT-5.5 avec des capacités de raisonnement améliorées, ses capacités vocales ont pris du retard, créant une disparité dans l’expérience multimodale globale. L’introduction de GPT-Bidi-1 comble cette lacune, soulignant la vision stratégique d’OpenAI visant à positionner la voix comme une interface principale pour l’IA de nouvelle génération. Cette avancée établit également une base technique essentielle pour les futurs appareils matériels axés sur l’audio et les outils de support vocal de niveau entreprise.
Le gouvernement américain soutient OpenAI dans son litige sur les droits d’auteur concernant l’entraînement des grands modèles de langage
L’administration Trump a déposé un mémoire de 20 pages soutenant OpenAI dans un procès en contrefaçon intenté par le New York Times, défendant la pratique de l’entreprise consistant à utiliser des œuvres protégées par le droit d’auteur sans licence p
Nvidia construit discrètement un géant de plusieurs milliards de dollars pour rivaliser avec l'activité des puces
Le PDG de Nvidia, Jensen Huang, a anticipé le marché de plus d’une décennie en lançant des travaux sur des puces spécifiques à l’intelligence artificielle en 2010, bien avant l’actuel boom de l’IA. Un mouvement stratégique parallèle en 2020, consista
La trio de DeepMind derrière l'IA de poker génère désormais des rendements pour les fonds spéculatifs quantitatifs
Trois anciens chercheurs de DeepMind, qui avaient précédemment développé une IA capable de vaincre des champions humains de poker, ont orienté cette technologie vers les marchés financiers, et la stratégie génère des rendements significatifs. Leur en





Maison






