Maison
OpenAI dévoile des modèles vocaux avancés pour des conversations en temps réel plus naturelles

OpenAI a lancé de nouveaux modèles conversationnels, GPT-Live-1 et GPT-Live-1 mini, conçus pour offrir un son plus naturel et gérer plus efficacement les échanges. Ces modèles en duplex intégral peuvent parler et écouter simultanément, ce qui permet aux utilisateurs d'interrompre naturellement la conversation et offre des fonctionnalités telles que la traduction en temps réel.
L'entreprise déploie également GPT-Live-1 mini en remplacement par défaut de l'actuel mode vocal avancé (Advanced Voice Mode) de ChatGPT. Les utilisateurs de l'offre payante auront accès au modèle GPT-Live-1, plus puissant. Auparavant, le système s’appuyait sur une combinaison d’un modèle de reconnaissance vocale, d’un grand modèle linguistique pour générer des réponses et d’un modèle de synthèse vocale pour produire le résultat final.
Lors d’une conférence de presse, OpenAI a déclaré que les nouveaux modèles remédient à des problèmes tels que l’interruption des utilisateurs pendant qu’ils parlent et le manque d’intelligence suffisante pour répondre aux questions. Les modèles mis à jour achemineront les requêtes vers les modèles textuels les plus récents, tels que GPT-5.5, pour la recherche, le raisonnement ou les tâches d’agent, tout en préservant le flux de la conversation.
OpenAI a également démontré que le modèle peut rester silencieux pendant de longues périodes, en assimilant le contexte conversationnel jusqu’à ce qu’on s’adresse à lui. De plus, comme le nouveau mode vocal s’intègre aux modèles GPT les plus récents, il peut présenter les informations sous forme visuelle. D’autres start-ups, telles que Monogram — qui a levé 40 millions de dollars en financement d’amorçage auprès de DST et Lux Capital — se concentrent également sur les réponses visuelles afin de rendre les assistants plus interactifs.
L’entreprise a souligné que le nouveau mode vocal de ChatGPT est conçu pour des conversations plus longues. Lors de la présentation, Atty Eleti, responsable produit de ChatGPT Voice, a indiqué avoir eu des conversations de 30 à 40 minutes avec la fonctionnalité vocale pendant ses promenades.
OpenAI estime que la voix pourrait devenir l’interface principale pour les tâches informatiques complexes. Selon certaines informations, l’entreprise pourrait lancer cette année des écouteurs dotés d’une intelligence artificielle, bien qu’aucun détail sur ces produits matériels n’ait été fourni.
« À terme, nous pensons que cela permettra également d’utiliser la voix comme une sorte d’interface principale pour l’informatique, et de gérer des tâches automatisées de plus en plus complexes et de longue durée. Au vu des cas d’utilisation incroyables que nous observons lorsque les utilisateurs se servent de Codex et de ChatGPT, nous pensons que la voix peut devenir l’interface du futur pour toutes sortes de tâches », a déclaré Atty Eleti.
OpenAI n’a cessé d’améliorer ses fonctionnalités vocales ces dernières années afin de rendre le mode vocal de ChatGPT plus naturel. L’entreprise indique que plus de 150 millions de personnes utilisent les fonctionnalités « Voix » et « Dictée » pour dialoguer avec ChatGPT.
Les concurrents s’efforcent également de rendre leurs assistants plus expressifs.
Apple et Amazon ont tous deux mis à jour leurs assistants pour les rendre plus conversationnels, avec une meilleure gestion du contexte. Des start-ups comme Sesame, cofondée par Brendan Iribe, cofondateur d’Oculus, et Ankit Kumar, ont lancé des assistants IA capables de mener des conversations plus naturelles tout en effectuant des tâches en arrière-plan.
OpenAI suit une voie similaire, avec pour objectif de permettre aux utilisateurs d’interagir avec son assistant en mode mains libres pendant des périodes plus longues. Bien qu’elle affirme que le nouveau mode vocal sonne plus naturellement, l’entreprise a souligné qu’il n’était pas conçu comme un compagnon IA. Elle a précisé que les nouveaux modèles intègrent des mesures de sécurité pour fournir des réponses adaptées à l’âge des adolescents et proposer des ressources si les conversations abordent des sujets tels que l’automutilation.
Le nouveau mode vocal peut encore être amélioré. Lors d’une démonstration de la fonctionnalité de traduction en direct en hindi, l’assistant s’est exprimé avec un fort accent américain et a utilisé un hindi peu naturel, légèrement livresque. L’entreprise a déclaré que ce mode était optimisé pour « la plupart des langues parlées », sans toutefois préciser lesquelles.
Article connexe
Google teste l'agent IA Remy pour Gemini à mesure que l'accent se déplace vers le contrôle utilisateur
Selon Business Insider, Google teste Remy, un nouvel agent personnel d’IA pour Gemini. Cet outil vise à exécuter des tâches au nom des utilisateurs, rationalisant ainsi les flux de travail professionnels et les routines quotidiennes.Actuellement, Re
Ollie mise sur la protection de la vie privée pour remporter la course aux assistants IA
Pour être véritablement utile, un assistant IA doit comprendre en profondeur son utilisateur. Ollie, un assistant personnel conçu pour la vie quotidienne, part du principe que cela ne nécessite pas de
Comment « AI LIVE : Londres » abordera les thèmes de l'IA et de l'automatisation industrielle
Ce sommet réunira des dirigeants de haut niveau venus du monde entier afin d'aborder les défis urgents auxquels sont confrontés les secteurs d'activité à l'échelle mondiale, allant des bouleversements
Recommandations de sujets spéciaux liés
commentaires (0)

OpenAI a lancé de nouveaux modèles conversationnels, GPT-Live-1 et GPT-Live-1 mini, conçus pour offrir un son plus naturel et gérer plus efficacement les échanges. Ces modèles en duplex intégral peuvent parler et écouter simultanément, ce qui permet aux utilisateurs d'interrompre naturellement la conversation et offre des fonctionnalités telles que la traduction en temps réel.
L'entreprise déploie également GPT-Live-1 mini en remplacement par défaut de l'actuel mode vocal avancé (Advanced Voice Mode) de ChatGPT. Les utilisateurs de l'offre payante auront accès au modèle GPT-Live-1, plus puissant. Auparavant, le système s’appuyait sur une combinaison d’un modèle de reconnaissance vocale, d’un grand modèle linguistique pour générer des réponses et d’un modèle de synthèse vocale pour produire le résultat final.
Lors d’une conférence de presse, OpenAI a déclaré que les nouveaux modèles remédient à des problèmes tels que l’interruption des utilisateurs pendant qu’ils parlent et le manque d’intelligence suffisante pour répondre aux questions. Les modèles mis à jour achemineront les requêtes vers les modèles textuels les plus récents, tels que GPT-5.5, pour la recherche, le raisonnement ou les tâches d’agent, tout en préservant le flux de la conversation.
OpenAI a également démontré que le modèle peut rester silencieux pendant de longues périodes, en assimilant le contexte conversationnel jusqu’à ce qu’on s’adresse à lui. De plus, comme le nouveau mode vocal s’intègre aux modèles GPT les plus récents, il peut présenter les informations sous forme visuelle. D’autres start-ups, telles que Monogram — qui a levé 40 millions de dollars en financement d’amorçage auprès de DST et Lux Capital — se concentrent également sur les réponses visuelles afin de rendre les assistants plus interactifs.
L’entreprise a souligné que le nouveau mode vocal de ChatGPT est conçu pour des conversations plus longues. Lors de la présentation, Atty Eleti, responsable produit de ChatGPT Voice, a indiqué avoir eu des conversations de 30 à 40 minutes avec la fonctionnalité vocale pendant ses promenades.
OpenAI estime que la voix pourrait devenir l’interface principale pour les tâches informatiques complexes. Selon certaines informations, l’entreprise pourrait lancer cette année des écouteurs dotés d’une intelligence artificielle, bien qu’aucun détail sur ces produits matériels n’ait été fourni.
« À terme, nous pensons que cela permettra également d’utiliser la voix comme une sorte d’interface principale pour l’informatique, et de gérer des tâches automatisées de plus en plus complexes et de longue durée. Au vu des cas d’utilisation incroyables que nous observons lorsque les utilisateurs se servent de Codex et de ChatGPT, nous pensons que la voix peut devenir l’interface du futur pour toutes sortes de tâches », a déclaré Atty Eleti.
OpenAI n’a cessé d’améliorer ses fonctionnalités vocales ces dernières années afin de rendre le mode vocal de ChatGPT plus naturel. L’entreprise indique que plus de 150 millions de personnes utilisent les fonctionnalités « Voix » et « Dictée » pour dialoguer avec ChatGPT.
Les concurrents s’efforcent également de rendre leurs assistants plus expressifs.
Apple et Amazon ont tous deux mis à jour leurs assistants pour les rendre plus conversationnels, avec une meilleure gestion du contexte. Des start-ups comme Sesame, cofondée par Brendan Iribe, cofondateur d’Oculus, et Ankit Kumar, ont lancé des assistants IA capables de mener des conversations plus naturelles tout en effectuant des tâches en arrière-plan.
OpenAI suit une voie similaire, avec pour objectif de permettre aux utilisateurs d’interagir avec son assistant en mode mains libres pendant des périodes plus longues. Bien qu’elle affirme que le nouveau mode vocal sonne plus naturellement, l’entreprise a souligné qu’il n’était pas conçu comme un compagnon IA. Elle a précisé que les nouveaux modèles intègrent des mesures de sécurité pour fournir des réponses adaptées à l’âge des adolescents et proposer des ressources si les conversations abordent des sujets tels que l’automutilation.
Le nouveau mode vocal peut encore être amélioré. Lors d’une démonstration de la fonctionnalité de traduction en direct en hindi, l’assistant s’est exprimé avec un fort accent américain et a utilisé un hindi peu naturel, légèrement livresque. L’entreprise a déclaré que ce mode était optimisé pour « la plupart des langues parlées », sans toutefois préciser lesquelles.
Ollie mise sur la protection de la vie privée pour remporter la course aux assistants IA
Pour être véritablement utile, un assistant IA doit comprendre en profondeur son utilisateur. Ollie, un assistant personnel conçu pour la vie quotidienne, part du principe que cela ne nécessite pas de
Comment « AI LIVE : Londres » abordera les thèmes de l'IA et de l'automatisation industrielle
Ce sommet réunira des dirigeants de haut niveau venus du monde entier afin d'aborder les défis urgents auxquels sont confrontés les secteurs d'activité à l'échelle mondiale, allant des bouleversements











