OpenAI prepara un nuevo modelo de voz bidireccional GPT-Bidi-1
Al parecer, OpenAI se está preparando para lanzar GPT-Bidi-1, un modelo de audio bidireccional de próxima generación diseñado para revolucionar las capacidades de voz de ChatGPT. Al adoptar una arquitectura bidireccional, este avance elimina las limitaciones de la comunicación simplex tradicional, permitiendo que el sistema escuche y hable simultáneamente. Esto posibilita la captura en tiempo real de las interrupciones del usuario y ajustes semánticos dinámicos sin tartamudeos, mejorando significativamente el flujo natural de las interacciones de voz en vivo.

El progreso del desarrollo indica que OpenAI ya ha integrado el código base de este modelo en las plataformas web y móviles. La nueva función coexistirá con el modo de voz avanzado existente, brindando a los usuarios la flexibilidad de cambiar al nuevo modo «Bidi» según su conveniencia. Además, el modelo introduce tres niveles de rendimiento distintos: Alto, Medio e Instantáneo, lo que permite a los usuarios equilibrar la profundidad de la interacción frente a la velocidad de respuesta en función de sus necesidades específicas.

Este salto tecnológico va más allá de las mejoras meramente en la calidad del audio, ya que constituye un componente crítico de la estrategia multimodal más amplia de OpenAI.
Aunque los modelos basados en texto de OpenAI han avanzado hasta GPT-5.5 con capacidades de razonamiento mejoradas, sus capacidades de voz han quedado rezagadas, lo que ha creado una disparidad en la experiencia multimodal general. La introducción de GPT-Bidi-1 aborda esta brecha, subrayando la visión estratégica de OpenAI de posicionar la voz como una interfaz principal para la inteligencia artificial de próxima generación. Este avance también sienta una base técnica vital para futuros dispositivos de hardware centrados en el audio y herramientas empresariales de soporte de voz.
Artículo relacionado
El gobierno de EE. UU. respalda a OpenAI en una disputa por derechos de autor sobre el entrenamiento de modelos de lenguaje grande (LLM)
El gobierno de Trump ha presentado un escrito de 20 páginas en apoyo de OpenAI en una demanda por derechos de autor presentada por The New York Times, defendiendo la práctica de la empresa de utilizar material con derechos de autor sin licencia para
Nvidia construye en silencio un coloso de miles de millones de dólares para rivalizar con el negocio de chips
El CEO de Nvidia, Jensen Huang, anticipó el mercado por más de una década, iniciando el trabajo en chips específicos para IA en 2010, mucho antes del actual auge de la inteligencia artificial. Una estrategia paralela en 2020, que consistió en fortale
El trío de DeepMind detrás de la IA del póker ahora está generando rendimientos para los fondos de cobertura cuantitativos
Tres exinvestigadores de DeepMind, que previamente desarrollaron una IA capaz de derrotar a campeones humanos de póker, han pivotado esa tecnología hacia los mercados financieros, y la estrategia está generando rendimientos significativos. Su empresa
Recomendaciones de temas especiales relacionados
comentario (0)
0/500
Al parecer, OpenAI se está preparando para lanzar GPT-Bidi-1, un modelo de audio bidireccional de próxima generación diseñado para revolucionar las capacidades de voz de ChatGPT. Al adoptar una arquitectura bidireccional, este avance elimina las limitaciones de la comunicación simplex tradicional, permitiendo que el sistema escuche y hable simultáneamente. Esto posibilita la captura en tiempo real de las interrupciones del usuario y ajustes semánticos dinámicos sin tartamudeos, mejorando significativamente el flujo natural de las interacciones de voz en vivo.

El progreso del desarrollo indica que OpenAI ya ha integrado el código base de este modelo en las plataformas web y móviles. La nueva función coexistirá con el modo de voz avanzado existente, brindando a los usuarios la flexibilidad de cambiar al nuevo modo «Bidi» según su conveniencia. Además, el modelo introduce tres niveles de rendimiento distintos: Alto, Medio e Instantáneo, lo que permite a los usuarios equilibrar la profundidad de la interacción frente a la velocidad de respuesta en función de sus necesidades específicas.

Este salto tecnológico va más allá de las mejoras meramente en la calidad del audio, ya que constituye un componente crítico de la estrategia multimodal más amplia de OpenAI.
Aunque los modelos basados en texto de OpenAI han avanzado hasta GPT-5.5 con capacidades de razonamiento mejoradas, sus capacidades de voz han quedado rezagadas, lo que ha creado una disparidad en la experiencia multimodal general. La introducción de GPT-Bidi-1 aborda esta brecha, subrayando la visión estratégica de OpenAI de posicionar la voz como una interfaz principal para la inteligencia artificial de próxima generación. Este avance también sienta una base técnica vital para futuros dispositivos de hardware centrados en el audio y herramientas empresariales de soporte de voz.
El gobierno de EE. UU. respalda a OpenAI en una disputa por derechos de autor sobre el entrenamiento de modelos de lenguaje grande (LLM)
El gobierno de Trump ha presentado un escrito de 20 páginas en apoyo de OpenAI en una demanda por derechos de autor presentada por The New York Times, defendiendo la práctica de la empresa de utilizar material con derechos de autor sin licencia para
Nvidia construye en silencio un coloso de miles de millones de dólares para rivalizar con el negocio de chips
El CEO de Nvidia, Jensen Huang, anticipó el mercado por más de una década, iniciando el trabajo en chips específicos para IA en 2010, mucho antes del actual auge de la inteligencia artificial. Una estrategia paralela en 2020, que consistió en fortale
El trío de DeepMind detrás de la IA del póker ahora está generando rendimientos para los fondos de cobertura cuantitativos
Tres exinvestigadores de DeepMind, que previamente desarrollaron una IA capaz de derrotar a campeones humanos de póker, han pivotado esa tecnología hacia los mercados financieros, y la estrategia está generando rendimientos significativos. Su empresa





Hogar






