Hogar
OpenAI presenta tres modelos de voz en tiempo real con capacidad de razonamiento al nivel de GPT-5

OpenAI, el gigante de la inteligencia artificial, ha vuelto a ampliar las fronteras de la tecnología de voz con el lanzamiento oficial de tres nuevos modelos de voz en tiempo real: GPT-Realtime-2, GPT-Realtime-Translate y GPT-Realtime-Whisper. Estos modelos ya están integrados en la API Realtime para desarrolladores y abordan retos habituales de la interacción por voz, como la alta latencia, la falta de gestión natural de las interrupciones y los problemas de compatibilidad multilingüe.
La característica más destacada de este lanzamiento es GPT-Realtime-2, descrito como el modelo de voz de IA más inteligente hasta la fecha y la primera herramienta de voz con un nivel de razonamiento equivalente al de GPT-5. A diferencia de los asistentes de voz convencionales, permite mantener conversaciones muy naturales y fluidas, al tiempo que realiza razonamientos lógicos en tiempo real, invoca herramientas externas sin interrupciones y detecta y responde con precisión a las interrupciones o correcciones del usuario. Este avance indica que los futuros asistentes de voz evolucionarán más allá de la simple ejecución de comandos para convertirse en socios colaborativos en tiempo real capaces de gestionar tareas complejas de varios pasos.
El precio de GPT-Realtime-2 se ha fijado en 32 dólares por millón de tokens para la entrada de audio (aproximadamente 218 RMB) y en 64 dólares por millón de tokens para la salida (aproximadamente 436 RMB). Los costes de las entradas almacenadas en caché son significativamente más bajos, de tan solo 0,4 dólares por millón de tokens.
Más allá del modelo de razonamiento principal, los otros dos modelos funcionales ofrecen capacidades diferenciadas. GPT-Realtime-Translate ofrece un excelente rendimiento en traducción, admitiendo la conversión en tiempo real entre 70 idiomas de entrada y 13 idiomas de salida. Su velocidad de traducción casi iguala el ritmo del hablante, lo que lo hace ideal para situaciones de comunicación en tiempo real de alta exigencia, como las reuniones internacionales. GPT-Realtime-Whisper se centra en la transcripción en streaming con latencia ultrabaja, ofreciendo una experiencia en la que «la voz sigue a la persona», lo que reduce significativamente los tiempos de espera para las notas de reuniones y los subtítulos en directo. Estos dos modelos utilizan una facturación más flexible, con un coste por minuto de 0,034 y 0,017 dólares, respectivamente.
Los analistas del sector consideran que las últimas iniciativas de OpenAI suponen un cambio en la interacción de voz mediante IA, pasando de la «respuesta simple» a la «comprensión profunda en tiempo real», lo que consolida aún más el liderazgo tecnológico de la empresa en la era de la inteligencia.
Artículo relacionado
Amazon lanza una nueva organización FDE de 1.000 millones de dólares tras OpenAI y Anthropic
A medida que las empresas lidian con la integración de la inteligencia artificial, recurren a expertos externos, lo que impulsa a los proveedores de servicios a crear equipos especializados para garantizar una implementación exitosa.El martes, Amazo
La Casa Blanca abandona la etiqueta de “Inteligencia Superior” para la IA
Cargando el reproductor…Esta semana, la Casa Blanca reunió a casi todos los principales directivos ejecutivos de empresas tecnológicas en una misma sala, incluidos Mark Zuckerberg, Jeff Bezos, Elon Musk y Dario Amodei de Anthropic, para firmar un co
Amazon recurre a la inteligencia artificial y a la energía limpia para impulsar la expansión de sus centros de datos
Amazon aprovecha la inteligencia artificial, la energía nuclear y los vehículos eléctricos para ampliar su infraestructura y reducir al mismo tiempo la intensidad de carbono. Crédito: AmazonEl Informe
Recomendaciones de temas especiales relacionados
comentario (0)
0/500

OpenAI, el gigante de la inteligencia artificial, ha vuelto a ampliar las fronteras de la tecnología de voz con el lanzamiento oficial de tres nuevos modelos de voz en tiempo real: GPT-Realtime-2, GPT-Realtime-Translate y GPT-Realtime-Whisper. Estos modelos ya están integrados en la API Realtime para desarrolladores y abordan retos habituales de la interacción por voz, como la alta latencia, la falta de gestión natural de las interrupciones y los problemas de compatibilidad multilingüe.
La característica más destacada de este lanzamiento es GPT-Realtime-2, descrito como el modelo de voz de IA más inteligente hasta la fecha y la primera herramienta de voz con un nivel de razonamiento equivalente al de GPT-5. A diferencia de los asistentes de voz convencionales, permite mantener conversaciones muy naturales y fluidas, al tiempo que realiza razonamientos lógicos en tiempo real, invoca herramientas externas sin interrupciones y detecta y responde con precisión a las interrupciones o correcciones del usuario. Este avance indica que los futuros asistentes de voz evolucionarán más allá de la simple ejecución de comandos para convertirse en socios colaborativos en tiempo real capaces de gestionar tareas complejas de varios pasos.
El precio de GPT-Realtime-2 se ha fijado en 32 dólares por millón de tokens para la entrada de audio (aproximadamente 218 RMB) y en 64 dólares por millón de tokens para la salida (aproximadamente 436 RMB). Los costes de las entradas almacenadas en caché son significativamente más bajos, de tan solo 0,4 dólares por millón de tokens.
Más allá del modelo de razonamiento principal, los otros dos modelos funcionales ofrecen capacidades diferenciadas. GPT-Realtime-Translate ofrece un excelente rendimiento en traducción, admitiendo la conversión en tiempo real entre 70 idiomas de entrada y 13 idiomas de salida. Su velocidad de traducción casi iguala el ritmo del hablante, lo que lo hace ideal para situaciones de comunicación en tiempo real de alta exigencia, como las reuniones internacionales. GPT-Realtime-Whisper se centra en la transcripción en streaming con latencia ultrabaja, ofreciendo una experiencia en la que «la voz sigue a la persona», lo que reduce significativamente los tiempos de espera para las notas de reuniones y los subtítulos en directo. Estos dos modelos utilizan una facturación más flexible, con un coste por minuto de 0,034 y 0,017 dólares, respectivamente.
Los analistas del sector consideran que las últimas iniciativas de OpenAI suponen un cambio en la interacción de voz mediante IA, pasando de la «respuesta simple» a la «comprensión profunda en tiempo real», lo que consolida aún más el liderazgo tecnológico de la empresa en la era de la inteligencia.
Amazon lanza una nueva organización FDE de 1.000 millones de dólares tras OpenAI y Anthropic
A medida que las empresas lidian con la integración de la inteligencia artificial, recurren a expertos externos, lo que impulsa a los proveedores de servicios a crear equipos especializados para garantizar una implementación exitosa.El martes, Amazo
La Casa Blanca abandona la etiqueta de “Inteligencia Superior” para la IA
Cargando el reproductor…Esta semana, la Casa Blanca reunió a casi todos los principales directivos ejecutivos de empresas tecnológicas en una misma sala, incluidos Mark Zuckerberg, Jeff Bezos, Elon Musk y Dario Amodei de Anthropic, para firmar un co
Amazon recurre a la inteligencia artificial y a la energía limpia para impulsar la expansión de sus centros de datos
Amazon aprovecha la inteligencia artificial, la energía nuclear y los vehículos eléctricos para ampliar su infraestructura y reducir al mismo tiempo la intensidad de carbono. Crédito: AmazonEl Informe











