Дом
OpenAI представила три модели распознавания речи в режиме реального времени с уровнем логического мышления, сопоставимым с GPT-5

OpenAI, гигант в области искусственного интеллекта, вновь расширил границы возможностей голосовых технологий, официально представив три новые модели для работы с голосом в режиме реального времени: GPT-Realtime-2, GPT-Realtime-Translate и GPT-Realtime-Whisper. Эти модели теперь интегрированы в Realtime API для разработчиков и призваны решать типичные проблемы голосового взаимодействия, такие как высокая задержка, отсутствие естественной обработки прерываний и проблемы с многоязычной поддержкой.
Главной особенностью этого релиза является GPT-Realtime-2, которую называют самой интеллектуальной голосовой моделью ИИ на сегодняшний день и первым голосовым инструментом с уровнем логического мышления GPT-5. В отличие от традиционных голосовых помощников, она обеспечивает чрезвычайно естественные и плавные диалоги, одновременно выполняя логические выводы в режиме реального времени, беспрепятственно вызывая внешние инструменты, а также точно распознавая прерывания или исправления со стороны пользователя и реагируя на них. Этот прорыв свидетельствует о том, что будущие голосовые помощники эволюционируют от простых исполнителей команд до партнеров по совместной работе в режиме реального времени, способных управлять многоэтапными сложными задачами.
Стоимость GPT-Realtime-2 установлена на уровне 32 доллара за миллион токенов для аудиовхода (примерно 218 юаней) и 64 доллара за миллион токенов для вывода (примерно 436 юаней). Стоимость кэшированного ввода значительно ниже — всего 0,4 доллара за миллион токенов.
Помимо основной модели логического вывода, две другие функциональные модели предлагают свои уникальные возможности. GPT-Realtime-Translate обеспечивает высокую эффективность перевода, поддерживая преобразование в режиме реального времени между 70 языками ввода и 13 языками вывода. Скорость перевода почти соответствует темпу речи говорящего, что делает эту модель идеальной для сценариев коммуникации в режиме реального времени с высокими требованиями, таких как международные встречи. GPT-Realtime-Whisper ориентирована на потоковую транскрипцию со сверхнизкой задержкой, обеспечивая эффект «голос следует за человеком», что значительно сокращает время ожидания при ведении протоколов встреч и создании субтитров в режиме реального времени. Для этих двух моделей используется более гибкая система тарификации: оплата взимается за минуту по ставкам 0,034 и 0,017 доллара соответственно.
Отраслевые аналитики рассматривают последние шаги OpenAI как переход в области голосового взаимодействия с ИИ от «простых ответов» к «глубокому пониманию в режиме реального времени», что еще больше укрепляет технологическое лидерство компании в эпоху интеллектуальных технологий.
Связанная статья
Amazon запускает новое подразделение FDE стоимостью 1 миллиард долларов после OpenAI и Anthropic
По мере того как компании сталкиваются с интеграцией искусственного интеллекта, они обращаются к внешним экспертам, что побуждает поставщиков услуг создавать специализированные команды для обеспечения успешной реализации проектов.Во вторник Amazon W
Белый дом отказывается от маркировки «сверхинтеллекта»
Загрузка плеера…На этой неделе Белый дом собрал почти всех ведущих технологических CEOs в одной комнате — включая Цукерберга, Безоса, Маска и Дарио Амодеи из Anthropic — для подписания обязательства по безопасности ИИ, которое президент Дональд Трам
Amazon использует ИИ и возобновляемые источники энергии для расширения своих центров обработки данных
Amazon использует искусственный интеллект, атомную энергетику и электромобили для расширения инфраструктуры при одновременном снижении углеродной интенсивности. Источник: AmazonВ отчете Amazon об усто
Рекомендации по связанным специальным темам
Комментарии (0)

OpenAI, гигант в области искусственного интеллекта, вновь расширил границы возможностей голосовых технологий, официально представив три новые модели для работы с голосом в режиме реального времени: GPT-Realtime-2, GPT-Realtime-Translate и GPT-Realtime-Whisper. Эти модели теперь интегрированы в Realtime API для разработчиков и призваны решать типичные проблемы голосового взаимодействия, такие как высокая задержка, отсутствие естественной обработки прерываний и проблемы с многоязычной поддержкой.
Главной особенностью этого релиза является GPT-Realtime-2, которую называют самой интеллектуальной голосовой моделью ИИ на сегодняшний день и первым голосовым инструментом с уровнем логического мышления GPT-5. В отличие от традиционных голосовых помощников, она обеспечивает чрезвычайно естественные и плавные диалоги, одновременно выполняя логические выводы в режиме реального времени, беспрепятственно вызывая внешние инструменты, а также точно распознавая прерывания или исправления со стороны пользователя и реагируя на них. Этот прорыв свидетельствует о том, что будущие голосовые помощники эволюционируют от простых исполнителей команд до партнеров по совместной работе в режиме реального времени, способных управлять многоэтапными сложными задачами.
Стоимость GPT-Realtime-2 установлена на уровне 32 доллара за миллион токенов для аудиовхода (примерно 218 юаней) и 64 доллара за миллион токенов для вывода (примерно 436 юаней). Стоимость кэшированного ввода значительно ниже — всего 0,4 доллара за миллион токенов.
Помимо основной модели логического вывода, две другие функциональные модели предлагают свои уникальные возможности. GPT-Realtime-Translate обеспечивает высокую эффективность перевода, поддерживая преобразование в режиме реального времени между 70 языками ввода и 13 языками вывода. Скорость перевода почти соответствует темпу речи говорящего, что делает эту модель идеальной для сценариев коммуникации в режиме реального времени с высокими требованиями, таких как международные встречи. GPT-Realtime-Whisper ориентирована на потоковую транскрипцию со сверхнизкой задержкой, обеспечивая эффект «голос следует за человеком», что значительно сокращает время ожидания при ведении протоколов встреч и создании субтитров в режиме реального времени. Для этих двух моделей используется более гибкая система тарификации: оплата взимается за минуту по ставкам 0,034 и 0,017 доллара соответственно.
Отраслевые аналитики рассматривают последние шаги OpenAI как переход в области голосового взаимодействия с ИИ от «простых ответов» к «глубокому пониманию в режиме реального времени», что еще больше укрепляет технологическое лидерство компании в эпоху интеллектуальных технологий.
Amazon запускает новое подразделение FDE стоимостью 1 миллиард долларов после OpenAI и Anthropic
По мере того как компании сталкиваются с интеграцией искусственного интеллекта, они обращаются к внешним экспертам, что побуждает поставщиков услуг создавать специализированные команды для обеспечения успешной реализации проектов.Во вторник Amazon W
Белый дом отказывается от маркировки «сверхинтеллекта»
Загрузка плеера…На этой неделе Белый дом собрал почти всех ведущих технологических CEOs в одной комнате — включая Цукерберга, Безоса, Маска и Дарио Амодеи из Anthropic — для подписания обязательства по безопасности ИИ, которое президент Дональд Трам
Amazon использует ИИ и возобновляемые источники энергии для расширения своих центров обработки данных
Amazon использует искусственный интеллект, атомную энергетику и электромобили для расширения инфраструктуры при одновременном снижении углеродной интенсивности. Источник: AmazonВ отчете Amazon об усто











