OpenAI готовит новую двунаправленную голосовую модель GPT-Bidi-1
По сообщениям, OpenAI готовится выпустить GPT-Bidi-1, двустороннюю аудиомодель нового поколения, призванную совершить революцию в голосовых возможностях ChatGPT. Благодаря использованию двусторонней архитектуры этот прорыв устраняет ограничения традиционной симплексной связи, позволяя системе одновременно слушать и говорить. Это обеспечивает реальное время захвата прерываний пользователя и динамическую семантическую корректировку без заикания, значительно улучшая естественный поток живых голосовых взаимодействий.

Данные о ходе разработки указывают на то, что OpenAI уже интегрировала базовый код этой модели для веб- и мобильных платформ. Новая функция будет сосуществовать с существующим расширенным голосовым режимом, предоставляя пользователям возможность по своему усмотрению переключиться на обновленный режим «Bidi». Кроме того, модель предлагает три различных уровня производительности — Высокий, Средний и Мгновенный, позволяя пользователям балансировать между глубиной взаимодействия и скоростью ответа в зависимости от их конкретных потребностей.

Этот технологический скачок выходит за рамки простого улучшения качества аудио и служит ключевым компонентом более широкой мультимодальной стратегии OpenAI.
Хотя текстовые модели OpenAI продвинулись до GPT-5.5 с улучшенными способностями к рассуждению, их голосовые возможности отставали, создавая разрыв в общем мультимодальном опыте. Внедрение GPT-Bidi-1 устраняет этот пробел, подчеркивая стратегическое видение OpenAI по позиционированию голоса как основного интерфейса для ИИ следующего поколения. Это достижение также закладывает важную техническую основу для будущих устройств с приоритетом аудио и инструментов поддержки голоса корпоративного уровня.
Связанная статья
Правительство США поддерживает OpenAI в споре об авторских правах, связанном с обучением больших языковых моделей
Администрация Трампа подала 20-страничный меморандум в поддержку OpenAI по иску о нарушении авторских прав, поданному The New York Times, защищая практику компании по использованию нелицензированного охраняемого авторским правом материала для обучени
Nvidia тихо создает многомиллиардного гиганта, чтобы конкурировать с чиповым бизнесом
Генеральный директор Nvidia Дженсен Хуанг опередил рынок более чем на десятилетие, начав работу над специализированными чипами для ИИ в 2010 году, задолго до текущего бума искусственного интеллекта. Параллельная стратегическая мера 2020 года — усилен
Трио DeepMind, стоящее за покерным ИИ, теперь генерирует доходность для количественных хедж-фондов
Три бывших исследователя DeepMind, ранее разработавшие ИИ, способный побеждать чемпионов мира по покеру, перенаправили свои технологии на финансовые рынки — и эта стратегия приносит значительную прибыль. Их пражская ИИ-компания EquiLibre Technologies
Рекомендации по связанным специальным темам
Комментарии (0)
По сообщениям, OpenAI готовится выпустить GPT-Bidi-1, двустороннюю аудиомодель нового поколения, призванную совершить революцию в голосовых возможностях ChatGPT. Благодаря использованию двусторонней архитектуры этот прорыв устраняет ограничения традиционной симплексной связи, позволяя системе одновременно слушать и говорить. Это обеспечивает реальное время захвата прерываний пользователя и динамическую семантическую корректировку без заикания, значительно улучшая естественный поток живых голосовых взаимодействий.

Данные о ходе разработки указывают на то, что OpenAI уже интегрировала базовый код этой модели для веб- и мобильных платформ. Новая функция будет сосуществовать с существующим расширенным голосовым режимом, предоставляя пользователям возможность по своему усмотрению переключиться на обновленный режим «Bidi». Кроме того, модель предлагает три различных уровня производительности — Высокий, Средний и Мгновенный, позволяя пользователям балансировать между глубиной взаимодействия и скоростью ответа в зависимости от их конкретных потребностей.

Этот технологический скачок выходит за рамки простого улучшения качества аудио и служит ключевым компонентом более широкой мультимодальной стратегии OpenAI.
Хотя текстовые модели OpenAI продвинулись до GPT-5.5 с улучшенными способностями к рассуждению, их голосовые возможности отставали, создавая разрыв в общем мультимодальном опыте. Внедрение GPT-Bidi-1 устраняет этот пробел, подчеркивая стратегическое видение OpenAI по позиционированию голоса как основного интерфейса для ИИ следующего поколения. Это достижение также закладывает важную техническую основу для будущих устройств с приоритетом аудио и инструментов поддержки голоса корпоративного уровня.
Правительство США поддерживает OpenAI в споре об авторских правах, связанном с обучением больших языковых моделей
Администрация Трампа подала 20-страничный меморандум в поддержку OpenAI по иску о нарушении авторских прав, поданному The New York Times, защищая практику компании по использованию нелицензированного охраняемого авторским правом материала для обучени
Nvidia тихо создает многомиллиардного гиганта, чтобы конкурировать с чиповым бизнесом
Генеральный директор Nvidia Дженсен Хуанг опередил рынок более чем на десятилетие, начав работу над специализированными чипами для ИИ в 2010 году, задолго до текущего бума искусственного интеллекта. Параллельная стратегическая мера 2020 года — усилен
Трио DeepMind, стоящее за покерным ИИ, теперь генерирует доходность для количественных хедж-фондов
Три бывших исследователя DeepMind, ранее разработавшие ИИ, способный побеждать чемпионов мира по покеру, перенаправили свои технологии на финансовые рынки — и эта стратегия приносит значительную прибыль. Их пражская ИИ-компания EquiLibre Technologies





Дом






