Дом
OpenAI представляет усовершенствованные голосовые модели для более естественного общения в режиме реального времени

Компания OpenAI представила новые диалоговые модели — GPT-Live-1 и GPT-Live-1 mini, разработанные для обеспечения более естественного звучания и более эффективного управления чередованием реплик. Эти полнодуплексные модели могут одновременно говорить и слушать, что позволяет пользователям естественным образом перебивать собеседника и реализовывать такие функции, как перевод в режиме реального времени.
Кроме того, компания внедряет GPT-Live-1 mini в качестве стандартной замены текущего расширенного голосового режима в ChatGPT. Пользователи платного тарифа получат доступ к более мощной модели GPT-Live-1. Ранее система использовала комбинацию модели преобразования речи в текст, большой языковой модели для генерации ответов и модели преобразования текста в речь для получения конечного результата.
В ходе пресс-брифинга OpenAI заявила, что новые модели решают такие проблемы, как перебивание пользователей во время речи и недостаточный интеллект для ответов на вопросы. Обновленные модели будут направлять запросы в новейшие текстовые модели, такие как GPT-5.5, для поиска, логического вывода или выполнения задач агента, сохраняя при этом поток разговора.
OpenAI также продемонстрировала, что модель может молчать в течение длительного времени, впитывая контекст разговора, пока к ней не обратятся. Кроме того, поскольку новый голосовой режим интегрирован с новейшими моделями GPT, он может представлять информацию в визуальном формате. Другие стартапы, такие как Monogram — который привлек 40 миллионов долларов стартового финансирования от DST и Lux Capital — также сосредоточиваются на визуальных ответах, чтобы сделать помощников более интерактивными.
Компания отметила, что новый голосовой режим в ChatGPT разработан для более длительных разговоров. На брифинге руководитель продукта ChatGPT Voice Атти Элети упомянул, что во время прогулок он вел 30–40-минутные разговоры с помощью голосовой функции.
OpenAI считает, что голос может стать основным интерфейсом для выполнения сложных вычислительных задач. Согласно сообщениям, компания может выпустить наушники с поддержкой ИИ уже в этом году, хотя подробностей об аппаратных продуктах не было предоставлено.
«Со временем, по нашему мнению, это также откроет возможность использовать голос в качестве основного интерфейса для работы с компьютером и управления всё более сложными и длительными задачами, выполняемыми агентами. Учитывая те удивительные сценарии использования, которые мы наблюдаем у людей, работающих с Codex и ChatGPT, мы считаем, что голос может стать интерфейсом будущего для всех видов работы», — сказал Элети.
В течение последних нескольких лет OpenAI совершенствовала голосовые функции, чтобы сделать голосовой режим ChatGPT более естественным. Компания сообщает, что более 150 миллионов человек используют функции «Голос» и «Диктовка» для общения с ChatGPT.
Конкуренты также работают над тем, чтобы сделать своих помощников более выразительными.
И Apple, и Amazon обновили своих помощников, сделав их более разговорными и улучшив обработку контекста. Такие стартапы, как Sesame, соучредителями которого являются соучредитель Oculus Брендан Ирибе и Анкит Кумар, запустили ИИ-помощников, которые ведут более естественную беседу, одновременно выполняя фоновые задачи.
OpenAI идет по аналогичному пути, стремясь дать пользователям возможность взаимодействовать со своим помощником без использования рук в течение более длительных периодов времени. Несмотря на утверждения о том, что новый голосовой режим звучит более естественно, компания подчеркнула, что он не задуман как ИИ-компаньон. Она отметила, что новые модели включают меры безопасности, позволяющие давать подросткам ответы, соответствующие их возрасту, и предлагать ресурсы, если разговор затрагивает такие темы, как самоповреждение.
Новый голосовой режим все еще имеет возможности для улучшения. Во время демонстрации функции синхронного перевода на хинди помощник говорил с сильным американским акцентом и использовал неестественный, слегка книжный хинди. Компания заявила, что режим оптимизирован для «большинства разговорных языков», но не уточнила, для каких именно.
Связанная статья
Google тестирует агента Remy AI для Gemini по мере смещения фокуса на управление пользователями
Согласно Business Insider, Google тестирует Remy, нового ИИ-персонального агента для Gemini. Этот инструмент предназначен для выполнения задач от имени пользователей, упрощая как профессиональные рабочие процессы, так и повседневные рутины.В настоящ
Олли делает ставку на приватность, чтобы выиграть гонку за лидерство в сфере ИИ-помощников
Чтобы быть по-настоящему полезным, ИИ-помощник должен глубоко понимать своего пользователя. Ollie — личный помощник, разработанный для повседневной жизни, — работает по принципу, согласно которому для
Как на мероприятии AI LIVE: London будут рассматриваться темы искусственного интеллекта и промышленной автоматизации
На саммите соберутся руководители высшего звена со всего мира, чтобы обсудить актуальные проблемы мировых отраслей — от радикальных изменений, вызванных искусственным интеллектом, до экономической нес
Рекомендации по связанным специальным темам
Комментарии (0)

Компания OpenAI представила новые диалоговые модели — GPT-Live-1 и GPT-Live-1 mini, разработанные для обеспечения более естественного звучания и более эффективного управления чередованием реплик. Эти полнодуплексные модели могут одновременно говорить и слушать, что позволяет пользователям естественным образом перебивать собеседника и реализовывать такие функции, как перевод в режиме реального времени.
Кроме того, компания внедряет GPT-Live-1 mini в качестве стандартной замены текущего расширенного голосового режима в ChatGPT. Пользователи платного тарифа получат доступ к более мощной модели GPT-Live-1. Ранее система использовала комбинацию модели преобразования речи в текст, большой языковой модели для генерации ответов и модели преобразования текста в речь для получения конечного результата.
В ходе пресс-брифинга OpenAI заявила, что новые модели решают такие проблемы, как перебивание пользователей во время речи и недостаточный интеллект для ответов на вопросы. Обновленные модели будут направлять запросы в новейшие текстовые модели, такие как GPT-5.5, для поиска, логического вывода или выполнения задач агента, сохраняя при этом поток разговора.
OpenAI также продемонстрировала, что модель может молчать в течение длительного времени, впитывая контекст разговора, пока к ней не обратятся. Кроме того, поскольку новый голосовой режим интегрирован с новейшими моделями GPT, он может представлять информацию в визуальном формате. Другие стартапы, такие как Monogram — который привлек 40 миллионов долларов стартового финансирования от DST и Lux Capital — также сосредоточиваются на визуальных ответах, чтобы сделать помощников более интерактивными.
Компания отметила, что новый голосовой режим в ChatGPT разработан для более длительных разговоров. На брифинге руководитель продукта ChatGPT Voice Атти Элети упомянул, что во время прогулок он вел 30–40-минутные разговоры с помощью голосовой функции.
OpenAI считает, что голос может стать основным интерфейсом для выполнения сложных вычислительных задач. Согласно сообщениям, компания может выпустить наушники с поддержкой ИИ уже в этом году, хотя подробностей об аппаратных продуктах не было предоставлено.
«Со временем, по нашему мнению, это также откроет возможность использовать голос в качестве основного интерфейса для работы с компьютером и управления всё более сложными и длительными задачами, выполняемыми агентами. Учитывая те удивительные сценарии использования, которые мы наблюдаем у людей, работающих с Codex и ChatGPT, мы считаем, что голос может стать интерфейсом будущего для всех видов работы», — сказал Элети.
В течение последних нескольких лет OpenAI совершенствовала голосовые функции, чтобы сделать голосовой режим ChatGPT более естественным. Компания сообщает, что более 150 миллионов человек используют функции «Голос» и «Диктовка» для общения с ChatGPT.
Конкуренты также работают над тем, чтобы сделать своих помощников более выразительными.
И Apple, и Amazon обновили своих помощников, сделав их более разговорными и улучшив обработку контекста. Такие стартапы, как Sesame, соучредителями которого являются соучредитель Oculus Брендан Ирибе и Анкит Кумар, запустили ИИ-помощников, которые ведут более естественную беседу, одновременно выполняя фоновые задачи.
OpenAI идет по аналогичному пути, стремясь дать пользователям возможность взаимодействовать со своим помощником без использования рук в течение более длительных периодов времени. Несмотря на утверждения о том, что новый голосовой режим звучит более естественно, компания подчеркнула, что он не задуман как ИИ-компаньон. Она отметила, что новые модели включают меры безопасности, позволяющие давать подросткам ответы, соответствующие их возрасту, и предлагать ресурсы, если разговор затрагивает такие темы, как самоповреждение.
Новый голосовой режим все еще имеет возможности для улучшения. Во время демонстрации функции синхронного перевода на хинди помощник говорил с сильным американским акцентом и использовал неестественный, слегка книжный хинди. Компания заявила, что режим оптимизирован для «большинства разговорных языков», но не уточнила, для каких именно.
Олли делает ставку на приватность, чтобы выиграть гонку за лидерство в сфере ИИ-помощников
Чтобы быть по-настоящему полезным, ИИ-помощник должен глубоко понимать своего пользователя. Ollie — личный помощник, разработанный для повседневной жизни, — работает по принципу, согласно которому для
Как на мероприятии AI LIVE: London будут рассматриваться темы искусственного интеллекта и промышленной автоматизации
На саммите соберутся руководители высшего звена со всего мира, чтобы обсудить актуальные проблемы мировых отраслей — от радикальных изменений, вызванных искусственным интеллектом, до экономической нес











