OpenAI、より自然なリアルタイム会話を実現する高度な音声モデルを発表

OpenAIは、より自然な話し口を実現し、会話のやり取りをより効果的に管理できるように設計された、新しい対話型モデル「GPT-Live-1」および「GPT-Live-1 mini」をリリースしました。これらの全二重通信モデルは、話すことと聞くことを同時に行うことができるため、ユーザーが自然に会話を割り込むことが可能になり、リアルタイム翻訳などの機能も利用できるようになります。
また同社は、ChatGPTの現行「Advanced Voice Mode」に代わるデフォルト機能として、「GPT-Live-1 mini」の提供を開始しています。有料プランのユーザーは、より大規模な「GPT-Live-1」モデルを利用できるようになります。 従来、システムは音声認識モデル、応答生成用の大規模言語モデル、およびテキスト読み上げモデルを組み合わせて、最終出力を生成していました。
OpenAIは記者会見で、新しいモデルが、ユーザーが話している最中に割り込んでしまったり、質問に答えるのに十分な知能が欠けていたりといった問題に対処すると述べた。更新されたモデルは、会話の流れを維持しつつ、検索、推論、またはエージェントタスクのために、GPT-5.5などの最新のテキストモデルにクエリをルーティングする。
またOpenAIは、このモデルが話しかけられるまで長時間にわたり沈黙を保ち、会話の文脈を吸収し続けることができることを実演した。 さらに、新しい音声モードは最新のGPTモデルと統合されているため、情報を視覚的に提示することが可能です。DSTやLux Capitalから4,000万ドルのシード資金を調達したMonogramなどの他のスタートアップも、アシスタントのインタラクティブ性を高めるために視覚的な応答に注力しています。
同社は、ChatGPTの新しい音声モードが、より長い会話に対応するように設計されていると述べた。ブリーフィングでは、ChatGPT Voiceのプロダクトリードであるアティ・エレティ氏が、散歩中にこの音声機能を使って30分から40分間の会話を交わしたことを明かした。
OpenAIは、音声が複雑なコンピューティングタスクの主要なインターフェースになる可能性があると見ている。報道によると、同社は今年中にAI機能を搭載したイヤホンを発売する可能性があるが、ハードウェア製品に関する詳細は明らかにされなかった。
「将来的には、これが音声を活用してコンピューティングの主要なインターフェースとして機能させ、ますます複雑化する長期にわたるエージェント型作業を管理する能力も解き放つと考えています。人々がCodexやChatGPTを使って実現しているような驚くべきユースケースにおいて、音声こそがあらゆる種類の作業に向けた未来のインターフェースになり得ると考えています」とエレティ氏は述べた。
OpenAIはここ数年、ChatGPTの音声モードをより自然なものにするため、音声ベースの機能の強化を進めてきた。同社によると、1億5000万人以上が「Voice」および「Dictation」機能を利用してChatGPTと対話しているという。
競合他社も、自社のアシスタントの表現力を高める取り組みを進めている。
AppleとAmazonはともに、文脈処理能力を向上させ、アシスタントの会話性を高めるアップデートを実施した。Oculusの共同創業者であるブレンダン・イリベ氏とアンキット・クマール氏が共同設立したSesameのようなスタートアップ企業は、バックグラウンドタスクを処理しながら、より自然な会話ができるAIアシスタントをリリースしている。
OpenAIも同様の道を歩んでおり、ユーザーがハンズフリーでより長い時間アシスタントとやり取りできるようにすることを目指している。 新しい音声モードの音声はより自然になったと主張しているものの、同社はこれがAIコンパニオンとして設計されたものではないことを強調した。また、新しいモデルには、10代の若者に対して年齢に応じた適切な応答を提供するための安全対策が組み込まれており、自傷行為などの話題に会話が及んだ場合には関連リソースを提示する仕組みも備わっていると述べた。
新しい音声モードにはまだ改善の余地がある。ヒンディー語のリアルタイム翻訳機能のデモでは、アシスタントは強いアメリカ訛りで話し、不自然でやや堅苦しいヒンディー語を使用していた。同社は、このモードが「最も広く話されている言語」向けに最適化されていると述べたが、具体的な言語名は明言しなかった。
関連記事
Google、Geminiへの焦点がユーザー制御へシフトする中で、Remy AIエージェントをテスト
『Business Insider』によると、GoogleはGemini向けの新しいAIパーソナルエージェント「Remy」をテスト中である。このツールはユーザーに代わってタスクを実行することを目的としており、業務フローと日常のルーチンの両方を効率化する。現在、RemyはGeminiアプリケーションの社内限定版においてテストが行われている。この報道は社内文書と、プロジェクトに精通した2人の人物へのインタビューを引用している。社内資料では、Remyを「24時間365日のパーソナルエージェント」と位
オリー社、AIアシスタント競争で優位に立つためプライバシー重視を掲げる
真に役立つAIアシスタントであるためには、ユーザーを深く理解する必要があります。日常生活向けに設計されたパーソナルアシスタント「Ollie」は、そのためにデータを明け渡したり、プライバシーを犠牲にしたりする必要はないという前提で動作します。一部のエンタープライズ向けAIツールにはデータプライバシー保護措置が講じられていますが、OllieはSOC 2準拠を達成した、一般家庭向けのAIサービスとしては
「AI LIVE: London」がAIと産業オートメーションをどのように掘り下げるか
このサミットには、世界中から経営幹部が集まり、AIによる変革から経済の変動性に至るまで、世界の産業が直面する喫緊の課題について議論します。「AI LIVE: The London Summit」では、「テクノロジー+人間の目的」をテーマに、2,000名を超える国際的なリーダーが一堂に会し、人工知能の新たな時代について検討を行います。BizClik傘下の『AI Magazine』は、「AI LIVE
関連特集おすすめ
コメント (0)
0/500

OpenAIは、より自然な話し口を実現し、会話のやり取りをより効果的に管理できるように設計された、新しい対話型モデル「GPT-Live-1」および「GPT-Live-1 mini」をリリースしました。これらの全二重通信モデルは、話すことと聞くことを同時に行うことができるため、ユーザーが自然に会話を割り込むことが可能になり、リアルタイム翻訳などの機能も利用できるようになります。
また同社は、ChatGPTの現行「Advanced Voice Mode」に代わるデフォルト機能として、「GPT-Live-1 mini」の提供を開始しています。有料プランのユーザーは、より大規模な「GPT-Live-1」モデルを利用できるようになります。 従来、システムは音声認識モデル、応答生成用の大規模言語モデル、およびテキスト読み上げモデルを組み合わせて、最終出力を生成していました。
OpenAIは記者会見で、新しいモデルが、ユーザーが話している最中に割り込んでしまったり、質問に答えるのに十分な知能が欠けていたりといった問題に対処すると述べた。更新されたモデルは、会話の流れを維持しつつ、検索、推論、またはエージェントタスクのために、GPT-5.5などの最新のテキストモデルにクエリをルーティングする。
またOpenAIは、このモデルが話しかけられるまで長時間にわたり沈黙を保ち、会話の文脈を吸収し続けることができることを実演した。 さらに、新しい音声モードは最新のGPTモデルと統合されているため、情報を視覚的に提示することが可能です。DSTやLux Capitalから4,000万ドルのシード資金を調達したMonogramなどの他のスタートアップも、アシスタントのインタラクティブ性を高めるために視覚的な応答に注力しています。
同社は、ChatGPTの新しい音声モードが、より長い会話に対応するように設計されていると述べた。ブリーフィングでは、ChatGPT Voiceのプロダクトリードであるアティ・エレティ氏が、散歩中にこの音声機能を使って30分から40分間の会話を交わしたことを明かした。
OpenAIは、音声が複雑なコンピューティングタスクの主要なインターフェースになる可能性があると見ている。報道によると、同社は今年中にAI機能を搭載したイヤホンを発売する可能性があるが、ハードウェア製品に関する詳細は明らかにされなかった。
「将来的には、これが音声を活用してコンピューティングの主要なインターフェースとして機能させ、ますます複雑化する長期にわたるエージェント型作業を管理する能力も解き放つと考えています。人々がCodexやChatGPTを使って実現しているような驚くべきユースケースにおいて、音声こそがあらゆる種類の作業に向けた未来のインターフェースになり得ると考えています」とエレティ氏は述べた。
OpenAIはここ数年、ChatGPTの音声モードをより自然なものにするため、音声ベースの機能の強化を進めてきた。同社によると、1億5000万人以上が「Voice」および「Dictation」機能を利用してChatGPTと対話しているという。
競合他社も、自社のアシスタントの表現力を高める取り組みを進めている。
AppleとAmazonはともに、文脈処理能力を向上させ、アシスタントの会話性を高めるアップデートを実施した。Oculusの共同創業者であるブレンダン・イリベ氏とアンキット・クマール氏が共同設立したSesameのようなスタートアップ企業は、バックグラウンドタスクを処理しながら、より自然な会話ができるAIアシスタントをリリースしている。
OpenAIも同様の道を歩んでおり、ユーザーがハンズフリーでより長い時間アシスタントとやり取りできるようにすることを目指している。 新しい音声モードの音声はより自然になったと主張しているものの、同社はこれがAIコンパニオンとして設計されたものではないことを強調した。また、新しいモデルには、10代の若者に対して年齢に応じた適切な応答を提供するための安全対策が組み込まれており、自傷行為などの話題に会話が及んだ場合には関連リソースを提示する仕組みも備わっていると述べた。
新しい音声モードにはまだ改善の余地がある。ヒンディー語のリアルタイム翻訳機能のデモでは、アシスタントは強いアメリカ訛りで話し、不自然でやや堅苦しいヒンディー語を使用していた。同社は、このモードが「最も広く話されている言語」向けに最適化されていると述べたが、具体的な言語名は明言しなかった。
オリー社、AIアシスタント競争で優位に立つためプライバシー重視を掲げる
真に役立つAIアシスタントであるためには、ユーザーを深く理解する必要があります。日常生活向けに設計されたパーソナルアシスタント「Ollie」は、そのためにデータを明け渡したり、プライバシーを犠牲にしたりする必要はないという前提で動作します。一部のエンタープライズ向けAIツールにはデータプライバシー保護措置が講じられていますが、OllieはSOC 2準拠を達成した、一般家庭向けのAIサービスとしては
「AI LIVE: London」がAIと産業オートメーションをどのように掘り下げるか
このサミットには、世界中から経営幹部が集まり、AIによる変革から経済の変動性に至るまで、世界の産業が直面する喫緊の課題について議論します。「AI LIVE: The London Summit」では、「テクノロジー+人間の目的」をテーマに、2,000名を超える国際的なリーダーが一堂に会し、人工知能の新たな時代について検討を行います。BizClik傘下の『AI Magazine』は、「AI LIVE





家






