OpenAI、新双方向音声モデルGPT-Bidi-1を準備中
OpenAIは、ChatGPTの音声機能を革新するために設計された次世代双方向音声モデル「GPT-Bidi-1」のリリースを準備していると報じられている。双方向アーキテクチャを採用することで、この画期的なモデルは従来の単方向通信の制限を解消し、システムが同時に聴取と発話を行うことを可能にする。これにより、ユーザーの割り込みをリアルタイムで捉え、 stuttering(つまずき)なく動的な意味調整を行うことができ、ライブ音声インタラクションの自然な流れを大幅に向上させる。

開発状況によると、OpenAIはこのモデルの基盤コードをすでにウェブおよびモバイルプラットフォームに統合している。新しい機能は既存の「高度な音声モード」と共存し、ユーザーは必要に応じて更新された「双方向(Bidi)」モードに切り替える柔軟性を得る。さらに、このモデルは「高品質」「標準」「即時」の3つの異なるパフォーマンスティアを導入し、ユーザーは特定のニーズに基づいてインタラクションの深さと応答速度のバランスを取ることができる。

この技術的飛躍は、単なる音声品質の向上を超え、OpenAIのより広範なマルチモーダル戦略における重要な構成要素となっている。
OpenAIのテキストベースモデルは推論能力を強化したGPT-5.5へと進化した一方で、その音声機能は遅れを取っており、全体的なマルチモーダル体験に格差が生じていた。GPT-Bidi-1の導入はこのギャップを埋めるものであり、OpenAIが次世代AIにおける主要なインターフェースとして音声を位置づけるという戦略的ビジョンを強調するものである。この進展は、今後の音声優先ハードウェアデバイスやエンタープライズグレードの音声サポートツールにとって、重要な技術的基盤を確立するものでもある。
関連記事
米政府、大規模言語モデルの学習に関する著作権紛争でOpenAIを支持
トランプ政権は、ニューヨーク・タイムズが提起した著作権訴訟において、OpenAIを支持する20ページの意見書を送付し、同社が無許可の著作権素材を使用して大規模言語モデルを訓練する慣行を擁護した。「米国には、AIの使用に関する実践と手続きにおいて世界的な基準を策定する、強力で競争力のある人工知能産業を引き続き発展させるという強い関心がある…したがって、米国が『人工知能における世界的なリーダーシップを維持する』ことは極めて重要である」と、意見書は述べ、昨年ドナルド・トランプ大統領によって署名された
Nvidiaは、チップ事業に対抗する数十億ドル規模の巨大企業を静かに構築している。
NvidiaのCEOであるジェンセン・ファンは、市場の予測を10年以上先取りし、現在のAIブームが到来するずっと以前となる2010年にAI専用チップの開発に取り掛かった。2020年の並行する戦略的動き、すなわち主要な買収を通じてデータセンターのネットワークを強化したことは、目立たないものではあるものの、Nvidiaの中で最も急速に成長し、最も収益性の高い部門の一つを生み出した。わずか数年のうちに、データセンターを接続するNvidiaのネットワーク部門は、コンピューティングに次ぐ同社の第2の収益
ポーカーAIを開発したDeepMindのトリオが、今やクオンツヘッジファンドにリターンを生み出している
ディープマインドの元研究者3名は、以前、人間のポーカーチャンピオンを破るAIを開発した経験を持ち、その技術を金融市場に応用し、その戦略は大きなリターンを生み出しています。プラハを拠点とする彼らのAI企業、EquiLibre Technologiesは、未公開額のシリーズA資金調達ラウンドを経て、5億ドルのバリュエーションに達しました。これはTechCrunchの報道によるものです。クレアダムが投資ラウンドをリードしました。ベンチャーキャピタル企業は金額を明言しませんでしたが、副社長のキャメロン
関連特集おすすめ
コメント (0)
0/500
OpenAIは、ChatGPTの音声機能を革新するために設計された次世代双方向音声モデル「GPT-Bidi-1」のリリースを準備していると報じられている。双方向アーキテクチャを採用することで、この画期的なモデルは従来の単方向通信の制限を解消し、システムが同時に聴取と発話を行うことを可能にする。これにより、ユーザーの割り込みをリアルタイムで捉え、 stuttering(つまずき)なく動的な意味調整を行うことができ、ライブ音声インタラクションの自然な流れを大幅に向上させる。

開発状況によると、OpenAIはこのモデルの基盤コードをすでにウェブおよびモバイルプラットフォームに統合している。新しい機能は既存の「高度な音声モード」と共存し、ユーザーは必要に応じて更新された「双方向(Bidi)」モードに切り替える柔軟性を得る。さらに、このモデルは「高品質」「標準」「即時」の3つの異なるパフォーマンスティアを導入し、ユーザーは特定のニーズに基づいてインタラクションの深さと応答速度のバランスを取ることができる。

この技術的飛躍は、単なる音声品質の向上を超え、OpenAIのより広範なマルチモーダル戦略における重要な構成要素となっている。
OpenAIのテキストベースモデルは推論能力を強化したGPT-5.5へと進化した一方で、その音声機能は遅れを取っており、全体的なマルチモーダル体験に格差が生じていた。GPT-Bidi-1の導入はこのギャップを埋めるものであり、OpenAIが次世代AIにおける主要なインターフェースとして音声を位置づけるという戦略的ビジョンを強調するものである。この進展は、今後の音声優先ハードウェアデバイスやエンタープライズグレードの音声サポートツールにとって、重要な技術的基盤を確立するものでもある。
米政府、大規模言語モデルの学習に関する著作権紛争でOpenAIを支持
トランプ政権は、ニューヨーク・タイムズが提起した著作権訴訟において、OpenAIを支持する20ページの意見書を送付し、同社が無許可の著作権素材を使用して大規模言語モデルを訓練する慣行を擁護した。「米国には、AIの使用に関する実践と手続きにおいて世界的な基準を策定する、強力で競争力のある人工知能産業を引き続き発展させるという強い関心がある…したがって、米国が『人工知能における世界的なリーダーシップを維持する』ことは極めて重要である」と、意見書は述べ、昨年ドナルド・トランプ大統領によって署名された
Nvidiaは、チップ事業に対抗する数十億ドル規模の巨大企業を静かに構築している。
NvidiaのCEOであるジェンセン・ファンは、市場の予測を10年以上先取りし、現在のAIブームが到来するずっと以前となる2010年にAI専用チップの開発に取り掛かった。2020年の並行する戦略的動き、すなわち主要な買収を通じてデータセンターのネットワークを強化したことは、目立たないものではあるものの、Nvidiaの中で最も急速に成長し、最も収益性の高い部門の一つを生み出した。わずか数年のうちに、データセンターを接続するNvidiaのネットワーク部門は、コンピューティングに次ぐ同社の第2の収益
ポーカーAIを開発したDeepMindのトリオが、今やクオンツヘッジファンドにリターンを生み出している
ディープマインドの元研究者3名は、以前、人間のポーカーチャンピオンを破るAIを開発した経験を持ち、その技術を金融市場に応用し、その戦略は大きなリターンを生み出しています。プラハを拠点とする彼らのAI企業、EquiLibre Technologiesは、未公開額のシリーズA資金調達ラウンドを経て、5億ドルのバリュエーションに達しました。これはTechCrunchの報道によるものです。クレアダムが投資ラウンドをリードしました。ベンチャーキャピタル企業は金額を明言しませんでしたが、副社長のキャメロン





家






