OpenAIは、自社のAPIにおいて音声認識機能を発表しました。

オープンAIは木曜日に、自社のAPIに新たな音声認識機能がいくつか追加されたと発表しました。これらの機能は、開発者が会話を行ったり、テキストを転写したり、翻訳したりできるアプリケーションを構築するのに役立つように設計されています。
同社の新しいGPT-Realtime-2は、ユーザーと会話を行うことができるリアルな音声シミュレーションを生成するために開発された音声モデルです。しかし、前身のGPT-Realtime-1.5とは異なり、このバージョンにはGPT-5クラスの推論機能が組み込まれており、オープンAIによると、これによってより複雑なユーザー要求に対応できるようになったとのことです。
また、同社はGPT-Realtime-Translateもリリースしており、その名前の通り、会話中にユーザーの話す内容をリアルタイムで翻訳するサービスを提供します。この機能は70以上の入力言語と13の出力言語をサポートしています。
最後に、オープンAIはGPT-Realtime-Whisperという新しいテキスト転写機能も導入しました。これにより、会話が行われている際にその内容をリアルタイムでテキストに変換することができます。
同社は、「今回リリースされたこれらのモデルによって、リアルタイムのオーディオ処理機能が単純な応答型のものから、実際に仕事をこなせる音声インターフェースへと進化した」と述べています。
これらの更新内容から恩恵を受けるのは誰でしょうか?顧客サービスの機能を拡充したい企業は明らかな対象です。しかし、オープンAIによると、新しい機能は教育、メディア、イベント、クリエイタープラットフォームなど、多岐にわたる分野で活用される見込みです。
これらのツールは企業にとって非常に有用かもしれませんが、悪用される可能性もあります。オープンAIは、新しい機能がスパムや詐欺、その他のオンライン上の不正行為に利用されるのを防ぐための対策を講じていると述べています。システム内には特定のトリガーが組み込まれており、「有害なコンテンツガイドラインに違反していると検出された場合には、会話を停止させることができる」とオープンAIは説明しています。
すべての新しい音声モデルは、オープンAIのRealtime APIに含まれています。TranslateおよびWhisperは分単位で料金が請求されますが、GPT-Realtime-2はトークンの消費量に基づいて料金が計算されます。
関連記事
サム・アルトマン氏によるAIの減速論が議論を呼ぶ
Apple Podcastsで聴くSpotifyで聴くOpenAIのCEO、サム・アルトマン氏は最近、社会が「これらの新しい能力レベルのいくつかに対して強固になる」時間を確保するため、「AI開発の速度を制御する」時期が来た可能性を示唆した。TechCrunchの「Equity」ポッドキャストの最新回で、ケルステン・コロセック、ショーン・Oケイン、そして私自身は、アルトマン氏の発言が、OpenAIのエージェントがHugging Faceのシステムに侵入した最近のハッキング事件をきっかけとしたも
OpenAIはアップルの営業秘密訴訟と戦っている
OpenAIは火曜日、Appleの営業秘密に関する主張に反論し、同訴訟は根拠がないと主張した。「これらの主張を真剣に受け止めているが、それを支持する証拠は見当たらない」とOpenAIは述べた。これはBloombergのEd LudlowがXで報じたものである。「私たちは公正な競争とどこでも働く自由を支持しており、世界中のユーザーを強化する技術の創出に注力しています。」これは、Appleが金曜日に米国北カリフォルニア連邦地方裁判所に提起した訴訟に続くものである。同訴訟は、OpenAIが元App
OpenAIのロボティクス部門ヘッド、ケイトリン・カリノフスキー氏がペンタゴンとの提携を理由に辞任
OpenAIのロボティクスリーダーであるケイトリン・カリノフスキーは、同社と国防総省との論争の的となったパートナーシップの後に辞任した。「これは簡単な決断ではなかった」と、カリノフスキーはソーシャルメディアでの声明で説明した。「AIが国家安全保障において重要な役割を果たしていることは事実だが、司法の監督なしにアメリカ国民の監視を行い、人間の承認なしに致死性の自律システムを展開することは、はるかに慎重な検討を必要とする境界線である」。Metaの拡張現実(AR)グラス部門を率いていたことで知られ
関連特集おすすめ
コメント (0)
0/500

オープンAIは木曜日に、自社のAPIに新たな音声認識機能がいくつか追加されたと発表しました。これらの機能は、開発者が会話を行ったり、テキストを転写したり、翻訳したりできるアプリケーションを構築するのに役立つように設計されています。
同社の新しいGPT-Realtime-2は、ユーザーと会話を行うことができるリアルな音声シミュレーションを生成するために開発された音声モデルです。しかし、前身のGPT-Realtime-1.5とは異なり、このバージョンにはGPT-5クラスの推論機能が組み込まれており、オープンAIによると、これによってより複雑なユーザー要求に対応できるようになったとのことです。
また、同社はGPT-Realtime-Translateもリリースしており、その名前の通り、会話中にユーザーの話す内容をリアルタイムで翻訳するサービスを提供します。この機能は70以上の入力言語と13の出力言語をサポートしています。
最後に、オープンAIはGPT-Realtime-Whisperという新しいテキスト転写機能も導入しました。これにより、会話が行われている際にその内容をリアルタイムでテキストに変換することができます。
同社は、「今回リリースされたこれらのモデルによって、リアルタイムのオーディオ処理機能が単純な応答型のものから、実際に仕事をこなせる音声インターフェースへと進化した」と述べています。
これらの更新内容から恩恵を受けるのは誰でしょうか?顧客サービスの機能を拡充したい企業は明らかな対象です。しかし、オープンAIによると、新しい機能は教育、メディア、イベント、クリエイタープラットフォームなど、多岐にわたる分野で活用される見込みです。
これらのツールは企業にとって非常に有用かもしれませんが、悪用される可能性もあります。オープンAIは、新しい機能がスパムや詐欺、その他のオンライン上の不正行為に利用されるのを防ぐための対策を講じていると述べています。システム内には特定のトリガーが組み込まれており、「有害なコンテンツガイドラインに違反していると検出された場合には、会話を停止させることができる」とオープンAIは説明しています。
すべての新しい音声モデルは、オープンAIのRealtime APIに含まれています。TranslateおよびWhisperは分単位で料金が請求されますが、GPT-Realtime-2はトークンの消費量に基づいて料金が計算されます。
サム・アルトマン氏によるAIの減速論が議論を呼ぶ
Apple Podcastsで聴くSpotifyで聴くOpenAIのCEO、サム・アルトマン氏は最近、社会が「これらの新しい能力レベルのいくつかに対して強固になる」時間を確保するため、「AI開発の速度を制御する」時期が来た可能性を示唆した。TechCrunchの「Equity」ポッドキャストの最新回で、ケルステン・コロセック、ショーン・Oケイン、そして私自身は、アルトマン氏の発言が、OpenAIのエージェントがHugging Faceのシステムに侵入した最近のハッキング事件をきっかけとしたも
OpenAIはアップルの営業秘密訴訟と戦っている
OpenAIは火曜日、Appleの営業秘密に関する主張に反論し、同訴訟は根拠がないと主張した。「これらの主張を真剣に受け止めているが、それを支持する証拠は見当たらない」とOpenAIは述べた。これはBloombergのEd LudlowがXで報じたものである。「私たちは公正な競争とどこでも働く自由を支持しており、世界中のユーザーを強化する技術の創出に注力しています。」これは、Appleが金曜日に米国北カリフォルニア連邦地方裁判所に提起した訴訟に続くものである。同訴訟は、OpenAIが元App
OpenAIのロボティクス部門ヘッド、ケイトリン・カリノフスキー氏がペンタゴンとの提携を理由に辞任
OpenAIのロボティクスリーダーであるケイトリン・カリノフスキーは、同社と国防総省との論争の的となったパートナーシップの後に辞任した。「これは簡単な決断ではなかった」と、カリノフスキーはソーシャルメディアでの声明で説明した。「AIが国家安全保障において重要な役割を果たしていることは事実だが、司法の監督なしにアメリカ国民の監視を行い、人間の承認なしに致死性の自律システムを展開することは、はるかに慎重な検討を必要とする境界線である」。Metaの拡張現実(AR)グラス部門を率いていたことで知られ





家






