Google、騒がしい環境でも正確なテキスト変換を実現する「Gemini 3.5 Transcribe」を発表
Googleは、Geminiシリーズの最新モデルである「Gemini 3.5 Transcribe」を正式にリリースし、同シリーズの中で最も精度の高い音声認識モデルとして位置づけています。現在、開発者、企業、一般ユーザー向けに提供されているこのモデルは、背景ノイズ、専門用語、自然な話し方など、業界が長年抱えてきた課題に対処します。
強力な汎化能力を備えた「Gemini 3.5 Transcribe」は、背景ノイズの除去や、専門分野にわたる複雑な語彙の処理に優れています。 このモデルはすでに、macOS版のGeminiアプリやAndroid版Gboardの「Rambler」機能において、パフォーマンスの向上を実現しています。開発者はこのツールを活用して、音声対応エージェント、リアルタイム字幕システム、通話後の分析ワークフローなど、革新的なソリューションを構築することができます。

日常会話のニュアンスに合わせて最適化されたこのモデルは、意味的な意図を正確に捉え、独自の語彙を識別することで、ユーザーが音声でタスクを完了できるよう支援します。自動修正、間投詞(「えー」「あー」など)のインテリジェントな除去、自動テキスト書式設定といった実用的な機能も備えています。 さらに、ファイル分析や画像生成といった複雑なタスクを他のGeminiモデルに委任することができ、エンドツーエンドのマルチモデル連携体験を提供します。
Googleの公開データによると、Gemini 3.5 Transcribeは、ストリーミング環境において平均単語誤り率(WER)がわずか4.0%、非ストリーミング環境では2.6%を達成しています。 騒がしい環境でも高い認識安定性を維持し、注文番号や郵便番号などの重要な英数字情報に対して優れた精度を発揮します。
また、このモデルは多言語対応とパーソナライゼーションにも優れており、85の言語に対応し、さまざまな地域のアクセントや方言に適応します。前処理済みの音声については、最大3人の話者に対するタイムスタンプ付きの話し手識別機能を提供します。さらに、ユーザー定義の語彙リストを完全にサポートしており、専門用語、独自の綴り、業界固有の名称を効果的に処理します。
エコシステムとの統合に関しては、開発者はGoogle AI StudioおよびGoogle Antigravity上のGemini APIを通じてGemini 3.5 Transcribeのプレビュー版にアクセスでき、一般ユーザーはAndroidおよびmacOSで試用できます。Googleは、このモデルをChromeに統合し、あらゆるWebフィールドでの音声入力を可能にする予定です。 今回の展開は、「Gemini 3.7 Flash」のリリース、全米のアンドロイドユーザーへのGeminiの提供拡大、およびWaymoの自動運転車への統合に続くものであり、あらゆるシナリオに対応するGoogleのAI製品群の急速な進展を裏付けるものです。
関連記事
米国の株式市場が歴史的なマイルストーンに到達、AIと航空宇宙の巨人が1兆ドル規模のデビューに向けて準備を進める
エロン・マスク、サム・アルトマン、ダリオ・アモダイというテクノロジー業界の三巨頭が、それぞれの事業で初公開株式発行(IPO)に向けて進んでいる。スペースX、OpenAI、Anthropicという業界の巨人3社が1兆ドル規模の企業価値に近づき、上場準備を進める中、2026年は米国史上、新規株式発行が最も重要な年となる見込みだ。この歴史的な資金増強は世界の金融の注目を集めており、公的市場がこのような規模の資金を吸収する能力に対する重要なストレステストとなっている。これらの主要な資金調達が一斉に開始
スウェーデンのAIスタートアップ「Lovable」が主要な資金調達ラウンド終了後、132億ドルの評価額を達成
AI駆動のコーディングツールが注目を集める中、スウェーデンのスタートアップ企業Lovableは大型の資金調達ラウンドを獲得した。同社は30億ドルの調達を目指しており、これにより評価額が昨年12月に記録された66億ドルの倍となる132億ドルに達する可能性がある。この投資をリードするのはMenlo Venturesと見られている。Lovableの魅力は、複雑なコーディングスキルを不要とし、ソフトウェア作成を簡素化する中核の「ヴァイブコーディング」技術に由来する。ユーザーは自然言語で要件を記述するだ
Google、Geminiへの焦点がユーザー制御へシフトする中で、Remy AIエージェントをテスト
『Business Insider』によると、GoogleはGemini向けの新しいAIパーソナルエージェント「Remy」をテスト中である。このツールはユーザーに代わってタスクを実行することを目的としており、業務フローと日常のルーチンの両方を効率化する。現在、RemyはGeminiアプリケーションの社内限定版においてテストが行われている。この報道は社内文書と、プロジェクトに精通した2人の人物へのインタビューを引用している。社内資料では、Remyを「24時間365日のパーソナルエージェント」と位
関連特集おすすめ
コメント (0)
0/500
Googleは、Geminiシリーズの最新モデルである「Gemini 3.5 Transcribe」を正式にリリースし、同シリーズの中で最も精度の高い音声認識モデルとして位置づけています。現在、開発者、企業、一般ユーザー向けに提供されているこのモデルは、背景ノイズ、専門用語、自然な話し方など、業界が長年抱えてきた課題に対処します。
強力な汎化能力を備えた「Gemini 3.5 Transcribe」は、背景ノイズの除去や、専門分野にわたる複雑な語彙の処理に優れています。 このモデルはすでに、macOS版のGeminiアプリやAndroid版Gboardの「Rambler」機能において、パフォーマンスの向上を実現しています。開発者はこのツールを活用して、音声対応エージェント、リアルタイム字幕システム、通話後の分析ワークフローなど、革新的なソリューションを構築することができます。

日常会話のニュアンスに合わせて最適化されたこのモデルは、意味的な意図を正確に捉え、独自の語彙を識別することで、ユーザーが音声でタスクを完了できるよう支援します。自動修正、間投詞(「えー」「あー」など)のインテリジェントな除去、自動テキスト書式設定といった実用的な機能も備えています。 さらに、ファイル分析や画像生成といった複雑なタスクを他のGeminiモデルに委任することができ、エンドツーエンドのマルチモデル連携体験を提供します。
Googleの公開データによると、Gemini 3.5 Transcribeは、ストリーミング環境において平均単語誤り率(WER)がわずか4.0%、非ストリーミング環境では2.6%を達成しています。 騒がしい環境でも高い認識安定性を維持し、注文番号や郵便番号などの重要な英数字情報に対して優れた精度を発揮します。
また、このモデルは多言語対応とパーソナライゼーションにも優れており、85の言語に対応し、さまざまな地域のアクセントや方言に適応します。前処理済みの音声については、最大3人の話者に対するタイムスタンプ付きの話し手識別機能を提供します。さらに、ユーザー定義の語彙リストを完全にサポートしており、専門用語、独自の綴り、業界固有の名称を効果的に処理します。
エコシステムとの統合に関しては、開発者はGoogle AI StudioおよびGoogle Antigravity上のGemini APIを通じてGemini 3.5 Transcribeのプレビュー版にアクセスでき、一般ユーザーはAndroidおよびmacOSで試用できます。Googleは、このモデルをChromeに統合し、あらゆるWebフィールドでの音声入力を可能にする予定です。 今回の展開は、「Gemini 3.7 Flash」のリリース、全米のアンドロイドユーザーへのGeminiの提供拡大、およびWaymoの自動運転車への統合に続くものであり、あらゆるシナリオに対応するGoogleのAI製品群の急速な進展を裏付けるものです。
米国の株式市場が歴史的なマイルストーンに到達、AIと航空宇宙の巨人が1兆ドル規模のデビューに向けて準備を進める
エロン・マスク、サム・アルトマン、ダリオ・アモダイというテクノロジー業界の三巨頭が、それぞれの事業で初公開株式発行(IPO)に向けて進んでいる。スペースX、OpenAI、Anthropicという業界の巨人3社が1兆ドル規模の企業価値に近づき、上場準備を進める中、2026年は米国史上、新規株式発行が最も重要な年となる見込みだ。この歴史的な資金増強は世界の金融の注目を集めており、公的市場がこのような規模の資金を吸収する能力に対する重要なストレステストとなっている。これらの主要な資金調達が一斉に開始
スウェーデンのAIスタートアップ「Lovable」が主要な資金調達ラウンド終了後、132億ドルの評価額を達成
AI駆動のコーディングツールが注目を集める中、スウェーデンのスタートアップ企業Lovableは大型の資金調達ラウンドを獲得した。同社は30億ドルの調達を目指しており、これにより評価額が昨年12月に記録された66億ドルの倍となる132億ドルに達する可能性がある。この投資をリードするのはMenlo Venturesと見られている。Lovableの魅力は、複雑なコーディングスキルを不要とし、ソフトウェア作成を簡素化する中核の「ヴァイブコーディング」技術に由来する。ユーザーは自然言語で要件を記述するだ





家






