Hume AI、TADAをリリース:処理速度が5倍で、誤認識のないオープンソースのモバイルTTS

Hume AIは、最新の音声生成モデル「TADA(Text-Acoustic Dual Alignment)」をオープンソース化しました。大規模言語モデル(LLM)を基盤とするこのテキスト・トゥ・スピーチ(TTS)システムは、テキストと音響信号の双方を対象とした革新的なデュアルアライメントアーキテクチャを採用しています。このアプローチにより、生成効率と信頼性が大幅に向上し、実用的な応用範囲も拡大します。
公式発表によると、TADAはテキストトークンと音響表現の間に厳密な1対1の同期を確立しています。このアーキテクチャにより、従来のLLMベースのTTSシステムに見られるトークンレベルのコンテンツ幻覚という一般的な問題が完全に解決されました。1,000件以上のテストサンプルを用いた評価において、本モデルではコンテンツ幻覚が1件も発生しませんでした。
性能面では、TADAは同等のLLM TTSシステムと比較して5倍以上の速度で音声を生成します。また、リソース効率も極めて高く、音声1秒あたりわずか2~3フレームの計算リソースしか必要としません。対照的に、従来のソリューションでは通常12.5~75フレームを必要とします。この効率性により、スマートフォンやエッジデバイスなどの低消費電力ハードウェア上でローカル推論を実行することが可能となり、クラウドサーバーが不要になります。
TADAは中国語を含む多言語対応を提供しており、その多言語バージョンはLlama3.23Bパラメータ規模に基づいています。 今回のリリースには、1B(主に英語向け)および3Bの多言語事前学習済みモデルが含まれています。2048トークンのコンテキストウィンドウを持つこのモデルは、1回の処理で約700秒間の連続音声を出力可能です。この能力は、同じトークン制約下で通常約70秒に制限される従来のソリューションをはるかに上回っています。
重要な革新点の一つは、同期転写機能です。音声生成と同時に、モデルは対応するテキスト転写を出力します。このプロセスにより、別途自動音声認識(ASR)を行う必要がなくなり、テキスト出力における追加の遅延がゼロになります。この機能は、リアルタイムキャプション、音声対話システム、コンテンツ作成ツールにおいて特に有用です。
人間の主観評価において、TADAは「自然さ」と「声の類似性」の両方で2位を獲得しました。パラメータ数が多く、より大規模なトレーニングデータを持つ複数のシステムを上回り、極めて競争力のある音質を誇っています。
リンク: https://huggingface.co/collections/HumeAI/tada
関連記事
スウェーデンのAIスタートアップ「Lovable」が主要な資金調達ラウンド終了後、132億ドルの評価額を達成
AI駆動のコーディングツールが注目を集める中、スウェーデンのスタートアップ企業Lovableは大型の資金調達ラウンドを獲得した。同社は30億ドルの調達を目指しており、これにより評価額が昨年12月に記録された66億ドルの倍となる132億ドルに達する可能性がある。この投資をリードするのはMenlo Venturesと見られている。Lovableの魅力は、複雑なコーディングスキルを不要とし、ソフトウェア作成を簡素化する中核の「ヴァイブコーディング」技術に由来する。ユーザーは自然言語で要件を記述するだ
Google、Geminiへの焦点がユーザー制御へシフトする中で、Remy AIエージェントをテスト
『Business Insider』によると、GoogleはGemini向けの新しいAIパーソナルエージェント「Remy」をテスト中である。このツールはユーザーに代わってタスクを実行することを目的としており、業務フローと日常のルーチンの両方を効率化する。現在、RemyはGeminiアプリケーションの社内限定版においてテストが行われている。この報道は社内文書と、プロジェクトに精通した2人の人物へのインタビューを引用している。社内資料では、Remyを「24時間365日のパーソナルエージェント」と位
Core Web Vitalsを修正してSEOランキングを向上させる方法
AIツールで報告書コメントの作成を効率化はじめに報告書コメント生成用のAIツールMagic SchoolAlmanac AIChat GPTMagic Schoolを使用した報告書コメントの生成Magic Schoolへのログイン報告書コメントツールの選択生徒向けのコメントのカスタマイズAlmanac AIを使用した報告書コメントの生成コースと評価基準の設定報告書の長さと生徒設定の構成Almanac AIによるコメントの生成Magic SchoolとAlmanac A
関連特集おすすめ
コメント (1)
0/500

Hume AIは、最新の音声生成モデル「TADA(Text-Acoustic Dual Alignment)」をオープンソース化しました。大規模言語モデル(LLM)を基盤とするこのテキスト・トゥ・スピーチ(TTS)システムは、テキストと音響信号の双方を対象とした革新的なデュアルアライメントアーキテクチャを採用しています。このアプローチにより、生成効率と信頼性が大幅に向上し、実用的な応用範囲も拡大します。
公式発表によると、TADAはテキストトークンと音響表現の間に厳密な1対1の同期を確立しています。このアーキテクチャにより、従来のLLMベースのTTSシステムに見られるトークンレベルのコンテンツ幻覚という一般的な問題が完全に解決されました。1,000件以上のテストサンプルを用いた評価において、本モデルではコンテンツ幻覚が1件も発生しませんでした。
性能面では、TADAは同等のLLM TTSシステムと比較して5倍以上の速度で音声を生成します。また、リソース効率も極めて高く、音声1秒あたりわずか2~3フレームの計算リソースしか必要としません。対照的に、従来のソリューションでは通常12.5~75フレームを必要とします。この効率性により、スマートフォンやエッジデバイスなどの低消費電力ハードウェア上でローカル推論を実行することが可能となり、クラウドサーバーが不要になります。
TADAは中国語を含む多言語対応を提供しており、その多言語バージョンはLlama3.23Bパラメータ規模に基づいています。 今回のリリースには、1B(主に英語向け)および3Bの多言語事前学習済みモデルが含まれています。2048トークンのコンテキストウィンドウを持つこのモデルは、1回の処理で約700秒間の連続音声を出力可能です。この能力は、同じトークン制約下で通常約70秒に制限される従来のソリューションをはるかに上回っています。
重要な革新点の一つは、同期転写機能です。音声生成と同時に、モデルは対応するテキスト転写を出力します。このプロセスにより、別途自動音声認識(ASR)を行う必要がなくなり、テキスト出力における追加の遅延がゼロになります。この機能は、リアルタイムキャプション、音声対話システム、コンテンツ作成ツールにおいて特に有用です。
人間の主観評価において、TADAは「自然さ」と「声の類似性」の両方で2位を獲得しました。パラメータ数が多く、より大規模なトレーニングデータを持つ複数のシステムを上回り、極めて競争力のある音質を誇っています。
リンク: https://huggingface.co/collections/HumeAI/tada
スウェーデンのAIスタートアップ「Lovable」が主要な資金調達ラウンド終了後、132億ドルの評価額を達成
AI駆動のコーディングツールが注目を集める中、スウェーデンのスタートアップ企業Lovableは大型の資金調達ラウンドを獲得した。同社は30億ドルの調達を目指しており、これにより評価額が昨年12月に記録された66億ドルの倍となる132億ドルに達する可能性がある。この投資をリードするのはMenlo Venturesと見られている。Lovableの魅力は、複雑なコーディングスキルを不要とし、ソフトウェア作成を簡素化する中核の「ヴァイブコーディング」技術に由来する。ユーザーは自然言語で要件を記述するだ
Core Web Vitalsを修正してSEOランキングを向上させる方法
AIツールで報告書コメントの作成を効率化はじめに報告書コメント生成用のAIツールMagic SchoolAlmanac AIChat GPTMagic Schoolを使用した報告書コメントの生成Magic Schoolへのログイン報告書コメントツールの選択生徒向けのコメントのカスタマイズAlmanac AIを使用した報告書コメントの生成コースと評価基準の設定報告書の長さと生徒設定の構成Almanac AIによるコメントの生成Magic SchoolとAlmanac A





家






