マイクロソフトのAIファミリー「VibeVoice」がオープンソース化、90分間の対話に対応、GitHubのスター数が2万7000を超えた
マイクロソフトは最近、自動音声認識(ASR)やテキスト読み上げ(TTS)などの機能を備えた、最先端の音声AIモデル群「VibeVoice」をオープンソース化しました。 このプロジェクトは、堅牢な長音源処理、自然な複数話者による対話生成、そしてリアルタイムかつ低遅延のパフォーマンスにより、開発者コミュニティから急速に注目を集めています。すでにGitHubで約27,000件のスターを獲得しています。
MITライセンスの下でオープンソースの研究フレームワークとして公開されたVibeVoiceは、クラウド利用料なしでローカル展開が可能であり、音声合成分野におけるコラボレーションとイノベーションの促進を目指しています。このモデルファミリーは3つのコアモデルで構成されており、それぞれが長文処理、話者の一貫性、自然な流暢性など、従来の音声AIが抱える特定の課題に対応しています。

VibeVoice-ASR-7B:最大60分間の音声を処理する、構造化音声認識のための強力なツール
VibeVoice-ASR-7Bは、最大60分間の音声ファイルを1回の処理で処理し、構造化された文字起こしを直接出力できる統合型音声認識モデルです。出力結果には話者の識別、正確なタイムスタンプ、発話内容の詳細が含まれ、固有名詞や専門用語の精度を高めるためのカスタムホットワードもサポートしています。 50以上の言語に対応しており、長時間の会議録音やポッドキャストの文字起こしといった複雑なシナリオに最適です。
コミュニティの開発者たちは、macOSおよびWindows向けの音声入力ツール「Vibing」など、このモデルを活用した実用的なツールをすでに開発しています。ユーザーからのフィードバックによると、速度と精度において高いパフォーマンスを発揮し、日々の音声入力の効率を大幅に向上させているとのことです。
VibeVoice-TTS-1.5B:最大 90 分間の複数話者による表現力豊かな音声生成
VibeVoice-TTS-1.5Bは中核となるテキスト読み上げモデルであり、一度に最大90分間の連続音声生成が可能で、最大4人の異なる話者をサポートし、自然な対話シミュレーションを実現します。合成音声は表現力豊かで、自然な間や強調、感情の変化をリアルに再現し、流暢に聞こえるため、ポッドキャスト、長編ナレーション、オーディオブック、または複数キャラクターによる対話に最適です。
1~2人の話者に限定される多くの従来のTTSモデルとは異なり、VibeVoice-TTSは長文および複数話者における一貫性において画期的な進歩を遂げています。そのアーキテクチャは、連続音声トークナイザー(音響的および意味的)と低フレームレート(7.5Hz)を組み合わせることで、長文シーケンスにおける計算効率を大幅に向上させています。
VibeVoice-Realtime-0.5B:約300ミリ秒のレイテンシーを実現するリアルタイムTTS
VibeVoice-Realtime-0.5Bはリアルタイムアプリケーション向けに設計されており、約300ミリ秒のファーストオーディオレイテンシーでストリーミングテキスト入力をサポートしつつ、最大10分間の音声生成が可能です。このモデルは、リアルタイム音声アシスタントやライブストリーミングの吹き替えなど、即時のフィードバックを必要とするインタラクティブなアプリケーションに特に適しています。
さらに、本プロジェクトでは実験的な話者サポートが導入されており、多言語音声や様々な英語スタイルのバリエーションが含まれており、開発者により幅広いカスタマイズオプションを提供します。
AIbaseレビュー:MicrosoftによるVibeVoiceのオープンソース化は、高性能な音声AIへの参入障壁を下げるだけでなく、完全なローカル展開ソリューションも提供します。このプロジェクトは、悪用されるリスクがあるとして一時的に公開が停止されましたが、音声透かしや音声による免責事項などのセキュリティ対策を実施した後、責任あるAI開発の原則に沿って再開されました。開発者は現在、GitHubやHugging Faceからモデルウェイトを入手し、Colabなどのプラットフォームを通じて迅速にテストを行うことができます。
Apple Silicon向けの最適化を含むオープンソースコミュニティからの継続的な貢献により、VibeVoiceはコンテンツ作成、アクセシビリティツール、音声インタラクション分野での採用を加速させる態勢が整っています。関心のある開発者は、Microsoftの公式プロジェクトページにアクセスして詳細を確認できます。
プロジェクトURL: https://github.com/microsoft/VibeVoice
関連記事
米国の株式市場が歴史的なマイルストーンに到達、AIと航空宇宙の巨人が1兆ドル規模のデビューに向けて準備を進める
エロン・マスク、サム・アルトマン、ダリオ・アモダイというテクノロジー業界の三巨頭が、それぞれの事業で初公開株式発行(IPO)に向けて進んでいる。スペースX、OpenAI、Anthropicという業界の巨人3社が1兆ドル規模の企業価値に近づき、上場準備を進める中、2026年は米国史上、新規株式発行が最も重要な年となる見込みだ。この歴史的な資金増強は世界の金融の注目を集めており、公的市場がこのような規模の資金を吸収する能力に対する重要なストレステストとなっている。これらの主要な資金調達が一斉に開始
スウェーデンのAIスタートアップ「Lovable」が主要な資金調達ラウンド終了後、132億ドルの評価額を達成
AI駆動のコーディングツールが注目を集める中、スウェーデンのスタートアップ企業Lovableは大型の資金調達ラウンドを獲得した。同社は30億ドルの調達を目指しており、これにより評価額が昨年12月に記録された66億ドルの倍となる132億ドルに達する可能性がある。この投資をリードするのはMenlo Venturesと見られている。Lovableの魅力は、複雑なコーディングスキルを不要とし、ソフトウェア作成を簡素化する中核の「ヴァイブコーディング」技術に由来する。ユーザーは自然言語で要件を記述するだ
Google、Geminiへの焦点がユーザー制御へシフトする中で、Remy AIエージェントをテスト
『Business Insider』によると、GoogleはGemini向けの新しいAIパーソナルエージェント「Remy」をテスト中である。このツールはユーザーに代わってタスクを実行することを目的としており、業務フローと日常のルーチンの両方を効率化する。現在、RemyはGeminiアプリケーションの社内限定版においてテストが行われている。この報道は社内文書と、プロジェクトに精通した2人の人物へのインタビューを引用している。社内資料では、Remyを「24時間365日のパーソナルエージェント」と位
関連特集おすすめ
コメント (0)
0/500
マイクロソフトは最近、自動音声認識(ASR)やテキスト読み上げ(TTS)などの機能を備えた、最先端の音声AIモデル群「VibeVoice」をオープンソース化しました。 このプロジェクトは、堅牢な長音源処理、自然な複数話者による対話生成、そしてリアルタイムかつ低遅延のパフォーマンスにより、開発者コミュニティから急速に注目を集めています。すでにGitHubで約27,000件のスターを獲得しています。
MITライセンスの下でオープンソースの研究フレームワークとして公開されたVibeVoiceは、クラウド利用料なしでローカル展開が可能であり、音声合成分野におけるコラボレーションとイノベーションの促進を目指しています。このモデルファミリーは3つのコアモデルで構成されており、それぞれが長文処理、話者の一貫性、自然な流暢性など、従来の音声AIが抱える特定の課題に対応しています。

VibeVoice-ASR-7B:最大60分間の音声を処理する、構造化音声認識のための強力なツール
VibeVoice-ASR-7Bは、最大60分間の音声ファイルを1回の処理で処理し、構造化された文字起こしを直接出力できる統合型音声認識モデルです。出力結果には話者の識別、正確なタイムスタンプ、発話内容の詳細が含まれ、固有名詞や専門用語の精度を高めるためのカスタムホットワードもサポートしています。 50以上の言語に対応しており、長時間の会議録音やポッドキャストの文字起こしといった複雑なシナリオに最適です。
コミュニティの開発者たちは、macOSおよびWindows向けの音声入力ツール「Vibing」など、このモデルを活用した実用的なツールをすでに開発しています。ユーザーからのフィードバックによると、速度と精度において高いパフォーマンスを発揮し、日々の音声入力の効率を大幅に向上させているとのことです。
VibeVoice-TTS-1.5B:最大 90 分間の複数話者による表現力豊かな音声生成
VibeVoice-TTS-1.5Bは中核となるテキスト読み上げモデルであり、一度に最大90分間の連続音声生成が可能で、最大4人の異なる話者をサポートし、自然な対話シミュレーションを実現します。合成音声は表現力豊かで、自然な間や強調、感情の変化をリアルに再現し、流暢に聞こえるため、ポッドキャスト、長編ナレーション、オーディオブック、または複数キャラクターによる対話に最適です。
1~2人の話者に限定される多くの従来のTTSモデルとは異なり、VibeVoice-TTSは長文および複数話者における一貫性において画期的な進歩を遂げています。そのアーキテクチャは、連続音声トークナイザー(音響的および意味的)と低フレームレート(7.5Hz)を組み合わせることで、長文シーケンスにおける計算効率を大幅に向上させています。
VibeVoice-Realtime-0.5B:約300ミリ秒のレイテンシーを実現するリアルタイムTTS
VibeVoice-Realtime-0.5Bはリアルタイムアプリケーション向けに設計されており、約300ミリ秒のファーストオーディオレイテンシーでストリーミングテキスト入力をサポートしつつ、最大10分間の音声生成が可能です。このモデルは、リアルタイム音声アシスタントやライブストリーミングの吹き替えなど、即時のフィードバックを必要とするインタラクティブなアプリケーションに特に適しています。
さらに、本プロジェクトでは実験的な話者サポートが導入されており、多言語音声や様々な英語スタイルのバリエーションが含まれており、開発者により幅広いカスタマイズオプションを提供します。
AIbaseレビュー:MicrosoftによるVibeVoiceのオープンソース化は、高性能な音声AIへの参入障壁を下げるだけでなく、完全なローカル展開ソリューションも提供します。このプロジェクトは、悪用されるリスクがあるとして一時的に公開が停止されましたが、音声透かしや音声による免責事項などのセキュリティ対策を実施した後、責任あるAI開発の原則に沿って再開されました。開発者は現在、GitHubやHugging Faceからモデルウェイトを入手し、Colabなどのプラットフォームを通じて迅速にテストを行うことができます。
Apple Silicon向けの最適化を含むオープンソースコミュニティからの継続的な貢献により、VibeVoiceはコンテンツ作成、アクセシビリティツール、音声インタラクション分野での採用を加速させる態勢が整っています。関心のある開発者は、Microsoftの公式プロジェクトページにアクセスして詳細を確認できます。
プロジェクトURL: https://github.com/microsoft/VibeVoice
米国の株式市場が歴史的なマイルストーンに到達、AIと航空宇宙の巨人が1兆ドル規模のデビューに向けて準備を進める
エロン・マスク、サム・アルトマン、ダリオ・アモダイというテクノロジー業界の三巨頭が、それぞれの事業で初公開株式発行(IPO)に向けて進んでいる。スペースX、OpenAI、Anthropicという業界の巨人3社が1兆ドル規模の企業価値に近づき、上場準備を進める中、2026年は米国史上、新規株式発行が最も重要な年となる見込みだ。この歴史的な資金増強は世界の金融の注目を集めており、公的市場がこのような規模の資金を吸収する能力に対する重要なストレステストとなっている。これらの主要な資金調達が一斉に開始
スウェーデンのAIスタートアップ「Lovable」が主要な資金調達ラウンド終了後、132億ドルの評価額を達成
AI駆動のコーディングツールが注目を集める中、スウェーデンのスタートアップ企業Lovableは大型の資金調達ラウンドを獲得した。同社は30億ドルの調達を目指しており、これにより評価額が昨年12月に記録された66億ドルの倍となる132億ドルに達する可能性がある。この投資をリードするのはMenlo Venturesと見られている。Lovableの魅力は、複雑なコーディングスキルを不要とし、ソフトウェア作成を簡素化する中核の「ヴァイブコーディング」技術に由来する。ユーザーは自然言語で要件を記述するだ





家






