ミストラル、オープンソースの音声生成モデルを発表
フランスのAI企業Mistralは木曜日、音声AIアシスタントやカスタマーサポートなどの企業向けアプリケーション向けに設計された、新しいオープンソースのテキスト読み上げ(TTS)モデルを発表した。このモデルにより、企業は営業や顧客エンゲージメントのための音声エージェントを構築できるようになり、MistralはElevenLabs、Deepgram、OpenAIの直接的な競合相手としての地位を確立した。
「Voxtral TTS」と名付けられたこのモデルは、英語、フランス語、ドイツ語、スペイン語、オランダ語、ポルトガル語、イタリア語、ヒンディー語、アラビア語の9言語に対応している。
「顧客から音声モデルの要望が寄せられていました。そこで、スマートウォッチ、スマートフォン、ノートPC、その他のエッジデバイスに搭載可能な小型の音声モデルを開発しました。コストは市場の他製品に比べてごくわずかですが、最先端の性能を発揮します」と、Mistral AIのサイエンスオペレーション担当副社長であるピエール・ストック氏は、TechCrunchとの電話インタビューで語った。

画像提供:Mistral
Mistral社によると、この新モデルは5秒未満の音声サンプルを用いて特定の声に順応でき、微妙なアクセント、抑揚、イントネーション、そして話し方の不規則性まで捉えることができるという。Ministral 3Bを基盤として構築されており、声の特性を維持したまま言語を切り替えることができるため、吹き替えやリアルタイム翻訳に最適だ。ストック氏は、同社がロボットのような音声ではなく、人間らしい音声を実現することを目指したと述べた。
同社によると、このモデルはリアルタイム性能を重視して設計されている。入力を受け取ってから「話し始める」までの時間である「Time-to-First-Audio(TTFA)」は、500文字の10秒間のサンプルに対して90ミリ秒である。 また、このモデルはリアルタイムファクター(RTF)6倍を達成しており、10秒間のクリップを約1.6秒で生成できることを意味する。

画像提供:Mistral AI
今年初め、Mistralは2つの文字起こしモデルをリリースしました。1つは大規模なバッチ処理用、もう1つは低遅延のリアルタイムユースケース向けです。この新しい音声モデルにより、同社は企業向けの包括的な音声製品スイートを構築しているようです。
ストック氏は次のように付け加えた。「音声、テキスト、画像といったマルチモーダルな入力ストリームと出力を処理できるエンドツーエンドのプラットフォームを構築する計画だ。最大の利点は、音声の入出力に対応したエンドツーエンドのエージェンティックシステムが、はるかに豊富な情報を提供できる点にある。」
Mistralは、そのオープンソースという性質とカスタマイズ機能を主要な差別化要因として位置付けており、企業が特定のニーズに合わせてモデルを調整できるため、競合他社のソリューションよりも優位性があるとしています。
関連記事
ElevenLabs、楽曲の途中でジャンルを切り替える音楽AIを発表
音声AI企業であるElevenLabsは、楽曲生成モデルの最新バージョンであるMusic v2をリリースしました。この新バージョンでは曲の途中でジャンルを変更することが可能です。このモデルは複雑なボーカルや楽曲構成にも対応するよう設計されています。同社が初版の楽曲生成モデルを発表してから約10ヶ月後の今回のリリースとなります。ElevenLabsによると、このモデルはオペラからヘヴィメタルへ、またその逆へと切り替えたり、一貫性を失うことなく速いテンポのラップを生成したり、楽曲に非音楽的な効果音
Google、DocsとKeepに音声プロンプト機能を導入
Google I/O 開発者会議において、同社は Docs、Keep、Gmail などの Workspace アプリに音声プロンプト機能を導入すると発表した。この機能により、ユーザーは音声を使って下書きを作成したり、メモを取ったり、メールを検索したりできるようになる。Docsでは、音声だけで文書の下書きを作成できます。TechCrunchが行ったデモでは、ユーザーがDriveから履歴書の詳細情報を
ゴールドマン・サックス出身者やMetaの創業者らが、見過ごされがちな市場向けに音声AIを開発
カスタマーサポートとサービスは、今日の音声AI分野において最も注目されている領域の一つです。しかし、人間のような話し方で、かつ遅延を最小限に抑えて応答する製品を開発することは、市場によっては他の市場よりもはるかに困難です。そして、主要なプレーヤーの多くは、アフリカや中東を念頭に置いて設計されていませんでした。このギャップを埋めるために昨年設立されたスタートアップ「AethexAI」は、4DX Ve
関連特集おすすめ
コメント (1)
0/500
I just tried out Mistral’s new open-source TTS model yesterday, and its pronunciation is way more natural than most free options I’ve used before. It’s super useful for companies that want to build their own voice assistants without spending tons on licensed services. Do you think this will change the game in the enterprise voice AI market?
フランスのAI企業Mistralは木曜日、音声AIアシスタントやカスタマーサポートなどの企業向けアプリケーション向けに設計された、新しいオープンソースのテキスト読み上げ(TTS)モデルを発表した。このモデルにより、企業は営業や顧客エンゲージメントのための音声エージェントを構築できるようになり、MistralはElevenLabs、Deepgram、OpenAIの直接的な競合相手としての地位を確立した。
「Voxtral TTS」と名付けられたこのモデルは、英語、フランス語、ドイツ語、スペイン語、オランダ語、ポルトガル語、イタリア語、ヒンディー語、アラビア語の9言語に対応している。
「顧客から音声モデルの要望が寄せられていました。そこで、スマートウォッチ、スマートフォン、ノートPC、その他のエッジデバイスに搭載可能な小型の音声モデルを開発しました。コストは市場の他製品に比べてごくわずかですが、最先端の性能を発揮します」と、Mistral AIのサイエンスオペレーション担当副社長であるピエール・ストック氏は、TechCrunchとの電話インタビューで語った。

画像提供:Mistral
Mistral社によると、この新モデルは5秒未満の音声サンプルを用いて特定の声に順応でき、微妙なアクセント、抑揚、イントネーション、そして話し方の不規則性まで捉えることができるという。Ministral 3Bを基盤として構築されており、声の特性を維持したまま言語を切り替えることができるため、吹き替えやリアルタイム翻訳に最適だ。ストック氏は、同社がロボットのような音声ではなく、人間らしい音声を実現することを目指したと述べた。
同社によると、このモデルはリアルタイム性能を重視して設計されている。入力を受け取ってから「話し始める」までの時間である「Time-to-First-Audio(TTFA)」は、500文字の10秒間のサンプルに対して90ミリ秒である。 また、このモデルはリアルタイムファクター(RTF)6倍を達成しており、10秒間のクリップを約1.6秒で生成できることを意味する。

画像提供:Mistral AI
今年初め、Mistralは2つの文字起こしモデルをリリースしました。1つは大規模なバッチ処理用、もう1つは低遅延のリアルタイムユースケース向けです。この新しい音声モデルにより、同社は企業向けの包括的な音声製品スイートを構築しているようです。
ストック氏は次のように付け加えた。「音声、テキスト、画像といったマルチモーダルな入力ストリームと出力を処理できるエンドツーエンドのプラットフォームを構築する計画だ。最大の利点は、音声の入出力に対応したエンドツーエンドのエージェンティックシステムが、はるかに豊富な情報を提供できる点にある。」
Mistralは、そのオープンソースという性質とカスタマイズ機能を主要な差別化要因として位置付けており、企業が特定のニーズに合わせてモデルを調整できるため、競合他社のソリューションよりも優位性があるとしています。
ElevenLabs、楽曲の途中でジャンルを切り替える音楽AIを発表
音声AI企業であるElevenLabsは、楽曲生成モデルの最新バージョンであるMusic v2をリリースしました。この新バージョンでは曲の途中でジャンルを変更することが可能です。このモデルは複雑なボーカルや楽曲構成にも対応するよう設計されています。同社が初版の楽曲生成モデルを発表してから約10ヶ月後の今回のリリースとなります。ElevenLabsによると、このモデルはオペラからヘヴィメタルへ、またその逆へと切り替えたり、一貫性を失うことなく速いテンポのラップを生成したり、楽曲に非音楽的な効果音
Google、DocsとKeepに音声プロンプト機能を導入
Google I/O 開発者会議において、同社は Docs、Keep、Gmail などの Workspace アプリに音声プロンプト機能を導入すると発表した。この機能により、ユーザーは音声を使って下書きを作成したり、メモを取ったり、メールを検索したりできるようになる。Docsでは、音声だけで文書の下書きを作成できます。TechCrunchが行ったデモでは、ユーザーがDriveから履歴書の詳細情報を
ゴールドマン・サックス出身者やMetaの創業者らが、見過ごされがちな市場向けに音声AIを開発
カスタマーサポートとサービスは、今日の音声AI分野において最も注目されている領域の一つです。しかし、人間のような話し方で、かつ遅延を最小限に抑えて応答する製品を開発することは、市場によっては他の市場よりもはるかに困難です。そして、主要なプレーヤーの多くは、アフリカや中東を念頭に置いて設計されていませんでした。このギャップを埋めるために昨年設立されたスタートアップ「AethexAI」は、4DX Ve
I just tried out Mistral’s new open-source TTS model yesterday, and its pronunciation is way more natural than most free options I’ve used before. It’s super useful for companies that want to build their own voice assistants without spending tons on licensed services. Do you think this will change the game in the enterprise voice AI market?





家






