ゴールドマン・サックス出身者やMetaの創業者らが、見過ごされがちな市場向けに音声AIを開発

カスタマーサポートとサービスは、今日の音声AI分野において最も注目されている領域の一つです。しかし、人間のような話し方で、かつ遅延を最小限に抑えて応答する製品を開発することは、市場によっては他の市場よりもはるかに困難です。そして、主要なプレーヤーの多くは、アフリカや中東を念頭に置いて設計されていませんでした。
このギャップを埋めるために昨年設立されたスタートアップ「AethexAI」は、4DX Venturesが主導し、Enza Capital、Dorm Room Fund、Mojo Ventures、Stanford GSB 26 Fundが参加するプレシードラウンドで300万ドルの資金調達に成功した。個人投資家には、スタンフォード大学の教員、通信業界の経営幹部、AnthropicのAI研究者らが名を連ねている。
同社は、VapiやLiveKitといった既存のオーケストレーションツールに依存するのではなく、ターゲット市場で話されている英語、フランス語、アラビア語の地域方言に対応するため、独自のコンパクトなモデルとオーケストレーション層をゼロから構築した。この決定は、後述するように、同地域で事業を展開する上での特有のニーズによって導かれたものである。
また同社は、企業が自社の技術をテストし、サービスに申し込めるプラットフォームの提供を開始するとともに、開発者がモデルを試用できるAPIやSDKも公開している。
このスタートアップは、マリアマ・ディアロ氏とアヨルワ・オデムイワ氏によって設立された。CEOのディアロ氏は以前ゴールドマン・サックスに勤務し、その後YC(Y Combinator)が支援するModelMLにプロダクトおよび成長担当として参画した。CTOのオデムイワ氏はカリフォルニア工科大学(Caltech)を卒業後、Metaで勤務し、スタンフォード大学ビジネススクールに在籍した後、同社を共同創業した。 二人は新興市場向けの何かを構築したいと考え、機会を探し始めた。
世界中の企業が、業務の一部を自動化するためにAIツールの導入を急いでいる。しかし、その導入が必ずしも順調に進むとは限らない。創業者らが調査したところ、エジプトのあるコールセンターでは、通話の大部分を自動化したものの、成果が芳しくなかったためシステムを元に戻していたことが判明した。 アフリカの複数のサポートセンターからは、適切なコストで通話自動化を担当するエンジニアを見つけ、採用することが長年の課題であると伝えられた。
「この地域での自動通話に見られた遅延やジッターは、とんでもないものでした。もし私たちがオーケストレーターとして機能していたら、地域外にホストされた大規模なモデルを使用せざるを得ず、遅延がさらに増大していたかもしれません。 これを機能させるには、非常に小さなモデルを使用し、すべての段階で遅延を削減する必要があると気づいた」と、オデムイワ氏はTechCrunchに対し、自社独自のモデルとオーケストレーション層を構築するという決定について語った。
最新のモデルを展開するAI研究所は、通常、モデルのトレーニングやデータ取得に数百万を費やしている。AethexAIは、この両方の課題に対する解決策を見出した。同社は、可能な限り大規模なモデルを追求するのではなく、精度を維持しつつ遅延の問題に対処するには小型モデルで十分であると結論付け、パラメータ数が3億から17億の範囲の独自の「Kora」シリーズを開発した。 これは大規模言語モデルのサイズに比べればごく一部に過ぎないが、それこそがまさに狙いである。
これらのモデルを学習させるため、同社は提携先のコールセンターから提供された匿名化された録音データを利用しました。また、より多くの音声データを収集するために、アフリカ各地のラジオ局へハードドライブを発送しました。コストを抑えるため、大学生による貢献者ネットワークを構築し、データのアノテーションや現地名の発音作業を行わせました。 その結果、同社によれば、現在1日あたり1万7,000件以上の通話に対応できるようになったという。
ビジネス面では、同社は音声AIを初めて導入するクライアントに対し、プロセスを丁寧に案内することに配慮しており、オンサイトでのデモやワークショップを通じて、自動化に最適なユースケースを特定できるよう支援している。
「現時点では、すべてのお客様のあらゆるニーズに応えることはできないと常にお伝えしています。当社は小規模な企業ですから。企業との話し合いを始める際、まずはその企業にとって最も重要なユースケースを1つ選んでいただくようお願いしています」とディアロ氏は語った。
このスタートアップはあらゆる業界との協業に前向きだが、現時点ではユースケースの大部分が、債権回収、顧客アクティベーション、あるいはKYC(顧客確認)——銀行や通信事業者が採用する標準的な本人確認プロセス——に関連する通話である。 同社は、現地市場に対応するため契約ベースで現地駐在のエンジニアを採用しているほか、音声AI通話のための通信インフラを扱うため、通信事業者とのチャネルパートナーシップを構築している。同社によれば、プラグアンドプレイ型のソリューションは、この市場では通用しないという。
4DX Venturesの共同創業者兼マネージングパートナーであるウォルター・バドゥー氏は、アフリカおよび中東市場は、ほとんどの音声AI企業が対象として設立された市場とは根本的に異なると主張する。
「アフリカや中東の企業は、顧客とのやり取りにおいて依然として音声が主要なチャネルであるため、欧米の企業に比べて約3倍の通話量を処理しています」と彼は述べた。「既存のシステムは、ハイエンドのGPUインフラ、標準的な英語やヨーロッパの音声環境、そして米国や欧州で一般的な企業ワークフローを特徴とする欧米市場向けに構築されました。 そのため、企業の方言やコードスイッチング、非公式な話し方を処理でき、かつ既存の電話インフラや実際の価格帯内で機能するシステムを必要とする場合、大きなギャップが生じているのです。」
言い換えれば、ElevenLabs、Deepgram、Sierra、Cognigyといった企業が急速にグローバル展開を進めている一方で、彼らが当初想定していた市場と、現在参入しようとしている市場は必ずしも一致していない。 AethexAIのようなスタートアップは、現地の方言に特化したモデル、現地でのパートナーシップ、その地域向けに構築されたインフラといった「ギャップ」こそが、大手企業には埋めるインセンティブもアーキテクチャもない市場機会であると見込んでいる。
関連記事
政府におけるエージェント型AIは、厳しい問いに直面している。「機械にどのような決定を許すべきか?」
アラブ首長国連邦(UAE)は、9年間にわたり人工知能(AI)の早期導入を進めてきた。同国は2017年10月に国家AI戦略を発表し、その直後に戦略を統括する閣僚ポストを新設、27歳のオマル・スルタン・アル・オラマ氏を世界初の人工知能担当国務大臣に任命した。 それ以来、同国は、多くの政府がまだ導入の途上にあるデジタルID、ソブリンクラウド、データ共有インフラを整備してきた。政府における「エージェント型
Google、DocsとKeepに音声プロンプト機能を導入
Google I/O 開発者会議において、同社は Docs、Keep、Gmail などの Workspace アプリに音声プロンプト機能を導入すると発表した。この機能により、ユーザーは音声を使って下書きを作成したり、メモを取ったり、メールを検索したりできるようになる。Docsでは、音声だけで文書の下書きを作成できます。TechCrunchが行ったデモでは、ユーザーがDriveから履歴書の詳細情報を
Google、iOS向けに「オフライン優先」のAI音声入力アプリをひっそりとリリース
Googleは今週月曜日、iOS向けに「オフライン優先」の音声入力アプリ「Google AI Edge Eloquent」をひっそりとリリースし、Wispr Flow、SuperWhisper、Willowなどの類似アプリと競合することになった。このアプリは無料でダウンロードできます。Gemmaベースの自動音声認識(ASR)モデルをダウンロードすれば、スマートフォンで音声入力を開始できます。アプリ
関連特集おすすめ
コメント (0)
0/500

カスタマーサポートとサービスは、今日の音声AI分野において最も注目されている領域の一つです。しかし、人間のような話し方で、かつ遅延を最小限に抑えて応答する製品を開発することは、市場によっては他の市場よりもはるかに困難です。そして、主要なプレーヤーの多くは、アフリカや中東を念頭に置いて設計されていませんでした。
このギャップを埋めるために昨年設立されたスタートアップ「AethexAI」は、4DX Venturesが主導し、Enza Capital、Dorm Room Fund、Mojo Ventures、Stanford GSB 26 Fundが参加するプレシードラウンドで300万ドルの資金調達に成功した。個人投資家には、スタンフォード大学の教員、通信業界の経営幹部、AnthropicのAI研究者らが名を連ねている。
同社は、VapiやLiveKitといった既存のオーケストレーションツールに依存するのではなく、ターゲット市場で話されている英語、フランス語、アラビア語の地域方言に対応するため、独自のコンパクトなモデルとオーケストレーション層をゼロから構築した。この決定は、後述するように、同地域で事業を展開する上での特有のニーズによって導かれたものである。
また同社は、企業が自社の技術をテストし、サービスに申し込めるプラットフォームの提供を開始するとともに、開発者がモデルを試用できるAPIやSDKも公開している。
このスタートアップは、マリアマ・ディアロ氏とアヨルワ・オデムイワ氏によって設立された。CEOのディアロ氏は以前ゴールドマン・サックスに勤務し、その後YC(Y Combinator)が支援するModelMLにプロダクトおよび成長担当として参画した。CTOのオデムイワ氏はカリフォルニア工科大学(Caltech)を卒業後、Metaで勤務し、スタンフォード大学ビジネススクールに在籍した後、同社を共同創業した。 二人は新興市場向けの何かを構築したいと考え、機会を探し始めた。
世界中の企業が、業務の一部を自動化するためにAIツールの導入を急いでいる。しかし、その導入が必ずしも順調に進むとは限らない。創業者らが調査したところ、エジプトのあるコールセンターでは、通話の大部分を自動化したものの、成果が芳しくなかったためシステムを元に戻していたことが判明した。 アフリカの複数のサポートセンターからは、適切なコストで通話自動化を担当するエンジニアを見つけ、採用することが長年の課題であると伝えられた。
「この地域での自動通話に見られた遅延やジッターは、とんでもないものでした。もし私たちがオーケストレーターとして機能していたら、地域外にホストされた大規模なモデルを使用せざるを得ず、遅延がさらに増大していたかもしれません。 これを機能させるには、非常に小さなモデルを使用し、すべての段階で遅延を削減する必要があると気づいた」と、オデムイワ氏はTechCrunchに対し、自社独自のモデルとオーケストレーション層を構築するという決定について語った。
最新のモデルを展開するAI研究所は、通常、モデルのトレーニングやデータ取得に数百万を費やしている。AethexAIは、この両方の課題に対する解決策を見出した。同社は、可能な限り大規模なモデルを追求するのではなく、精度を維持しつつ遅延の問題に対処するには小型モデルで十分であると結論付け、パラメータ数が3億から17億の範囲の独自の「Kora」シリーズを開発した。 これは大規模言語モデルのサイズに比べればごく一部に過ぎないが、それこそがまさに狙いである。
これらのモデルを学習させるため、同社は提携先のコールセンターから提供された匿名化された録音データを利用しました。また、より多くの音声データを収集するために、アフリカ各地のラジオ局へハードドライブを発送しました。コストを抑えるため、大学生による貢献者ネットワークを構築し、データのアノテーションや現地名の発音作業を行わせました。 その結果、同社によれば、現在1日あたり1万7,000件以上の通話に対応できるようになったという。
ビジネス面では、同社は音声AIを初めて導入するクライアントに対し、プロセスを丁寧に案内することに配慮しており、オンサイトでのデモやワークショップを通じて、自動化に最適なユースケースを特定できるよう支援している。
「現時点では、すべてのお客様のあらゆるニーズに応えることはできないと常にお伝えしています。当社は小規模な企業ですから。企業との話し合いを始める際、まずはその企業にとって最も重要なユースケースを1つ選んでいただくようお願いしています」とディアロ氏は語った。
このスタートアップはあらゆる業界との協業に前向きだが、現時点ではユースケースの大部分が、債権回収、顧客アクティベーション、あるいはKYC(顧客確認)——銀行や通信事業者が採用する標準的な本人確認プロセス——に関連する通話である。 同社は、現地市場に対応するため契約ベースで現地駐在のエンジニアを採用しているほか、音声AI通話のための通信インフラを扱うため、通信事業者とのチャネルパートナーシップを構築している。同社によれば、プラグアンドプレイ型のソリューションは、この市場では通用しないという。
4DX Venturesの共同創業者兼マネージングパートナーであるウォルター・バドゥー氏は、アフリカおよび中東市場は、ほとんどの音声AI企業が対象として設立された市場とは根本的に異なると主張する。
「アフリカや中東の企業は、顧客とのやり取りにおいて依然として音声が主要なチャネルであるため、欧米の企業に比べて約3倍の通話量を処理しています」と彼は述べた。「既存のシステムは、ハイエンドのGPUインフラ、標準的な英語やヨーロッパの音声環境、そして米国や欧州で一般的な企業ワークフローを特徴とする欧米市場向けに構築されました。 そのため、企業の方言やコードスイッチング、非公式な話し方を処理でき、かつ既存の電話インフラや実際の価格帯内で機能するシステムを必要とする場合、大きなギャップが生じているのです。」
言い換えれば、ElevenLabs、Deepgram、Sierra、Cognigyといった企業が急速にグローバル展開を進めている一方で、彼らが当初想定していた市場と、現在参入しようとしている市場は必ずしも一致していない。 AethexAIのようなスタートアップは、現地の方言に特化したモデル、現地でのパートナーシップ、その地域向けに構築されたインフラといった「ギャップ」こそが、大手企業には埋めるインセンティブもアーキテクチャもない市場機会であると見込んでいる。
政府におけるエージェント型AIは、厳しい問いに直面している。「機械にどのような決定を許すべきか?」
アラブ首長国連邦(UAE)は、9年間にわたり人工知能(AI)の早期導入を進めてきた。同国は2017年10月に国家AI戦略を発表し、その直後に戦略を統括する閣僚ポストを新設、27歳のオマル・スルタン・アル・オラマ氏を世界初の人工知能担当国務大臣に任命した。 それ以来、同国は、多くの政府がまだ導入の途上にあるデジタルID、ソブリンクラウド、データ共有インフラを整備してきた。政府における「エージェント型
Google、DocsとKeepに音声プロンプト機能を導入
Google I/O 開発者会議において、同社は Docs、Keep、Gmail などの Workspace アプリに音声プロンプト機能を導入すると発表した。この機能により、ユーザーは音声を使って下書きを作成したり、メモを取ったり、メールを検索したりできるようになる。Docsでは、音声だけで文書の下書きを作成できます。TechCrunchが行ったデモでは、ユーザーがDriveから履歴書の詳細情報を
Google、iOS向けに「オフライン優先」のAI音声入力アプリをひっそりとリリース
Googleは今週月曜日、iOS向けに「オフライン優先」の音声入力アプリ「Google AI Edge Eloquent」をひっそりとリリースし、Wispr Flow、SuperWhisper、Willowなどの類似アプリと競合することになった。このアプリは無料でダウンロードできます。Gemmaベースの自動音声認識(ASR)モデルをダウンロードすれば、スマートフォンで音声入力を開始できます。アプリ





家






