芝麻揭開病毒虛擬助手瑪雅背後的基礎AI模型

Sesame,這家創新的 AI 公司,推出了令人驚嘆的逼真語音助手 Maya,近日通過釋出驅動其功能的基礎模型掀起波瀾。該模型名為 CSM-1B,擁有 10 億個參數,這一術語指的是構成模型的各個組成部分。該模型以 Apache 2.0 許可證釋出,適用於商業用途且限制極少,如 AI 開發平台 Hugging Face 上所宣佈。
CSM-1B 通過將文字和音頻輸入轉換為「RVQ 音頻代碼」來運作。RVQ 代表「殞地向量量化」,這是一種將音頻轉換為離散符號或代碼的方法。此技術也被其他尖端 AI 音頻技術所採用,例如 Google 的 SoundStream 和 Meta 的 Encodec。CSM-1B 的核心利用了 Meta 的 Llama 家族模型,結合了一個音頻「解碼器」組件。Sesame 表示,經過微調的 CSM-1B 特殊版本為 Maya 的語音提供了動力。
Sesame 在其 Hugging Face 和 GitHub 儲存庫中將該模型描述為「基礎生成模型」,指出它設計用於生成多種聲音,但尚未針對任何特定聲音進行優化。由於訓練數據集中的「數據污染」,該模型具備一定程度的非英語語言處理能力,但其在此方面的表現可能不佳。有趣的是,Sesame 對訓練數據的細節保密,讓人好奇這個模型的構建過程。
一個引人注目的問題是缺乏強大的防護措施。Sesame 採用誠信制度,僅鼓勵使用者和開發者避免未經許可複製某人的聲音、製作假新聞等誤導性內容,或參與任何「有害」或「惡意」的活動。我親自測試了 Hugging Face 上的演示,僅一分鐘內就複製了我的聲音。生成關於任何主題的語音非常簡單,甚至包括選舉和俄羅斯宣傳等敏感話題。
《消費者報告》最近指出,許多 AI 驅動的語音複製工具缺乏「有意義的」防護措施,這可能導致潛在的詐騙或濫用。Sesame 由 Oculus 共同創辦人 Brendan Iribe 共同創立,在二月底以其幾乎擺脫恐怖谷效應的助手技術吸引了公眾的目光。Maya 和 Sesame 的另一個助手 Miles 展現出逼真的人類特徵,例如呼吸、語帶瑕疵,以及在講話中可被打斷,類似於 OpenAI 的語音模式。
在財務方面,Sesame 獲得了 Andreessen Horowitz、Spark Capital 和 Matrix Partners 等重量級投資者的未公開資金支持。除了語音助手外,該公司還在探索原型 AI 眼鏡,計劃全天佩戴並搭載其定制模型。這一舉動顯示了 Sesame 將 AI 技術進一步推向我們日常生活的雄心。
相關文章
Google 測試 Remy AI 代理,以 Gemini 為重點轉向使用者控制
根據《商業內幕》的報道,谷歌正在測試 Remy,這是 Gemini 的一款全新 AI 個人代理工具。該工具旨在代表使用者執行任務,從而簡化專業工作流程和日常事務。目前,Remy 正在 Gemini 應用的內部員工專屬版本中進行測試。該報告引用了一份內部檔案以及對兩位熟悉該專案的個人的採訪。內部資料將 Remy 描述為“全天候個人代理”,將 Gemini 定位為能夠代表使用者行事的主動助手。接近該專案的訊息人士證實,谷歌員工正在積極測試 Remy。谷歌發言人拒絕提供進一步評論。該報告未提及公開發布
奧利押注隱私保護,力爭在 AI 助理競賽中勝出
要真正發揮實用價值,人工智慧助理必須深入了解其使用者。Ollie 是一款專為日常生活設計的個人助理,其運作前提是:這無需您交出個人資料,亦不會損害您的隱私。雖然某些企業級 AI 工具提供資料隱私保障,但 Ollie 作為首批獲得 SOC 2 合規認證的主流、以家庭為導向的 AI 服務之一,顯得格外突出。此框架允許企業透過獨立稽核證明,其已建立正式的管控措施來保護客戶資料,並確保系統運作的安全性。達
「AI LIVE:倫敦」將如何探討人工智慧與工業自動化
本次峰會將匯聚來自全球的高階主管,共同探討全球產業面臨的迫切挑戰,涵蓋範圍從人工智慧驅動的顛覆性變革到經濟波動。AI LIVE:倫敦峰會將以「科技+人類使命」為主題,匯聚逾 2,000 位國際領袖,共同探討人工智慧新興時代的發展。隸屬於 BizClik 旗下的《AI Magazine》已公佈其於「AI LIVE:倫敦峰會」上舉辦的「人工智慧與工業自動化」聯合爐邊談話的與會陣容。該座談會定於 10
相關專題推薦
評論 (8)
0/500
C'est incroyable ce que Sesame a fait avec Maya ! Un modèle à 1 milliard de paramètres, ça doit être une sacrée bête. Mais franchement, ça donne quoi en termes d'éthique ? On va tous finir avec des assistants trop parfaits ? 😅
Wow, Sesame's CSM-1B sounds like a game-changer! A billion parameters for Maya’s lifelike voice? That’s some serious tech flex. Curious how it stacks up against other models in real-world use. 😎
Whoa, a 1B parameter model powering Maya? That's some serious brainpower! Curious how Sesame's CSM-1B stacks up against other AI giants. Excited to see where this tech takes us! 🚀
Sesame's base AI model for Maya is mind-blowing! 1 billion parameters? That's insane! Maya's voice is so lifelike, it's like talking to a real person. But sometimes she gets a bit too chatty, which can be annoying. Still, a fantastic piece of tech! 🤯
¡El modelo base de IA de Sesame para Maya es alucinante! ¿1 billón de parámetros? ¡Eso es una locura! La voz de Maya es tan realista, parece que estoy hablando con una persona real. Pero a veces se pone un poco parlanchina, lo que puede ser molesto. Aún así, una tecnología fantástica! 🤯
Das Basis-AI-Modell von Sesame für Maya ist umwerfend! 1 Milliarde Parameter? Das ist verrückt! Mayas Stimme ist so lebensecht, es fühlt sich an, als würde man mit einer echten Person sprechen. Aber manchmal wird sie ein bisschen zu gesprächig, was nervig sein kann. Trotzdem, eine fantastische Technologie! 🤯

Sesame,這家創新的 AI 公司,推出了令人驚嘆的逼真語音助手 Maya,近日通過釋出驅動其功能的基礎模型掀起波瀾。該模型名為 CSM-1B,擁有 10 億個參數,這一術語指的是構成模型的各個組成部分。該模型以 Apache 2.0 許可證釋出,適用於商業用途且限制極少,如 AI 開發平台 Hugging Face 上所宣佈。
CSM-1B 通過將文字和音頻輸入轉換為「RVQ 音頻代碼」來運作。RVQ 代表「殞地向量量化」,這是一種將音頻轉換為離散符號或代碼的方法。此技術也被其他尖端 AI 音頻技術所採用,例如 Google 的 SoundStream 和 Meta 的 Encodec。CSM-1B 的核心利用了 Meta 的 Llama 家族模型,結合了一個音頻「解碼器」組件。Sesame 表示,經過微調的 CSM-1B 特殊版本為 Maya 的語音提供了動力。
Sesame 在其 Hugging Face 和 GitHub 儲存庫中將該模型描述為「基礎生成模型」,指出它設計用於生成多種聲音,但尚未針對任何特定聲音進行優化。由於訓練數據集中的「數據污染」,該模型具備一定程度的非英語語言處理能力,但其在此方面的表現可能不佳。有趣的是,Sesame 對訓練數據的細節保密,讓人好奇這個模型的構建過程。
一個引人注目的問題是缺乏強大的防護措施。Sesame 採用誠信制度,僅鼓勵使用者和開發者避免未經許可複製某人的聲音、製作假新聞等誤導性內容,或參與任何「有害」或「惡意」的活動。我親自測試了 Hugging Face 上的演示,僅一分鐘內就複製了我的聲音。生成關於任何主題的語音非常簡單,甚至包括選舉和俄羅斯宣傳等敏感話題。
《消費者報告》最近指出,許多 AI 驅動的語音複製工具缺乏「有意義的」防護措施,這可能導致潛在的詐騙或濫用。Sesame 由 Oculus 共同創辦人 Brendan Iribe 共同創立,在二月底以其幾乎擺脫恐怖谷效應的助手技術吸引了公眾的目光。Maya 和 Sesame 的另一個助手 Miles 展現出逼真的人類特徵,例如呼吸、語帶瑕疵,以及在講話中可被打斷,類似於 OpenAI 的語音模式。
在財務方面,Sesame 獲得了 Andreessen Horowitz、Spark Capital 和 Matrix Partners 等重量級投資者的未公開資金支持。除了語音助手外,該公司還在探索原型 AI 眼鏡,計劃全天佩戴並搭載其定制模型。這一舉動顯示了 Sesame 將 AI 技術進一步推向我們日常生活的雄心。
奧利押注隱私保護,力爭在 AI 助理競賽中勝出
要真正發揮實用價值,人工智慧助理必須深入了解其使用者。Ollie 是一款專為日常生活設計的個人助理,其運作前提是:這無需您交出個人資料,亦不會損害您的隱私。雖然某些企業級 AI 工具提供資料隱私保障,但 Ollie 作為首批獲得 SOC 2 合規認證的主流、以家庭為導向的 AI 服務之一,顯得格外突出。此框架允許企業透過獨立稽核證明,其已建立正式的管控措施來保護客戶資料,並確保系統運作的安全性。達
「AI LIVE:倫敦」將如何探討人工智慧與工業自動化
本次峰會將匯聚來自全球的高階主管,共同探討全球產業面臨的迫切挑戰,涵蓋範圍從人工智慧驅動的顛覆性變革到經濟波動。AI LIVE:倫敦峰會將以「科技+人類使命」為主題,匯聚逾 2,000 位國際領袖,共同探討人工智慧新興時代的發展。隸屬於 BizClik 旗下的《AI Magazine》已公佈其於「AI LIVE:倫敦峰會」上舉辦的「人工智慧與工業自動化」聯合爐邊談話的與會陣容。該座談會定於 10
C'est incroyable ce que Sesame a fait avec Maya ! Un modèle à 1 milliard de paramètres, ça doit être une sacrée bête. Mais franchement, ça donne quoi en termes d'éthique ? On va tous finir avec des assistants trop parfaits ? 😅
Wow, Sesame's CSM-1B sounds like a game-changer! A billion parameters for Maya’s lifelike voice? That’s some serious tech flex. Curious how it stacks up against other models in real-world use. 😎
Whoa, a 1B parameter model powering Maya? That's some serious brainpower! Curious how Sesame's CSM-1B stacks up against other AI giants. Excited to see where this tech takes us! 🚀
Sesame's base AI model for Maya is mind-blowing! 1 billion parameters? That's insane! Maya's voice is so lifelike, it's like talking to a real person. But sometimes she gets a bit too chatty, which can be annoying. Still, a fantastic piece of tech! 🤯
¡El modelo base de IA de Sesame para Maya es alucinante! ¿1 billón de parámetros? ¡Eso es una locura! La voz de Maya es tan realista, parece que estoy hablando con una persona real. Pero a veces se pone un poco parlanchina, lo que puede ser molesto. Aún así, una tecnología fantástica! 🤯
Das Basis-AI-Modell von Sesame für Maya ist umwerfend! 1 Milliarde Parameter? Das ist verrückt! Mayas Stimme ist so lebensecht, es fühlt sich an, als würde man mit einer echten Person sprechen. Aber manchmal wird sie ein bisschen zu gesprächig, was nervig sein kann. Trotzdem, eine fantastische Technologie! 🤯





首頁






