Openai升級其轉錄和發聲的AI模型
OpenAI 正在透過其 API 推出新的 AI 模型,用於轉錄和語音生成,承諾相較於早期版本有顯著改進。這些更新是 OpenAI 更大「代理」願景的一部分,專注於創建能夠獨立為使用者執行任務的自主系統。雖然「代理」一詞可能引發爭議,但 OpenAI 產品負責人 Olivier Godement 將其視為能與企業客戶互動的聊天機器人。
Godement 在接受 TechCrunch 簡報時表示:「未來幾個月,我們將看到越來越多的代理出現。總體目標是協助客戶和開發者使用有用、易於存取且精確的代理。」
OpenAI 最新的文字轉語音模型,名為「gpt-4o-mini-tts」,不僅旨在生成更逼真且細膩的語音,還比前代模型更具適應性。開發者現在可以使用自然語言指令引導模型,例如「像瘋狂科學家一樣說話」或「使用平靜的語音,如冥想導師」。這種控制程度能提供更個人化的語音體驗。
以下是一個「真實犯罪風格」、滄桑語音的範例:
以下是一個女性「專業」語音的範例:
OpenAI 產品團隊成員 Jeff Harris 向 TechCrunch 強調,目標是讓開發者能夠自訂語音「體驗」和「情境」。「在不同場景中,你不希望語音單調,」Harris 解釋道。「例如,在客戶服務場景中,語音需要為錯誤表達歉意,你可以將這種情感融入語音。我們堅信,開發者和使用者不僅想控制內容,還想控制說話方式。」
談到 OpenAI 的新語音轉文字產品「gpt-4o-transcribe」和「gpt-4o-mini-transcribe」,這些模型將取代過時的 Whisper 轉錄模型。它們接受了多樣化的高品質音訊數據訓練,據稱能更好地處理帶口音和多樣化的語音,即使在嘈雜環境中也是如此。此外,這些模型較不易出現「幻覺」,即 Whisper 有時會自行編造單詞或整段內容,導致轉錄中出現不準確的種族評論或虛構醫療治療等問題。
「在這方面,這些模型比 Whisper 有顯著改進,」Harris 指出。「確保模型準確性對於可靠的語音體驗至關重要,所謂準確性,我們指的是模型能正確捕捉說出的詞語,而不添加未說出的內容。」
然而,性能可能因語言而異。OpenAI 的內部基準顯示,兩者中較精確的 gpt-4o-transcribe 在印度和德拉威語言(如泰米爾語、泰盧固語、馬拉雅拉姆語和坎納達語)的「詞錯率」接近 30%。這意味著在這些語言中,每十個詞中大約有三個可能與人工轉錄不同。

OpenAI 轉錄基準測試結果。圖片來源:OpenAI 與以往慣例不同,OpenAI 不會免費提供這些新轉錄模型。過去,他們以 MIT 許可證發布新版 Whisper,供商業使用。Harris 指出,gpt-4o-transcribe 和 gpt-4o-mini-transcribe 比 Whisper 大得多,不適合公開發布。
「這些模型太大,無法像 Whisper 那樣在普通筆記型電腦上運行,」Harris 補充道。「當我們公開發布模型時,我們希望謹慎行事,確保它們針對特定需求進行優化。我們認為終端使用者設備是開源模型的主要應用領域。」
2025 年 3 月 20 日上午 11:54(太平洋時間)更新,以澄清詞錯率的語言表述,並更新基準測試結果圖表為更近期版本。
相關文章
山姆·奧特曼引發關於人工智慧減速的辯論
在Apple Podcasts上收聽在Spotify上收聽OpenAI執行長薩姆·阿爾特曼(Sam Altman)最近表示,現在可能是時候“控制人工智慧的發展速度”,以便社會“在這些新的能力水平周圍加固自身”。在TechCrunch《Equity》播客的最新一期中,Kirsten Korosec、Sean O’Kane和我討論了阿爾特曼的言論可能由最近的一次駭客攻擊所觸發,該攻擊中一名OpenAI代理突破了Hugging Face的系統。Sean指出,雖然由AI代理執行的駭客攻擊是前所未
OpenAI 與蘋果公司就商業秘密訴訟進行對抗
OpenAI 於週二駁回了蘋果公司的商業秘密指控,稱該訴訟毫無根據。“我們認真對待這些指控,但未發現任何支援它們的證據,”OpenAI 表示,據彭博社記者 Ed Ludlow 在 X 平臺報道,“我們支援公平競爭和工作自由,專注於創造賦能全球使用者的技術。”此前,蘋果公司於週五在美國加利福尼亞州北區聯邦地區法院提起訴訟,指控 OpenAI 策劃了一項從前蘋果員工處竊取機密資料和智慧財產權的計劃。這份長達 41 頁的訴狀針對 OpenAI 的高管層,包括首席硬體官 Tang Tan,他是一名擁有
OpenAI機器人專案主管凱特琳·卡利諾夫斯基因五角大樓合作專案辭職
OpenAI 機器人業務負責人凱特琳·卡利諾夫斯基(Caitlin Kalinowski)在該公司與國防部達成備受爭議的合作伙伴關係後辭職。“這不是一個輕鬆的決定,”卡利諾夫斯基在社交媒體宣告中解釋道。“雖然人工智慧在國家安全中發揮著至關重要的作用,但在沒有司法監督的情況下對美國公民進行監視,以及在未經人類授權的情況下部署致命自主武器,都是需要更加慎重考慮的界限。”卡利諾夫斯基此前因領導 Meta 的增強現實眼鏡部門而聞名,她於 2024 年 11 月加入 OpenAI。在辭職信中,她強調她
相關專題推薦
評論 (33)
0/500
The new OpenAI models sound like a game-changer for voice tech! Can't wait to see how devs use this to make apps talk smoother than ever. 😎
Wow, OpenAI's new transcription and voice models sound like a game-changer! I'm curious how these 'agentic' systems will stack up against real-world tasks. Could they finally nail natural-sounding convos? 🤔
Os novos modelos de transcrição e geração de voz da OpenAI são um divisor de águas! Estou usando no meu podcast e as melhorias são impressionantes. O único ponto negativo? São um pouco caros, mas se você puder pagar, vale cada centavo! 🎙️💸
OpenAI's new transcription and voice models are a game changer! I've been using them for my podcast and the improvements are night and day. The only downside? They're a bit pricey, but if you can swing it, they're worth every penny! 🎙️💸
OpenAI 正在透過其 API 推出新的 AI 模型,用於轉錄和語音生成,承諾相較於早期版本有顯著改進。這些更新是 OpenAI 更大「代理」願景的一部分,專注於創建能夠獨立為使用者執行任務的自主系統。雖然「代理」一詞可能引發爭議,但 OpenAI 產品負責人 Olivier Godement 將其視為能與企業客戶互動的聊天機器人。
Godement 在接受 TechCrunch 簡報時表示:「未來幾個月,我們將看到越來越多的代理出現。總體目標是協助客戶和開發者使用有用、易於存取且精確的代理。」
OpenAI 最新的文字轉語音模型,名為「gpt-4o-mini-tts」,不僅旨在生成更逼真且細膩的語音,還比前代模型更具適應性。開發者現在可以使用自然語言指令引導模型,例如「像瘋狂科學家一樣說話」或「使用平靜的語音,如冥想導師」。這種控制程度能提供更個人化的語音體驗。
以下是一個「真實犯罪風格」、滄桑語音的範例:
以下是一個女性「專業」語音的範例:
OpenAI 產品團隊成員 Jeff Harris 向 TechCrunch 強調,目標是讓開發者能夠自訂語音「體驗」和「情境」。「在不同場景中,你不希望語音單調,」Harris 解釋道。「例如,在客戶服務場景中,語音需要為錯誤表達歉意,你可以將這種情感融入語音。我們堅信,開發者和使用者不僅想控制內容,還想控制說話方式。」
談到 OpenAI 的新語音轉文字產品「gpt-4o-transcribe」和「gpt-4o-mini-transcribe」,這些模型將取代過時的 Whisper 轉錄模型。它們接受了多樣化的高品質音訊數據訓練,據稱能更好地處理帶口音和多樣化的語音,即使在嘈雜環境中也是如此。此外,這些模型較不易出現「幻覺」,即 Whisper 有時會自行編造單詞或整段內容,導致轉錄中出現不準確的種族評論或虛構醫療治療等問題。
「在這方面,這些模型比 Whisper 有顯著改進,」Harris 指出。「確保模型準確性對於可靠的語音體驗至關重要,所謂準確性,我們指的是模型能正確捕捉說出的詞語,而不添加未說出的內容。」
然而,性能可能因語言而異。OpenAI 的內部基準顯示,兩者中較精確的 gpt-4o-transcribe 在印度和德拉威語言(如泰米爾語、泰盧固語、馬拉雅拉姆語和坎納達語)的「詞錯率」接近 30%。這意味著在這些語言中,每十個詞中大約有三個可能與人工轉錄不同。

與以往慣例不同,OpenAI 不會免費提供這些新轉錄模型。過去,他們以 MIT 許可證發布新版 Whisper,供商業使用。Harris 指出,gpt-4o-transcribe 和 gpt-4o-mini-transcribe 比 Whisper 大得多,不適合公開發布。
「這些模型太大,無法像 Whisper 那樣在普通筆記型電腦上運行,」Harris 補充道。「當我們公開發布模型時,我們希望謹慎行事,確保它們針對特定需求進行優化。我們認為終端使用者設備是開源模型的主要應用領域。」
2025 年 3 月 20 日上午 11:54(太平洋時間)更新,以澄清詞錯率的語言表述,並更新基準測試結果圖表為更近期版本。
山姆·奧特曼引發關於人工智慧減速的辯論
在Apple Podcasts上收聽在Spotify上收聽OpenAI執行長薩姆·阿爾特曼(Sam Altman)最近表示,現在可能是時候“控制人工智慧的發展速度”,以便社會“在這些新的能力水平周圍加固自身”。在TechCrunch《Equity》播客的最新一期中,Kirsten Korosec、Sean O’Kane和我討論了阿爾特曼的言論可能由最近的一次駭客攻擊所觸發,該攻擊中一名OpenAI代理突破了Hugging Face的系統。Sean指出,雖然由AI代理執行的駭客攻擊是前所未
OpenAI 與蘋果公司就商業秘密訴訟進行對抗
OpenAI 於週二駁回了蘋果公司的商業秘密指控,稱該訴訟毫無根據。“我們認真對待這些指控,但未發現任何支援它們的證據,”OpenAI 表示,據彭博社記者 Ed Ludlow 在 X 平臺報道,“我們支援公平競爭和工作自由,專注於創造賦能全球使用者的技術。”此前,蘋果公司於週五在美國加利福尼亞州北區聯邦地區法院提起訴訟,指控 OpenAI 策劃了一項從前蘋果員工處竊取機密資料和智慧財產權的計劃。這份長達 41 頁的訴狀針對 OpenAI 的高管層,包括首席硬體官 Tang Tan,他是一名擁有
OpenAI機器人專案主管凱特琳·卡利諾夫斯基因五角大樓合作專案辭職
OpenAI 機器人業務負責人凱特琳·卡利諾夫斯基(Caitlin Kalinowski)在該公司與國防部達成備受爭議的合作伙伴關係後辭職。“這不是一個輕鬆的決定,”卡利諾夫斯基在社交媒體宣告中解釋道。“雖然人工智慧在國家安全中發揮著至關重要的作用,但在沒有司法監督的情況下對美國公民進行監視,以及在未經人類授權的情況下部署致命自主武器,都是需要更加慎重考慮的界限。”卡利諾夫斯基此前因領導 Meta 的增強現實眼鏡部門而聞名,她於 2024 年 11 月加入 OpenAI。在辭職信中,她強調她
The new OpenAI models sound like a game-changer for voice tech! Can't wait to see how devs use this to make apps talk smoother than ever. 😎
Wow, OpenAI's new transcription and voice models sound like a game-changer! I'm curious how these 'agentic' systems will stack up against real-world tasks. Could they finally nail natural-sounding convos? 🤔
Os novos modelos de transcrição e geração de voz da OpenAI são um divisor de águas! Estou usando no meu podcast e as melhorias são impressionantes. O único ponto negativo? São um pouco caros, mas se você puder pagar, vale cada centavo! 🎙️💸
OpenAI's new transcription and voice models are a game changer! I've been using them for my podcast and the improvements are night and day. The only downside? They're a bit pricey, but if you can swing it, they're worth every penny! 🎙️💸





首頁






