AI基準:我們現在應該忽略它們嗎?
歡迎體驗TechCrunch的定期AI通訊!我們將短暫休息,但別擔心,您仍可在TechCrunch獲取所有AI報導,包括我的專欄、每日分析及突發新聞。想每天直接收到這些報導?請在此處訂閱我們的每日通訊。
本週,Elon Musk的AI新創公司xAI推出最新旗艦AI模型Grok 3,驅動公司Grok聊天機器人應用程式。他們使用20萬個GPU進行訓練,該模型在數學、程式設計等基準測試中,超越包括OpenAI在內的多個頂尖模型。
但讓我們來談談這些基準測試的真正意義。
在TC,我們報導這些基準數據,儘管我們並不總是對此感到興奮,因為這是AI產業展示模型進步的少數方式之一。問題在於,這些熱門AI基準測試往往聚焦於冷門內容,得分無法真正反映AI在人們實際關心的事務上的表現。
Wharton教授Ethan Mollick在X上表示,急需更好的測試及獨立團體來執行。他指出,AI公司通常自行報告基準結果,這讓人難以完全信任。
「公開基準測試既『平庸』又飽和,許多AI測試就像美食評論,基於主觀感受,」Mollick寫道。「如果AI對工作至關重要,我們需要更多。」
許多人在嘗試為AI設計新基準,但對於最佳方式尚未達成共識。一些人認為基準應聚焦於經濟影響才有用,另一些人則認為實際應用與實用性才是成功的真正衡量標準。
這場爭論可能永無止境。或許,如X用戶Roon建議,除非出現重大AI突破,否則我們應少關注新模型與基準。這樣或許對我們的理智更好,即使可能錯過一些AI熱潮。
如前所述,《本週AI》將暫停更新。感謝讀者們一路以來的支持,無論高低起伏。下次見。
新聞

圖片來源:Nathan Laine/Bloomberg / Getty Images OpenAI正試圖「解除審查」ChatGPT。Max撰文介紹他們如何改變AI開發方式,擁抱「知識自由」,即使涉及困難或爭議性話題。OpenAI前技術長Mira Murati創辦新公司Thinking Machines Lab,致力於開發工具以「讓AI滿足[人們的]獨特需求與目標」。
xAI發布Grok 3,並為iOS及網頁版Grok應用程式新增功能。
Meta將於明年春季舉辦首場專注於生成式AI的開發者大會,名為LlamaCon,以其Llama模型命名,定於4月29日舉行。
Paul撰文介紹OpenEuroLLM,由約20個組織合作打造,旨在為歐洲建構「透明AI」基礎模型,尊重歐盟所有語言的「語言與文化多樣性」。
本週研究論文

圖片來源:Jakub Porzycki/NurPhoto / Getty Images OpenAI研究人員提出新AI基準SWE-Lancer,測試AI程式設計能力,包含超過1400個自由軟體工程任務,從修復錯誤、添加功能到提出技術實現方案。OpenAI表示,表現最佳的模型Anthropic的Claude 3.5 Sonnet,在完整SWE-Lancer基準中僅得分40.3%,顯示AI仍有很長的路要走。他們未測試OpenAI的o3-mini或中國DeepSeek的R1等較新模型。
本週模型
中國AI公司Stepfun發布「開放」AI模型Step-Audio,能理解並生成中文、英文、日文的語音。用戶甚至可調整合成音頻的情感與方言,包括歌唱。
Stepfun是多家資金雄厚的中國AI新創之一,發布具寬鬆許可的模型。該公司2023年成立,最近完成一輪數億美元融資,投資者包括中國國有私募股權公司。
雜錦

圖片來源:Nous Research AI研究團體Nous Research宣稱發布首個結合推理與「直觀語言模型能力」的AI模型。他們的模型DeepHermes-3 Preview可在短與長「思維鏈」間切換,以平衡準確度與運算能力。在「推理」模式下,解決較難問題時耗時更長,並展示其思考過程。
據報導,Anthropic計畫不久後發布類似模型,OpenAI也表示這在其近期計畫中。
相關文章
山姆·奧特曼引發關於人工智慧減速的辯論
在Apple Podcasts上收聽在Spotify上收聽OpenAI執行長薩姆·阿爾特曼(Sam Altman)最近表示,現在可能是時候“控制人工智慧的發展速度”,以便社會“在這些新的能力水平周圍加固自身”。在TechCrunch《Equity》播客的最新一期中,Kirsten Korosec、Sean O’Kane和我討論了阿爾特曼的言論可能由最近的一次駭客攻擊所觸發,該攻擊中一名OpenAI代理突破了Hugging Face的系統。Sean指出,雖然由AI代理執行的駭客攻擊是前所未
OpenAI 與蘋果公司就商業秘密訴訟進行對抗
OpenAI 於週二駁回了蘋果公司的商業秘密指控,稱該訴訟毫無根據。“我們認真對待這些指控,但未發現任何支援它們的證據,”OpenAI 表示,據彭博社記者 Ed Ludlow 在 X 平臺報道,“我們支援公平競爭和工作自由,專注於創造賦能全球使用者的技術。”此前,蘋果公司於週五在美國加利福尼亞州北區聯邦地區法院提起訴訟,指控 OpenAI 策劃了一項從前蘋果員工處竊取機密資料和智慧財產權的計劃。這份長達 41 頁的訴狀針對 OpenAI 的高管層,包括首席硬體官 Tang Tan,他是一名擁有
OpenAI機器人專案主管凱特琳·卡利諾夫斯基因五角大樓合作專案辭職
OpenAI 機器人業務負責人凱特琳·卡利諾夫斯基(Caitlin Kalinowski)在該公司與國防部達成備受爭議的合作伙伴關係後辭職。“這不是一個輕鬆的決定,”卡利諾夫斯基在社交媒體宣告中解釋道。“雖然人工智慧在國家安全中發揮著至關重要的作用,但在沒有司法監督的情況下對美國公民進行監視,以及在未經人類授權的情況下部署致命自主武器,都是需要更加慎重考慮的界限。”卡利諾夫斯基此前因領導 Meta 的增強現實眼鏡部門而聞名,她於 2024 年 11 月加入 OpenAI。在辭職信中,她強調她
相關專題推薦
評論 (62)
0/500
I mean, benchmarks are just a snapshot—does anyone really trust them when companies train models specifically to ace them? 🤔 Might be better to focus on real-world performance rather than chasing numbers on a leaderboard.
AI benchmarks are getting so hyped, but are they even reliable yet? 🤔 Feels like companies just cherry-pick numbers to flex. I’d rather see real-world use cases than some random leaderboard scores.
AI benchmarks are getting so hyped, but are they even reliable yet? Feels like we're chasing numbers instead of real progress. 🤔 What do you all think—should we just ignore them for now?
AI benchmarks are cool, but are they just tech flexing? I’d rather see real-world uses than numbers on a chart. 🤔
AI benchmarks sound cool, but are they just overhyped numbers? I’m curious if they really tell us anything useful about real-world performance. 🧐
歡迎體驗TechCrunch的定期AI通訊!我們將短暫休息,但別擔心,您仍可在TechCrunch獲取所有AI報導,包括我的專欄、每日分析及突發新聞。想每天直接收到這些報導?請在此處訂閱我們的每日通訊。
本週,Elon Musk的AI新創公司xAI推出最新旗艦AI模型Grok 3,驅動公司Grok聊天機器人應用程式。他們使用20萬個GPU進行訓練,該模型在數學、程式設計等基準測試中,超越包括OpenAI在內的多個頂尖模型。
但讓我們來談談這些基準測試的真正意義。
在TC,我們報導這些基準數據,儘管我們並不總是對此感到興奮,因為這是AI產業展示模型進步的少數方式之一。問題在於,這些熱門AI基準測試往往聚焦於冷門內容,得分無法真正反映AI在人們實際關心的事務上的表現。
Wharton教授Ethan Mollick在X上表示,急需更好的測試及獨立團體來執行。他指出,AI公司通常自行報告基準結果,這讓人難以完全信任。
「公開基準測試既『平庸』又飽和,許多AI測試就像美食評論,基於主觀感受,」Mollick寫道。「如果AI對工作至關重要,我們需要更多。」
許多人在嘗試為AI設計新基準,但對於最佳方式尚未達成共識。一些人認為基準應聚焦於經濟影響才有用,另一些人則認為實際應用與實用性才是成功的真正衡量標準。
這場爭論可能永無止境。或許,如X用戶Roon建議,除非出現重大AI突破,否則我們應少關注新模型與基準。這樣或許對我們的理智更好,即使可能錯過一些AI熱潮。
如前所述,《本週AI》將暫停更新。感謝讀者們一路以來的支持,無論高低起伏。下次見。
新聞

OpenAI前技術長Mira Murati創辦新公司Thinking Machines Lab,致力於開發工具以「讓AI滿足[人們的]獨特需求與目標」。
xAI發布Grok 3,並為iOS及網頁版Grok應用程式新增功能。
Meta將於明年春季舉辦首場專注於生成式AI的開發者大會,名為LlamaCon,以其Llama模型命名,定於4月29日舉行。
Paul撰文介紹OpenEuroLLM,由約20個組織合作打造,旨在為歐洲建構「透明AI」基礎模型,尊重歐盟所有語言的「語言與文化多樣性」。
本週研究論文

OpenAI表示,表現最佳的模型Anthropic的Claude 3.5 Sonnet,在完整SWE-Lancer基準中僅得分40.3%,顯示AI仍有很長的路要走。他們未測試OpenAI的o3-mini或中國DeepSeek的R1等較新模型。
本週模型
中國AI公司Stepfun發布「開放」AI模型Step-Audio,能理解並生成中文、英文、日文的語音。用戶甚至可調整合成音頻的情感與方言,包括歌唱。
Stepfun是多家資金雄厚的中國AI新創之一,發布具寬鬆許可的模型。該公司2023年成立,最近完成一輪數億美元融資,投資者包括中國國有私募股權公司。
雜錦

他們的模型DeepHermes-3 Preview可在短與長「思維鏈」間切換,以平衡準確度與運算能力。在「推理」模式下,解決較難問題時耗時更長,並展示其思考過程。
據報導,Anthropic計畫不久後發布類似模型,OpenAI也表示這在其近期計畫中。
山姆·奧特曼引發關於人工智慧減速的辯論
在Apple Podcasts上收聽在Spotify上收聽OpenAI執行長薩姆·阿爾特曼(Sam Altman)最近表示,現在可能是時候“控制人工智慧的發展速度”,以便社會“在這些新的能力水平周圍加固自身”。在TechCrunch《Equity》播客的最新一期中,Kirsten Korosec、Sean O’Kane和我討論了阿爾特曼的言論可能由最近的一次駭客攻擊所觸發,該攻擊中一名OpenAI代理突破了Hugging Face的系統。Sean指出,雖然由AI代理執行的駭客攻擊是前所未
OpenAI 與蘋果公司就商業秘密訴訟進行對抗
OpenAI 於週二駁回了蘋果公司的商業秘密指控,稱該訴訟毫無根據。“我們認真對待這些指控,但未發現任何支援它們的證據,”OpenAI 表示,據彭博社記者 Ed Ludlow 在 X 平臺報道,“我們支援公平競爭和工作自由,專注於創造賦能全球使用者的技術。”此前,蘋果公司於週五在美國加利福尼亞州北區聯邦地區法院提起訴訟,指控 OpenAI 策劃了一項從前蘋果員工處竊取機密資料和智慧財產權的計劃。這份長達 41 頁的訴狀針對 OpenAI 的高管層,包括首席硬體官 Tang Tan,他是一名擁有
OpenAI機器人專案主管凱特琳·卡利諾夫斯基因五角大樓合作專案辭職
OpenAI 機器人業務負責人凱特琳·卡利諾夫斯基(Caitlin Kalinowski)在該公司與國防部達成備受爭議的合作伙伴關係後辭職。“這不是一個輕鬆的決定,”卡利諾夫斯基在社交媒體宣告中解釋道。“雖然人工智慧在國家安全中發揮著至關重要的作用,但在沒有司法監督的情況下對美國公民進行監視,以及在未經人類授權的情況下部署致命自主武器,都是需要更加慎重考慮的界限。”卡利諾夫斯基此前因領導 Meta 的增強現實眼鏡部門而聞名,她於 2024 年 11 月加入 OpenAI。在辭職信中,她強調她
I mean, benchmarks are just a snapshot—does anyone really trust them when companies train models specifically to ace them? 🤔 Might be better to focus on real-world performance rather than chasing numbers on a leaderboard.
AI benchmarks are getting so hyped, but are they even reliable yet? 🤔 Feels like companies just cherry-pick numbers to flex. I’d rather see real-world use cases than some random leaderboard scores.
AI benchmarks are getting so hyped, but are they even reliable yet? Feels like we're chasing numbers instead of real progress. 🤔 What do you all think—should we just ignore them for now?
AI benchmarks are cool, but are they just tech flexing? I’d rather see real-world uses than numbers on a chart. 🤔
AI benchmarks sound cool, but are they just overhyped numbers? I’m curious if they really tell us anything useful about real-world performance. 🧐





首頁






