關於AI基準測試的辯論已達到神奇寶貝

即使是深受喜愛的寶可夢世界,也無法免於圍繞AI基準測試的爭議。近期在X上的一則病毒式貼文引起了相當大的熱議,聲稱Google的最新Gemini模型在經典寶可夢電玩三部曲中超越了Anthropic領先的Claude模型。根據該貼文,Gemini在一位開發者的Twitch直播中令人印象深刻地抵達了紫苑鎮,而Claude截至二月底仍落後於月見山。
Gemini目前在寶可夢中確實領先Claude,已抵達紫苑鎮
僅有119人觀看直播,實在是極其被低估的直播 pic.twitter.com/8AvSovAI4x
— Jush (@Jush21e8) 2025年4月10日
然而,這則貼文刻意忽略了一個事實:Gemini擁有一定的優勢。Reddit上的敏銳用戶很快指出,Gemini直播背後的開發者打造了一個自訂的小地圖。這個巧妙的工具幫助模型識別遊戲中的「圖塊」,例如可砍伐的樹木,這顯著減少了Gemini在分析螢幕截圖並決定下一步行動所需的時間。
雖然寶可夢可能不是最嚴肅的AI基準測試,但它確實是一個有趣且具啟發性的例子,展示了不同設置如何影響這些測試的結果。以Anthropic的最新模型Anthropic 3.7 Sonnet為例,在旨在測試編碼能力的SWE-bench Verified基準測試中,其得分為62.3%的準確率。但在Anthropic打造的「自訂框架」下,該分數躍升至70.3%。
這還不只如此。Meta對其較新的模型Llama 4 Maverick進行了專為LM Arena基準測試的微調,該模型的原始版本在同一測試中的表現遠不如微調版本。
鑑於AI基準測試,包括我們友好的寶可夢例子,本身就有些不穩定,這些自訂調整和非標準方法使得在模型上市時進行有意義的比較變得更加困難。看來,要將蘋果與蘋果進行比較,正變得越來越困難。
相關文章
Google 測試 Remy AI 代理,以 Gemini 為重點轉向使用者控制
根據《商業內幕》的報道,谷歌正在測試 Remy,這是 Gemini 的一款全新 AI 個人代理工具。該工具旨在代表使用者執行任務,從而簡化專業工作流程和日常事務。目前,Remy 正在 Gemini 應用的內部員工專屬版本中進行測試。該報告引用了一份內部檔案以及對兩位熟悉該專案的個人的採訪。內部資料將 Remy 描述為“全天候個人代理”,將 Gemini 定位為能夠代表使用者行事的主動助手。接近該專案的訊息人士證實,谷歌員工正在積極測試 Remy。谷歌發言人拒絕提供進一步評論。該報告未提及公開發布
奧利押注隱私保護,力爭在 AI 助理競賽中勝出
要真正發揮實用價值,人工智慧助理必須深入了解其使用者。Ollie 是一款專為日常生活設計的個人助理,其運作前提是:這無需您交出個人資料,亦不會損害您的隱私。雖然某些企業級 AI 工具提供資料隱私保障,但 Ollie 作為首批獲得 SOC 2 合規認證的主流、以家庭為導向的 AI 服務之一,顯得格外突出。此框架允許企業透過獨立稽核證明,其已建立正式的管控措施來保護客戶資料,並確保系統運作的安全性。達
「AI LIVE:倫敦」將如何探討人工智慧與工業自動化
本次峰會將匯聚來自全球的高階主管,共同探討全球產業面臨的迫切挑戰,涵蓋範圍從人工智慧驅動的顛覆性變革到經濟波動。AI LIVE:倫敦峰會將以「科技+人類使命」為主題,匯聚逾 2,000 位國際領袖,共同探討人工智慧新興時代的發展。隸屬於 BizClik 旗下的《AI Magazine》已公佈其於「AI LIVE:倫敦峰會」上舉辦的「人工智慧與工業自動化」聯合爐邊談話的與會陣容。該座談會定於 10
相關專題推薦
評論 (9)
0/500
¿De verdad comparan a los Pokémon en benchmarks de IA? 😂 Suena raro pero me intriga saber cómo lo hacen. ¿Le harán jugar al Pokémon Rojo/Fuego para ver cuántas medallas consigue sin que se pierda? Sería divertido si fuese así, aunque al final estos rankings a veces se sienten solo una guerra de marketing entre las grandes tecnológicas. ¡Quiero ver un torneo oficial de IA jugando! 🎮
Mais franchement, comparer des IA sur Pokémon ? 😂 C'est comme évaluer un chef étoilé sur sa capacité à faire des nuggets. Cette course aux benchmarks devient absurde – next step on va les tester sur Candy Crush ? En tout cas ça montre à quel point les labos cherchent désespérément des moyens originaux de se démarquer.
Whoa, AI playing Pokémon? That's wild! I wonder if Gemini's got a secret Pikachu strategy or just brute-forced its way through. Gotta catch 'em all, I guess! ⚡️
Debates over AI benchmarking in Pokémon? That's wild! I never thought I'd see the day when AI models are compared using Pokémon games. It's fun but kinda confusing. Can someone explain how Gemini outpaced Claude? 🤯

即使是深受喜愛的寶可夢世界,也無法免於圍繞AI基準測試的爭議。近期在X上的一則病毒式貼文引起了相當大的熱議,聲稱Google的最新Gemini模型在經典寶可夢電玩三部曲中超越了Anthropic領先的Claude模型。根據該貼文,Gemini在一位開發者的Twitch直播中令人印象深刻地抵達了紫苑鎮,而Claude截至二月底仍落後於月見山。
Gemini目前在寶可夢中確實領先Claude,已抵達紫苑鎮
僅有119人觀看直播,實在是極其被低估的直播 pic.twitter.com/8AvSovAI4x
— Jush (@Jush21e8) 2025年4月10日
然而,這則貼文刻意忽略了一個事實:Gemini擁有一定的優勢。Reddit上的敏銳用戶很快指出,Gemini直播背後的開發者打造了一個自訂的小地圖。這個巧妙的工具幫助模型識別遊戲中的「圖塊」,例如可砍伐的樹木,這顯著減少了Gemini在分析螢幕截圖並決定下一步行動所需的時間。
雖然寶可夢可能不是最嚴肅的AI基準測試,但它確實是一個有趣且具啟發性的例子,展示了不同設置如何影響這些測試的結果。以Anthropic的最新模型Anthropic 3.7 Sonnet為例,在旨在測試編碼能力的SWE-bench Verified基準測試中,其得分為62.3%的準確率。但在Anthropic打造的「自訂框架」下,該分數躍升至70.3%。
這還不只如此。Meta對其較新的模型Llama 4 Maverick進行了專為LM Arena基準測試的微調,該模型的原始版本在同一測試中的表現遠不如微調版本。
鑑於AI基準測試,包括我們友好的寶可夢例子,本身就有些不穩定,這些自訂調整和非標準方法使得在模型上市時進行有意義的比較變得更加困難。看來,要將蘋果與蘋果進行比較,正變得越來越困難。
奧利押注隱私保護,力爭在 AI 助理競賽中勝出
要真正發揮實用價值,人工智慧助理必須深入了解其使用者。Ollie 是一款專為日常生活設計的個人助理,其運作前提是:這無需您交出個人資料,亦不會損害您的隱私。雖然某些企業級 AI 工具提供資料隱私保障,但 Ollie 作為首批獲得 SOC 2 合規認證的主流、以家庭為導向的 AI 服務之一,顯得格外突出。此框架允許企業透過獨立稽核證明,其已建立正式的管控措施來保護客戶資料,並確保系統運作的安全性。達
「AI LIVE:倫敦」將如何探討人工智慧與工業自動化
本次峰會將匯聚來自全球的高階主管,共同探討全球產業面臨的迫切挑戰,涵蓋範圍從人工智慧驅動的顛覆性變革到經濟波動。AI LIVE:倫敦峰會將以「科技+人類使命」為主題,匯聚逾 2,000 位國際領袖,共同探討人工智慧新興時代的發展。隸屬於 BizClik 旗下的《AI Magazine》已公佈其於「AI LIVE:倫敦峰會」上舉辦的「人工智慧與工業自動化」聯合爐邊談話的與會陣容。該座談會定於 10
¿De verdad comparan a los Pokémon en benchmarks de IA? 😂 Suena raro pero me intriga saber cómo lo hacen. ¿Le harán jugar al Pokémon Rojo/Fuego para ver cuántas medallas consigue sin que se pierda? Sería divertido si fuese así, aunque al final estos rankings a veces se sienten solo una guerra de marketing entre las grandes tecnológicas. ¡Quiero ver un torneo oficial de IA jugando! 🎮
Mais franchement, comparer des IA sur Pokémon ? 😂 C'est comme évaluer un chef étoilé sur sa capacité à faire des nuggets. Cette course aux benchmarks devient absurde – next step on va les tester sur Candy Crush ? En tout cas ça montre à quel point les labos cherchent désespérément des moyens originaux de se démarquer.
Whoa, AI playing Pokémon? That's wild! I wonder if Gemini's got a secret Pikachu strategy or just brute-forced its way through. Gotta catch 'em all, I guess! ⚡️
Debates over AI benchmarking in Pokémon? That's wild! I never thought I'd see the day when AI models are compared using Pokémon games. It's fun but kinda confusing. Can someone explain how Gemini outpaced Claude? 🤯





首頁






