人類聲稱AI並不停滯,它超出了基準測試

大型語言模型(LLMs)和其他生成式AI技術在自我修正方面取得顯著進展,這為新應用鋪平了道路,包括所謂的「代理AI」,根據領先AI模型開發商Anthropic的副總裁Michael Gerstenhaber表示。
「它在自我修正、自我推理方面表現得非常好,」在Anthropic領導API技術的Gerstenhaber,在紐約接受彭博情報分析師Anurag Rana採訪時分享道。Anthropic是Claude系列LLMs的創造者,與OpenAI的GPT模型直接競爭。「每隔幾個月,我們就發布一個新模型,擴展了LLMs的能力,」他補充說,強調了該行業的動態特性,每一次模型修訂都解鎖了新的潛在用途。
AI模型的新能力
Anthropic的最新模型引入了任務規劃等能力,使它們能像人類一樣在電腦上執行任務,例如線上訂購披薩。「規劃中間步驟,這在昨天還不可行,現在已觸手可及,」Gerstenhaber談到這種逐步執行任務的能力時指出。
這場討論還邀請了AI新創公司Scale AI的首席技術專家Vijay Karunamurthy參加,是彭博情報主辦的為期一天的會議的一部分,會議主題為「生成式AI:能否兌現生產力承諾?」
挑戰AI懷疑論
Gerstenhaber的見解挑戰了AI懷疑論者的觀點,這些人認為生成式AI及更廣泛的AI領域「正面臨瓶頸」,認為每個新模型迭代的回報正在減少。例如,AI學者Gary Marcus自2022年以來一直直言不諱地表達他的擔憂,警告僅僅增加AI模型的規模(更多參數)不會成比例地提升其性能。
然而,Gerstenhaber堅稱Anthropic正在突破當前AI基準所能衡量的範圍。「即使某些領域的進展看似放緩,那是因為我們正在解鎖全新功能,但我們已經飽和了基準以及執行舊任務的能力,」他解釋道。這使得越來越難以全面評估當前生成式AI模型所能實現的全部潛力。
規模擴展與學習
Gerstenhaber和Karunamurthy都強調了擴展生成式AI模型以增強其自我修正能力的重要性。「我們確實看到智能的規模越來越大,」Gerstenhaber評論道。Karunamurthy補充說:「我們相信在規劃和推理方面沒有遇到瓶頸的原因之一,是我們仍在學習如何結構化這些任務,以便模型能適應新的多樣環境。」
Gerstenhaber同意這一觀點,說道:「我們正處於早期階段,從應用開發者那裡學習他們的需求以及模型的不足之處,然後將這些反饋整合回語言模型中。」
實時學習與適應
根據Gerstenhaber的說法,這種進展很大程度上是由Anthropic的基礎研究快速進展以及來自業界的實時反饋驅動的。「我們正在適應業界告訴我們的需求,實時學習,」他說。
客戶通常從較大的模型開始,然後縮減到更簡單的模型以適應特定用途。「最初,他們評估一個模型是否足夠智能以良好執行任務,然後是否足夠快以滿足應用需求,最後是否能盡可能具有成本效益,」Gerstenhaber解釋道。
相關文章
美國股市觸及歷史裡程碑,人工智慧與航空航天巨頭準備開啟萬億美元時代
埃隆·馬斯克、山姆·阿爾特曼和達里奧·阿莫迪,這三位科技領域的巨頭,正推動其各自的企業邁向首次公開募股(IPO)。隨著 SpaceX、OpenAI 和 Anthropic——這三家估值接近萬億美元的行業巨頭——即將上市,2026 年被預測將成為美國曆史上新股發行規模最大的一年。這一歷史性的資本激增已引起全球金融界的關注,成為檢驗公共市場吸收如此大規模資金能力的關鍵壓力測試。這些主要融資活動的同步啟動預計將打破 2021 年創下的 1560 億美元紀錄。超級獨角獸的資本博弈每家公司上市的路徑
瑞典人工智慧初創公司Lovable Eyes在完成主要融資輪後估值達132億美元
隨著人工智慧驅動的編碼工具日益普及,瑞典初創公司 Lovable 已獲一輪重大融資。該公司計劃籌集 30 億美元,其估值有望升至 132 億美元——這是去年 12 月記錄的 66 億美元的兩倍。預計 Menlo Ventures 將主導此次投資。Lovable 的吸引力源於其核心的“氛圍編碼”(vibe coding)技術,該技術透過消除對複雜編碼技能的需求來簡化軟體開發。使用者只需以自然語言描述其需求,系統即可自動生成應用程式。這種直觀的方法吸引了個人開發者、設計師和小企業,並擴充套件至 Work
Google 測試 Remy AI 代理,以 Gemini 為重點轉向使用者控制
根據《商業內幕》的報道,谷歌正在測試 Remy,這是 Gemini 的一款全新 AI 個人代理工具。該工具旨在代表使用者執行任務,從而簡化專業工作流程和日常事務。目前,Remy 正在 Gemini 應用的內部員工專屬版本中進行測試。該報告引用了一份內部檔案以及對兩位熟悉該專案的個人的採訪。內部資料將 Remy 描述為“全天候個人代理”,將 Gemini 定位為能夠代表使用者行事的主動助手。接近該專案的訊息人士證實,谷歌員工正在積極測試 Remy。谷歌發言人拒絕提供進一步評論。該報告未提及公開發布
相關專題推薦
評論 (8)
0/500
This self-correction stuff is wild! 😮 It's like AI is learning to double-check its own homework. Wonder how far this 'agentic AI' will go—could it outsmart us at our own jobs soon?
It's wild to think AI can now self-correct! 😮 Makes me wonder how soon we'll see these 'agentic AI' systems running our lives—hope they don’t outsmart us too much!
This article really opened my eyes to how fast AI is evolving! Self-correcting LLMs sound like a game-changer for agentic AI. Can’t wait to see what new apps come out of this! 😄
La perspectiva de Anthropic sobre que la IA no se estanca sino que supera los benchmarks es bastante genial. Es como si la IA estuviera jugando ajedrez mientras nosotros aún estamos tratando de entender las damas. Lo de la autocorrección suena prometedor, pero aún estoy un poco escéptico. 🤔
Anthropic의 AI가 정체되지 않고 벤치마크를 뛰어넘는다는 생각이 멋지네요. AI는 체스를 하고 있는데, 우리는 아직 체커를 이해하는 단계예요. 자기 교정 이야기는 유망하지만, 아직 조금 회의적이에요. 🤔

大型語言模型(LLMs)和其他生成式AI技術在自我修正方面取得顯著進展,這為新應用鋪平了道路,包括所謂的「代理AI」,根據領先AI模型開發商Anthropic的副總裁Michael Gerstenhaber表示。
「它在自我修正、自我推理方面表現得非常好,」在Anthropic領導API技術的Gerstenhaber,在紐約接受彭博情報分析師Anurag Rana採訪時分享道。Anthropic是Claude系列LLMs的創造者,與OpenAI的GPT模型直接競爭。「每隔幾個月,我們就發布一個新模型,擴展了LLMs的能力,」他補充說,強調了該行業的動態特性,每一次模型修訂都解鎖了新的潛在用途。
AI模型的新能力
Anthropic的最新模型引入了任務規劃等能力,使它們能像人類一樣在電腦上執行任務,例如線上訂購披薩。「規劃中間步驟,這在昨天還不可行,現在已觸手可及,」Gerstenhaber談到這種逐步執行任務的能力時指出。
這場討論還邀請了AI新創公司Scale AI的首席技術專家Vijay Karunamurthy參加,是彭博情報主辦的為期一天的會議的一部分,會議主題為「生成式AI:能否兌現生產力承諾?」
挑戰AI懷疑論
Gerstenhaber的見解挑戰了AI懷疑論者的觀點,這些人認為生成式AI及更廣泛的AI領域「正面臨瓶頸」,認為每個新模型迭代的回報正在減少。例如,AI學者Gary Marcus自2022年以來一直直言不諱地表達他的擔憂,警告僅僅增加AI模型的規模(更多參數)不會成比例地提升其性能。
然而,Gerstenhaber堅稱Anthropic正在突破當前AI基準所能衡量的範圍。「即使某些領域的進展看似放緩,那是因為我們正在解鎖全新功能,但我們已經飽和了基準以及執行舊任務的能力,」他解釋道。這使得越來越難以全面評估當前生成式AI模型所能實現的全部潛力。
規模擴展與學習
Gerstenhaber和Karunamurthy都強調了擴展生成式AI模型以增強其自我修正能力的重要性。「我們確實看到智能的規模越來越大,」Gerstenhaber評論道。Karunamurthy補充說:「我們相信在規劃和推理方面沒有遇到瓶頸的原因之一,是我們仍在學習如何結構化這些任務,以便模型能適應新的多樣環境。」
Gerstenhaber同意這一觀點,說道:「我們正處於早期階段,從應用開發者那裡學習他們的需求以及模型的不足之處,然後將這些反饋整合回語言模型中。」
實時學習與適應
根據Gerstenhaber的說法,這種進展很大程度上是由Anthropic的基礎研究快速進展以及來自業界的實時反饋驅動的。「我們正在適應業界告訴我們的需求,實時學習,」他說。
客戶通常從較大的模型開始,然後縮減到更簡單的模型以適應特定用途。「最初,他們評估一個模型是否足夠智能以良好執行任務,然後是否足夠快以滿足應用需求,最後是否能盡可能具有成本效益,」Gerstenhaber解釋道。
美國股市觸及歷史裡程碑,人工智慧與航空航天巨頭準備開啟萬億美元時代
埃隆·馬斯克、山姆·阿爾特曼和達里奧·阿莫迪,這三位科技領域的巨頭,正推動其各自的企業邁向首次公開募股(IPO)。隨著 SpaceX、OpenAI 和 Anthropic——這三家估值接近萬億美元的行業巨頭——即將上市,2026 年被預測將成為美國曆史上新股發行規模最大的一年。這一歷史性的資本激增已引起全球金融界的關注,成為檢驗公共市場吸收如此大規模資金能力的關鍵壓力測試。這些主要融資活動的同步啟動預計將打破 2021 年創下的 1560 億美元紀錄。超級獨角獸的資本博弈每家公司上市的路徑
瑞典人工智慧初創公司Lovable Eyes在完成主要融資輪後估值達132億美元
隨著人工智慧驅動的編碼工具日益普及,瑞典初創公司 Lovable 已獲一輪重大融資。該公司計劃籌集 30 億美元,其估值有望升至 132 億美元——這是去年 12 月記錄的 66 億美元的兩倍。預計 Menlo Ventures 將主導此次投資。Lovable 的吸引力源於其核心的“氛圍編碼”(vibe coding)技術,該技術透過消除對複雜編碼技能的需求來簡化軟體開發。使用者只需以自然語言描述其需求,系統即可自動生成應用程式。這種直觀的方法吸引了個人開發者、設計師和小企業,並擴充套件至 Work
This self-correction stuff is wild! 😮 It's like AI is learning to double-check its own homework. Wonder how far this 'agentic AI' will go—could it outsmart us at our own jobs soon?
It's wild to think AI can now self-correct! 😮 Makes me wonder how soon we'll see these 'agentic AI' systems running our lives—hope they don’t outsmart us too much!
This article really opened my eyes to how fast AI is evolving! Self-correcting LLMs sound like a game-changer for agentic AI. Can’t wait to see what new apps come out of this! 😄
La perspectiva de Anthropic sobre que la IA no se estanca sino que supera los benchmarks es bastante genial. Es como si la IA estuviera jugando ajedrez mientras nosotros aún estamos tratando de entender las damas. Lo de la autocorrección suena prometedor, pero aún estoy un poco escéptico. 🤔
Anthropic의 AI가 정체되지 않고 벤치마크를 뛰어넘는다는 생각이 멋지네요. AI는 체스를 하고 있는데, 우리는 아직 체커를 이해하는 단계예요. 자기 교정 이야기는 유망하지만, 아직 조금 회의적이에요. 🤔





首頁






