Grok 4.6 正式釋出,效能與 GPT-5.6 相當,成本降低超過 60%

xAI 已推出 Grok 4.6,在人工智慧智慧指數中取得 61 分,與 GPT-5.6 Sol (Max) 持平,並略低於 Claude Opus 5(63 分)和 Claude Fable 5(62 分)。這一表現使 Grok 4.6 躋身全球頂級模型行列,直接挑戰來自 OpenAI 和 Anthropic 的旗艦產品。該模型基於 Grok 4.5 的基礎構建,引入了推理能力和高階技術概念訓練方面的核心增強,利用由模型自身生成的精選資料,以及高質量工程資料集和最佳化後的訓練演算法。
訓練方法的一個關鍵轉變涉及自我強化的資料迴圈:Grok 4.5 被用於重新生成監督微調軌跡,重點涵蓋推理、智慧體工具利用以及科學、技術、工程和數學(STEM)、軟體工程及知識工作等領域。該模型還接受了廣泛的基於智慧體的強化學習任務訓練,包括知識工作、通用編碼、核心最佳化、網頁開發和計算機輔助設計——這一策略顯然旨在應對新興“智慧體時代”的主要工作負載。
智慧體基準測試取得了顯著改進,大幅降低了複雜長期任務所需的精力。
在智慧體相關的基準評估中,Grok 4.6 展現了卓越的效能。它在 GDPval-AA v2 上取得了 1753 的 Elo 分數,僅次於 Claude Opus 5。DeepSWE v1.1 的得分提升至 65.9%,相比 Grok 4.5 的 54% 有顯著增長,而 APEX-Agents 則從 47.1% 躍升至 57.5%。Terminal-Bench v3.0 從 15.7% 提升至 26%,同時在 CursorBench v3.2 上取得 69.9% 和 FrontierCode v1.1 上取得 61.3% 的優異結果,標誌著在編碼和智慧體能力方面均取得了重大突破。
值得注意的是,Grok 4.6 具有獨特的成本效益優勢。其定價為每百萬輸入令牌 2 美元,每百萬輸出令牌 6 美元,比 Claude Opus 5(5 美元/25 美元)和 GPT-5.6 Sol(5 美元/30 美元)便宜超過 60%。在 AA-Briefcase 長期知識工作基準測試中,Grok 4.6 平均僅需 53 輪即可完成任務,消耗約 5 億個輸入令牌;而 Claude Opus 5 則需要大約 103 輪和 20 億個令牌。這意味著 Grok 4.6 以不到四分之一的資源消耗實現了相當的結果,凸顯了明顯的成本效能優勢。該模型現已透過 Cursor、Grok Build、API、OpenRouter、Vercel 和 Cloudflare 提供訪問服務。在其上線的第一週,使用者在 Grok Build 和 Cursor 上將獲得雙倍使用額度。憑藉 50 萬個令牌的大上下文視窗,一場聚焦於“同等智慧、更低價格”的競爭格局已正式開啟。
相關文章
美國股市觸及歷史裡程碑,人工智慧與航空航天巨頭準備開啟萬億美元時代
埃隆·馬斯克、山姆·阿爾特曼和達里奧·阿莫迪,這三位科技領域的巨頭,正推動其各自的企業邁向首次公開募股(IPO)。隨著 SpaceX、OpenAI 和 Anthropic——這三家估值接近萬億美元的行業巨頭——即將上市,2026 年被預測將成為美國曆史上新股發行規模最大的一年。這一歷史性的資本激增已引起全球金融界的關注,成為檢驗公共市場吸收如此大規模資金能力的關鍵壓力測試。這些主要融資活動的同步啟動預計將打破 2021 年創下的 1560 億美元紀錄。超級獨角獸的資本博弈每家公司上市的路徑
瑞典人工智慧初創公司Lovable Eyes在完成主要融資輪後估值達132億美元
隨著人工智慧驅動的編碼工具日益普及,瑞典初創公司 Lovable 已獲一輪重大融資。該公司計劃籌集 30 億美元,其估值有望升至 132 億美元——這是去年 12 月記錄的 66 億美元的兩倍。預計 Menlo Ventures 將主導此次投資。Lovable 的吸引力源於其核心的“氛圍編碼”(vibe coding)技術,該技術透過消除對複雜編碼技能的需求來簡化軟體開發。使用者只需以自然語言描述其需求,系統即可自動生成應用程式。這種直觀的方法吸引了個人開發者、設計師和小企業,並擴充套件至 Work
Google 測試 Remy AI 代理,以 Gemini 為重點轉向使用者控制
根據《商業內幕》的報道,谷歌正在測試 Remy,這是 Gemini 的一款全新 AI 個人代理工具。該工具旨在代表使用者執行任務,從而簡化專業工作流程和日常事務。目前,Remy 正在 Gemini 應用的內部員工專屬版本中進行測試。該報告引用了一份內部檔案以及對兩位熟悉該專案的個人的採訪。內部資料將 Remy 描述為“全天候個人代理”,將 Gemini 定位為能夠代表使用者行事的主動助手。接近該專案的訊息人士證實,谷歌員工正在積極測試 Remy。谷歌發言人拒絕提供進一步評論。該報告未提及公開發布
相關專題推薦
評論 (0)
0/500

xAI 已推出 Grok 4.6,在人工智慧智慧指數中取得 61 分,與 GPT-5.6 Sol (Max) 持平,並略低於 Claude Opus 5(63 分)和 Claude Fable 5(62 分)。這一表現使 Grok 4.6 躋身全球頂級模型行列,直接挑戰來自 OpenAI 和 Anthropic 的旗艦產品。該模型基於 Grok 4.5 的基礎構建,引入了推理能力和高階技術概念訓練方面的核心增強,利用由模型自身生成的精選資料,以及高質量工程資料集和最佳化後的訓練演算法。
訓練方法的一個關鍵轉變涉及自我強化的資料迴圈:Grok 4.5 被用於重新生成監督微調軌跡,重點涵蓋推理、智慧體工具利用以及科學、技術、工程和數學(STEM)、軟體工程及知識工作等領域。該模型還接受了廣泛的基於智慧體的強化學習任務訓練,包括知識工作、通用編碼、核心最佳化、網頁開發和計算機輔助設計——這一策略顯然旨在應對新興“智慧體時代”的主要工作負載。
智慧體基準測試取得了顯著改進,大幅降低了複雜長期任務所需的精力。
在智慧體相關的基準評估中,Grok 4.6 展現了卓越的效能。它在 GDPval-AA v2 上取得了 1753 的 Elo 分數,僅次於 Claude Opus 5。DeepSWE v1.1 的得分提升至 65.9%,相比 Grok 4.5 的 54% 有顯著增長,而 APEX-Agents 則從 47.1% 躍升至 57.5%。Terminal-Bench v3.0 從 15.7% 提升至 26%,同時在 CursorBench v3.2 上取得 69.9% 和 FrontierCode v1.1 上取得 61.3% 的優異結果,標誌著在編碼和智慧體能力方面均取得了重大突破。
值得注意的是,Grok 4.6 具有獨特的成本效益優勢。其定價為每百萬輸入令牌 2 美元,每百萬輸出令牌 6 美元,比 Claude Opus 5(5 美元/25 美元)和 GPT-5.6 Sol(5 美元/30 美元)便宜超過 60%。在 AA-Briefcase 長期知識工作基準測試中,Grok 4.6 平均僅需 53 輪即可完成任務,消耗約 5 億個輸入令牌;而 Claude Opus 5 則需要大約 103 輪和 20 億個令牌。這意味著 Grok 4.6 以不到四分之一的資源消耗實現了相當的結果,凸顯了明顯的成本效能優勢。該模型現已透過 Cursor、Grok Build、API、OpenRouter、Vercel 和 Cloudflare 提供訪問服務。在其上線的第一週,使用者在 Grok Build 和 Cursor 上將獲得雙倍使用額度。憑藉 50 萬個令牌的大上下文視窗,一場聚焦於“同等智慧、更低價格”的競爭格局已正式開啟。
美國股市觸及歷史裡程碑,人工智慧與航空航天巨頭準備開啟萬億美元時代
埃隆·馬斯克、山姆·阿爾特曼和達里奧·阿莫迪,這三位科技領域的巨頭,正推動其各自的企業邁向首次公開募股(IPO)。隨著 SpaceX、OpenAI 和 Anthropic——這三家估值接近萬億美元的行業巨頭——即將上市,2026 年被預測將成為美國曆史上新股發行規模最大的一年。這一歷史性的資本激增已引起全球金融界的關注,成為檢驗公共市場吸收如此大規模資金能力的關鍵壓力測試。這些主要融資活動的同步啟動預計將打破 2021 年創下的 1560 億美元紀錄。超級獨角獸的資本博弈每家公司上市的路徑
瑞典人工智慧初創公司Lovable Eyes在完成主要融資輪後估值達132億美元
隨著人工智慧驅動的編碼工具日益普及,瑞典初創公司 Lovable 已獲一輪重大融資。該公司計劃籌集 30 億美元,其估值有望升至 132 億美元——這是去年 12 月記錄的 66 億美元的兩倍。預計 Menlo Ventures 將主導此次投資。Lovable 的吸引力源於其核心的“氛圍編碼”(vibe coding)技術,該技術透過消除對複雜編碼技能的需求來簡化軟體開發。使用者只需以自然語言描述其需求,系統即可自動生成應用程式。這種直觀的方法吸引了個人開發者、設計師和小企業,並擴充套件至 Work





首頁






