xAI Grok 4.20 達成業界最低的幻覺率,將完整性置於效能之上
當人工智慧巨頭們正瘋狂投入資源以追求頂尖的性能分數時,伊隆·馬斯克旗下的 xAI 卻採取了不同的策略,將重心放在該領域中最棘手的問題上:資訊造假。 今日,xAI 正式推出Grok4.20Beta。儘管其在絕對智能分數上仍落後於頂級模型,但在「真實性」這項關鍵指標上卻創下了新的業界紀錄。

根據《Artificial Analysis》的最新評估,Grok4.20在推理模式下的智慧指數得分為48分。雖然落後於 和 (兩者均得57分),但其事實可靠性表現尤為亮眼:
低幻覺率:在 AA 全知測試中,Grok4.20 達成了78% 的「非幻覺率」,創下新紀錄。
知己所不知:當面對無法回答的問題時,該模型不再傾向於捏造虛假事實,而是更精確地承認「我不知道」。這種誠實態度對於嚴謹的辦公與研究環境至關重要。
技術架構:三合一 API 矩陣
為滿足多元需求,xAI 推出了三種 API 變體:
推理模式:優先考量深度邏輯思考而非速度,這正是本次打破「幻覺率」紀錄的關鍵。
標準模式:針對快速回應與例行互動進行優化。
多代理模式:支援多個 AI 實例協同作業,以處理複雜任務。
市場策略:更多內容,無需額外費用
除了獨特的性能表現外,Grok 4.20 還推出了一項進取的商業策略:
大上下文:支援長達200 萬個標記的上下文視窗,可一次性處理整本書或大型程式碼庫。
價格優勢:每百萬個標記的定價介於 2 至 6 美元之間,不僅比前一代 Grok4 更便宜,在當前西方主流模型中也極具競爭力。
Grok4.20 的發布反映了 xAI 的戰略轉向——不再執著於通往 AGI 的總分競賽,而是精準鎖定「企業級可靠性」這一痛點。 正如評估機構所言,若其他模型致力於成為「全知先知」,Grok4.20 則致力於成為「永不說謊的助手」。
對於對資料準確性有極高要求的用戶而言,除了 OpenAI 和 Google 之外,Grok4.20 可能會成為第三個主要選擇。
相關文章
位元組跳動旗下 Seed 啟動全球校園招聘,以虛擬股份爭奪頂尖大模型人才
在大型語言模型的競爭格局中,爭奪頂尖人才仍然是最關鍵的戰略資產。4月1日,位元組跳動宣佈啟動Seed全球校園招聘計劃,作為其大模型人才培養專案的一部分。該活動面向2027屆畢業生及現有實習生,旨在全球範圍內發掘並鎖定AI領域的精英研發與工程人才。規模擴張:全球甄選100名“AI種子”在技術快速進步的背景下,位元組跳動有限公司今年大幅增加了對基礎AI人才的投入:招聘範圍: 該計劃旨在從全球範圍內招聘約100名專注於大模型的傑出候選人,物件為2027屆畢業生。發展路徑: Seed計劃將核心
Suno 在法律訴訟中為歌曲新增水印
Suno,這個允許使用者生成由人工智慧創作的音樂的平臺,近日推出了新功能,包括為平臺製作的曲目新增標籤、限制下載,並更新社羣標準以遏制未經授權的複製品。這些更新是在Suno面臨多家唱片公司和藝術家組織提起的多起訴訟之際推出的。在部落格文章中,聯合創始人兼執行長Mikey Shulman概述了核心原則,強調該平臺旨在促進原創創作,同時擴大更廣泛受眾對人工智慧音樂工具的訪問許可權。一個主要的爭議點在於,使用者將人工智慧生成的歌曲上傳到其他流媒體服務並透過操縱系統獲取收入。Suno表示,現在將採用音訊
馬斯克承認 Grok 構建過程中洩露了使用者程式碼,並承諾清除所有歷史資料
埃隆·馬斯克直接回應了圍繞 Grok Build 的隱私爭議,首先以簡單的“True”(屬實)確認了該事件的有效性。他承諾,此前上傳至 SpaceXAI 的所有使用者資料將被永久刪除,並表示“不留一個位元組”。這是人工智慧行業首次由主要科技領袖公開承認錯誤並主動刪除使用者資料。安全研究人員的“釣魚”測試揭示了資料洩露的具體證據此次爭議源於獨立人工智慧安全研究人員 @cereblab 的一份報告。SpaceXAI 推出的 AI 程式設計助手 Grok Build 在其官方網站上聲稱其“優先本地執行,程式碼
相關專題推薦
評論 (0)
0/500
當人工智慧巨頭們正瘋狂投入資源以追求頂尖的性能分數時,伊隆·馬斯克旗下的 xAI 卻採取了不同的策略,將重心放在該領域中最棘手的問題上:資訊造假。 今日,xAI 正式推出Grok4.20Beta。儘管其在絕對智能分數上仍落後於頂級模型,但在「真實性」這項關鍵指標上卻創下了新的業界紀錄。

根據《Artificial Analysis》的最新評估,Grok4.20在推理模式下的智慧指數得分為48分。雖然落後於
低幻覺率:在 AA 全知測試中,Grok4.20 達成了78% 的「非幻覺率」,創下新紀錄。
知己所不知:當面對無法回答的問題時,該模型不再傾向於捏造虛假事實,而是更精確地承認「我不知道」。這種誠實態度對於嚴謹的辦公與研究環境至關重要。
技術架構:三合一 API 矩陣
為滿足多元需求,xAI 推出了三種 API 變體:
推理模式:優先考量深度邏輯思考而非速度,這正是本次打破「幻覺率」紀錄的關鍵。
標準模式:針對快速回應與例行互動進行優化。
多代理模式:支援多個 AI 實例協同作業,以處理複雜任務。
市場策略:更多內容,無需額外費用
除了獨特的性能表現外,Grok 4.20 還推出了一項進取的商業策略:
大上下文:支援長達200 萬個標記的上下文視窗,可一次性處理整本書或大型程式碼庫。
價格優勢:每百萬個標記的定價介於 2 至 6 美元之間,不僅比前一代 Grok4 更便宜,在當前西方主流模型中也極具競爭力。
Grok4.20 的發布反映了 xAI 的戰略轉向——不再執著於通往 AGI 的總分競賽,而是精準鎖定「企業級可靠性」這一痛點。 正如評估機構所言,若其他模型致力於成為「全知先知」,Grok4.20 則致力於成為「永不說謊的助手」。
對於對資料準確性有極高要求的用戶而言,除了 OpenAI 和 Google 之外,Grok4.20 可能會成為第三個主要選擇。
位元組跳動旗下 Seed 啟動全球校園招聘,以虛擬股份爭奪頂尖大模型人才
在大型語言模型的競爭格局中,爭奪頂尖人才仍然是最關鍵的戰略資產。4月1日,位元組跳動宣佈啟動Seed全球校園招聘計劃,作為其大模型人才培養專案的一部分。該活動面向2027屆畢業生及現有實習生,旨在全球範圍內發掘並鎖定AI領域的精英研發與工程人才。規模擴張:全球甄選100名“AI種子”在技術快速進步的背景下,位元組跳動有限公司今年大幅增加了對基礎AI人才的投入:招聘範圍: 該計劃旨在從全球範圍內招聘約100名專注於大模型的傑出候選人,物件為2027屆畢業生。發展路徑: Seed計劃將核心
Suno 在法律訴訟中為歌曲新增水印
Suno,這個允許使用者生成由人工智慧創作的音樂的平臺,近日推出了新功能,包括為平臺製作的曲目新增標籤、限制下載,並更新社羣標準以遏制未經授權的複製品。這些更新是在Suno面臨多家唱片公司和藝術家組織提起的多起訴訟之際推出的。在部落格文章中,聯合創始人兼執行長Mikey Shulman概述了核心原則,強調該平臺旨在促進原創創作,同時擴大更廣泛受眾對人工智慧音樂工具的訪問許可權。一個主要的爭議點在於,使用者將人工智慧生成的歌曲上傳到其他流媒體服務並透過操縱系統獲取收入。Suno表示,現在將採用音訊
馬斯克承認 Grok 構建過程中洩露了使用者程式碼,並承諾清除所有歷史資料
埃隆·馬斯克直接回應了圍繞 Grok Build 的隱私爭議,首先以簡單的“True”(屬實)確認了該事件的有效性。他承諾,此前上傳至 SpaceXAI 的所有使用者資料將被永久刪除,並表示“不留一個位元組”。這是人工智慧行業首次由主要科技領袖公開承認錯誤並主動刪除使用者資料。安全研究人員的“釣魚”測試揭示了資料洩露的具體證據此次爭議源於獨立人工智慧安全研究人員 @cereblab 的一份報告。SpaceXAI 推出的 AI 程式設計助手 Grok Build 在其官方網站上聲稱其“優先本地執行,程式碼





首頁






