Claude Opus 4.7 正式推出,重視可靠性勝於智能
Anthropic 今年持續保持強勁的開發步調,幾乎每隔一天就會推出新功能。備受期待的 Claude Opus 4.7 剛正式發布,有趣的是,Anthropic 在公告中直言不諱地表示:「這並非我們最強大的模型。」 傳聞中更強大的 Claude Mythos Preview 仍處於待命狀態。儘管如此,Opus 4.7 仍引起了相當大的關注,因為它著重解決的是「更可靠」而非「更聰明」的問題。

基準測試結果相當亮眼。在嚴苛的程式設計基準測試 SWE-bench Pro 上, 4.7 版本的成績從前一版的 53.4% 躍升至 64.3%,提升近 11 個百分點,超越了 GPT-5.4(57.7%)和 Gemini 3.1 Pro(54.2%)。 在視覺推理基準測試 CharXiv 上,其表現從 69.1% 躍升至 82.1%,這主要得益於新增的 2576 像素長邊識別能力,其清晰度較前代產品提升了三倍以上。 在工具呼叫評估 MCP-Atlas 上,其得分為 77.3%;而在法律 AI 平台 Harvey 的 BigLaw 基準測試中,則達到 90.9%。 然而,在代理式搜尋評估BrowseComp上,4.7版從83.7%微幅下滑至79.3%,被GPT-5.4和Gemini超越——這歸因於其「不捏造」的個性,當資訊不完整時,它傾向於報告錯誤而非進行推測。
除了數字之外,性格的轉變更值得注意。Replit 的負責人在測試後指出:「它在技術討論中能與我切磋,協助我做出更佳決策,確實像一位更優秀的同事。」數據科學平台 Hex 也觀察到,當資料缺失時,4.7 會直接回報錯誤,而非像以往那樣提供「看似合理但完全錯誤」的替代值。 與此同時,任務韌性也顯著提升——Notion 團隊的測試顯示,該工具的錯誤率已降至先前水平的三分之一,且當工具鏈發生故障時,它能克服障礙並獨立完成任務。 Vercel 甚至發現了一種新行為:在編寫系統級代碼之前,4.7 會先自行進行數學證明。

當然,能力提升伴隨著代價。4.7 引入了新的分詞器,針對相同文本生成的令牌數量增加了 1 到 1.35 倍。此外,它在處理複雜任務時傾向於「思考更久一些」,因此實際消耗量幾乎肯定會更高。 為解決此問題,Anthropic 新增了「xhigh」超高額度思考強度等級。Claude Code 已預設將所有套件設為此等級,並推出「深度審查」指令 / ultrareview、針對 Max 用戶的 Auto Mode 擴充功能,以及「任務預算」功能的公開測試版,以協助開發者管理字元使用量。
功能更強大的 Mythos Preview 近期已透過「Project Glasswing」計畫向企業開放,用於網路安全研究;但由於其能力過於強大且安全評估尚未完成,目前尚未對外公開發布。
今日發布的 4.7 版本標誌著 Anthropic 高頻次發布節奏中的最新里程碑。Mythos 終將問世——而當它真正登場時,現已相當強大的 4.7 版本或許僅僅是序幕。
相關文章
如何修復核心網頁指標以獲得更好的 SEO 排名
利用 AI 工具簡化成績單評語撰寫引言用於生成成績單評語的 AI 工具Magic SchoolAlmanac AIChat GPT使用 Magic School 生成成績單評語登入 Magic School選擇成績單評語工具為學生定製評語使用 Almanac AI 生成成績單評語設定課程與評分方案配置評語長度與學生資訊使用 Almanac AI 生成評語比較 Magic School 與 Almanac AI設定的便捷性可定製性與課程內容的整合速度與效率使用
Slackbot 成為 AI 智慧體
Slackbot,嵌入在Salesforce企業訊息平臺Slack中的自動化助手,正在演變為一個AI智慧體。Salesforce技術長Parker Harris設想它將達到與OpenAI的ChatGPT相媲美的病毒式傳播地位。這家雲軟體巨頭於週二推出了更新版的Slackbot。該新版AI驅動版本面向Business+和Enterprise+客戶,可直接在Slack內查詢資訊、起草電子郵件和安排會議。在獲得適當許可權的情況下,它還能與Microsoft Teams和Google Drive等企
位元組跳動加大核心AI激勵,豆包增長14.6%
位元組跳動近日召開豆包股權說明會,公佈面向豆包部門員工的最新激勵政策。豆包股票的行權價已從2026年6月的14.85美元上調至17.02美元,漲幅約為14.6%。此次調整不僅提升了豆包股票的估值,還大幅擴大了其覆蓋範圍。根據員工崗位的不同,部分員工可能獲得相當於其總薪酬約5%的豆包股票。根據新的兌換機制,位元組跳動允許員工在整體薪酬包中,將部分現金工資兌換為豆包股權。兌換比例因職級而異,設有20%和30%等不同檔位。例如,L2和L3級員工可選擇20%的全覆蓋兌換比例,而L3和L4級員工的該比例可
相關專題推薦
評論 (0)
0/500
Anthropic 今年持續保持強勁的開發步調,幾乎每隔一天就會推出新功能。備受期待的 Claude Opus 4.7 剛正式發布,有趣的是,Anthropic 在公告中直言不諱地表示:「這並非我們最強大的模型。」 傳聞中更強大的 Claude Mythos Preview 仍處於待命狀態。儘管如此,Opus 4.7 仍引起了相當大的關注,因為它著重解決的是「更可靠」而非「更聰明」的問題。

基準測試結果相當亮眼。在嚴苛的程式設計基準測試 SWE-bench Pro 上, 4.7 版本的成績從前一版的 53.4% 躍升至 64.3%,提升近 11 個百分點,超越了 GPT-5.4(57.7%)和 Gemini 3.1 Pro(54.2%)。 在視覺推理基準測試 CharXiv 上,其表現從 69.1% 躍升至 82.1%,這主要得益於新增的 2576 像素長邊識別能力,其清晰度較前代產品提升了三倍以上。 在工具呼叫評估 MCP-Atlas 上,其得分為 77.3%;而在法律 AI 平台 Harvey 的 BigLaw 基準測試中,則達到 90.9%。 然而,在代理式搜尋評估BrowseComp上,4.7版從83.7%微幅下滑至79.3%,被GPT-5.4和Gemini超越——這歸因於其「不捏造」的個性,當資訊不完整時,它傾向於報告錯誤而非進行推測。
除了數字之外,性格的轉變更值得注意。Replit 的負責人在測試後指出:「它在技術討論中能與我切磋,協助我做出更佳決策,確實像一位更優秀的同事。」數據科學平台 Hex 也觀察到,當資料缺失時,4.7 會直接回報錯誤,而非像以往那樣提供「看似合理但完全錯誤」的替代值。 與此同時,任務韌性也顯著提升——Notion 團隊的測試顯示,該工具的錯誤率已降至先前水平的三分之一,且當工具鏈發生故障時,它能克服障礙並獨立完成任務。 Vercel 甚至發現了一種新行為:在編寫系統級代碼之前,4.7 會先自行進行數學證明。

當然,能力提升伴隨著代價。4.7 引入了新的分詞器,針對相同文本生成的令牌數量增加了 1 到 1.35 倍。此外,它在處理複雜任務時傾向於「思考更久一些」,因此實際消耗量幾乎肯定會更高。 為解決此問題,Anthropic 新增了「xhigh」超高額度思考強度等級。Claude Code 已預設將所有套件設為此等級,並推出「深度審查」指令 / ultrareview、針對 Max 用戶的 Auto Mode 擴充功能,以及「任務預算」功能的公開測試版,以協助開發者管理字元使用量。
功能更強大的 Mythos Preview 近期已透過「Project Glasswing」計畫向企業開放,用於網路安全研究;但由於其能力過於強大且安全評估尚未完成,目前尚未對外公開發布。
今日發布的 4.7 版本標誌著 Anthropic 高頻次發布節奏中的最新里程碑。Mythos 終將問世——而當它真正登場時,現已相當強大的 4.7 版本或許僅僅是序幕。
如何修復核心網頁指標以獲得更好的 SEO 排名
利用 AI 工具簡化成績單評語撰寫引言用於生成成績單評語的 AI 工具Magic SchoolAlmanac AIChat GPT使用 Magic School 生成成績單評語登入 Magic School選擇成績單評語工具為學生定製評語使用 Almanac AI 生成成績單評語設定課程與評分方案配置評語長度與學生資訊使用 Almanac AI 生成評語比較 Magic School 與 Almanac AI設定的便捷性可定製性與課程內容的整合速度與效率使用
Slackbot 成為 AI 智慧體
Slackbot,嵌入在Salesforce企業訊息平臺Slack中的自動化助手,正在演變為一個AI智慧體。Salesforce技術長Parker Harris設想它將達到與OpenAI的ChatGPT相媲美的病毒式傳播地位。這家雲軟體巨頭於週二推出了更新版的Slackbot。該新版AI驅動版本面向Business+和Enterprise+客戶,可直接在Slack內查詢資訊、起草電子郵件和安排會議。在獲得適當許可權的情況下,它還能與Microsoft Teams和Google Drive等企
位元組跳動加大核心AI激勵,豆包增長14.6%
位元組跳動近日召開豆包股權說明會,公佈面向豆包部門員工的最新激勵政策。豆包股票的行權價已從2026年6月的14.85美元上調至17.02美元,漲幅約為14.6%。此次調整不僅提升了豆包股票的估值,還大幅擴大了其覆蓋範圍。根據員工崗位的不同,部分員工可能獲得相當於其總薪酬約5%的豆包股票。根據新的兌換機制,位元組跳動允許員工在整體薪酬包中,將部分現金工資兌換為豆包股權。兌換比例因職級而異,設有20%和30%等不同檔位。例如,L2和L3級員工可選擇20%的全覆蓋兌換比例,而L3和L4級員工的該比例可





首頁






