選項
首頁
新聞
Deep Cogito 推出四款開源混合推理模型,具備自我提升的直覺能力

Deep Cogito 推出四款開源混合推理模型,具備自我提升的直覺能力

2026-02-21
187

由前谷歌工程師創立的舊金山人工智慧研究新創公司Deep Cogito,近日發布四款新型「半開放式」大型語言模型(LLMs)。這些模型致力解決關鍵挑戰:學習隨時間推移更有效地進行推理,並逐步提升自主能力。

這組被統稱為Cogito v2家族的模型,參數規模從700億至6,710億不等。開發者與企業可透過混合授權模式取得使用權,包含寬鬆授權與完全開放授權。本次發布包含:

  • Cogito v2-70B (Dense)
  • Cogito v2-109B(專家混合模型)
  • Cogito v2-405B(密集型)
  • Cogito v2-671B (混合專家模型)

密集型與專家混合模型各具特色。密集型變體(70B與405B)對每項輸入皆啟用所有參數,使其預測結果更可預測,且更易部署於各類硬體環境。

此類模型適用於低延遲任務、微調及GPU資源受限的環境。相對地,MoE模型(109B與671B)採用稀疏路由機制,每則查詢僅激活特定子集的「專家」子網路。此設計能大幅擴展模型總體積,卻無需成比例增加運算成本。

因此,MoE 模型在高效能推論與複雜推理研究領域表現卓越,以較低執行時間成本實現頂尖準確度。在 Cogito v2 產品線中,671B MoE 模型作為旗艦產品,憑藉其規模與高效路由機制,在基準測試中媲美或超越領先的開放模型——且常以更短的推理鏈達成。

企業用戶現可透過 Hugging Face 存取模型,本地部署則可使用 Unsloth。無法自行託管的用戶可透過 Together AI、Baseten 及 RunPod 取得 API 存取權限。

671B模型另提供FP8量化版本(8位元浮點)。透過將參數精度從16位元降至8位元,此版本實現更快速、經濟且易於部署的硬體解決方案,通常能維持原始效能的95%至99%。然在需高精度的任務(如特定數學或推理問題)中,準確度可能略有下降。

四款Cogito v2模型皆屬混合推理系統:既能即時回應,亦能在必要時進行內部反思後再作答。

此反思機制不僅是推論階段的功能,更是訓練過程的內在組成部分。

模型經訓練後能將推理路徑內化,其推導解法的步驟——即內部「思考過程」——會被提煉回歸至模型的基礎權重中。

隨著時間推移,它們學會區分有效的推理路徑與無關的思路。

正如 Deep Cogito 部落格所述,研究人員不鼓勵模型「多繞彎路」尋找答案,而是引導其培養對最高效推理路徑的直覺。

Deep Cogito 指出,此舉使推理過程更快速高效,即使在標準運作模式下也能實現全面性能提升。

邁向自我提升人工智慧之路

儘管對廣大AI社群而言相對新穎,Deep Cogito其實已研發技術逾一年。

該公司於2025年4月正式亮相,推出基於Meta Llama 3.2的開源模型。這些初始模型在2024年11月獲得Benchmark領投的1300萬美元種子輪融資後,展現出令人鼓舞的成果。Benchmark合夥人Eric Vishria隨後加入公司董事會。

如VentureBeat先前報導,Cogito v1系列最小模型(30億與80億參數)在多項基準測試中持續超越同級Llama 3模型,優勢往往相當顯著。

Deep Cogito執行長暨共同創辦人Drishan Arora(前Google大型語言模型首席工程師)闡述公司願景:打造能透過迭代精進推理能力的模型,其運作原理類似AlphaGo透過自我對弈實現的自我提升。

此方法的核心在於「迭代蒸餾與強化」(IDA),該技術以模型自身演進的洞察力取代靜態訓練提示。

理解機器直覺

Cogito v2版本大幅擴展了此自我優化迴圈。其核心理念直截了當:推理能力應融入模型核心智能,而非僅在推論階段啟動。

為實現此目標,該公司建構了一套系統:模型在訓練過程中生成推理鏈,並從自身的中間思考過程學習。

內部基準測試證實了實質性提升。旗艦級671B MoE模型在推理任務上超越DeepSeek R1,其推理鏈平均長度縮短60%,卻能匹敵甚至超越DeepSeek最新的0528模型。

在MMLU、GSM8K及MGSM等基準測試中,Cogito 671B MoE模型與Qwen1.5-72B、DeepSeek v3等頂尖開源模型表現旗鼓相當,其效能已逼近Claude 4 Opus及o3等封閉模型水準。

關鍵發現包括:

  • 在推理模式下,Cogito 671B MoE於多語言問答與常識領域與DeepSeek R1 0528持平,並在策略規劃與邏輯演繹方面表現更勝一籌。
  • 在標準(非推理)模式下,其表現超越DeepSeek v3 0324,證明即使不經延伸推理步驟,蒸餾出的直覺仍能提升效能。
  • 以更少步驟完成推理帶來實質效益:降低複雜查詢的推論成本與提升回應速度。

阿羅拉將此比喻為「搜尋目的地」與「已具備明確方位感」的差異。

他在X平台發文解釋:「由於Cogito模型在推理過程中能發展出更精準的搜尋軌跡直覺,其推理鏈比DeepSeek R1縮短了60%。」

Deep Cogito 模型的卓越之處:機器直覺的實踐

Cogito v2內部測試案例彰顯此能力。某數學題中,使用者詢問時速80英里的火車能否在2.5小時內行駛240英里。

多數模型需進行繁複的逐步計算且易出錯,而Cogito 671B僅經簡短內部推演,即計算出240 ÷ 80 = 3小時,正確推斷火車無法準時抵達。其內部運算符號使用量不足100個,相較之下DeepSeek R1得出相同結論時耗費逾200個符號。

在關於美國最高法院裁決適用性的法律推理範例中,Cogito的推理模式採用清晰的兩步邏輯:首先判定假設案例是否符合先例,繼而闡明結論依據。這種細膩的詮釋性推理仍是多數大型語言模型面臨的挑戰。

該模型在處理模糊性方面亦展現進步。面對多跳問題(如判定親屬關係:「愛麗絲是鮑伯的母親,鮑伯是查理的父親。愛麗絲對查理而言是誰?」),Cogito v2模型能精準識別「祖母」關係,即使表述稍作變動亦能正確判斷——此為其他開放模型常失誤之處。

實現大規模效率

值得注意的是,Deep Cogito 報告稱其八款 Cogito 模型(含 v1 系列)的總訓練成本低於 350 萬美元——僅為某些前沿模型所披露九位數預算的零頭。

此預算涵蓋了大規模數據生成、合成強化學習、基礎設施及逾千次訓練實驗。

阿羅拉將此成本效益歸因於核心原則:打造更智能的模型取決於更優異的基礎理解("先驗知識"),而非單純餵入更多數據。

透過教導模型避免冗餘或誤導性的推理路徑,Cogito v2 在不增加推論時間或成本的前提下實現穩健性能——這對以 API 為基礎的服務或邊緣裝置部署至關重要,因其延遲與成本是關鍵考量因素。

展望未來:Deep Cogito的路線圖

Cogito v2代表迭代進程而非終極產品。阿羅拉將公司方法比喻為「爬坡法」:運行模型、從推理中學習、提煉經驗、循環往復。每版模型皆在前代基礎上持續進化。

Deep Cogito 持續承諾將所有現有及未來模型開源。其研究成果已獲得 Benchmark 創投的 Eric Vishria 與 South Park Commons 的 Aditya Agarwal 等投資者支持。

基礎設施合作夥伴包括 Hugging Face、Together AI、RunPod、Baseten、Meta 的 Llama 團隊以及 Unsloth。

開發者、研究人員及企業用戶現可立即使用這些模型進行本地部署、多模態比對及領域專屬微調。

對開源人工智慧社群而言,Cogito v2不僅是基準里程碑,更提出建構智能的新範式:其核心不在於更努力思考,而在於學習如何更有效地思考。

相關文章
Suno 在法律訴訟中為歌曲新增水印 Suno 在法律訴訟中為歌曲新增水印 Suno,這個允許使用者生成由人工智慧創作的音樂的平臺,近日推出了新功能,包括為平臺製作的曲目新增標籤、限制下載,並更新社羣標準以遏制未經授權的複製品。這些更新是在Suno面臨多家唱片公司和藝術家組織提起的多起訴訟之際推出的。在部落格文章中,聯合創始人兼執行長Mikey Shulman概述了核心原則,強調該平臺旨在促進原創創作,同時擴大更廣泛受眾對人工智慧音樂工具的訪問許可權。一個主要的爭議點在於,使用者將人工智慧生成的歌曲上傳到其他流媒體服務並透過操縱系統獲取收入。Suno表示,現在將採用音訊
馬斯克承認 Grok 構建過程中洩露了使用者程式碼,並承諾清除所有歷史資料 馬斯克承認 Grok 構建過程中洩露了使用者程式碼,並承諾清除所有歷史資料 埃隆·馬斯克直接回應了圍繞 Grok Build 的隱私爭議,首先以簡單的“True”(屬實)確認了該事件的有效性。他承諾,此前上傳至 SpaceXAI 的所有使用者資料將被永久刪除,並表示“不留一個位元組”。這是人工智慧行業首次由主要科技領袖公開承認錯誤並主動刪除使用者資料。安全研究人員的“釣魚”測試揭示了資料洩露的具體證據此次爭議源於獨立人工智慧安全研究人員 @cereblab 的一份報告。SpaceXAI 推出的 AI 程式設計助手 Grok Build 在其官方網站上聲稱其“優先本地執行,程式碼
美國股市觸及歷史裡程碑,人工智慧與航空航天巨頭準備開啟萬億美元時代 美國股市觸及歷史裡程碑,人工智慧與航空航天巨頭準備開啟萬億美元時代 埃隆·馬斯克、山姆·阿爾特曼和達里奧·阿莫迪,這三位科技領域的巨頭,正推動其各自的企業邁向首次公開募股(IPO)。隨著 SpaceX、OpenAI 和 Anthropic——這三家估值接近萬億美元的行業巨頭——即將上市,2026 年被預測將成為美國曆史上新股發行規模最大的一年。這一歷史性的資本激增已引起全球金融界的關注,成為檢驗公共市場吸收如此大規模資金能力的關鍵壓力測試。這些主要融資活動的同步啟動預計將打破 2021 年創下的 1560 億美元紀錄。超級獨角獸的資本博弈每家公司上市的路徑
相關專題推薦
搜索引擎優化 最適合制定搜尋策略的 AI 搜尋結果頁面(SERP)分析工具
最適合制定搜尋策略的 AI 搜尋結果頁面(SERP)分析工具

XIX.AI 透過嚴格的實際測試及每週更新的排行榜,精選了 2026 年最新、最佳且評價最高的 AI 搜尋結果頁面(SERP)分析工具,以協助制定搜尋策略。這些強大的工具能幫助您發掘隱藏的優化機會、提升內容表現,並在搜尋領域中取得競爭優勢。立即探索最適合您的工具,提升您的搜尋策略。現在就來探索吧!

13 個工具
xix.ai
數據分析 適用於 SaaS 和電商團隊的 KPI 監控最佳 AI 異常檢測工具
適用於 SaaS 和電商團隊的 KPI 監控最佳 AI 異常檢測工具

2026 年最新最佳頂級評分 AI 異常檢測工具,助力 SaaS 和電商團隊的 KPI 監控!XIX.AI 基於嚴格的真實世界測試和每週更新的排名,精心策劃了一套強大且顛覆性的工具合集。您將找到詳細的免費與付費對比洞察,幫助您識別必須嘗試的解決方案,從而提升生產力並釋放您的 AI 優勢。立即探索!

10 個工具
xix.ai
寫作 最適合撰寫長篇 SEO 文章的 AI 大綱生成工具
最適合撰寫長篇 SEO 文章的 AI 大綱生成工具

2026 年最新最佳、評價最高的 AI 大綱生成器,專為長篇 SEO 文章打造,由 XIX.AI 精心精選。這些強大的工具能為快速創作高品質內容提供革命性的協助,大幅提升寫作效率。 透過免費版與付費版的比較、實際測試結果及詳細排名,協助您找出最符合需求且不容錯過的選項。立即探索,釋放您的 AI 優勢。

8 個工具
xix.ai
教育與學習 適用於作業與考試準備的人工智慧學習工具
適用於作業與考試準備的人工智慧學習工具

2026 年最新最佳 AI 學習工具,助您完成作業與備考!XIX.AI 精心整理了一份備受好評的清單,收錄了這些強大且具革命性、經實測驗證的工具,能幫助學生提升效率、簡化作業流程,並在考試中取得優異成績。 獲取免費版與付費版的比較、詳細排名,以及必試選項,以釋放您的 AI 優勢。立即探索!

10 個工具
xix.ai
音樂創作 面向詞曲創作者、旋律片段、主旋律及多語言草稿創作的AI人聲演示工具
面向詞曲創作者、旋律片段、主旋律及多語言草稿創作的AI人聲演示工具

2026 年最新最佳 AI 人聲演示工具,專為詞曲創作者、旋律創作者和多語言內容團隊打造!XIX.AI 精心整理了一份經過嚴格真實世界測試的高評分、變革性工具列表。您將找到詳細的免費與付費對比資料、全面排名以及必試選項,幫助您提升創作效率並釋放創意潛力。立即探索,發現滿足您所有內容需求的完美工具!

9 個工具
xix.ai
商業 最適合小型企業的頂尖 AI 競爭情勢分析工具
最適合小型企業的頂尖 AI 競爭情勢分析工具

2026 年最新、最佳且評價最高的中小企業 AI 競爭研究工具!XIX.AI 精心精選了一系列極具威力且能改變遊戲規則的工具,並透過嚴謹的實測與詳細排名,每週更新內容。您可在此找到詳盡的免費版與付費版比較,協助您找出必試的工具,以提升工作效率並獲得競爭優勢。 立即探索,找出最適合您的工具!

9 個工具
xix.ai
評論 (3)
0/500
LarryMitchell
LarryMitchell 2026-06-14 04:00:14

Interesting move by Deep Cogito. But 'open-ish' sounds like a marketing term—how open is it really? Also, self-improving intuition sounds spooky. Are we building AI that can rewrite its own reasoning without oversight? 🤔

JamesCarter
JamesCarter 2026-05-03 22:01:06

Interesting approach, but 'open-ish' sounds like a marketing gimmick. If the weights aren't fully open, how can the community truly verify their 'self-improving' claims? Feels like another startup trying to have its cake and eat it too. The intuition part is fascinating, though. 🤔

WillieJones
WillieJones 2026-04-09 00:00:50

¿Modelos auto-mejorables? Parece prometedor, pero siempre me pregunto: ¿cómo verifican que la intuición emergente no genere sesgos peligrosos o alucinaciones más sofisticadas? 🤔 Sería bueno ver más transparencia en los datos de entrenamiento.

OR