學術團隊憑藉 SFT 終結科技巨頭的壟斷;OpenSeeker-v2 榮登搜尋代理程式排行榜榜首
在大規模語言模型(LLMs)不斷演進的領域中,深度搜尋能力已成為先進智慧代理人的決定性優勢。然而,這個領域長期以來一直由資金雄厚的產業巨頭所掌控。 傳統的開發方法通常依賴於資源密集型的流程,其中包含預訓練、持續預訓練(CPT)、監督式微調(SFT)以及強化學習(RL)。
一支學術研究團隊最近發表了他們的最新成果「OpenSeeker-v2」,從根本上挑戰了這一既定觀點。根據他們的報告,透過在高品質、高難度的任務軌跡上進行訓練,即使是簡單的監督式微調(SFT)方法,也能打造出頂級的搜尋代理。

該團隊闡述了三項關鍵的資料合成優化策略:首先,擴展知識圖譜以創造更廣闊的探索空間;其次,大幅擴充工具庫的種類以突破功能極限;最後,採用嚴格的低步數過濾機制,以確保訓練資料的品質與效率。
實驗結果顯示,OpenSeeker-v2(具備 300 億個參數並採用 ReAct 架構)僅憑 10,600 個數據點進行訓練,便在四大核心基準測試中展現出壓倒性的表現:在 BrowseComp 上獲得 46.0%、在 BrowseComp-ZH 上獲得 58.1%、 在「Humanity’s Last Exam」上達 34.6%,以及在 xbench 上達 78.0%。這些數值不僅創下新紀錄,更全面超越了依賴結合 CPT、SFT 和 RL 的繁複處理流程的業界模型——例如 Tongyi DeepResearch。

值得注意的是,這標誌著首個由純學術團隊開發、僅採用 SFT 技術,且在相同模型規模與架構下達成的最先進(SOTA)搜尋代理。 該團隊現已將OpenSeeker-v2 的模型權重開源。這項突破顯著降低了先進搜尋代理的研發門檻,並為學術界與開源社群提供了更易於取得且輕量化的開發途徑。
論文:https://arxiv.org/pdf/2605.04036
相關文章
位元組跳動旗下 Seed 啟動全球校園招聘,以虛擬股份爭奪頂尖大模型人才
在大型語言模型的競爭格局中,爭奪頂尖人才仍然是最關鍵的戰略資產。4月1日,位元組跳動宣佈啟動Seed全球校園招聘計劃,作為其大模型人才培養專案的一部分。該活動面向2027屆畢業生及現有實習生,旨在全球範圍內發掘並鎖定AI領域的精英研發與工程人才。規模擴張:全球甄選100名“AI種子”在技術快速進步的背景下,位元組跳動有限公司今年大幅增加了對基礎AI人才的投入:招聘範圍: 該計劃旨在從全球範圍內招聘約100名專注於大模型的傑出候選人,物件為2027屆畢業生。發展路徑: Seed計劃將核心
Suno 在法律訴訟中為歌曲新增水印
Suno,這個允許使用者生成由人工智慧創作的音樂的平臺,近日推出了新功能,包括為平臺製作的曲目新增標籤、限制下載,並更新社羣標準以遏制未經授權的複製品。這些更新是在Suno面臨多家唱片公司和藝術家組織提起的多起訴訟之際推出的。在部落格文章中,聯合創始人兼執行長Mikey Shulman概述了核心原則,強調該平臺旨在促進原創創作,同時擴大更廣泛受眾對人工智慧音樂工具的訪問許可權。一個主要的爭議點在於,使用者將人工智慧生成的歌曲上傳到其他流媒體服務並透過操縱系統獲取收入。Suno表示,現在將採用音訊
馬斯克承認 Grok 構建過程中洩露了使用者程式碼,並承諾清除所有歷史資料
埃隆·馬斯克直接回應了圍繞 Grok Build 的隱私爭議,首先以簡單的“True”(屬實)確認了該事件的有效性。他承諾,此前上傳至 SpaceXAI 的所有使用者資料將被永久刪除,並表示“不留一個位元組”。這是人工智慧行業首次由主要科技領袖公開承認錯誤並主動刪除使用者資料。安全研究人員的“釣魚”測試揭示了資料洩露的具體證據此次爭議源於獨立人工智慧安全研究人員 @cereblab 的一份報告。SpaceXAI 推出的 AI 程式設計助手 Grok Build 在其官方網站上聲稱其“優先本地執行,程式碼
相關專題推薦
評論 (0)
0/500
在大規模語言模型(LLMs)不斷演進的領域中,深度搜尋能力已成為先進智慧代理人的決定性優勢。然而,這個領域長期以來一直由資金雄厚的產業巨頭所掌控。 傳統的開發方法通常依賴於資源密集型的流程,其中包含預訓練、持續預訓練(CPT)、監督式微調(SFT)以及強化學習(RL)。
一支學術研究團隊最近發表了他們的最新成果「OpenSeeker-v2」,從根本上挑戰了這一既定觀點。根據他們的報告,透過在高品質、高難度的任務軌跡上進行訓練,即使是簡單的監督式微調(SFT)方法,也能打造出頂級的搜尋代理。

該團隊闡述了三項關鍵的資料合成優化策略:首先,擴展知識圖譜以創造更廣闊的探索空間;其次,大幅擴充工具庫的種類以突破功能極限;最後,採用嚴格的低步數過濾機制,以確保訓練資料的品質與效率。
實驗結果顯示,OpenSeeker-v2(具備 300 億個參數並採用 ReAct 架構)僅憑 10,600 個數據點進行訓練,便在四大核心基準測試中展現出壓倒性的表現:在 BrowseComp 上獲得 46.0%、在 BrowseComp-ZH 上獲得 58.1%、 在「Humanity’s Last Exam」上達 34.6%,以及在 xbench 上達 78.0%。這些數值不僅創下新紀錄,更全面超越了依賴結合 CPT、SFT 和 RL 的繁複處理流程的業界模型——例如 Tongyi DeepResearch。

值得注意的是,這標誌著首個由純學術團隊開發、僅採用 SFT 技術,且在相同模型規模與架構下達成的最先進(SOTA)搜尋代理。 該團隊現已將OpenSeeker-v2 的模型權重開源。這項突破顯著降低了先進搜尋代理的研發門檻,並為學術界與開源社群提供了更易於取得且輕量化的開發途徑。
論文:https://arxiv.org/pdf/2605.04036
位元組跳動旗下 Seed 啟動全球校園招聘,以虛擬股份爭奪頂尖大模型人才
在大型語言模型的競爭格局中,爭奪頂尖人才仍然是最關鍵的戰略資產。4月1日,位元組跳動宣佈啟動Seed全球校園招聘計劃,作為其大模型人才培養專案的一部分。該活動面向2027屆畢業生及現有實習生,旨在全球範圍內發掘並鎖定AI領域的精英研發與工程人才。規模擴張:全球甄選100名“AI種子”在技術快速進步的背景下,位元組跳動有限公司今年大幅增加了對基礎AI人才的投入:招聘範圍: 該計劃旨在從全球範圍內招聘約100名專注於大模型的傑出候選人,物件為2027屆畢業生。發展路徑: Seed計劃將核心
Suno 在法律訴訟中為歌曲新增水印
Suno,這個允許使用者生成由人工智慧創作的音樂的平臺,近日推出了新功能,包括為平臺製作的曲目新增標籤、限制下載,並更新社羣標準以遏制未經授權的複製品。這些更新是在Suno面臨多家唱片公司和藝術家組織提起的多起訴訟之際推出的。在部落格文章中,聯合創始人兼執行長Mikey Shulman概述了核心原則,強調該平臺旨在促進原創創作,同時擴大更廣泛受眾對人工智慧音樂工具的訪問許可權。一個主要的爭議點在於,使用者將人工智慧生成的歌曲上傳到其他流媒體服務並透過操縱系統獲取收入。Suno表示,現在將採用音訊
馬斯克承認 Grok 構建過程中洩露了使用者程式碼,並承諾清除所有歷史資料
埃隆·馬斯克直接回應了圍繞 Grok Build 的隱私爭議,首先以簡單的“True”(屬實)確認了該事件的有效性。他承諾,此前上傳至 SpaceXAI 的所有使用者資料將被永久刪除,並表示“不留一個位元組”。這是人工智慧行業首次由主要科技領袖公開承認錯誤並主動刪除使用者資料。安全研究人員的“釣魚”測試揭示了資料洩露的具體證據此次爭議源於獨立人工智慧安全研究人員 @cereblab 的一份報告。SpaceXAI 推出的 AI 程式設計助手 Grok Build 在其官方網站上聲稱其“優先本地執行,程式碼





首頁






