李飛飛的 ESI-Bench:人工智慧從「觀察者」演進為「行動者」
近期,李飛飛團隊發布的 ESI-Bench(具身空間智能基準測試)引起了廣泛關注。這項被譽為「具身智能領域的 ImageNet」的基準測試,揭示了頂尖大型模型在與實體空間互動時所存在的關鍵缺陷。

為何 ESI-Bench 標誌著具身智能的新標準
早期的 AI 空間智能評估主要依賴「被動感知」:向模型輸入幾張最佳視角的圖像,並讓模型進行邏輯推理。這種方法本質上測試的是模型的「視覺」,而非其「空間認知」。
ESI-Bench 的核心突破在於其強制執行「感知-動作迴路」。
觀察者成為行動者:在 ESI-Bench 中,模型不能僅停留在原地並根據給定的圖像進行判斷;它必須主動決定前往何處、觀察什麼、拾取哪些物體,以及操作哪些機械結構,並透過一系列互動動作來發掘隱藏的空間資訊。
設計基礎:此基準測試以認知心理學家伊莉莎白·斯佩爾克(Elizabeth Spelke)提出的「人類嬰兒核心知識系統」為基礎,涵蓋四大維度:物體表徵、佈局與幾何、數量表徵,以及目標導向行動。
規模與平台:該基準包含 10 個類別、29 個子類別及 3,081 個任務實例,建構於 OmniGibson 模擬平台之上,並採用 BEHAVIOR-1K 場景庫中的素材。
評估揭示的三項核心真相
研究團隊針對 GPT-5 及 Gemini 系列等尖端多模態模型進行了深入測試。結果發人深省:
1. 感知並非瓶頸——行動策略才是
當獲得最佳視角時,模型往往能給出準確答案——準確率可從 14.6% 躍升至 95.1%。但當模型必須主動尋找視角時,準確率便會急劇下降。
行動盲點:模型缺乏導航與操作策略;錯誤的行動會導致視角不佳,進而引發後續判斷中的連鎖錯誤。
2. 不完美的 3D 重建比 2D 影像更具誤導性
這項研究推翻了「3D 地圖是萬能解決方案」的假設。
當輸入完美的俯視 3D 真實資料時,推理表現極佳。然而,使用當前先進的 VGGT 進行即時重建會引入幾何瑕疵、遮擋錯誤和深度偏差——這本質上是向推理模型輸入有毒資料,其表現甚至比單純查看 2D 影像還要差。

3. 元認知缺陷:AI 無法察覺自己「所見不足」
這是人類與人工智慧之間最大的認知差距:
認知謹慎度的差異:當資訊模稜兩可時,人類會主動尋求反駁的觀點,並在不確定性下降低自信程度。
模型幻覺:即使在資訊極度有限的情況下,模型往往過早停止探索,並自信地給出錯誤結論。研究團隊將此稱為「元認知缺陷」——模型缺乏內在的懷疑機制,無法評估當前資訊是否足夠。
具身智能的未來方向
ESI-Bench 標誌著具身智能評估從「靜態圖文配對」向「真實物理互動」的範式轉移。正如李飛飛團隊所指出的,要實現真正的空間智能,僅靠堆疊視覺編碼器或提升運算能力是遠遠不夠的。
未來的具身智能研究必須著重於賦予模型:
主動探索與序列決策能力,而非單純的圖像辨識;
更強的魯棒性,即使在場景觀察不完整的情況下仍能維持邏輯判斷;
內建元認知迴路,使 AI 在缺乏答案時學會主動探索,而非產生錯誤的「幻覺」。
相關文章
位元組跳動旗下 Seed 啟動全球校園招聘,以虛擬股份爭奪頂尖大模型人才
在大型語言模型的競爭格局中,爭奪頂尖人才仍然是最關鍵的戰略資產。4月1日,位元組跳動宣佈啟動Seed全球校園招聘計劃,作為其大模型人才培養專案的一部分。該活動面向2027屆畢業生及現有實習生,旨在全球範圍內發掘並鎖定AI領域的精英研發與工程人才。規模擴張:全球甄選100名“AI種子”在技術快速進步的背景下,位元組跳動有限公司今年大幅增加了對基礎AI人才的投入:招聘範圍: 該計劃旨在從全球範圍內招聘約100名專注於大模型的傑出候選人,物件為2027屆畢業生。發展路徑: Seed計劃將核心
Suno 在法律訴訟中為歌曲新增水印
Suno,這個允許使用者生成由人工智慧創作的音樂的平臺,近日推出了新功能,包括為平臺製作的曲目新增標籤、限制下載,並更新社羣標準以遏制未經授權的複製品。這些更新是在Suno面臨多家唱片公司和藝術家組織提起的多起訴訟之際推出的。在部落格文章中,聯合創始人兼執行長Mikey Shulman概述了核心原則,強調該平臺旨在促進原創創作,同時擴大更廣泛受眾對人工智慧音樂工具的訪問許可權。一個主要的爭議點在於,使用者將人工智慧生成的歌曲上傳到其他流媒體服務並透過操縱系統獲取收入。Suno表示,現在將採用音訊
馬斯克承認 Grok 構建過程中洩露了使用者程式碼,並承諾清除所有歷史資料
埃隆·馬斯克直接回應了圍繞 Grok Build 的隱私爭議,首先以簡單的“True”(屬實)確認了該事件的有效性。他承諾,此前上傳至 SpaceXAI 的所有使用者資料將被永久刪除,並表示“不留一個位元組”。這是人工智慧行業首次由主要科技領袖公開承認錯誤並主動刪除使用者資料。安全研究人員的“釣魚”測試揭示了資料洩露的具體證據此次爭議源於獨立人工智慧安全研究人員 @cereblab 的一份報告。SpaceXAI 推出的 AI 程式設計助手 Grok Build 在其官方網站上聲稱其“優先本地執行,程式碼
相關專題推薦
評論 (0)
0/500
近期,李飛飛團隊發布的 ESI-Bench(具身空間智能基準測試)引起了廣泛關注。這項被譽為「具身智能領域的 ImageNet」的基準測試,揭示了頂尖大型模型在與實體空間互動時所存在的關鍵缺陷。

為何 ESI-Bench 標誌著具身智能的新標準
早期的 AI 空間智能評估主要依賴「被動感知」:向模型輸入幾張最佳視角的圖像,並讓模型進行邏輯推理。這種方法本質上測試的是模型的「視覺」,而非其「空間認知」。
ESI-Bench 的核心突破在於其強制執行「感知-動作迴路」。
觀察者成為行動者:在 ESI-Bench 中,模型不能僅停留在原地並根據給定的圖像進行判斷;它必須主動決定前往何處、觀察什麼、拾取哪些物體,以及操作哪些機械結構,並透過一系列互動動作來發掘隱藏的空間資訊。
設計基礎:此基準測試以認知心理學家伊莉莎白·斯佩爾克(Elizabeth Spelke)提出的「人類嬰兒核心知識系統」為基礎,涵蓋四大維度:物體表徵、佈局與幾何、數量表徵,以及目標導向行動。
規模與平台:該基準包含 10 個類別、29 個子類別及 3,081 個任務實例,建構於 OmniGibson 模擬平台之上,並採用 BEHAVIOR-1K 場景庫中的素材。
評估揭示的三項核心真相
研究團隊針對 GPT-5 及 Gemini 系列等尖端多模態模型進行了深入測試。結果發人深省:
1. 感知並非瓶頸——行動策略才是
當獲得最佳視角時,模型往往能給出準確答案——準確率可從 14.6% 躍升至 95.1%。但當模型必須主動尋找視角時,準確率便會急劇下降。
行動盲點:模型缺乏導航與操作策略;錯誤的行動會導致視角不佳,進而引發後續判斷中的連鎖錯誤。
2. 不完美的 3D 重建比 2D 影像更具誤導性
這項研究推翻了「3D 地圖是萬能解決方案」的假設。
當輸入完美的俯視 3D 真實資料時,推理表現極佳。然而,使用當前先進的 VGGT 進行即時重建會引入幾何瑕疵、遮擋錯誤和深度偏差——這本質上是向推理模型輸入有毒資料,其表現甚至比單純查看 2D 影像還要差。

3. 元認知缺陷:AI 無法察覺自己「所見不足」
這是人類與人工智慧之間最大的認知差距:
認知謹慎度的差異:當資訊模稜兩可時,人類會主動尋求反駁的觀點,並在不確定性下降低自信程度。
模型幻覺:即使在資訊極度有限的情況下,模型往往過早停止探索,並自信地給出錯誤結論。研究團隊將此稱為「元認知缺陷」——模型缺乏內在的懷疑機制,無法評估當前資訊是否足夠。
具身智能的未來方向
ESI-Bench 標誌著具身智能評估從「靜態圖文配對」向「真實物理互動」的範式轉移。正如李飛飛團隊所指出的,要實現真正的空間智能,僅靠堆疊視覺編碼器或提升運算能力是遠遠不夠的。
未來的具身智能研究必須著重於賦予模型:
主動探索與序列決策能力,而非單純的圖像辨識;
更強的魯棒性,即使在場景觀察不完整的情況下仍能維持邏輯判斷;
內建元認知迴路,使 AI 在缺乏答案時學會主動探索,而非產生錯誤的「幻覺」。
位元組跳動旗下 Seed 啟動全球校園招聘,以虛擬股份爭奪頂尖大模型人才
在大型語言模型的競爭格局中,爭奪頂尖人才仍然是最關鍵的戰略資產。4月1日,位元組跳動宣佈啟動Seed全球校園招聘計劃,作為其大模型人才培養專案的一部分。該活動面向2027屆畢業生及現有實習生,旨在全球範圍內發掘並鎖定AI領域的精英研發與工程人才。規模擴張:全球甄選100名“AI種子”在技術快速進步的背景下,位元組跳動有限公司今年大幅增加了對基礎AI人才的投入:招聘範圍: 該計劃旨在從全球範圍內招聘約100名專注於大模型的傑出候選人,物件為2027屆畢業生。發展路徑: Seed計劃將核心
Suno 在法律訴訟中為歌曲新增水印
Suno,這個允許使用者生成由人工智慧創作的音樂的平臺,近日推出了新功能,包括為平臺製作的曲目新增標籤、限制下載,並更新社羣標準以遏制未經授權的複製品。這些更新是在Suno面臨多家唱片公司和藝術家組織提起的多起訴訟之際推出的。在部落格文章中,聯合創始人兼執行長Mikey Shulman概述了核心原則,強調該平臺旨在促進原創創作,同時擴大更廣泛受眾對人工智慧音樂工具的訪問許可權。一個主要的爭議點在於,使用者將人工智慧生成的歌曲上傳到其他流媒體服務並透過操縱系統獲取收入。Suno表示,現在將採用音訊
馬斯克承認 Grok 構建過程中洩露了使用者程式碼,並承諾清除所有歷史資料
埃隆·馬斯克直接回應了圍繞 Grok Build 的隱私爭議,首先以簡單的“True”(屬實)確認了該事件的有效性。他承諾,此前上傳至 SpaceXAI 的所有使用者資料將被永久刪除,並表示“不留一個位元組”。這是人工智慧行業首次由主要科技領袖公開承認錯誤並主動刪除使用者資料。安全研究人員的“釣魚”測試揭示了資料洩露的具體證據此次爭議源於獨立人工智慧安全研究人員 @cereblab 的一份報告。SpaceXAI 推出的 AI 程式設計助手 Grok Build 在其官方網站上聲稱其“優先本地執行,程式碼





首頁






