AI編碼工具轉向終端機開發領域

多年來,諸如Cursor、Windsurf和GitHub Copilot等人工智慧增強型程式碼編輯器,始終是軟體開發領域的標竿。 然而隨著自主型人工智慧能力提升,以及更直覺的「氛圍編碼」方法逐漸普及,一場靜默的演進正重塑這些系統的運作模式。它們不再僅限於操作程式碼,而是日益直接介入系統的命令列殼層。這標誌著人工智慧輔助開發的根本性轉變——對產業未來走向而言,此舉雖微妙卻可能帶來顛覆性影響。
終端機介面常令人聯想起九零年代駭客電影中冷峻的黑白螢幕,作為執行程式與管理資料的經典介面,儘管視覺呈現不如現代程式編輯器精緻,在熟練者手中仍具強大威力。雖然程式碼導向的代理程式能撰寫與除錯,但終端機工具往往是將書寫程式轉化為可運作部署應用程式的關鍵環節。
此趨勢在頂尖人工智慧實驗室中尤為顯著。自今年二月起,Anthropic、DeepMind與OpenAI相繼推出命令列編碼工具(分別為Claude Code、Gemini CLI及CLI Codex),這些工具迅速成為其最受歡迎的產品。由於這些工具常沿用前代產品的品牌名稱,此轉變容易被忽略。然而本質上,人工智慧代理程式與電腦的互動模式——無論線上或離線——已然改變。 許多人認為這僅是開端。
「我們的核心假設是:未來約95%的大型語言模型與電腦互動將透過終端機式介面進行,」知名終端機基準測試平台TerminalBench的共同創辦人Alex Shaw如此表示。
當部分成熟的程式碼平台面臨動盪之際,終端式工具正嶄露頭角。以AI程式碼編輯器Windsurf為例,其核心團隊遭競爭對手挖角——高階主管被Google招攬,剩餘公司則被Cognition收購——使該消費級產品的長期可行性蒙上陰影。
與此同時,新研究指出開發者可能高估傳統工具的生產力效益。METR針對Windsurf主要競爭對手Cursor Pro的評估發現,開發者預期效率提升20-30%,實際觀察卻慢了近20%。本質上,這種程式碼輔助工具在某些情況下反而耗費程式設計師的時間。
這為Warp等企業創造了契機,該公司目前在TerminalBench排行榜中名列前茅。Warp自稱是「代理式開發環境」,填補了完整IDE與Claude Code等命令列工具之間的空白。創辦人Zach Lloyd對終端機的潛力仍持樂觀態度,認為它能解決傳統程式編輯器(如Cursor)無法處理的問題。
Techcrunch 活動 即時直播!TechCrunch全舞台
更聰明的建構。更快速的擴展。更深層的連結。與Precursor Ventures、NEA、Index Ventures、Underscore VC等機構的先驅者共聚,參與這場充滿策略分享、實作工作坊與深度交流的盛會。
立即購買 TechCrunch 全場通行證,立省 450 美元
更聰明地打造。更快地擴展。更深入地連結。與來自Precursor Ventures、NEA、Index Ventures、Underscore VC等機構的遠見者齊聚,共度充滿策略、工作坊與深度連結的精彩一日。
麻薩諸塞州波士頓市 | 7月15日 | 立即註冊 「終端機位於開發者技術棧的最基礎層級,使其成為執行人工智慧代理最靈活的場域,」洛伊德解釋道。
要理解此新方法的差異,可從其評估基準著眼。 前一代基於代碼的工具,主要透過解決 GitHub 問題來衡量效能,這正是 SWE-Bench 測試的基礎。每個 SWE-Bench 問題皆源自 GitHub 公開問題——一段失效的代碼。模型會反覆優化代碼直至正常運作。儘管像 Cursor 這樣的整合產品已發展出更精密的方法,但核心的 GitHub/SWE-Bench 模式始終不變:從失效代碼出發,逐步修復。
終端機工具則採用更廣闊的視角,考量程式運行的完整環境而非僅限程式碼。這涵蓋編碼作業,以及配置Git伺服器或診斷腳本失敗原因等DevOps導向任務。 某項TerminalBench挑戰提供解壓縮程式與目標文本檔案,要求代理程式逆向工程出對應的壓縮演算法;另一項則要求代理程式從原始碼編譯Linux核心,卻未提及需先取得原始碼。解決這些問題需要程式設計中固有的持續性與創造性解題能力。
「TerminalBench的難度不僅在於我們向代理程式提出的問題,」Shaw指出,「更在於我們所設置的複雜環境。」
關鍵在於,此新方法需透過循序漸進的理性步驟解決問題——這正是使代理型人工智慧如此強大的核心能力。然而,即使尖端的代理模型在某些環境中仍顯力不從心。Warp模型僅解決半數問題便創下TerminalBench最高分,既凸顯基準測試的艱鉅性,也揭示實現終端機完整潛能仍需持續努力。
儘管如此,洛伊德堅稱我們已邁入終端工具能可靠處理開發者大量非編碼工作量的階段——這份邀約實在難以拒絕。
「試想日常工作中建立新專案、釐清依賴關係並使其可執行的流程——Warp能自主處理其中大部分環節,」洛伊德表示,「若遇到無法解決的情況,它會精確告知原因。」
相關文章
瑞典人工智慧初創公司Lovable Eyes在完成主要融資輪後估值達132億美元
隨著人工智慧驅動的編碼工具日益普及,瑞典初創公司 Lovable 已獲一輪重大融資。該公司計劃籌集 30 億美元,其估值有望升至 132 億美元——這是去年 12 月記錄的 66 億美元的兩倍。預計 Menlo Ventures 將主導此次投資。Lovable 的吸引力源於其核心的“氛圍編碼”(vibe coding)技術,該技術透過消除對複雜編碼技能的需求來簡化軟體開發。使用者只需以自然語言描述其需求,系統即可自動生成應用程式。這種直觀的方法吸引了個人開發者、設計師和小企業,並擴充套件至 Work
Google 測試 Remy AI 代理,以 Gemini 為重點轉向使用者控制
根據《商業內幕》的報道,谷歌正在測試 Remy,這是 Gemini 的一款全新 AI 個人代理工具。該工具旨在代表使用者執行任務,從而簡化專業工作流程和日常事務。目前,Remy 正在 Gemini 應用的內部員工專屬版本中進行測試。該報告引用了一份內部檔案以及對兩位熟悉該專案的個人的採訪。內部資料將 Remy 描述為“全天候個人代理”,將 Gemini 定位為能夠代表使用者行事的主動助手。接近該專案的訊息人士證實,谷歌員工正在積極測試 Remy。谷歌發言人拒絕提供進一步評論。該報告未提及公開發布
如何修復核心網頁指標以獲得更好的 SEO 排名
利用 AI 工具簡化成績單評語撰寫引言用於生成成績單評語的 AI 工具Magic SchoolAlmanac AIChat GPT使用 Magic School 生成成績單評語登入 Magic School選擇成績單評語工具為學生定製評語使用 Almanac AI 生成成績單評語設定課程與評分方案配置評語長度與學生資訊使用 Almanac AI 生成評語比較 Magic School 與 Almanac AI設定的便捷性可定製性與課程內容的整合速度與效率使用
相關專題推薦
評論 (3)
0/500
Interessant, dass sich die KI-Coding-Tools jetzt auf das Terminal konzentrieren. Ich habe Cursor und Copilot im Editor benutzt, aber die Idee, direkt in der Kommandozeile zu arbeiten, klingt nach einem logischen nächsten Schritt für mehr Effizienz. Hoffentlich bleibt die Bedienung trotzdem intuitiv – sonst wird das nichts mit dem 'Vibe-Coding' 😅. Mal sehen, wie sich das gegen die etablierten Editoren durchsetzt.

多年來,諸如Cursor、Windsurf和GitHub Copilot等人工智慧增強型程式碼編輯器,始終是軟體開發領域的標竿。 然而隨著自主型人工智慧能力提升,以及更直覺的「氛圍編碼」方法逐漸普及,一場靜默的演進正重塑這些系統的運作模式。它們不再僅限於操作程式碼,而是日益直接介入系統的命令列殼層。這標誌著人工智慧輔助開發的根本性轉變——對產業未來走向而言,此舉雖微妙卻可能帶來顛覆性影響。
終端機介面常令人聯想起九零年代駭客電影中冷峻的黑白螢幕,作為執行程式與管理資料的經典介面,儘管視覺呈現不如現代程式編輯器精緻,在熟練者手中仍具強大威力。雖然程式碼導向的代理程式能撰寫與除錯,但終端機工具往往是將書寫程式轉化為可運作部署應用程式的關鍵環節。
此趨勢在頂尖人工智慧實驗室中尤為顯著。自今年二月起,Anthropic、DeepMind與OpenAI相繼推出命令列編碼工具(分別為Claude Code、Gemini CLI及CLI Codex),這些工具迅速成為其最受歡迎的產品。由於這些工具常沿用前代產品的品牌名稱,此轉變容易被忽略。然而本質上,人工智慧代理程式與電腦的互動模式——無論線上或離線——已然改變。 許多人認為這僅是開端。
「我們的核心假設是:未來約95%的大型語言模型與電腦互動將透過終端機式介面進行,」知名終端機基準測試平台TerminalBench的共同創辦人Alex Shaw如此表示。
當部分成熟的程式碼平台面臨動盪之際,終端式工具正嶄露頭角。以AI程式碼編輯器Windsurf為例,其核心團隊遭競爭對手挖角——高階主管被Google招攬,剩餘公司則被Cognition收購——使該消費級產品的長期可行性蒙上陰影。
與此同時,新研究指出開發者可能高估傳統工具的生產力效益。METR針對Windsurf主要競爭對手Cursor Pro的評估發現,開發者預期效率提升20-30%,實際觀察卻慢了近20%。本質上,這種程式碼輔助工具在某些情況下反而耗費程式設計師的時間。
這為Warp等企業創造了契機,該公司目前在TerminalBench排行榜中名列前茅。Warp自稱是「代理式開發環境」,填補了完整IDE與Claude Code等命令列工具之間的空白。創辦人Zach Lloyd對終端機的潛力仍持樂觀態度,認為它能解決傳統程式編輯器(如Cursor)無法處理的問題。
Techcrunch 活動即時直播!TechCrunch全舞台
更聰明的建構。更快速的擴展。更深層的連結。與Precursor Ventures、NEA、Index Ventures、Underscore VC等機構的先驅者共聚,參與這場充滿策略分享、實作工作坊與深度交流的盛會。
立即購買 TechCrunch 全場通行證,立省 450 美元
更聰明地打造。更快地擴展。更深入地連結。與來自Precursor Ventures、NEA、Index Ventures、Underscore VC等機構的遠見者齊聚,共度充滿策略、工作坊與深度連結的精彩一日。
麻薩諸塞州波士頓市 | 7月15日 | 立即註冊「終端機位於開發者技術棧的最基礎層級,使其成為執行人工智慧代理最靈活的場域,」洛伊德解釋道。
要理解此新方法的差異,可從其評估基準著眼。 前一代基於代碼的工具,主要透過解決 GitHub 問題來衡量效能,這正是 SWE-Bench 測試的基礎。每個 SWE-Bench 問題皆源自 GitHub 公開問題——一段失效的代碼。模型會反覆優化代碼直至正常運作。儘管像 Cursor 這樣的整合產品已發展出更精密的方法,但核心的 GitHub/SWE-Bench 模式始終不變:從失效代碼出發,逐步修復。
終端機工具則採用更廣闊的視角,考量程式運行的完整環境而非僅限程式碼。這涵蓋編碼作業,以及配置Git伺服器或診斷腳本失敗原因等DevOps導向任務。 某項TerminalBench挑戰提供解壓縮程式與目標文本檔案,要求代理程式逆向工程出對應的壓縮演算法;另一項則要求代理程式從原始碼編譯Linux核心,卻未提及需先取得原始碼。解決這些問題需要程式設計中固有的持續性與創造性解題能力。
「TerminalBench的難度不僅在於我們向代理程式提出的問題,」Shaw指出,「更在於我們所設置的複雜環境。」
關鍵在於,此新方法需透過循序漸進的理性步驟解決問題——這正是使代理型人工智慧如此強大的核心能力。然而,即使尖端的代理模型在某些環境中仍顯力不從心。Warp模型僅解決半數問題便創下TerminalBench最高分,既凸顯基準測試的艱鉅性,也揭示實現終端機完整潛能仍需持續努力。
儘管如此,洛伊德堅稱我們已邁入終端工具能可靠處理開發者大量非編碼工作量的階段——這份邀約實在難以拒絕。
「試想日常工作中建立新專案、釐清依賴關係並使其可執行的流程——Warp能自主處理其中大部分環節,」洛伊德表示,「若遇到無法解決的情況,它會精確告知原因。」
瑞典人工智慧初創公司Lovable Eyes在完成主要融資輪後估值達132億美元
隨著人工智慧驅動的編碼工具日益普及,瑞典初創公司 Lovable 已獲一輪重大融資。該公司計劃籌集 30 億美元,其估值有望升至 132 億美元——這是去年 12 月記錄的 66 億美元的兩倍。預計 Menlo Ventures 將主導此次投資。Lovable 的吸引力源於其核心的“氛圍編碼”(vibe coding)技術,該技術透過消除對複雜編碼技能的需求來簡化軟體開發。使用者只需以自然語言描述其需求,系統即可自動生成應用程式。這種直觀的方法吸引了個人開發者、設計師和小企業,並擴充套件至 Work
如何修復核心網頁指標以獲得更好的 SEO 排名
利用 AI 工具簡化成績單評語撰寫引言用於生成成績單評語的 AI 工具Magic SchoolAlmanac AIChat GPT使用 Magic School 生成成績單評語登入 Magic School選擇成績單評語工具為學生定製評語使用 Almanac AI 生成成績單評語設定課程與評分方案配置評語長度與學生資訊使用 Almanac AI 生成評語比較 Magic School 與 Almanac AI設定的便捷性可定製性與課程內容的整合速度與效率使用
Interessant, dass sich die KI-Coding-Tools jetzt auf das Terminal konzentrieren. Ich habe Cursor und Copilot im Editor benutzt, aber die Idee, direkt in der Kommandozeile zu arbeiten, klingt nach einem logischen nächsten Schritt für mehr Effizienz. Hoffentlich bleibt die Bedienung trotzdem intuitiv – sonst wird das nichts mit dem 'Vibe-Coding' 😅. Mal sehen, wie sich das gegen die etablierten Editoren durchsetzt.





首頁






