模型擴充時代結束,演算法獲利成優先考量

在過去十年的大部分時間裡,人工智慧的進步主要來自於規模的擴大。成功來自於更大的資料集、更多的參數和更強大的運算能力,團隊爭相建立更大型的模型。進步是以萬億個參數和 PB 級的訓練資料來衡量的--這個時代我們現在稱之為擴展時代。儘管這種方法驅動了今日大部分的人工智慧能力,但我們已接近一個臨界點,那就是單純地擴大模型已不再是最有效、最智慧或最永續的發展路徑。因此,焦點正從純粹的規模轉移到演算法的突破。本文將探討為何單單擴大規模已經無法滿足需求,以及下一波的人工智慧進展將如何取決於演算法的創新。
模型擴充的回報遞減定律
擴充時代建立在堅實的經驗基礎上。研究人員持續發現,增加模型和資料集的規模會帶來可預測的效能提升 - 這種模式被稱為擴充定律。這些原則成為領導 AI 實驗室的指導策略,並引發了開發更大型系統的競賽。這場競賽催生了大型語言模型和基礎模型,這些模型驅動了當今許多人工智能應用程式。然而,就像任何指數級趨勢一樣,AI 的擴充曲線現在已經開始漸趨平穩。開發更大型模型的成本正在急劇攀升。現在訓練一個最先進的系統所消耗的能源可能相當於一個小城鎮,這引起了重大的環境問題。財務支出已變得如此龐大,以至於只有少數特定的組織才能參與其中。與此同時,我們也目睹了回報遞減的明顯信號。參數數量增加一倍已不再會帶來相稱的能力提升。改進變得循序漸進,主要是改進現有的知識,而不是實現新的功能。每增加一美元和瓦特的投資所獲得的價值正在下降。擴充方法已接近其實用與經濟的極限。
新領域:算法效率
縮放定律的限制促使研究人員轉向演算法效率。現在的重點不再是單純依賴運算強度,而是設計更有效運用資源的智慧型演算法。最近的發展突顯了這一轉變的前景。舉例來說,Transformer 架構由其注意力機制所驅動,多年來一直在人工智慧領域佔據主導地位。然而,這個機制有一個基本的限制:它的運算需求會隨著序列長度快速增加。Mamba 等狀態空間模型 (State Space Models, SSM) 正成為引人注目的替代方案。透過促進更有選擇性的推理,SSM 可以達到媲美大型 Transformer 的效能,同時運作速度更快,記憶體使用量也大幅減少。
演算法效率的另一個例子是專家混合 (MoE) 模型的出現。MoE 系統不需要為每個輸入動用整個龐大的網路,而是僅將任務導向最相關的小型專門網路子集,或稱為 「專家」。儘管整個模型可能包含數十億個參數,但每次計算只會利用一小部分。將其想像成擁有一個龐大的圖書館,但只檢查幾本必要的書來回答問題,而不是每次都閱讀館內的每一卷書。其結果是,一個巨型模型的知識容量,與一個更小模型的運作效率。
結合這些概念的另一個例子是 DeepSeek-V3,這是一個使用多頭潛在注意力 (MLA) 擴充的專家混合模型。MLA 透過壓縮 key-value 狀態來改進傳統注意力,讓模型能夠有效率地處理長序列 - 類似 SSM - 同時維持 Transformers 的優點。DeepSeek-V3 總共擁有 2360 億個參數,但每個任務只啟動一小部分,因此在編碼和邏輯推理等領域取得領先的效能,同時比同等規模的大型驅動模型更實用、更不佔用資源。
這些並非只是個別案例。它們標誌著更智慧、更有效率的設計正朝著更廣泛的方向邁進。研究人員現在專注於如何在不影響效能的前提下,讓模型更快速、更緊湊、對資料的依賴更少。
為什麼這種轉變很重要
從以規模為優先轉變為強調演算法創新,對人工智慧領域有著深遠的影響。首先,它使 AI 開發民主化。突破不再僅僅取決於能否使用最強大的超級電腦。現在,一個小規模、熟練的研究團隊就能設計出優於用更多預算創造的模型的新穎設計。這使得創新從資源的競爭轉變為想法和專業知識的競爭。因此,大學、新創企業和獨立實驗室可以扮演更重要的角色,挑戰大型科技公司的主導地位。
其次,它使人工智能在現實世界的應用更加實用。在研究論文中,一個擁有 5000 億個參數的模型看起來可能令人印象深刻,但其龐大的規模卻使其部署起來既困難又昂貴。相比之下,Mamba 或 Mixture of Experts 模型等高效替代方案可在標準硬體(包括邊緣裝置)上運作。這種實用性對於將人工智能整合到日常工具(如醫療診斷系統或手機上的即時翻譯功能)至關重要。
第三,它解決了永續性的問題。建立和操作大型 AI 模型所需的能源正成為嚴重的環境問題。透過著重效率,我們可以大幅減少與 AI 開發相關的碳足跡。
下一步是什麼?智慧設計時代
我們正在進入智能設計時代。核心問題正在從「我們可以建立多龐大的模型?」轉變為「我們如何設計一個本質上更智慧、更有效率的模型?
這種演進將激發幾個核心研究領域的創新。預期人工智慧模型架構會有進展。新興模型,包括之前提到的狀態空間模型,可以重新定義神經網路處理資訊的方式。例如,受動力系統啟發的架構已經在實驗環境中展現了更強的能力。另一個關鍵領域是訓練技術,讓模型能以更少的範例進行有效學習。少點學習 (few-shot) 和零點學習 (zero-shot) 的進展讓人工智能更具資料效率,而激活導向 (activation steering) 等方法可在不重新訓練的情況下增強行為能力。訓練後的改進與合成資料的產生也大幅降低了訓練需求,有時甚至可降低 10,000 倍。
我們也會發現人們對混合模型的興趣與日俱增,例如神經代謝式人工智能(neuro-symbolic AI)。結合神經網路的模式識別與符號系統的邏輯嚴謹性,神經符號人工智能在 2025 年正逐漸受到重視,它提供了更好的可解釋性並降低了對資料的依賴性。顯著的例子包括 AlphaGeometry 2 與 AlphaProof,這兩項技術協助 Google DeepMind 在 2025 年國際數學奧林匹克 (IMO) 中獲得金牌。我們的目標是創造出不僅能從統計學上預測下一個字,還能以更像人類的方式理解和推理世界的系統。
底線
縮放時代是不可或缺的,它為人工智能帶來了非凡的進步。它突破了可實現的界限,並創造了我們今天使用的基礎技術。然而,就像任何成熟的技術一樣,最初的策略終究會達到極限。下一個重大突破不會來自於在現有堆疊上增加更多的層次。相反,它們將來自於重新想像堆疊本身。
未來屬於那些開拓新演算法、架構和機器學習核心科學的人。在這個未來,智慧的衡量標準不是參數的數量,而是設計的精密度。對更智慧演算法的追求才剛剛開始。這一轉變為更具包容性、對環境更負責任以及真正智慧的人工智能鋪平了道路。
相關文章
如何修復核心網頁指標以獲得更好的 SEO 排名
利用 AI 工具簡化成績單評語撰寫引言用於生成成績單評語的 AI 工具Magic SchoolAlmanac AIChat GPT使用 Magic School 生成成績單評語登入 Magic School選擇成績單評語工具為學生定製評語使用 Almanac AI 生成成績單評語設定課程與評分方案配置評語長度與學生資訊使用 Almanac AI 生成評語比較 Magic School 與 Almanac AI設定的便捷性可定製性與課程內容的整合速度與效率使用
Slackbot 成為 AI 智慧體
Slackbot,嵌入在Salesforce企業訊息平臺Slack中的自動化助手,正在演變為一個AI智慧體。Salesforce技術長Parker Harris設想它將達到與OpenAI的ChatGPT相媲美的病毒式傳播地位。這家雲軟體巨頭於週二推出了更新版的Slackbot。該新版AI驅動版本面向Business+和Enterprise+客戶,可直接在Slack內查詢資訊、起草電子郵件和安排會議。在獲得適當許可權的情況下,它還能與Microsoft Teams和Google Drive等企
位元組跳動加大核心AI激勵,豆包增長14.6%
位元組跳動近日召開豆包股權說明會,公佈面向豆包部門員工的最新激勵政策。豆包股票的行權價已從2026年6月的14.85美元上調至17.02美元,漲幅約為14.6%。此次調整不僅提升了豆包股票的估值,還大幅擴大了其覆蓋範圍。根據員工崗位的不同,部分員工可能獲得相當於其總薪酬約5%的豆包股票。根據新的兌換機制,位元組跳動允許員工在整體薪酬包中,將部分現金工資兌換為豆包股權。兌換比例因職級而異,設有20%和30%等不同檔位。例如,L2和L3級員工可選擇20%的全覆蓋兌換比例,而L3和L4級員工的該比例可
相關專題推薦
評論 (1)
0/500

在過去十年的大部分時間裡,人工智慧的進步主要來自於規模的擴大。成功來自於更大的資料集、更多的參數和更強大的運算能力,團隊爭相建立更大型的模型。進步是以萬億個參數和 PB 級的訓練資料來衡量的--這個時代我們現在稱之為擴展時代。儘管這種方法驅動了今日大部分的人工智慧能力,但我們已接近一個臨界點,那就是單純地擴大模型已不再是最有效、最智慧或最永續的發展路徑。因此,焦點正從純粹的規模轉移到演算法的突破。本文將探討為何單單擴大規模已經無法滿足需求,以及下一波的人工智慧進展將如何取決於演算法的創新。
模型擴充的回報遞減定律
擴充時代建立在堅實的經驗基礎上。研究人員持續發現,增加模型和資料集的規模會帶來可預測的效能提升 - 這種模式被稱為擴充定律。這些原則成為領導 AI 實驗室的指導策略,並引發了開發更大型系統的競賽。這場競賽催生了大型語言模型和基礎模型,這些模型驅動了當今許多人工智能應用程式。然而,就像任何指數級趨勢一樣,AI 的擴充曲線現在已經開始漸趨平穩。開發更大型模型的成本正在急劇攀升。現在訓練一個最先進的系統所消耗的能源可能相當於一個小城鎮,這引起了重大的環境問題。財務支出已變得如此龐大,以至於只有少數特定的組織才能參與其中。與此同時,我們也目睹了回報遞減的明顯信號。參數數量增加一倍已不再會帶來相稱的能力提升。改進變得循序漸進,主要是改進現有的知識,而不是實現新的功能。每增加一美元和瓦特的投資所獲得的價值正在下降。擴充方法已接近其實用與經濟的極限。
新領域:算法效率
縮放定律的限制促使研究人員轉向演算法效率。現在的重點不再是單純依賴運算強度,而是設計更有效運用資源的智慧型演算法。最近的發展突顯了這一轉變的前景。舉例來說,Transformer 架構由其注意力機制所驅動,多年來一直在人工智慧領域佔據主導地位。然而,這個機制有一個基本的限制:它的運算需求會隨著序列長度快速增加。Mamba 等狀態空間模型 (State Space Models, SSM) 正成為引人注目的替代方案。透過促進更有選擇性的推理,SSM 可以達到媲美大型 Transformer 的效能,同時運作速度更快,記憶體使用量也大幅減少。
演算法效率的另一個例子是專家混合 (MoE) 模型的出現。MoE 系統不需要為每個輸入動用整個龐大的網路,而是僅將任務導向最相關的小型專門網路子集,或稱為 「專家」。儘管整個模型可能包含數十億個參數,但每次計算只會利用一小部分。將其想像成擁有一個龐大的圖書館,但只檢查幾本必要的書來回答問題,而不是每次都閱讀館內的每一卷書。其結果是,一個巨型模型的知識容量,與一個更小模型的運作效率。
結合這些概念的另一個例子是 DeepSeek-V3,這是一個使用多頭潛在注意力 (MLA) 擴充的專家混合模型。MLA 透過壓縮 key-value 狀態來改進傳統注意力,讓模型能夠有效率地處理長序列 - 類似 SSM - 同時維持 Transformers 的優點。DeepSeek-V3 總共擁有 2360 億個參數,但每個任務只啟動一小部分,因此在編碼和邏輯推理等領域取得領先的效能,同時比同等規模的大型驅動模型更實用、更不佔用資源。
這些並非只是個別案例。它們標誌著更智慧、更有效率的設計正朝著更廣泛的方向邁進。研究人員現在專注於如何在不影響效能的前提下,讓模型更快速、更緊湊、對資料的依賴更少。
為什麼這種轉變很重要
從以規模為優先轉變為強調演算法創新,對人工智慧領域有著深遠的影響。首先,它使 AI 開發民主化。突破不再僅僅取決於能否使用最強大的超級電腦。現在,一個小規模、熟練的研究團隊就能設計出優於用更多預算創造的模型的新穎設計。這使得創新從資源的競爭轉變為想法和專業知識的競爭。因此,大學、新創企業和獨立實驗室可以扮演更重要的角色,挑戰大型科技公司的主導地位。
其次,它使人工智能在現實世界的應用更加實用。在研究論文中,一個擁有 5000 億個參數的模型看起來可能令人印象深刻,但其龐大的規模卻使其部署起來既困難又昂貴。相比之下,Mamba 或 Mixture of Experts 模型等高效替代方案可在標準硬體(包括邊緣裝置)上運作。這種實用性對於將人工智能整合到日常工具(如醫療診斷系統或手機上的即時翻譯功能)至關重要。
第三,它解決了永續性的問題。建立和操作大型 AI 模型所需的能源正成為嚴重的環境問題。透過著重效率,我們可以大幅減少與 AI 開發相關的碳足跡。
下一步是什麼?智慧設計時代
我們正在進入智能設計時代。核心問題正在從「我們可以建立多龐大的模型?」轉變為「我們如何設計一個本質上更智慧、更有效率的模型?
這種演進將激發幾個核心研究領域的創新。預期人工智慧模型架構會有進展。新興模型,包括之前提到的狀態空間模型,可以重新定義神經網路處理資訊的方式。例如,受動力系統啟發的架構已經在實驗環境中展現了更強的能力。另一個關鍵領域是訓練技術,讓模型能以更少的範例進行有效學習。少點學習 (few-shot) 和零點學習 (zero-shot) 的進展讓人工智能更具資料效率,而激活導向 (activation steering) 等方法可在不重新訓練的情況下增強行為能力。訓練後的改進與合成資料的產生也大幅降低了訓練需求,有時甚至可降低 10,000 倍。
我們也會發現人們對混合模型的興趣與日俱增,例如神經代謝式人工智能(neuro-symbolic AI)。結合神經網路的模式識別與符號系統的邏輯嚴謹性,神經符號人工智能在 2025 年正逐漸受到重視,它提供了更好的可解釋性並降低了對資料的依賴性。顯著的例子包括 AlphaGeometry 2 與 AlphaProof,這兩項技術協助 Google DeepMind 在 2025 年國際數學奧林匹克 (IMO) 中獲得金牌。我們的目標是創造出不僅能從統計學上預測下一個字,還能以更像人類的方式理解和推理世界的系統。
底線
縮放時代是不可或缺的,它為人工智能帶來了非凡的進步。它突破了可實現的界限,並創造了我們今天使用的基礎技術。然而,就像任何成熟的技術一樣,最初的策略終究會達到極限。下一個重大突破不會來自於在現有堆疊上增加更多的層次。相反,它們將來自於重新想像堆疊本身。
未來屬於那些開拓新演算法、架構和機器學習核心科學的人。在這個未來,智慧的衡量標準不是參數的數量,而是設計的精密度。對更智慧演算法的追求才剛剛開始。這一轉變為更具包容性、對環境更負責任以及真正智慧的人工智能鋪平了道路。
如何修復核心網頁指標以獲得更好的 SEO 排名
利用 AI 工具簡化成績單評語撰寫引言用於生成成績單評語的 AI 工具Magic SchoolAlmanac AIChat GPT使用 Magic School 生成成績單評語登入 Magic School選擇成績單評語工具為學生定製評語使用 Almanac AI 生成成績單評語設定課程與評分方案配置評語長度與學生資訊使用 Almanac AI 生成評語比較 Magic School 與 Almanac AI設定的便捷性可定製性與課程內容的整合速度與效率使用
Slackbot 成為 AI 智慧體
Slackbot,嵌入在Salesforce企業訊息平臺Slack中的自動化助手,正在演變為一個AI智慧體。Salesforce技術長Parker Harris設想它將達到與OpenAI的ChatGPT相媲美的病毒式傳播地位。這家雲軟體巨頭於週二推出了更新版的Slackbot。該新版AI驅動版本面向Business+和Enterprise+客戶,可直接在Slack內查詢資訊、起草電子郵件和安排會議。在獲得適當許可權的情況下,它還能與Microsoft Teams和Google Drive等企
位元組跳動加大核心AI激勵,豆包增長14.6%
位元組跳動近日召開豆包股權說明會,公佈面向豆包部門員工的最新激勵政策。豆包股票的行權價已從2026年6月的14.85美元上調至17.02美元,漲幅約為14.6%。此次調整不僅提升了豆包股票的估值,還大幅擴大了其覆蓋範圍。根據員工崗位的不同,部分員工可能獲得相當於其總薪酬約5%的豆包股票。根據新的兌換機制,位元組跳動允許員工在整體薪酬包中,將部分現金工資兌換為豆包股權。兌換比例因職級而異,設有20%和30%等不同檔位。例如,L2和L3級員工可選擇20%的全覆蓋兌換比例,而L3和L4級員工的該比例可





首頁






