Google 發表 Gemma 4 E2B 架構,實現裝置端人工智慧的突破

開源大型模型生態系統在其底層架構方面取得了重大突破。 Google DeepMind 近期推出了迄今為止最強大的開源模型——Gemma4。雖然該模型的參數數量與前代產品相近,約為 300 億,但其「每參數智慧」已實現顯著飛躍。該模型在多項核心任務上的表現,現已可與一年半前頂尖的閉源大型模型相媲美。
Gemma4 最引人注目的技術創新,在於引入了全新的「E2B」(參數卸載)架構。在傳統的 Transformer 設計中,大型嵌入層通常會消耗大量 GPU 記憶體。新架構巧妙地在每個層中加入嵌入表,以查表機制取代耗資源的全矩陣乘法。 舉例來說,在採用 E2B 架構的 500 億參數模型中,僅需將 200 億參數載入 GPU 記憶體,其餘 300 億參數則可安全地卸載至 CPU 甚至磁碟。 這使得模型僅需 2GB 的 GPU 記憶體即可進行快速推論,突破了手機和樹莓派等邊緣裝置的部署瓶頸。
作為一項極具野心且複雜的發布,Google DeepMind 團隊與近 50 家外部合作夥伴進行了協調,包括 Hugging Face、llama.cpp、Ollama、NVIDIA 及 AMD。目前,Gemma4 已與 Android Studio 深度整合。 開發者可在離線環境中,透過「代理模式」(Agent mode)安全地調用 AI 來本地編寫 Android 程式碼,無需將任何程式碼上傳至雲端 API。這極大程度地滿足了職場對資料隱私與離線作業的強烈需求。
在多模態能力與核心體驗方面,Gemma4 承襲了 Gemini3 的研究成果。即使是參數僅有 2B 或 4B 的小型邊緣模型,也能提供卓越的多語言支援(140 種語言)與多模態理解能力,輕鬆處理語音辨識、語音查詢,以及 30 至 60 秒的影片分析。 儘管該模型在絕對知識容量上仍遜於更大規模的模型,且在文字擴散(Diffusion Transformer)和專家混合(MoE)微調等前沿實驗領域面臨業界公認的挑戰,但其高密度智慧已不容小覷。
隨著大型模型的開箱即用能力持續提升,垂直領域的開發生態系統正經歷深刻的重組,而純粹傳統微調的熱度則逐漸消退。 展望未來,Google DeepMind 提出了一項里程碑式的預測:在未來一至兩年內,用戶的智慧型手機將能夠直接在裝置上運行性能媲美 Gemini3Pro 的強大模型。 屆時,大多數複雜的智能代理任務都將在本地完成,無需依賴雲端運算能力,這無疑將為下一代消費級應用整合與使用者體驗帶來顛覆性的變革。
相關文章
Suno 在法律訴訟中為歌曲新增水印
Suno,這個允許使用者生成由人工智慧創作的音樂的平臺,近日推出了新功能,包括為平臺製作的曲目新增標籤、限制下載,並更新社羣標準以遏制未經授權的複製品。這些更新是在Suno面臨多家唱片公司和藝術家組織提起的多起訴訟之際推出的。在部落格文章中,聯合創始人兼執行長Mikey Shulman概述了核心原則,強調該平臺旨在促進原創創作,同時擴大更廣泛受眾對人工智慧音樂工具的訪問許可權。一個主要的爭議點在於,使用者將人工智慧生成的歌曲上傳到其他流媒體服務並透過操縱系統獲取收入。Suno表示,現在將採用音訊
馬斯克承認 Grok 構建過程中洩露了使用者程式碼,並承諾清除所有歷史資料
埃隆·馬斯克直接回應了圍繞 Grok Build 的隱私爭議,首先以簡單的“True”(屬實)確認了該事件的有效性。他承諾,此前上傳至 SpaceXAI 的所有使用者資料將被永久刪除,並表示“不留一個位元組”。這是人工智慧行業首次由主要科技領袖公開承認錯誤並主動刪除使用者資料。安全研究人員的“釣魚”測試揭示了資料洩露的具體證據此次爭議源於獨立人工智慧安全研究人員 @cereblab 的一份報告。SpaceXAI 推出的 AI 程式設計助手 Grok Build 在其官方網站上聲稱其“優先本地執行,程式碼
美國股市觸及歷史裡程碑,人工智慧與航空航天巨頭準備開啟萬億美元時代
埃隆·馬斯克、山姆·阿爾特曼和達里奧·阿莫迪,這三位科技領域的巨頭,正推動其各自的企業邁向首次公開募股(IPO)。隨著 SpaceX、OpenAI 和 Anthropic——這三家估值接近萬億美元的行業巨頭——即將上市,2026 年被預測將成為美國曆史上新股發行規模最大的一年。這一歷史性的資本激增已引起全球金融界的關注,成為檢驗公共市場吸收如此大規模資金能力的關鍵壓力測試。這些主要融資活動的同步啟動預計將打破 2021 年創下的 1560 億美元紀錄。超級獨角獸的資本博弈每家公司上市的路徑
相關專題推薦
評論 (0)
0/500

開源大型模型生態系統在其底層架構方面取得了重大突破。 Google DeepMind 近期推出了迄今為止最強大的開源模型——Gemma4。雖然該模型的參數數量與前代產品相近,約為 300 億,但其「每參數智慧」已實現顯著飛躍。該模型在多項核心任務上的表現,現已可與一年半前頂尖的閉源大型模型相媲美。
Gemma4 最引人注目的技術創新,在於引入了全新的「E2B」(參數卸載)架構。在傳統的 Transformer 設計中,大型嵌入層通常會消耗大量 GPU 記憶體。新架構巧妙地在每個層中加入嵌入表,以查表機制取代耗資源的全矩陣乘法。 舉例來說,在採用 E2B 架構的 500 億參數模型中,僅需將 200 億參數載入 GPU 記憶體,其餘 300 億參數則可安全地卸載至 CPU 甚至磁碟。 這使得模型僅需 2GB 的 GPU 記憶體即可進行快速推論,突破了手機和樹莓派等邊緣裝置的部署瓶頸。
作為一項極具野心且複雜的發布,Google DeepMind 團隊與近 50 家外部合作夥伴進行了協調,包括 Hugging Face、llama.cpp、Ollama、NVIDIA 及 AMD。目前,Gemma4 已與 Android Studio 深度整合。 開發者可在離線環境中,透過「代理模式」(Agent mode)安全地調用 AI 來本地編寫 Android 程式碼,無需將任何程式碼上傳至雲端 API。這極大程度地滿足了職場對資料隱私與離線作業的強烈需求。
在多模態能力與核心體驗方面,Gemma4 承襲了 Gemini3 的研究成果。即使是參數僅有 2B 或 4B 的小型邊緣模型,也能提供卓越的多語言支援(140 種語言)與多模態理解能力,輕鬆處理語音辨識、語音查詢,以及 30 至 60 秒的影片分析。 儘管該模型在絕對知識容量上仍遜於更大規模的模型,且在文字擴散(Diffusion Transformer)和專家混合(MoE)微調等前沿實驗領域面臨業界公認的挑戰,但其高密度智慧已不容小覷。
隨著大型模型的開箱即用能力持續提升,垂直領域的開發生態系統正經歷深刻的重組,而純粹傳統微調的熱度則逐漸消退。 展望未來,Google DeepMind 提出了一項里程碑式的預測:在未來一至兩年內,用戶的智慧型手機將能夠直接在裝置上運行性能媲美 Gemini3Pro 的強大模型。 屆時,大多數複雜的智能代理任務都將在本地完成,無需依賴雲端運算能力,這無疑將為下一代消費級應用整合與使用者體驗帶來顛覆性的變革。
Suno 在法律訴訟中為歌曲新增水印
Suno,這個允許使用者生成由人工智慧創作的音樂的平臺,近日推出了新功能,包括為平臺製作的曲目新增標籤、限制下載,並更新社羣標準以遏制未經授權的複製品。這些更新是在Suno面臨多家唱片公司和藝術家組織提起的多起訴訟之際推出的。在部落格文章中,聯合創始人兼執行長Mikey Shulman概述了核心原則,強調該平臺旨在促進原創創作,同時擴大更廣泛受眾對人工智慧音樂工具的訪問許可權。一個主要的爭議點在於,使用者將人工智慧生成的歌曲上傳到其他流媒體服務並透過操縱系統獲取收入。Suno表示,現在將採用音訊
馬斯克承認 Grok 構建過程中洩露了使用者程式碼,並承諾清除所有歷史資料
埃隆·馬斯克直接回應了圍繞 Grok Build 的隱私爭議,首先以簡單的“True”(屬實)確認了該事件的有效性。他承諾,此前上傳至 SpaceXAI 的所有使用者資料將被永久刪除,並表示“不留一個位元組”。這是人工智慧行業首次由主要科技領袖公開承認錯誤並主動刪除使用者資料。安全研究人員的“釣魚”測試揭示了資料洩露的具體證據此次爭議源於獨立人工智慧安全研究人員 @cereblab 的一份報告。SpaceXAI 推出的 AI 程式設計助手 Grok Build 在其官方網站上聲稱其“優先本地執行,程式碼
美國股市觸及歷史裡程碑,人工智慧與航空航天巨頭準備開啟萬億美元時代
埃隆·馬斯克、山姆·阿爾特曼和達里奧·阿莫迪,這三位科技領域的巨頭,正推動其各自的企業邁向首次公開募股(IPO)。隨著 SpaceX、OpenAI 和 Anthropic——這三家估值接近萬億美元的行業巨頭——即將上市,2026 年被預測將成為美國曆史上新股發行規模最大的一年。這一歷史性的資本激增已引起全球金融界的關注,成為檢驗公共市場吸收如此大規模資金能力的關鍵壓力測試。這些主要融資活動的同步啟動預計將打破 2021 年創下的 1560 億美元紀錄。超級獨角獸的資本博弈每家公司上市的路徑





首頁






