了解長上下文窗口:關鍵見解
昨日,我們展示了AI技術的最新突破——Gemini 1.5模型。此新版本在速度和效率上帶來顯著提升,但真正的改變遊戲規則的是其創新的長上下文窗口。此功能使模型能同時處理前所未有的令牌數量——構成文字、圖像或影片的基本單位。為了解釋這一進展,我們請教了Google DeepMind項目團隊,了解長上下文窗口是什麼,以及它如何改變開發者的工作方式。
理解長上下文窗口至關重要,因為它們使AI模型能在整個會話中保持並回憶資訊。想像在對話中幾分鐘後試圖記住一個名字,或急於記下電話號碼以免忘記。AI模型面臨類似挑戰,常常在幾次互動後「忘記」細節。長上下文窗口通過讓模型在其「記憶」中保留更多資訊來解決這個問題。
此前,Gemini模型能同時處理高達32,000個令牌。然而,隨著1.5 Pro版本的早期測試發布,我們將界限推至驚人的100萬個令牌——這是迄今為止任何大型基礎模型中最大的上下文窗口。我們的研究甚至超越了這一點,成功測試了高達1000萬個令牌。上下文窗口越大,模型能處理的資料——文字、圖像、音訊、程式碼或影片——就越多元且廣泛。
Google DeepMind研究科學家、長上下文項目負責人之一Nikolay Savinov分享道:「我們的初步目標是達到128,000個令牌,但我認為設定更高目標會更有益,因此我提出了100萬個令牌。現在,我們的研究已超過這個目標十倍。」
實現這一飛躍需要一系列深度學習創新。Pranav Shyam的早期探索提供了關鍵見解,引導了我們的研究。Google DeepMind工程師Denis Teplyashin解釋說:「每一個突破都帶來了新的可能性。當這些創新結合時,我們對結果感到震驚,從128,000個令牌擴展到512,000個,然後是100萬個,最近在我們的內部研究中達到1000萬個令牌。」
1.5 Pro的擴展容量開啟了令人興奮的新應用。例如,過去模型能總結數十頁的文檔,現在它能處理長達數千頁的文檔。之前的模型能分析數千行程式碼,而1.5 Pro現在能一次處理數萬行程式碼。
另一位Google DeepMind研究科學家Machel Reid分享了一些引人入勝的測試結果:「在一次測試中,我們將整個程式碼庫輸入模型,它為其生成了全面的文檔,這非常了不起。在另一次測試中,它在『觀看』整部45分鐘的1924年電影《Sherlock Jr.》後,準確回答了相關問題。」
1.5 Pro還擅長在提示中的資料間進行推理。Machel舉了一個涉及稀有語言Kalamang的例子,全球說這種語言的人不到200人。「模型本身無法直接翻譯成Kalamang,但有了長上下文窗口,我們可以包含整個語法手冊和例句。模型隨後學會了從英文翻譯到Kalamang,表現與從相同材料學習的人相當。」
Gemini 1.5 Pro配備標準的128K令牌上下文窗口,但部分開發者和企業客戶可通過AI Studio和Vertex AI在私人預覽中訪問100萬令牌的上下文窗口。管理如此大的上下文窗口需要大量計算,我們正在積極優化以降低延遲並擴展其規模。
展望未來,團隊專注於使模型更快、更高效,並以安全為優先。他們還在探索進一步擴展長上下文窗口、增強底層架構以及利用新硬體改進的方法。Nikolay指出:「一次性處理1000萬個令牌已接近我們Tensor Processing Units的熱限制。我們尚未確定極限在哪裡,隨著硬體的不斷進化,模型可能具備更多能力。」
團隊迫切希望看到開發者和更廣泛的社群利用這些新功能創造出創新的應用。Machel反思道:「當我第一次看到我們擁有100萬個令牌的上下文時,我想,『這到底能用來做什麼?』但現在,我相信人們的想像力將會擴展,帶來更多這些新功能的創意應用。」
[ttpp][yyxx]

相關文章
Google 測試 Remy AI 代理,以 Gemini 為重點轉向使用者控制
根據《商業內幕》的報道,谷歌正在測試 Remy,這是 Gemini 的一款全新 AI 個人代理工具。該工具旨在代表使用者執行任務,從而簡化專業工作流程和日常事務。目前,Remy 正在 Gemini 應用的內部員工專屬版本中進行測試。該報告引用了一份內部檔案以及對兩位熟悉該專案的個人的採訪。內部資料將 Remy 描述為“全天候個人代理”,將 Gemini 定位為能夠代表使用者行事的主動助手。接近該專案的訊息人士證實,谷歌員工正在積極測試 Remy。谷歌發言人拒絕提供進一步評論。該報告未提及公開發布
奧利押注隱私保護,力爭在 AI 助理競賽中勝出
要真正發揮實用價值,人工智慧助理必須深入了解其使用者。Ollie 是一款專為日常生活設計的個人助理,其運作前提是:這無需您交出個人資料,亦不會損害您的隱私。雖然某些企業級 AI 工具提供資料隱私保障,但 Ollie 作為首批獲得 SOC 2 合規認證的主流、以家庭為導向的 AI 服務之一,顯得格外突出。此框架允許企業透過獨立稽核證明,其已建立正式的管控措施來保護客戶資料,並確保系統運作的安全性。達
「AI LIVE:倫敦」將如何探討人工智慧與工業自動化
本次峰會將匯聚來自全球的高階主管,共同探討全球產業面臨的迫切挑戰,涵蓋範圍從人工智慧驅動的顛覆性變革到經濟波動。AI LIVE:倫敦峰會將以「科技+人類使命」為主題,匯聚逾 2,000 位國際領袖,共同探討人工智慧新興時代的發展。隸屬於 BizClik 旗下的《AI Magazine》已公佈其於「AI LIVE:倫敦峰會」上舉辦的「人工智慧與工業自動化」聯合爐邊談話的與會陣容。該座談會定於 10
相關專題推薦
評論 (31)
0/500
So they're finally trying to catch up with the long context trend? I mean, it's cool and all, but how many people actually need to process a million tokens in one go? Feels like a spec war more than a practical feature. Still, if it reduces the need for chunking tricks, I'm all for it.
すごい!長文コンテキストの機能が実用化されたら、研究やビジネス文書の分析が一気に楽になりそう🤩。でもこれ、倫理面でどうなんだろう?膨大なデータを読み込むということは、プライバシー問題も発生しそうで少し不安…。他社は今後どう追従するのか気になるなぁ。開発スピード速すぎて置いていかれそう!
Super cool to see Gemini 1.5's long context window in action! 😎 Makes me wonder how it'll handle massive datasets compared to older models.
Wow, the long context window in Gemini 1.5 sounds like a game-changer! I'm curious how it'll handle massive datasets in real-world apps. Excited to see where this takes AI! 🚀
昨日,我們展示了AI技術的最新突破——Gemini 1.5模型。此新版本在速度和效率上帶來顯著提升,但真正的改變遊戲規則的是其創新的長上下文窗口。此功能使模型能同時處理前所未有的令牌數量——構成文字、圖像或影片的基本單位。為了解釋這一進展,我們請教了Google DeepMind項目團隊,了解長上下文窗口是什麼,以及它如何改變開發者的工作方式。
理解長上下文窗口至關重要,因為它們使AI模型能在整個會話中保持並回憶資訊。想像在對話中幾分鐘後試圖記住一個名字,或急於記下電話號碼以免忘記。AI模型面臨類似挑戰,常常在幾次互動後「忘記」細節。長上下文窗口通過讓模型在其「記憶」中保留更多資訊來解決這個問題。
此前,Gemini模型能同時處理高達32,000個令牌。然而,隨著1.5 Pro版本的早期測試發布,我們將界限推至驚人的100萬個令牌——這是迄今為止任何大型基礎模型中最大的上下文窗口。我們的研究甚至超越了這一點,成功測試了高達1000萬個令牌。上下文窗口越大,模型能處理的資料——文字、圖像、音訊、程式碼或影片——就越多元且廣泛。
Google DeepMind研究科學家、長上下文項目負責人之一Nikolay Savinov分享道:「我們的初步目標是達到128,000個令牌,但我認為設定更高目標會更有益,因此我提出了100萬個令牌。現在,我們的研究已超過這個目標十倍。」
實現這一飛躍需要一系列深度學習創新。Pranav Shyam的早期探索提供了關鍵見解,引導了我們的研究。Google DeepMind工程師Denis Teplyashin解釋說:「每一個突破都帶來了新的可能性。當這些創新結合時,我們對結果感到震驚,從128,000個令牌擴展到512,000個,然後是100萬個,最近在我們的內部研究中達到1000萬個令牌。」
1.5 Pro的擴展容量開啟了令人興奮的新應用。例如,過去模型能總結數十頁的文檔,現在它能處理長達數千頁的文檔。之前的模型能分析數千行程式碼,而1.5 Pro現在能一次處理數萬行程式碼。
另一位Google DeepMind研究科學家Machel Reid分享了一些引人入勝的測試結果:「在一次測試中,我們將整個程式碼庫輸入模型,它為其生成了全面的文檔,這非常了不起。在另一次測試中,它在『觀看』整部45分鐘的1924年電影《Sherlock Jr.》後,準確回答了相關問題。」
1.5 Pro還擅長在提示中的資料間進行推理。Machel舉了一個涉及稀有語言Kalamang的例子,全球說這種語言的人不到200人。「模型本身無法直接翻譯成Kalamang,但有了長上下文窗口,我們可以包含整個語法手冊和例句。模型隨後學會了從英文翻譯到Kalamang,表現與從相同材料學習的人相當。」
Gemini 1.5 Pro配備標準的128K令牌上下文窗口,但部分開發者和企業客戶可通過AI Studio和Vertex AI在私人預覽中訪問100萬令牌的上下文窗口。管理如此大的上下文窗口需要大量計算,我們正在積極優化以降低延遲並擴展其規模。
展望未來,團隊專注於使模型更快、更高效,並以安全為優先。他們還在探索進一步擴展長上下文窗口、增強底層架構以及利用新硬體改進的方法。Nikolay指出:「一次性處理1000萬個令牌已接近我們Tensor Processing Units的熱限制。我們尚未確定極限在哪裡,隨著硬體的不斷進化,模型可能具備更多能力。」
團隊迫切希望看到開發者和更廣泛的社群利用這些新功能創造出創新的應用。Machel反思道:「當我第一次看到我們擁有100萬個令牌的上下文時,我想,『這到底能用來做什麼?』但現在,我相信人們的想像力將會擴展,帶來更多這些新功能的創意應用。」
[ttpp][yyxx]

奧利押注隱私保護,力爭在 AI 助理競賽中勝出
要真正發揮實用價值,人工智慧助理必須深入了解其使用者。Ollie 是一款專為日常生活設計的個人助理,其運作前提是:這無需您交出個人資料,亦不會損害您的隱私。雖然某些企業級 AI 工具提供資料隱私保障,但 Ollie 作為首批獲得 SOC 2 合規認證的主流、以家庭為導向的 AI 服務之一,顯得格外突出。此框架允許企業透過獨立稽核證明,其已建立正式的管控措施來保護客戶資料,並確保系統運作的安全性。達
「AI LIVE:倫敦」將如何探討人工智慧與工業自動化
本次峰會將匯聚來自全球的高階主管,共同探討全球產業面臨的迫切挑戰,涵蓋範圍從人工智慧驅動的顛覆性變革到經濟波動。AI LIVE:倫敦峰會將以「科技+人類使命」為主題,匯聚逾 2,000 位國際領袖,共同探討人工智慧新興時代的發展。隸屬於 BizClik 旗下的《AI Magazine》已公佈其於「AI LIVE:倫敦峰會」上舉辦的「人工智慧與工業自動化」聯合爐邊談話的與會陣容。該座談會定於 10
So they're finally trying to catch up with the long context trend? I mean, it's cool and all, but how many people actually need to process a million tokens in one go? Feels like a spec war more than a practical feature. Still, if it reduces the need for chunking tricks, I'm all for it.
すごい!長文コンテキストの機能が実用化されたら、研究やビジネス文書の分析が一気に楽になりそう🤩。でもこれ、倫理面でどうなんだろう?膨大なデータを読み込むということは、プライバシー問題も発生しそうで少し不安…。他社は今後どう追従するのか気になるなぁ。開発スピード速すぎて置いていかれそう!
Super cool to see Gemini 1.5's long context window in action! 😎 Makes me wonder how it'll handle massive datasets compared to older models.
Wow, the long context window in Gemini 1.5 sounds like a game-changer! I'm curious how it'll handle massive datasets in real-world apps. Excited to see where this takes AI! 🚀





首頁






