了解长上下文窗口:关键见解
昨日,我们发布了AI技术领域的最新突破——Gemini 1.5模型。这一新版本在速度和效率方面带来显著提升,但真正的变革在于其创新的长上下文窗口功能。这一功能使模型能够一次性处理前所未有的令牌数量——构成文字、图像或视频的基本单位。为了阐明这一进步,我们咨询了Google DeepMind项目团队,了解长上下文窗口的本质及其如何革新开发者工作方式。
理解长上下文窗口至关重要,因为它们使AI模型能够在整个会话中保持和回忆信息。想象一下,在对话中刚提到一个名字几分钟后就试图回忆,或者急于在忘记之前写下电话号码。AI模型面临类似挑战,通常在几次交互后“忘记”细节。长上下文窗口通过让模型在其“记忆”中保留更多信息来解决这一问题。
此前,Gemini模型可同时处理高达32,000个令牌。然而,随着1.5 Pro版本的早期测试发布,我们将界限推至惊人的100万个令牌——迄今为止任何大规模基础模型中最大的上下文窗口。我们的研究甚至超越了这一数字,成功测试了高达1000万个令牌。上下文窗口越大,模型能处理的数据——文本、图像、音频、代码或视频——就越多样和广泛。
Google DeepMind研究科学家、长上下文项目负责人之一Nikolay Savinov分享道:“我们的初步目标是达到128,000个令牌,但我认为目标更高会更有益,于是我提出了100万个令牌。现在,我们的研究成果已超出这一目标10倍。”
实现这一飞跃需要一系列深度学习创新。Pranav Shyam的早期探索提供了关键见解,指导了我们的研究。Google DeepMind工程师Denis Teplyashin解释说:“每项突破都引领了另一项突破,开辟了新的可能性。当这些创新结合时,我们对结果感到震惊,从128,000个令牌扩展到512,000个,然后是100万个,最近在内部研究中达到了1000万个令牌。”
1.5 Pro的扩展能力开启了令人兴奋的新应用。例如,以前模型只能总结几十页的文档,现在它可以处理数千页的文档。之前的模型能分析数千行代码,而1.5 Pro现在可以一次性处理数万行代码。
另一位Google DeepMind研究科学家Machel Reid分享了一些引人注目的测试结果:“在一次测试中,我们将整个代码库输入模型,它生成了全面的文档,真是不可思议。在另一次测试中,它在‘观看’完整的45分钟1924年电影《Sherlock Jr.》后,准确回答了相关问题。”
1.5 Pro还在提示中的数据推理方面表现出色。Machel举了一个涉及稀有语言Kalamang的例子,这种语言全球仅有不到200人使用。“模型本身无法翻译成Kalamang,但通过长上下文窗口,我们可以包含整个语法手册和示例句子。模型随后学会了从英语翻译到Kalamang,水平堪比从相同材料学习的人。”
Gemini 1.5 Pro标配128K令牌的上下文窗口,但部分开发者和企业客户可以通过AI Studio和Vertex AI在私人预览中访问100万个令牌的上下文窗口。管理如此大的上下文窗口在计算上非常密集,我们正在积极优化以减少延迟,同时扩大规模。
展望未来,团队专注于使模型更快、更高效,同时以安全性为优先。他们还在探索进一步扩展长上下文窗口、增强底层架构以及利用新硬件改进的方法。Nikolay指出:“一次性处理1000万个令牌已接近我们Tensor Processing Units的热极限。我们还不确定极限在哪里,随着硬件的持续发展,模型可能具备更多能力。”
团队期待看到开发者和更广泛社区利用这些新功能创造的创新应用。Machel反思道:“当我第一次看到我们有100万个令牌的上下文时,我想,‘这能用来做什么?’但现在,我相信人们的想象力会扩展,带来更多创造性的新功能应用。”
[ttpp][yyxx]

相关文章
Google 测试 Remy AI 代理,以 Gemini 为重点转向用户控制
根据《商业内幕》的报道,谷歌正在测试 Remy,这是 Gemini 的一款全新 AI 个人代理工具。该工具旨在代表用户执行任务,从而简化专业工作流程和日常事务。目前,Remy 正在 Gemini 应用的内部员工专属版本中进行测试。该报告引用了一份内部文件以及对两位熟悉该项目的个人的采访。内部资料将 Remy 描述为“全天候个人代理”,将 Gemini 定位为能够代表用户行事的主动助手。接近该项目的消息人士证实,谷歌员工正在积极测试 Remy。谷歌发言人拒绝提供进一步评论。该报告未提及公开发布
奥利押注隐私保护,力争在AI助手竞争中胜出
要真正发挥帮助作用,人工智能助手必须深刻理解其用户。Ollie 是一款专为日常生活设计的个人助理,其运作理念是:实现这一点无需用户交出数据,也不会损害用户的隐私。虽然某些企业级人工智能工具提供了数据隐私保护措施,但Ollie作为首批通过SOC 2认证的主流、面向家庭的人工智能服务之一,尤为突出。该认证框架允许企业通过独立审计证明,其已建立正式的控制措施来保护客户数据,并确保系统安全运行。达成这一里
AI LIVE:伦敦将如何探讨人工智能与工业自动化
本次峰会将汇聚来自全球的高管,共同探讨全球各行业面临的紧迫挑战,涵盖从人工智能驱动的颠覆性变革到经济波动等各个方面。AI LIVE:伦敦峰会将以“技术与人类使命”为主题,汇聚2,000余位国际领袖,共同探讨人工智能的新时代。BizClik旗下品牌《AI Magazine》已公布其在“AI LIVE:伦敦峰会”上举办的关于人工智能与工业自动化的联合炉边谈话环节阵容。该专题讨论会定于10月20日在伦敦
相关专题推荐
评论 (31)
0/500
So they're finally trying to catch up with the long context trend? I mean, it's cool and all, but how many people actually need to process a million tokens in one go? Feels like a spec war more than a practical feature. Still, if it reduces the need for chunking tricks, I'm all for it.
すごい!長文コンテキストの機能が実用化されたら、研究やビジネス文書の分析が一気に楽になりそう🤩。でもこれ、倫理面でどうなんだろう?膨大なデータを読み込むということは、プライバシー問題も発生しそうで少し不安…。他社は今後どう追従するのか気になるなぁ。開発スピード速すぎて置いていかれそう!
Super cool to see Gemini 1.5's long context window in action! 😎 Makes me wonder how it'll handle massive datasets compared to older models.
Wow, the long context window in Gemini 1.5 sounds like a game-changer! I'm curious how it'll handle massive datasets in real-world apps. Excited to see where this takes AI! 🚀
昨日,我们发布了AI技术领域的最新突破——Gemini 1.5模型。这一新版本在速度和效率方面带来显著提升,但真正的变革在于其创新的长上下文窗口功能。这一功能使模型能够一次性处理前所未有的令牌数量——构成文字、图像或视频的基本单位。为了阐明这一进步,我们咨询了Google DeepMind项目团队,了解长上下文窗口的本质及其如何革新开发者工作方式。
理解长上下文窗口至关重要,因为它们使AI模型能够在整个会话中保持和回忆信息。想象一下,在对话中刚提到一个名字几分钟后就试图回忆,或者急于在忘记之前写下电话号码。AI模型面临类似挑战,通常在几次交互后“忘记”细节。长上下文窗口通过让模型在其“记忆”中保留更多信息来解决这一问题。
此前,Gemini模型可同时处理高达32,000个令牌。然而,随着1.5 Pro版本的早期测试发布,我们将界限推至惊人的100万个令牌——迄今为止任何大规模基础模型中最大的上下文窗口。我们的研究甚至超越了这一数字,成功测试了高达1000万个令牌。上下文窗口越大,模型能处理的数据——文本、图像、音频、代码或视频——就越多样和广泛。
Google DeepMind研究科学家、长上下文项目负责人之一Nikolay Savinov分享道:“我们的初步目标是达到128,000个令牌,但我认为目标更高会更有益,于是我提出了100万个令牌。现在,我们的研究成果已超出这一目标10倍。”
实现这一飞跃需要一系列深度学习创新。Pranav Shyam的早期探索提供了关键见解,指导了我们的研究。Google DeepMind工程师Denis Teplyashin解释说:“每项突破都引领了另一项突破,开辟了新的可能性。当这些创新结合时,我们对结果感到震惊,从128,000个令牌扩展到512,000个,然后是100万个,最近在内部研究中达到了1000万个令牌。”
1.5 Pro的扩展能力开启了令人兴奋的新应用。例如,以前模型只能总结几十页的文档,现在它可以处理数千页的文档。之前的模型能分析数千行代码,而1.5 Pro现在可以一次性处理数万行代码。
另一位Google DeepMind研究科学家Machel Reid分享了一些引人注目的测试结果:“在一次测试中,我们将整个代码库输入模型,它生成了全面的文档,真是不可思议。在另一次测试中,它在‘观看’完整的45分钟1924年电影《Sherlock Jr.》后,准确回答了相关问题。”
1.5 Pro还在提示中的数据推理方面表现出色。Machel举了一个涉及稀有语言Kalamang的例子,这种语言全球仅有不到200人使用。“模型本身无法翻译成Kalamang,但通过长上下文窗口,我们可以包含整个语法手册和示例句子。模型随后学会了从英语翻译到Kalamang,水平堪比从相同材料学习的人。”
Gemini 1.5 Pro标配128K令牌的上下文窗口,但部分开发者和企业客户可以通过AI Studio和Vertex AI在私人预览中访问100万个令牌的上下文窗口。管理如此大的上下文窗口在计算上非常密集,我们正在积极优化以减少延迟,同时扩大规模。
展望未来,团队专注于使模型更快、更高效,同时以安全性为优先。他们还在探索进一步扩展长上下文窗口、增强底层架构以及利用新硬件改进的方法。Nikolay指出:“一次性处理1000万个令牌已接近我们Tensor Processing Units的热极限。我们还不确定极限在哪里,随着硬件的持续发展,模型可能具备更多能力。”
团队期待看到开发者和更广泛社区利用这些新功能创造的创新应用。Machel反思道:“当我第一次看到我们有100万个令牌的上下文时,我想,‘这能用来做什么?’但现在,我相信人们的想象力会扩展,带来更多创造性的新功能应用。”
[ttpp][yyxx]

奥利押注隐私保护,力争在AI助手竞争中胜出
要真正发挥帮助作用,人工智能助手必须深刻理解其用户。Ollie 是一款专为日常生活设计的个人助理,其运作理念是:实现这一点无需用户交出数据,也不会损害用户的隐私。虽然某些企业级人工智能工具提供了数据隐私保护措施,但Ollie作为首批通过SOC 2认证的主流、面向家庭的人工智能服务之一,尤为突出。该认证框架允许企业通过独立审计证明,其已建立正式的控制措施来保护客户数据,并确保系统安全运行。达成这一里
AI LIVE:伦敦将如何探讨人工智能与工业自动化
本次峰会将汇聚来自全球的高管,共同探讨全球各行业面临的紧迫挑战,涵盖从人工智能驱动的颠覆性变革到经济波动等各个方面。AI LIVE:伦敦峰会将以“技术与人类使命”为主题,汇聚2,000余位国际领袖,共同探讨人工智能的新时代。BizClik旗下品牌《AI Magazine》已公布其在“AI LIVE:伦敦峰会”上举办的关于人工智能与工业自动化的联合炉边谈话环节阵容。该专题讨论会定于10月20日在伦敦
So they're finally trying to catch up with the long context trend? I mean, it's cool and all, but how many people actually need to process a million tokens in one go? Feels like a spec war more than a practical feature. Still, if it reduces the need for chunking tricks, I'm all for it.
すごい!長文コンテキストの機能が実用化されたら、研究やビジネス文書の分析が一気に楽になりそう🤩。でもこれ、倫理面でどうなんだろう?膨大なデータを読み込むということは、プライバシー問題も発生しそうで少し不安…。他社は今後どう追従するのか気になるなぁ。開発スピード速すぎて置いていかれそう!
Super cool to see Gemini 1.5's long context window in action! 😎 Makes me wonder how it'll handle massive datasets compared to older models.
Wow, the long context window in Gemini 1.5 sounds like a game-changer! I'm curious how it'll handle massive datasets in real-world apps. Excited to see where this takes AI! 🚀





首页






