Sakana AI 的 AI 插件简化了大型模型的文档处理流程
大型语言模型在处理长文本时常面临的困境——通常被称为“记忆焦虑”——或许很快将成为历史。 近日,总部位于东京的AI初创公司Sakana AI发布了两项突破性技术:Text-to-LoRA(T2L) 和Doc-to-LoRA(D2L)。借助创新的“超级网络”架构,这些技术使大型模型能够在不到一秒的时间内“吸收”海量文档或学习新任务,且无需重新训练。

AI开发者长期以来面临着一个艰难的权衡:要么将冗长的文档塞进聊天窗口——这会减慢响应速度并消耗大量内存,要么付出高昂的成本对模型进行微调。Sakana AI提供了一种第三种选择。通过一次性预训练费用,它生成微小的权重插件(LoRA),从而实现低成本、高效的模型适配。
Doc-to-LoRA:内存需求从 12GB 降至仅 50MB
这是本次最新版本中最令人印象深刻的技术。使用传统方法处理一份 128,000 个令牌(约 100,000 词)的文档,需要超过12GB的显存来存储信息。借助 D2L,模型可以直接将这些信息“消化”成一个小于50MB 的插件。
惊人速度:传统技术处理一份文档需要40到100秒,而D2L仅需不到1秒即可完成。
突破界限:该技术使模型能够处理长度达到其原始上下文窗口四倍的文本,在“大海捞针”式的检索测试中实现了近乎完美的准确率。
文本到LoRA:用日常语言定制AI
Text-to-LoRA 使模型响应更敏捷。用户只需用自然语言描述任务——例如“帮我解决一道复杂的数学竞赛题”——系统便会自动生成专用插件以提升性能。实验表明,通过这种方式创建的适配器在数学和逻辑推理任务上的表现,甚至优于从头训练的专用模型。
强大的跨模态技术:让文本模型“看见”图像
研究人员发现了一个意外的收获:D2L展现出了强大的跨模态能力。通过将视觉信息映射到纯文本模型的参数中,一个从未处理过图像的模型能够以**75.03%**的准确率对图像进行分类。
Sakana AI 的成果显著降低了个人和企业定制私有 AI 模型的门槛,同时也为开发更轻量、更智能的通用人工智能(AGI)开辟了新路径。
论文:https://arxiv.org/pdf/2602.15902
相关文章
Slackbot 成为 AI 智能体
Slackbot,嵌入在Salesforce企业消息平台Slack中的自动化助手,正在演变为一个AI智能体。Salesforce首席技术官Parker Harris设想它将达到与OpenAI的ChatGPT相媲美的病毒式传播地位。这家云软件巨头于周二推出了更新版的Slackbot。该新版AI驱动版本面向Business+和Enterprise+客户,可直接在Slack内查找信息、起草电子邮件和安排会议。在获得适当权限的情况下,它还能与Microsoft Teams和Google Drive等企
字节跳动加大核心AI激励,豆包增长14.6%
字节跳动近日召开豆包股权说明会,公布面向豆包部门员工的最新激励政策。豆包股票的行权价已从2026年6月的14.85美元上调至17.02美元,涨幅约为14.6%。此次调整不仅提升了豆包股票的估值,还大幅扩大了其覆盖范围。根据员工岗位的不同,部分员工可能获得相当于其总薪酬约5%的豆包股票。根据新的兑换机制,字节跳动允许员工在整体薪酬包中,将部分现金工资兑换为豆包股权。兑换比例因职级而异,设有20%和30%等不同档位。例如,L2和L3级员工可选择20%的全覆盖兑换比例,而L3和L4级员工的该比例可
MiniMax 推出 10 倍团队计划,以激励全球 AI 专家
MiniMax(稀宇科技)通用人工智能实验室正式推出“10x Team”,这是一项全球人才协作计划。该计划旨在招募跨行业的顶尖专家,探索大模型在垂直领域的深度应用。通过将深厚的行业知识与前沿人工智能技术相结合,MiniMax 致力于将大模型的生产力从通用场景拓展至专业场景,最终推动行业效率实现“十倍增长”。验证行业认知价值,开放多模态核心资源过去与行业专家的合作表明,深厚的专业洞察对于构建高质量、实用的行业专属大模型至关重要。在此基础上,“10x Team”计划将向合作伙伴开放包括多模态模型
相关专题推荐
评论 (0)
0/500
大型语言模型在处理长文本时常面临的困境——通常被称为“记忆焦虑”——或许很快将成为历史。 近日,总部位于东京的AI初创公司Sakana AI发布了两项突破性技术:Text-to-LoRA(T2L) 和Doc-to-LoRA(D2L)。借助创新的“超级网络”架构,这些技术使大型模型能够在不到一秒的时间内“吸收”海量文档或学习新任务,且无需重新训练。

AI开发者长期以来面临着一个艰难的权衡:要么将冗长的文档塞进聊天窗口——这会减慢响应速度并消耗大量内存,要么付出高昂的成本对模型进行微调。Sakana AI提供了一种第三种选择。通过一次性预训练费用,它生成微小的权重插件(LoRA),从而实现低成本、高效的模型适配。
Doc-to-LoRA:内存需求从 12GB 降至仅 50MB
这是本次最新版本中最令人印象深刻的技术。使用传统方法处理一份 128,000 个令牌(约 100,000 词)的文档,需要超过12GB的显存来存储信息。借助 D2L,模型可以直接将这些信息“消化”成一个小于50MB 的插件。
惊人速度:传统技术处理一份文档需要40到100秒,而D2L仅需不到1秒即可完成。
突破界限:该技术使模型能够处理长度达到其原始上下文窗口四倍的文本,在“大海捞针”式的检索测试中实现了近乎完美的准确率。
文本到LoRA:用日常语言定制AI
Text-to-LoRA 使模型响应更敏捷。用户只需用自然语言描述任务——例如“帮我解决一道复杂的数学竞赛题”——系统便会自动生成专用插件以提升性能。实验表明,通过这种方式创建的适配器在数学和逻辑推理任务上的表现,甚至优于从头训练的专用模型。
强大的跨模态技术:让文本模型“看见”图像
研究人员发现了一个意外的收获:D2L展现出了强大的跨模态能力。通过将视觉信息映射到纯文本模型的参数中,一个从未处理过图像的模型能够以**75.03%**的准确率对图像进行分类。
Sakana AI 的成果显著降低了个人和企业定制私有 AI 模型的门槛,同时也为开发更轻量、更智能的通用人工智能(AGI)开辟了新路径。
论文:https://arxiv.org/pdf/2602.15902
Slackbot 成为 AI 智能体
Slackbot,嵌入在Salesforce企业消息平台Slack中的自动化助手,正在演变为一个AI智能体。Salesforce首席技术官Parker Harris设想它将达到与OpenAI的ChatGPT相媲美的病毒式传播地位。这家云软件巨头于周二推出了更新版的Slackbot。该新版AI驱动版本面向Business+和Enterprise+客户,可直接在Slack内查找信息、起草电子邮件和安排会议。在获得适当权限的情况下,它还能与Microsoft Teams和Google Drive等企
字节跳动加大核心AI激励,豆包增长14.6%
字节跳动近日召开豆包股权说明会,公布面向豆包部门员工的最新激励政策。豆包股票的行权价已从2026年6月的14.85美元上调至17.02美元,涨幅约为14.6%。此次调整不仅提升了豆包股票的估值,还大幅扩大了其覆盖范围。根据员工岗位的不同,部分员工可能获得相当于其总薪酬约5%的豆包股票。根据新的兑换机制,字节跳动允许员工在整体薪酬包中,将部分现金工资兑换为豆包股权。兑换比例因职级而异,设有20%和30%等不同档位。例如,L2和L3级员工可选择20%的全覆盖兑换比例,而L3和L4级员工的该比例可
MiniMax 推出 10 倍团队计划,以激励全球 AI 专家
MiniMax(稀宇科技)通用人工智能实验室正式推出“10x Team”,这是一项全球人才协作计划。该计划旨在招募跨行业的顶尖专家,探索大模型在垂直领域的深度应用。通过将深厚的行业知识与前沿人工智能技术相结合,MiniMax 致力于将大模型的生产力从通用场景拓展至专业场景,最终推动行业效率实现“十倍增长”。验证行业认知价值,开放多模态核心资源过去与行业专家的合作表明,深厚的专业洞察对于构建高质量、实用的行业专属大模型至关重要。在此基础上,“10x Team”计划将向合作伙伴开放包括多模态模型





首页






