Deep Cogito的LLMS使用IDA优于类似大小的模型
Deep Cogito,一家总部位于旧金山的公司,以其最新发布的开源大型语言模型(LLMs)在AI社区中掀起了波澜。这些模型拥有从30亿到700亿个参数的多种规模,不仅仅是另一组AI工具;它们是公司所称的“通用超智能”的大胆一步。Deep Cogito声称,其每个模型在大多数标准基准测试中都超越了同等规模的领先开源模型,包括来自LLAMA、DeepSeek和Qwen的模型。这是一个相当大胆的声明,但更令人印象深刻的是,他们的700亿参数模型据报道超过了最近发布的Llama 4 109亿参数混合专家(MoE)模型。
迭代蒸馏与放大(IDA)
Deep Cogito突破的核心是一种他们称之为迭代蒸馏与放大(IDA)的新训练方法。这种方法被描述为“一种通过迭代自我改进实现通用超智能的可扩展且高效的Alignment策略”。它旨在突破传统LLM训练的限制,在传统训练中,模型的智能往往受到更大“监督者”模型或人类策展者的上限限制。
IDA过程围绕两个关键步骤反复进行:
- 放大:这一步骤利用更多的计算能力帮助模型提出更好的解决方案或能力,类似于高级推理技术。
- 蒸馏:在此,模型内化这些改进的能力,优化其参数。
Deep Cogito认为,这创造了一个“正反馈循环”,使模型的智能能够更直接地随计算资源和IDA过程本身的效率而增长,而不是受限于监督者的智能。
公司指出像AlphaGo这样的历史成功案例,强调“高级推理和迭代自我改进”至关重要。他们声称IDA将这些元素引入了LLM训练。他们还强调了IDA的效率,指出他们的小团队仅用大约75天就开发出了这些模型。与其他方法如基于人类反馈的强化学习(RLHF)或从更大模型的标准蒸馏相比,IDA据说提供了更好的可扩展性。
作为证明,Deep Cogito强调他们的700亿参数模型在性能上超过了Llama 3.3 700亿(从4050亿模型蒸馏)和Llama 4 Scout 109亿(从2万亿参数模型蒸馏)。
Deep Cogito模型的能力与性能
新的Cogito模型基于Llama和Qwen检查点,专为编码、函数调用和代理应用量身定制。一个突出特点是它们的双重功能:“每个模型都可以直接回答(标准LLM),或在回答前进行自我反思(类似推理模型)。”这与Claude 3.5等模型的功能相似。然而,Deep Cogito提到他们并未专注于非常长的推理链,优先考虑更快的回答和蒸馏较短链的效率。
公司分享了广泛的基准测试结果,将他们的Cogito模型与同等规模的先进开源模型在直接和推理模式下进行比较。在MMLU、MMLU-Pro、ARC、GSM8K和MATH等一系列基准测试中,以及在不同模型规模(30亿、80亿、140亿、320亿、700亿)中,Cogito模型通常显示出显著的性能提升。例如,Cogito 700亿模型在标准模式下MMLU得分91.73%,比Llama 3.3 700亿提高了+6.40%,在思考模式下得分91.00%,比Deepseek R1 Distill 700亿提高了+4.40%。Livebench得分也反映了这些提升。
以下是140亿模型的基准测试,用于中等规模的比较:

虽然Deep Cogito承认基准测试无法完全反映现实世界的实用性,但他们对其模型的实际性能仍充满信心。此次发布被视为预览,公司表示他们“仍处于这一扩展曲线的早期阶段”。他们计划在未来几周和几个月内发布当前规模的改进检查点,并推出更大的MoE模型(1090亿、4000亿、6710亿)。所有未来模型也将是开源的。
相关文章
Google 测试 Remy AI 代理,以 Gemini 为重点转向用户控制
根据《商业内幕》的报道,谷歌正在测试 Remy,这是 Gemini 的一款全新 AI 个人代理工具。该工具旨在代表用户执行任务,从而简化专业工作流程和日常事务。目前,Remy 正在 Gemini 应用的内部员工专属版本中进行测试。该报告引用了一份内部文件以及对两位熟悉该项目的个人的采访。内部资料将 Remy 描述为“全天候个人代理”,将 Gemini 定位为能够代表用户行事的主动助手。接近该项目的消息人士证实,谷歌员工正在积极测试 Remy。谷歌发言人拒绝提供进一步评论。该报告未提及公开发布
奥利押注隐私保护,力争在AI助手竞争中胜出
要真正发挥帮助作用,人工智能助手必须深刻理解其用户。Ollie 是一款专为日常生活设计的个人助理,其运作理念是:实现这一点无需用户交出数据,也不会损害用户的隐私。虽然某些企业级人工智能工具提供了数据隐私保护措施,但Ollie作为首批通过SOC 2认证的主流、面向家庭的人工智能服务之一,尤为突出。该认证框架允许企业通过独立审计证明,其已建立正式的控制措施来保护客户数据,并确保系统安全运行。达成这一里
AI LIVE:伦敦将如何探讨人工智能与工业自动化
本次峰会将汇聚来自全球的高管,共同探讨全球各行业面临的紧迫挑战,涵盖从人工智能驱动的颠覆性变革到经济波动等各个方面。AI LIVE:伦敦峰会将以“技术与人类使命”为主题,汇聚2,000余位国际领袖,共同探讨人工智能的新时代。BizClik旗下品牌《AI Magazine》已公布其在“AI LIVE:伦敦峰会”上举办的关于人工智能与工业自动化的联合炉边谈话环节阵容。该专题讨论会定于10月20日在伦敦
相关专题推荐
评论 (29)
0/500
看起来这家叫做Deep Cogito的新公司有点门道。IDA架构?之前没听说过这个技术,好奇跟MoE比怎么样。要是能出个小点的模型让大家体验一下就好了,毕竟现在动辄几十B参数量,普通开发者根本玩不起。希望别只是实验室数据漂亮,实际应用打折扣。
Deep Cogito's LLMs sound like a game-changer! Outperforming models of similar size with IDA is no small feat. Curious to see how these stack up in real-world tasks. 🚀
Super cool to see Deep Cogito pushing the boundaries with their LLMs! 😎 Those parameter sizes are wild—wonder how they stack up in real-world tasks?
LLM от Deep Cogito впечатляют, но приложение могло бы иметь лучший UI. Навигация по разным размерам моделей немного неуклюжая. Тем не менее, производительность на высшем уровне, особенно с технологией IDA. Обязательно стоит посмотреть, если вы интересуетесь ИИ и хотите увидеть, что возможно с большими языковыми моделями! 🤖💡
Deep Cogito,一家总部位于旧金山的公司,以其最新发布的开源大型语言模型(LLMs)在AI社区中掀起了波澜。这些模型拥有从30亿到700亿个参数的多种规模,不仅仅是另一组AI工具;它们是公司所称的“通用超智能”的大胆一步。Deep Cogito声称,其每个模型在大多数标准基准测试中都超越了同等规模的领先开源模型,包括来自LLAMA、DeepSeek和Qwen的模型。这是一个相当大胆的声明,但更令人印象深刻的是,他们的700亿参数模型据报道超过了最近发布的Llama 4 109亿参数混合专家(MoE)模型。
迭代蒸馏与放大(IDA)
Deep Cogito突破的核心是一种他们称之为迭代蒸馏与放大(IDA)的新训练方法。这种方法被描述为“一种通过迭代自我改进实现通用超智能的可扩展且高效的Alignment策略”。它旨在突破传统LLM训练的限制,在传统训练中,模型的智能往往受到更大“监督者”模型或人类策展者的上限限制。
IDA过程围绕两个关键步骤反复进行:
- 放大:这一步骤利用更多的计算能力帮助模型提出更好的解决方案或能力,类似于高级推理技术。
- 蒸馏:在此,模型内化这些改进的能力,优化其参数。
Deep Cogito认为,这创造了一个“正反馈循环”,使模型的智能能够更直接地随计算资源和IDA过程本身的效率而增长,而不是受限于监督者的智能。
公司指出像AlphaGo这样的历史成功案例,强调“高级推理和迭代自我改进”至关重要。他们声称IDA将这些元素引入了LLM训练。他们还强调了IDA的效率,指出他们的小团队仅用大约75天就开发出了这些模型。与其他方法如基于人类反馈的强化学习(RLHF)或从更大模型的标准蒸馏相比,IDA据说提供了更好的可扩展性。
作为证明,Deep Cogito强调他们的700亿参数模型在性能上超过了Llama 3.3 700亿(从4050亿模型蒸馏)和Llama 4 Scout 109亿(从2万亿参数模型蒸馏)。
Deep Cogito模型的能力与性能
新的Cogito模型基于Llama和Qwen检查点,专为编码、函数调用和代理应用量身定制。一个突出特点是它们的双重功能:“每个模型都可以直接回答(标准LLM),或在回答前进行自我反思(类似推理模型)。”这与Claude 3.5等模型的功能相似。然而,Deep Cogito提到他们并未专注于非常长的推理链,优先考虑更快的回答和蒸馏较短链的效率。
公司分享了广泛的基准测试结果,将他们的Cogito模型与同等规模的先进开源模型在直接和推理模式下进行比较。在MMLU、MMLU-Pro、ARC、GSM8K和MATH等一系列基准测试中,以及在不同模型规模(30亿、80亿、140亿、320亿、700亿)中,Cogito模型通常显示出显著的性能提升。例如,Cogito 700亿模型在标准模式下MMLU得分91.73%,比Llama 3.3 700亿提高了+6.40%,在思考模式下得分91.00%,比Deepseek R1 Distill 700亿提高了+4.40%。Livebench得分也反映了这些提升。
以下是140亿模型的基准测试,用于中等规模的比较:

虽然Deep Cogito承认基准测试无法完全反映现实世界的实用性,但他们对其模型的实际性能仍充满信心。此次发布被视为预览,公司表示他们“仍处于这一扩展曲线的早期阶段”。他们计划在未来几周和几个月内发布当前规模的改进检查点,并推出更大的MoE模型(1090亿、4000亿、6710亿)。所有未来模型也将是开源的。
奥利押注隐私保护,力争在AI助手竞争中胜出
要真正发挥帮助作用,人工智能助手必须深刻理解其用户。Ollie 是一款专为日常生活设计的个人助理,其运作理念是:实现这一点无需用户交出数据,也不会损害用户的隐私。虽然某些企业级人工智能工具提供了数据隐私保护措施,但Ollie作为首批通过SOC 2认证的主流、面向家庭的人工智能服务之一,尤为突出。该认证框架允许企业通过独立审计证明,其已建立正式的控制措施来保护客户数据,并确保系统安全运行。达成这一里
AI LIVE:伦敦将如何探讨人工智能与工业自动化
本次峰会将汇聚来自全球的高管,共同探讨全球各行业面临的紧迫挑战,涵盖从人工智能驱动的颠覆性变革到经济波动等各个方面。AI LIVE:伦敦峰会将以“技术与人类使命”为主题,汇聚2,000余位国际领袖,共同探讨人工智能的新时代。BizClik旗下品牌《AI Magazine》已公布其在“AI LIVE:伦敦峰会”上举办的关于人工智能与工业自动化的联合炉边谈话环节阵容。该专题讨论会定于10月20日在伦敦
看起来这家叫做Deep Cogito的新公司有点门道。IDA架构?之前没听说过这个技术,好奇跟MoE比怎么样。要是能出个小点的模型让大家体验一下就好了,毕竟现在动辄几十B参数量,普通开发者根本玩不起。希望别只是实验室数据漂亮,实际应用打折扣。
Deep Cogito's LLMs sound like a game-changer! Outperforming models of similar size with IDA is no small feat. Curious to see how these stack up in real-world tasks. 🚀
Super cool to see Deep Cogito pushing the boundaries with their LLMs! 😎 Those parameter sizes are wild—wonder how they stack up in real-world tasks?
LLM от Deep Cogito впечатляют, но приложение могло бы иметь лучший UI. Навигация по разным размерам моделей немного неуклюжая. Тем не менее, производительность на высшем уровне, особенно с технологией IDA. Обязательно стоит посмотреть, если вы интересуетесь ИИ и хотите увидеть, что возможно с большими языковыми моделями! 🤖💡





首页






