LLMS Deep Cogito превосходит модели аналогичного размера с использованием IDA
Deep Cogito, компания из Сан-Франциско, вызывает ажиотаж в сообществе ИИ благодаря последнему выпуску открытых больших языковых моделей (LLM). Эти модели, варьирующиеся по размеру от 3 миллиардов до 70 миллиардов параметров, не просто очередной набор инструментов ИИ; они представляют собой смелый шаг к тому, что компания называет "общей сверхинтеллектуальностью". Deep Cogito утверждает, что каждая из их моделей превосходит ведущие открытые модели аналогичного размера, включая модели от LLAMA, DeepSeek и Qwen, по большинству стандартных тестов. Это довольно смелое заявление, но еще более впечатляюще то, что их модель 70B, как сообщается, превзошла недавно выпущенную модель Llama 4 109B Mixture-of-Experts (MoE).
Итеративная дистилляция и усиление (IDA)
В основе прорыва Deep Cogito лежит новый подход к обучению, который они называют итеративной дистилляцией и усилением (IDA). Этот метод описывается как "масштабируемая и эффективная стратегия выравнивания для общей сверхинтеллектуальности с использованием итеративного самосовершенствования". Он разработан, чтобы преодолеть ограничения традиционного обучения LLM, где интеллект модели часто достигает потолка, определяемого более крупными моделями-"надзирателями" или человеческими кураторами.
Процесс IDA включает два ключевых этапа, которые повторяются многократно:
- Усиление: На этом этапе используется больше вычислительной мощности, чтобы помочь модели находить лучшие решения или способности, подобно продвинутым техникам рассуждения.
- Дистилляция: Здесь модель усваивает эти улучшенные способности, уточняя свои параметры.
Deep Cogito утверждает, что это создает "положительную обратную связь", позволяя интеллекту модели расти более прямо пропорционально вычислительным ресурсам и эффективности самого процесса IDA, а не ограничиваться интеллектом надзирателя.
Компания указывает на исторические успехи, такие как AlphaGo, подчеркивая, что "продвинутое рассуждение и итеративное самосовершенствование" были ключевыми. IDA, как они утверждают, привносит эти элементы в обучение LLM. Они также подчеркивают эффективность IDA, отмечая, что их небольшая команда смогла разработать эти модели примерно за 75 дней. По сравнению с другими методами, такими как обучение с подкреплением на основе человеческой обратной связи (RLHF) или стандартная дистилляция из более крупных моделей, IDA, как утверждается, обеспечивает лучшую масштабируемость.
В качестве доказательства Deep Cogito подчеркивает, как их модель 70B превосходит как Llama 3.3 70B (дистиллированную из модели 405B), так и Llama 4 Scout 109B (дистиллированную из модели с 2T параметров).
Возможности и производительность моделей Deep Cogito
Новые модели Cogito, основанные на контрольных точках Llama и Qwen, адаптированы для программирования, вызова функций и агентских приложений. Отличительной особенностью является их двойная функциональность: "Каждая модель может отвечать напрямую (стандартный LLM) или размышлять перед ответом (как модели рассуждения)". Это напоминает возможности, наблюдаемые в моделях, таких как Claude 3.5. Однако Deep Cogito отмечает, что они не сосредотачивались на очень длинных цепочках рассуждений, отдавая приоритет более быстрым ответам и эффективности дистилляции более коротких цепочек.
Компания предоставила обширные результаты тестов, сравнивая свои модели Cogito с современными открытыми моделями эквивалентного размера как в прямом, так и в режиме рассуждений. По ряду тестов, таких как MMLU, MMLU-Pro, ARC, GSM8K и MATH, и для разных размеров моделей (3B, 8B, 14B, 32B, 70B), модели Cogito в целом демонстрируют значительные улучшения производительности. Например, модель Cogito 70B набирает 91,73% на MMLU в стандартном режиме, что на +6,40% лучше, чем Llama 3.3 70B, и 91,00% в режиме размышления, что на +4,40% лучше, чем Deepseek R1 Distill 70B. Результаты Livebench также отражают эти успехи.
Вот тесты моделей 14B для сравнения среднего размера:

Хотя Deep Cogito признает, что тесты не полностью отражают реальную полезность, они остаются уверенными в практической производительности своих моделей. Этот выпуск считается предварительным, и компания заявляет, что они "все еще находятся на ранних стадиях этой кривой масштабирования". Они планируют выпустить улучшенные контрольные точки для текущих размеров и представить более крупные модели MoE (109B, 400B, 671B) в ближайшие недели и месяцы. Все будущие модели также будут с открытым исходным кодом.
Связанная статья
Олли делает ставку на приватность, чтобы выиграть гонку за лидерство в сфере ИИ-помощников
Чтобы быть по-настоящему полезным, ИИ-помощник должен глубоко понимать своего пользователя. Ollie — личный помощник, разработанный для повседневной жизни, — работает по принципу, согласно которому для
Как на мероприятии AI LIVE: London будут рассматриваться темы искусственного интеллекта и промышленной автоматизации
На саммите соберутся руководители высшего звена со всего мира, чтобы обсудить актуальные проблемы мировых отраслей — от радикальных изменений, вызванных искусственным интеллектом, до экономической нес
Anthropic выходит на рынок юридических технологий ИИ по мере усиления конкуренции
Anthropic unveiled a suite of new chatbot capabilities on Tuesday, aimed at delivering automated support to legal practices. Эти инструменты были представлены во вторник и направлены на предоставление автоматизированной поддержки юридическим фирмам.
Рекомендации по связанным специальным темам
Комментарии (29)
看起来这家叫做Deep Cogito的新公司有点门道。IDA架构?之前没听说过这个技术,好奇跟MoE比怎么样。要是能出个小点的模型让大家体验一下就好了,毕竟现在动辄几十B参数量,普通开发者根本玩不起。希望别只是实验室数据漂亮,实际应用打折扣。
Deep Cogito's LLMs sound like a game-changer! Outperforming models of similar size with IDA is no small feat. Curious to see how these stack up in real-world tasks. 🚀
Super cool to see Deep Cogito pushing the boundaries with their LLMs! 😎 Those parameter sizes are wild—wonder how they stack up in real-world tasks?
LLM от Deep Cogito впечатляют, но приложение могло бы иметь лучший UI. Навигация по разным размерам моделей немного неуклюжая. Тем не менее, производительность на высшем уровне, особенно с технологией IDA. Обязательно стоит посмотреть, если вы интересуетесь ИИ и хотите увидеть, что возможно с большими языковыми моделями! 🤖💡
Deep Cogito, компания из Сан-Франциско, вызывает ажиотаж в сообществе ИИ благодаря последнему выпуску открытых больших языковых моделей (LLM). Эти модели, варьирующиеся по размеру от 3 миллиардов до 70 миллиардов параметров, не просто очередной набор инструментов ИИ; они представляют собой смелый шаг к тому, что компания называет "общей сверхинтеллектуальностью". Deep Cogito утверждает, что каждая из их моделей превосходит ведущие открытые модели аналогичного размера, включая модели от LLAMA, DeepSeek и Qwen, по большинству стандартных тестов. Это довольно смелое заявление, но еще более впечатляюще то, что их модель 70B, как сообщается, превзошла недавно выпущенную модель Llama 4 109B Mixture-of-Experts (MoE).
Итеративная дистилляция и усиление (IDA)
В основе прорыва Deep Cogito лежит новый подход к обучению, который они называют итеративной дистилляцией и усилением (IDA). Этот метод описывается как "масштабируемая и эффективная стратегия выравнивания для общей сверхинтеллектуальности с использованием итеративного самосовершенствования". Он разработан, чтобы преодолеть ограничения традиционного обучения LLM, где интеллект модели часто достигает потолка, определяемого более крупными моделями-"надзирателями" или человеческими кураторами.
Процесс IDA включает два ключевых этапа, которые повторяются многократно:
- Усиление: На этом этапе используется больше вычислительной мощности, чтобы помочь модели находить лучшие решения или способности, подобно продвинутым техникам рассуждения.
- Дистилляция: Здесь модель усваивает эти улучшенные способности, уточняя свои параметры.
Deep Cogito утверждает, что это создает "положительную обратную связь", позволяя интеллекту модели расти более прямо пропорционально вычислительным ресурсам и эффективности самого процесса IDA, а не ограничиваться интеллектом надзирателя.
Компания указывает на исторические успехи, такие как AlphaGo, подчеркивая, что "продвинутое рассуждение и итеративное самосовершенствование" были ключевыми. IDA, как они утверждают, привносит эти элементы в обучение LLM. Они также подчеркивают эффективность IDA, отмечая, что их небольшая команда смогла разработать эти модели примерно за 75 дней. По сравнению с другими методами, такими как обучение с подкреплением на основе человеческой обратной связи (RLHF) или стандартная дистилляция из более крупных моделей, IDA, как утверждается, обеспечивает лучшую масштабируемость.
В качестве доказательства Deep Cogito подчеркивает, как их модель 70B превосходит как Llama 3.3 70B (дистиллированную из модели 405B), так и Llama 4 Scout 109B (дистиллированную из модели с 2T параметров).
Возможности и производительность моделей Deep Cogito
Новые модели Cogito, основанные на контрольных точках Llama и Qwen, адаптированы для программирования, вызова функций и агентских приложений. Отличительной особенностью является их двойная функциональность: "Каждая модель может отвечать напрямую (стандартный LLM) или размышлять перед ответом (как модели рассуждения)". Это напоминает возможности, наблюдаемые в моделях, таких как Claude 3.5. Однако Deep Cogito отмечает, что они не сосредотачивались на очень длинных цепочках рассуждений, отдавая приоритет более быстрым ответам и эффективности дистилляции более коротких цепочек.
Компания предоставила обширные результаты тестов, сравнивая свои модели Cogito с современными открытыми моделями эквивалентного размера как в прямом, так и в режиме рассуждений. По ряду тестов, таких как MMLU, MMLU-Pro, ARC, GSM8K и MATH, и для разных размеров моделей (3B, 8B, 14B, 32B, 70B), модели Cogito в целом демонстрируют значительные улучшения производительности. Например, модель Cogito 70B набирает 91,73% на MMLU в стандартном режиме, что на +6,40% лучше, чем Llama 3.3 70B, и 91,00% в режиме размышления, что на +4,40% лучше, чем Deepseek R1 Distill 70B. Результаты Livebench также отражают эти успехи.
Вот тесты моделей 14B для сравнения среднего размера:

Хотя Deep Cogito признает, что тесты не полностью отражают реальную полезность, они остаются уверенными в практической производительности своих моделей. Этот выпуск считается предварительным, и компания заявляет, что они "все еще находятся на ранних стадиях этой кривой масштабирования". Они планируют выпустить улучшенные контрольные точки для текущих размеров и представить более крупные модели MoE (109B, 400B, 671B) в ближайшие недели и месяцы. Все будущие модели также будут с открытым исходным кодом.
Олли делает ставку на приватность, чтобы выиграть гонку за лидерство в сфере ИИ-помощников
Чтобы быть по-настоящему полезным, ИИ-помощник должен глубоко понимать своего пользователя. Ollie — личный помощник, разработанный для повседневной жизни, — работает по принципу, согласно которому для
Как на мероприятии AI LIVE: London будут рассматриваться темы искусственного интеллекта и промышленной автоматизации
На саммите соберутся руководители высшего звена со всего мира, чтобы обсудить актуальные проблемы мировых отраслей — от радикальных изменений, вызванных искусственным интеллектом, до экономической нес
Anthropic выходит на рынок юридических технологий ИИ по мере усиления конкуренции
Anthropic unveiled a suite of new chatbot capabilities on Tuesday, aimed at delivering automated support to legal practices. Эти инструменты были представлены во вторник и направлены на предоставление автоматизированной поддержки юридическим фирмам.
看起来这家叫做Deep Cogito的新公司有点门道。IDA架构?之前没听说过这个技术,好奇跟MoE比怎么样。要是能出个小点的模型让大家体验一下就好了,毕竟现在动辄几十B参数量,普通开发者根本玩不起。希望别只是实验室数据漂亮,实际应用打折扣。
Deep Cogito's LLMs sound like a game-changer! Outperforming models of similar size with IDA is no small feat. Curious to see how these stack up in real-world tasks. 🚀
Super cool to see Deep Cogito pushing the boundaries with their LLMs! 😎 Those parameter sizes are wild—wonder how they stack up in real-world tasks?
LLM от Deep Cogito впечатляют, но приложение могло бы иметь лучший UI. Навигация по разным размерам моделей немного неуклюжая. Тем не менее, производительность на высшем уровне, особенно с технологией IDA. Обязательно стоит посмотреть, если вы интересуетесь ИИ и хотите увидеть, что возможно с большими языковыми моделями! 🤖💡





Дом






