Дом
Выпущена предварительная версия модели LFM2.5 DSpark: скорость вывода заключений увеличена в 3,18 раза
Компании Liquid AI и Hugging Face официально выпустили предварительные контрольные точки моделей DSpark для серии LFM2.5, включающие LFM2.5-1.2B-Instruct, LFM2.5-2.6B и LFM2.5-8B-A1B. Данная инновация представляет собой новый спекулятивный путь декодирования, который значительно повышает пропускную способность инференса при сохранении качества вывода.
Основные улучшения производительности и практическое применение
Тесты в реальных условиях демонстрируют впечатляющее ускорение, обеспечиваемое DSpark. На графических процессорах (GPU) пропускная способность увеличивается до 3,18 раза, а на периферийных устройствах — до 2,87 раза.
При инференции на периферийных агентах LFM2.5-2.6B сокращает задержку вызова функций в среднем на 57 %. При тестировании на MacBook Pro M4 Max он достигает скорости до 139 токенов в секунду, снижая барьер для развертывания локальных агентов и обеспечивая пользовательский опыт, сопоставимый с проприетарными облачными моделями.

Понимание архитектуры и механизма работы DSpark
Традиционная инференция LLM сталкивается с «узким местом» в виде пропускной способности памяти, поскольку большая часть времени уходит на передачу весов из DRAM в SRAM. Спекулятивное декодирование решает эту проблему за счёт использования облегчённой черновой модели для генерации токенов-кандидатов, которые затем проверяются целевой моделью за один проход в прямом направлении, что позволяет эффективно распределить затраты на загрузку весов.
DSpark объединяет существующие методы с помощью трёх основных компонентов:
Параллельная базовая сеть: аналогично DFlash, она генерирует скрытые состояния для всех черновых токенов за один проход в прямом направлении на основе контекстных признаков целевой модели.Последовательная головка (головка Маркова): Моделируя марковские цепи между соседними токенами, она усиливает зависимости и повышает коэффициент принятия для последующих позиций.Валидатор планирования по уровню достоверности: он прогнозирует вероятность выживания каждого токена, автоматически отбрасывая суффиксы с низким уровнем достоверности, когда затраты на валидацию превышают экономию.Для обучения черновая модель использует разнообразный набор данных, включающий SFT, чаты, код и вызовы функций. После тщательных абляционных исследований первоначальная версия представляет собой архитектуру, основанную исключительно на механизме внимания, с 5 слоями и 9 блоками, при этом количество параметров составляет около 300 миллионов.

Обеспечение качества и интеграция в экосистему
Из-за спекулятивного декодирования алгоритм жадного декодирования принимает только черновые токены, которые идеально соответствуют распределению целевой модели. Отклоненные токены заменяются выходом целевой модели, что гарантирует соответствие сгенерированной последовательности базовой структуре алгоритма жадного декодирования без потери точности в тестах.
На момент выпуска DSpark обеспечил совместимость с основными фреймворками для инференса:
SGLang: поддерживает выполнение на ускорителях благодаря специальной интеграции и конфигурациям запуска.llama.cpp: предлагает официальную поддержку сборки, позволяя пользователям загружать соответствующие веса GGUF и файлы черновых моделей через командную строку.
Связанная статья
Как компания Unitree формирует будущее гуманоидной робототехники
Новое устройство Unitree с встроенным ИИ и технологией сверхширокоугольного 4D-ЛиДАР для усовершенствованной навигации в реальных условиях. Источник: UnitreeВан Синсин, генеральный директор Unitree, с
Почему компания Abnormal AI заключила партнерство с OpenAI в рамках проекта Daybreak
Майкл Айелло, руководитель отдела кибербезопасности в OpenAI | Источник: Майкл Айелло/LinkedInКомпания Abnormal AI присоединилась к программе Daybreak от OpenAI; по словам Майка Айелло, это партнерств
Компания «AI Agent Elements Claw» завершила разработку сверхпроводящего материала
По мере того как искусственный интеллект расширяет границы научных исследований, достигнута важная веха. 3 июля Академия DAMO компании Alibaba в партнерстве с Китайским народным университетом и Универ
Рекомендации по связанным специальным темам
Комментарии (0)
Компании Liquid AI и Hugging Face официально выпустили предварительные контрольные точки моделей DSpark для серии LFM2.5, включающие LFM2.5-1.2B-Instruct, LFM2.5-2.6B и LFM2.5-8B-A1B. Данная инновация представляет собой новый спекулятивный путь декодирования, который значительно повышает пропускную способность инференса при сохранении качества вывода.
Основные улучшения производительности и практическое применение
Тесты в реальных условиях демонстрируют впечатляющее ускорение, обеспечиваемое DSpark. На графических процессорах (GPU) пропускная способность увеличивается до 3,18 раза, а на периферийных устройствах — до 2,87 раза.
При инференции на периферийных агентах LFM2.5-2.6B сокращает задержку вызова функций в среднем на 57 %. При тестировании на MacBook Pro M4 Max он достигает скорости до 139 токенов в секунду, снижая барьер для развертывания локальных агентов и обеспечивая пользовательский опыт, сопоставимый с проприетарными облачными моделями.

Понимание архитектуры и механизма работы DSpark
Традиционная инференция LLM сталкивается с «узким местом» в виде пропускной способности памяти, поскольку большая часть времени уходит на передачу весов из DRAM в SRAM. Спекулятивное декодирование решает эту проблему за счёт использования облегчённой черновой модели для генерации токенов-кандидатов, которые затем проверяются целевой моделью за один проход в прямом направлении, что позволяет эффективно распределить затраты на загрузку весов.
DSpark объединяет существующие методы с помощью трёх основных компонентов:
Параллельная базовая сеть: аналогично DFlash, она генерирует скрытые состояния для всех черновых токенов за один проход в прямом направлении на основе контекстных признаков целевой модели.Последовательная головка (головка Маркова): Моделируя марковские цепи между соседними токенами, она усиливает зависимости и повышает коэффициент принятия для последующих позиций.Валидатор планирования по уровню достоверности: он прогнозирует вероятность выживания каждого токена, автоматически отбрасывая суффиксы с низким уровнем достоверности, когда затраты на валидацию превышают экономию.Для обучения черновая модель использует разнообразный набор данных, включающий SFT, чаты, код и вызовы функций. После тщательных абляционных исследований первоначальная версия представляет собой архитектуру, основанную исключительно на механизме внимания, с 5 слоями и 9 блоками, при этом количество параметров составляет около 300 миллионов.

Обеспечение качества и интеграция в экосистему
Из-за спекулятивного декодирования алгоритм жадного декодирования принимает только черновые токены, которые идеально соответствуют распределению целевой модели. Отклоненные токены заменяются выходом целевой модели, что гарантирует соответствие сгенерированной последовательности базовой структуре алгоритма жадного декодирования без потери точности в тестах.
На момент выпуска DSpark обеспечил совместимость с основными фреймворками для инференса:
SGLang: поддерживает выполнение на ускорителях благодаря специальной интеграции и конфигурациям запуска.llama.cpp: предлагает официальную поддержку сборки, позволяя пользователям загружать соответствующие веса GGUF и файлы черновых моделей через командную строку.
Как компания Unitree формирует будущее гуманоидной робототехники
Новое устройство Unitree с встроенным ИИ и технологией сверхширокоугольного 4D-ЛиДАР для усовершенствованной навигации в реальных условиях. Источник: UnitreeВан Синсин, генеральный директор Unitree, с
Почему компания Abnormal AI заключила партнерство с OpenAI в рамках проекта Daybreak
Майкл Айелло, руководитель отдела кибербезопасности в OpenAI | Источник: Майкл Айелло/LinkedInКомпания Abnormal AI присоединилась к программе Daybreak от OpenAI; по словам Майка Айелло, это партнерств
Компания «AI Agent Elements Claw» завершила разработку сверхпроводящего материала
По мере того как искусственный интеллект расширяет границы научных исследований, достигнута важная веха. 3 июля Академия DAMO компании Alibaba в партнерстве с Китайским народным университетом и Универ











