Дом
Атака по уменьшению размеров модели 1.3B в MiniCPM-V 4.6 переопределяет концепцию мультимодальных технологий на периферии
11 мая компания Mingshi Intelligence совместно с Университетом Цинхуа и сообществом OpenBMB, занимающимся разработкой программного обеспечения с открытым исходным кодом, представила новую мультимодальную крупномасштабную модель для периферийных устройств — MiniCPM-V4.6. Несмотря на свои компактные размеры — всего 1,3 миллиарда параметров — эта «облегчённая» модель расширяет границы возможностей более крупных моделей благодаря исключительной интеллектуальной плотности и кроссплатформенной адаптивности, ускоряя внедрение искусственного интеллекта на периферии в реальных условиях.

1. Максимальная производительность: 1,3 млрд параметров обеспечивают исключительные результаты
MiniCPM-V4.6 выпускается в двух версиях — «Instruct» и «Thinking» — обе демонстрируют впечатляющие способности к рассуждению и пониманию в различных тестах по сравнению с моделями аналогичного размера.
Мировое лидерство: в рейтинге Artificial Analysis (AA) MiniCPM-V4.6 набрала впечатляющие 13 баллов, значительно превзойдя конкурентов аналогичного размера (например, Qwen3.5-0.8B от Alibaba и Gemma4-E2B-it от Google), при этом почти сравнявшись по производительности с более крупными моделями, такими как Qwen3.5-2B. Это устанавливает новый эталон для моделей с 1 млрд параметров.
Расширенные возможности: от общего понимания соотношения «изображение-текст» и сложного математического рассуждения в области STEM до сложного распознавания текста в документах (OCR) и понимания временных отношений в видео — модель демонстрирует высокий уровень интеллекта. В частности, версия Thinking отличается превосходными способностями к рассуждению на основе нескольких изображений и подавлению галлюцинаций.
2. Прорыв в эффективности: экстремальная интеллектуальная плотность на периферии
Чтобы преодолеть ограничения памяти при развертывании на периферии, MiniCPM-V4.6 была глубоко оптимизирована с точки зрения скорости вывода и эффективности использования ресурсов.
Незначительное потребление памяти: потребность в памяти снижается до всего 6 ГБ, что обеспечивает плавную работу на обычных смартфонах, ПК и устройствах «умного дома».
Эффективность вывода: благодаря технологии vLLM пропускная способность вывода в 1,5 раза превышает показатели конкурентов. При обработке изображения сверхвысокого разрешения 3136² на периферии задержка первого ответа составляет всего 75,7 мс— это в 2,2 раза быстрее, чем у конкурирующих моделей.
Пропускная способность: один графический процессор (GPU) обеспечивает генерацию текста со скоростью 7 013 токенов в секунду и может обрабатывать изображения размером 1 344² со скоростью 54,79 изображений в секунду, демонстрируя замечательную эффективность.
3. Основная технология: LLaVA-UHD v4 сводит к минимуму накладные расходы
Легкая архитектура модели стала возможной благодаря LLaVA-UHD v4, совместно разработанной Mingshi Intelligence и Университетом Цинхуа.
Переработка кодирования: благодаря усовершенствованному модулю кодирования изображений ViT и модулю неглубокого сжатия накладные расходы на кодирование изображений сокращены на 50%, а на операциях с плавающей запятой в высоком разрешении — на 55,8%.
Гибридное сжатие: внедрена гибридная компрессия токенов с коэффициентом 4×/16×, позволяющая гибко переключаться между режимами «приоритет производительности» и «приоритет скорости». Эта технология прошла проверку в рекомендательной модели OneRec компании Kuaishou, обрабатывающей огромные объемы трафика.
4. Внедрение в экосистему: от лаборатории к промышленному применению
Выпуск MiniCPM-V4.6 с открытым исходным кодом знаменует собой важную веху как с технической точки зрения, так и с точки зрения экосистемы.
Простота разработки: он легко интегрируется с фреймворками для тонкой настройки, такими как ms-swift и LLaMA-Factory, что позволяет осуществлять полномасштабную тонко настройку на одном графическом процессоре RTX 4090.
Кроссплатформенная поддержка: благодаря совместимости с vLLM, Ollama и другими основными фреймворками, она предлагает тестовые версии для iOS, Android и HarmonyOS, что позволяет использовать ИИ на более широком спектре аппаратных платформ.
Практическое применение: эта серия моделей уже внедрена в автомобильной промышленности, в сфере ПК, «умного дома» и промышленного контроля; среди партнеров — Lenovo, Geely, SAIC Volkswagen, Xiaomi и OPPO.
Связанная статья
Акции США достигли исторической отметки, поскольку гиганты искусственного интеллекта и аэрокосмической отрасли готовятся к дебюту с оценкой в триллион долларов
Илон Маск, Сэм Алтман и Дарио Амодэй, три титана технологического сектора, продвигаются к первичным публичным предложениям акций своих respective компаний. Благодаря SpaceX, OpenAI и Anthropic — трем отраслевым гигантам, чья оценка приближается к три
Шведский стартап в области искусственного интеллекта Lovable Eyes достиг оценки в 13,2 миллиарда долларов после крупного раунда финансирования
По мере того как инструменты для программирования на основе искусственного интеллекта набирают популярность, шведский стартап Lovable привлек крупный раунд финансирования. Компания нацелена на привлечение $3 млрд, что потенциально может увеличить её
Google тестирует агента Remy AI для Gemini по мере смещения фокуса на управление пользователями
Согласно Business Insider, Google тестирует Remy, нового ИИ-персонального агента для Gemini. Этот инструмент предназначен для выполнения задач от имени пользователей, упрощая как профессиональные рабочие процессы, так и повседневные рутины.В настоящ
Рекомендации по связанным специальным темам
Комментарии (0)
11 мая компания Mingshi Intelligence совместно с Университетом Цинхуа и сообществом OpenBMB, занимающимся разработкой программного обеспечения с открытым исходным кодом, представила новую мультимодальную крупномасштабную модель для периферийных устройств — MiniCPM-V4.6. Несмотря на свои компактные размеры — всего 1,3 миллиарда параметров — эта «облегчённая» модель расширяет границы возможностей более крупных моделей благодаря исключительной интеллектуальной плотности и кроссплатформенной адаптивности, ускоряя внедрение искусственного интеллекта на периферии в реальных условиях.

1. Максимальная производительность: 1,3 млрд параметров обеспечивают исключительные результаты
MiniCPM-V4.6 выпускается в двух версиях — «Instruct» и «Thinking» — обе демонстрируют впечатляющие способности к рассуждению и пониманию в различных тестах по сравнению с моделями аналогичного размера.
Мировое лидерство: в рейтинге Artificial Analysis (AA) MiniCPM-V4.6 набрала впечатляющие 13 баллов, значительно превзойдя конкурентов аналогичного размера (например, Qwen3.5-0.8B от Alibaba и Gemma4-E2B-it от Google), при этом почти сравнявшись по производительности с более крупными моделями, такими как Qwen3.5-2B. Это устанавливает новый эталон для моделей с 1 млрд параметров.
Расширенные возможности: от общего понимания соотношения «изображение-текст» и сложного математического рассуждения в области STEM до сложного распознавания текста в документах (OCR) и понимания временных отношений в видео — модель демонстрирует высокий уровень интеллекта. В частности, версия Thinking отличается превосходными способностями к рассуждению на основе нескольких изображений и подавлению галлюцинаций.
2. Прорыв в эффективности: экстремальная интеллектуальная плотность на периферии
Чтобы преодолеть ограничения памяти при развертывании на периферии, MiniCPM-V4.6 была глубоко оптимизирована с точки зрения скорости вывода и эффективности использования ресурсов.
Незначительное потребление памяти: потребность в памяти снижается до всего 6 ГБ, что обеспечивает плавную работу на обычных смартфонах, ПК и устройствах «умного дома».
Эффективность вывода: благодаря технологии vLLM пропускная способность вывода в 1,5 раза превышает показатели конкурентов. При обработке изображения сверхвысокого разрешения 3136² на периферии задержка первого ответа составляет всего 75,7 мс— это в 2,2 раза быстрее, чем у конкурирующих моделей.
Пропускная способность: один графический процессор (GPU) обеспечивает генерацию текста со скоростью 7 013 токенов в секунду и может обрабатывать изображения размером 1 344² со скоростью 54,79 изображений в секунду, демонстрируя замечательную эффективность.
3. Основная технология: LLaVA-UHD v4 сводит к минимуму накладные расходы
Легкая архитектура модели стала возможной благодаря LLaVA-UHD v4, совместно разработанной Mingshi Intelligence и Университетом Цинхуа.
Переработка кодирования: благодаря усовершенствованному модулю кодирования изображений ViT и модулю неглубокого сжатия накладные расходы на кодирование изображений сокращены на 50%, а на операциях с плавающей запятой в высоком разрешении — на 55,8%.
Гибридное сжатие: внедрена гибридная компрессия токенов с коэффициентом 4×/16×, позволяющая гибко переключаться между режимами «приоритет производительности» и «приоритет скорости». Эта технология прошла проверку в рекомендательной модели OneRec компании Kuaishou, обрабатывающей огромные объемы трафика.
4. Внедрение в экосистему: от лаборатории к промышленному применению
Выпуск MiniCPM-V4.6 с открытым исходным кодом знаменует собой важную веху как с технической точки зрения, так и с точки зрения экосистемы.
Простота разработки: он легко интегрируется с фреймворками для тонкой настройки, такими как ms-swift и LLaMA-Factory, что позволяет осуществлять полномасштабную тонко настройку на одном графическом процессоре RTX 4090.
Кроссплатформенная поддержка: благодаря совместимости с vLLM, Ollama и другими основными фреймворками, она предлагает тестовые версии для iOS, Android и HarmonyOS, что позволяет использовать ИИ на более широком спектре аппаратных платформ.
Практическое применение: эта серия моделей уже внедрена в автомобильной промышленности, в сфере ПК, «умного дома» и промышленного контроля; среди партнеров — Lenovo, Geely, SAIC Volkswagen, Xiaomi и OPPO.
Акции США достигли исторической отметки, поскольку гиганты искусственного интеллекта и аэрокосмической отрасли готовятся к дебюту с оценкой в триллион долларов
Илон Маск, Сэм Алтман и Дарио Амодэй, три титана технологического сектора, продвигаются к первичным публичным предложениям акций своих respective компаний. Благодаря SpaceX, OpenAI и Anthropic — трем отраслевым гигантам, чья оценка приближается к три
Шведский стартап в области искусственного интеллекта Lovable Eyes достиг оценки в 13,2 миллиарда долларов после крупного раунда финансирования
По мере того как инструменты для программирования на основе искусственного интеллекта набирают популярность, шведский стартап Lovable привлек крупный раунд финансирования. Компания нацелена на привлечение $3 млрд, что потенциально может увеличить её











