Дом
Microsoft открыла исходный код Phi-4-Vision — облегченной мультимодальной модели искусственного интеллекта
Компания Microsoft официально открыла исходный код своей новейшей модели мультимодального вывода Phi-4-reasoning-vision-15B. Обладая 15 миллиардами параметров, эта модель обеспечивает идеальный баланс между высокой производительностью и низкой стоимостью. Благодаря своей облегченной архитектуре она становится привлекательным новым решением для решения сложных задач визуального анализа в условиях ограниченных ресурсов.
«Компактный мощный инструмент», работающий на основе очищенных данных
В отличие от типичных отраслевых моделей, обученных на триллионах токенов, Phi-4-reasoning-vision была разработана с использованием всего 200 миллиардов мультимодальных токенов. Команда уделила приоритетное внимание качеству данных, тщательно очистив данные из открытых источников, сгенерировав целевые синтетические данные и тщательно откалибровав соотношения данных по конкретным областям — например, увеличив математический контент для усиления вычислительного мышления. Такой подход обеспечивает отличную производительность при научном мышлении и задачах локализации элементов на экране.

Инновационная стратегия гибридного рассуждения
Ключевой инновацией этой модели является ее конструкция «гибридного пути рассуждений»:
Задачи восприятия: для простых задач, таких как подписывание изображений или OCR, модель по умолчанию переходит в режим прямого ответа, оптимизируя скорость и снижая задержку.
Задачи рассуждения: при столкновении со сложной логикой, такой как интерпретация математических формул или научных диаграмм, модель автоматически запускает процесс структурированной цепочки мыслей (CoT), чтобы обеспечить точность ответа.
Пользователи также могут вручную переключаться между этими двумя режимами с помощью определенных триггерных фраз, адаптируя поведение модели к различным потребностям приложения.
Благодаря интеграции кодера динамического разрешения SigLIP-2 модель отлично справляется с распознаванием мелких деталей на скриншотах высокого разрешения. Эта способность делает ее идеальной основой для разработки агентов использования компьютера (CUA), которые могут точно идентифицировать кнопки, поля и другие элементы цифровых интерфейсов и взаимодействовать с ними.
Phi-4-reasoning-vision-15B теперь доступна на основных платформах с открытым исходным кодом. Microsoft предполагает, что эта компактная модель продемонстрирует, как «меньше и быстрее» может также означать «более способная» в мультимодальной области, способствуя продвижению внедрения пространственного интеллекта и интерактивных технологий реального времени.
Связанная статья
Южная Корея начала строительство национального центра вычислений на базе искусственного интеллекта, инвестируя 2,5 триллиона вон с целевым сроком завершения к 2028 году
Южнокорейское издание EtNews сообщает, что 3 августа в парке дата-центров Solar City в Сунане (провинция Чолла-Намдо) состоялась церемония закладки первого камня в основание Центра вычислений ИИ Кореи (KOACC). При общем объеме инвестиций в 2,5 трлн в
Шесть технологических гигантов поддерживают Linux Foundation с суммой $12,5 млн для борьбы с шумом уязвимостей в ИИ
Для борьбы с потоком низкокачественных отчетов о безопасности, генерируемых инструментами автоматизации на базе ИИ, шесть крупных технологических компаний — Anthropic, Amazon (AWS), GitHub, Google, Microsoft и OpenAI — совместно выделили 12,5 млн дол
Маск рассматривал возможность оставить OpenAI своим детям, пока Альтман давал показания
Утром генеральный директор OpenAI Сэм Альтман выступил в суде, чтобы ответить на иск бывшего сооснователя Илона Маска, оспаривающего корпоративную структуру компании.Когда его спросили об утверждении Маска о том, что другие основатели «похитили благ
Рекомендации по связанным специальным темам
Комментарии (1)
Компания Microsoft официально открыла исходный код своей новейшей модели мультимодального вывода Phi-4-reasoning-vision-15B. Обладая 15 миллиардами параметров, эта модель обеспечивает идеальный баланс между высокой производительностью и низкой стоимостью. Благодаря своей облегченной архитектуре она становится привлекательным новым решением для решения сложных задач визуального анализа в условиях ограниченных ресурсов.
«Компактный мощный инструмент», работающий на основе очищенных данных
В отличие от типичных отраслевых моделей, обученных на триллионах токенов, Phi-4-reasoning-vision была разработана с использованием всего 200 миллиардов мультимодальных токенов. Команда уделила приоритетное внимание качеству данных, тщательно очистив данные из открытых источников, сгенерировав целевые синтетические данные и тщательно откалибровав соотношения данных по конкретным областям — например, увеличив математический контент для усиления вычислительного мышления. Такой подход обеспечивает отличную производительность при научном мышлении и задачах локализации элементов на экране.

Инновационная стратегия гибридного рассуждения
Ключевой инновацией этой модели является ее конструкция «гибридного пути рассуждений»:
Задачи восприятия: для простых задач, таких как подписывание изображений или OCR, модель по умолчанию переходит в режим прямого ответа, оптимизируя скорость и снижая задержку.
Задачи рассуждения: при столкновении со сложной логикой, такой как интерпретация математических формул или научных диаграмм, модель автоматически запускает процесс структурированной цепочки мыслей (CoT), чтобы обеспечить точность ответа.
Пользователи также могут вручную переключаться между этими двумя режимами с помощью определенных триггерных фраз, адаптируя поведение модели к различным потребностям приложения.
Благодаря интеграции кодера динамического разрешения SigLIP-2 модель отлично справляется с распознаванием мелких деталей на скриншотах высокого разрешения. Эта способность делает ее идеальной основой для разработки агентов использования компьютера (CUA), которые могут точно идентифицировать кнопки, поля и другие элементы цифровых интерфейсов и взаимодействовать с ними.
Phi-4-reasoning-vision-15B теперь доступна на основных платформах с открытым исходным кодом. Microsoft предполагает, что эта компактная модель продемонстрирует, как «меньше и быстрее» может также означать «более способная» в мультимодальной области, способствуя продвижению внедрения пространственного интеллекта и интерактивных технологий реального времени.
Южная Корея начала строительство национального центра вычислений на базе искусственного интеллекта, инвестируя 2,5 триллиона вон с целевым сроком завершения к 2028 году
Южнокорейское издание EtNews сообщает, что 3 августа в парке дата-центров Solar City в Сунане (провинция Чолла-Намдо) состоялась церемония закладки первого камня в основание Центра вычислений ИИ Кореи (KOACC). При общем объеме инвестиций в 2,5 трлн в
Шесть технологических гигантов поддерживают Linux Foundation с суммой $12,5 млн для борьбы с шумом уязвимостей в ИИ
Для борьбы с потоком низкокачественных отчетов о безопасности, генерируемых инструментами автоматизации на базе ИИ, шесть крупных технологических компаний — Anthropic, Amazon (AWS), GitHub, Google, Microsoft и OpenAI — совместно выделили 12,5 млн дол
Маск рассматривал возможность оставить OpenAI своим детям, пока Альтман давал показания
Утром генеральный директор OpenAI Сэм Альтман выступил в суде, чтобы ответить на иск бывшего сооснователя Илона Маска, оспаривающего корпоративную структуру компании.Когда его спросили об утверждении Маска о том, что другие основатели «похитили благ











