Дом
Microsoft представила разработанные собственными силами модели MAI-Image-2.5-Pro и MAI-Voice-2-Flash, которые теперь интегрированы в Bing и PowerPoint
23 июля компания Microsoft объявила о запуске публичной предварительной версии двух собственных моделей искусственного интеллекта: MAI-Image-2.5-Pro и MAI-Voice-2-Flash. Эти модели предназначены для генерации изображений высокого качества и голосового взаимодействия с высокой степенью параллелизма. Microsoft подчеркнула, что обучающие данные очищены, их происхождение прослеживается, и они не получены в результате дистилляции сторонних моделей. Созданные с нуля, эти модели напрямую обслуживают пользователей продуктов Microsoft.

Модель изображений с максимальной точностью снижает затраты на использование графических процессоров (GPU) до 84%
MAI-Image-2.5-Pro — самая точная модель обработки изображений от Microsoft, предназначенная для сложных задач, таких как генерация ключевых изображений, детальное редактирование и рендеринг текста внутри изображения, при этом она поддерживает инструкции по редактированию на естественном языке. Она стала моделью генерации изображений по умолчанию в Bing Image Creator и используется для редактирования «изображение-к-изображению» в PowerPoint. По сравнению с GPT-Image-2 она сокращает затраты на GPU до 84 %. После развертывания в OneDrive показатель успешности сценариев вырос на 26 %, задержка P95 снизилась примерно на 25 %, а эффективность в производственных средах со средней нагрузкой повысилась в 2,5 раза.
Стоимость составляет 5 долларов за миллион токенов для текстового ввода и 106 долларов за миллион токенов для вывода изображений.
Голосовая модель удваивает скорость, обслуживая таких клиентов, как T-Mobile

MAI-Voice-2-Flash оптимизирована для высокочастотных голосовых приложений, обеспечивая примерно вдвое большую скорость по сравнению с предыдущим поколением и снижение затрат на 32%, что делает её идеальным решением для сценариев, требующих быстрого реагирования, таких как контакт-центры и голосовые помощники. Интегрированная в Dynamics 365 Contact Center, она обслуживает таких клиентов, как T-Mobile и EasyJet, обеспечивая снижение затрат на использование графических процессоров (GPU) до 89%. Microsoft также внедрила эту модель в сервис Azure Voice Live, что позволяет разработчикам создавать интерактивных голосовых агентов.
Кроме того, модель MAI-Transcribe-1.5 из той же серии была применена в медицинском голосовом решении Dragon Copilot, которым пользуются 170 000 медицинских работников. В прошлом квартале она обработала 28 миллионов консультаций пациентов, поддерживает 58 языков и снижает уровень ошибок транскрипции примерно на 50 % для большинства языков. Microsoft сообщила, что вычислительный кластер нового поколения GB200 уже введен в эксплуатацию, а серия MAI будет продолжать расширяться.
Связанная статья
ByteDance’s Seed запускает глобальную кампанию по набору сотрудников в кампусах, предлагая виртуальные акции для привлечения лучших специалистов по крупным языковым моделям
В условиях конкурентной борьбы крупных языковых моделей привлечение высококвалифицированных специалистов остается самым важным стратегическим активом.1 апреля ByteDance объявил о запуске глобальной программы набора на кампусы Seed, являющейся частью
Suno добавляет водяные знаки на песни в ходе судебных разбирательств
Suno, платформа, позволяющая пользователям создавать музыку с помощью искусственного интеллекта, представила новые функции для маркировки треков, созданных на платформе, ограничения на скачивание и обновления стандартов сообщества для борьбы с несанк
Маск признал, что утечка кода Grok привела к раскрытию пользовательских данных, и пообещал стереть всю историческую информацию.
Илон Маск напрямую отреагировал на скандал с конфиденциальностью вокруг Grok Build, начав с простого «Да», чтобы подтвердить достоверность инцидента. Он пообещал, что все данные пользователей, ранее загруженные в SpaceXAI, будут безвозвратно удалены,
Рекомендации по связанным специальным темам
Комментарии (0)
23 июля компания Microsoft объявила о запуске публичной предварительной версии двух собственных моделей искусственного интеллекта: MAI-Image-2.5-Pro и MAI-Voice-2-Flash. Эти модели предназначены для генерации изображений высокого качества и голосового взаимодействия с высокой степенью параллелизма. Microsoft подчеркнула, что обучающие данные очищены, их происхождение прослеживается, и они не получены в результате дистилляции сторонних моделей. Созданные с нуля, эти модели напрямую обслуживают пользователей продуктов Microsoft.

Модель изображений с максимальной точностью снижает затраты на использование графических процессоров (GPU) до 84%
MAI-Image-2.5-Pro — самая точная модель обработки изображений от Microsoft, предназначенная для сложных задач, таких как генерация ключевых изображений, детальное редактирование и рендеринг текста внутри изображения, при этом она поддерживает инструкции по редактированию на естественном языке. Она стала моделью генерации изображений по умолчанию в Bing Image Creator и используется для редактирования «изображение-к-изображению» в PowerPoint. По сравнению с GPT-Image-2 она сокращает затраты на GPU до 84 %. После развертывания в OneDrive показатель успешности сценариев вырос на 26 %, задержка P95 снизилась примерно на 25 %, а эффективность в производственных средах со средней нагрузкой повысилась в 2,5 раза.
Стоимость составляет 5 долларов за миллион токенов для текстового ввода и 106 долларов за миллион токенов для вывода изображений.
Голосовая модель удваивает скорость, обслуживая таких клиентов, как T-Mobile

MAI-Voice-2-Flash оптимизирована для высокочастотных голосовых приложений, обеспечивая примерно вдвое большую скорость по сравнению с предыдущим поколением и снижение затрат на 32%, что делает её идеальным решением для сценариев, требующих быстрого реагирования, таких как контакт-центры и голосовые помощники. Интегрированная в Dynamics 365 Contact Center, она обслуживает таких клиентов, как T-Mobile и EasyJet, обеспечивая снижение затрат на использование графических процессоров (GPU) до 89%. Microsoft также внедрила эту модель в сервис Azure Voice Live, что позволяет разработчикам создавать интерактивных голосовых агентов.
Кроме того, модель MAI-Transcribe-1.5 из той же серии была применена в медицинском голосовом решении Dragon Copilot, которым пользуются 170 000 медицинских работников. В прошлом квартале она обработала 28 миллионов консультаций пациентов, поддерживает 58 языков и снижает уровень ошибок транскрипции примерно на 50 % для большинства языков. Microsoft сообщила, что вычислительный кластер нового поколения GB200 уже введен в эксплуатацию, а серия MAI будет продолжать расширяться.
ByteDance’s Seed запускает глобальную кампанию по набору сотрудников в кампусах, предлагая виртуальные акции для привлечения лучших специалистов по крупным языковым моделям
В условиях конкурентной борьбы крупных языковых моделей привлечение высококвалифицированных специалистов остается самым важным стратегическим активом.1 апреля ByteDance объявил о запуске глобальной программы набора на кампусы Seed, являющейся частью
Suno добавляет водяные знаки на песни в ходе судебных разбирательств
Suno, платформа, позволяющая пользователям создавать музыку с помощью искусственного интеллекта, представила новые функции для маркировки треков, созданных на платформе, ограничения на скачивание и обновления стандартов сообщества для борьбы с несанк
Маск признал, что утечка кода Grok привела к раскрытию пользовательских данных, и пообещал стереть всю историческую информацию.
Илон Маск напрямую отреагировал на скандал с конфиденциальностью вокруг Grok Build, начав с простого «Да», чтобы подтвердить достоверность инцидента. Он пообещал, что все данные пользователей, ранее загруженные в SpaceXAI, будут безвозвратно удалены,











