Alibaba представляет Qwen-UI-Agent — мультимодальную базовую модель для реальных задач
Компания Alibaba официально представила Qwen-UI-Agent — базовую модель для агентов графического пользовательского интерфейса (GUI), предназначенную для работы в реальных условиях. Эта модель, охватывающая мобильные, настольные, веб-среды и среды глубокого поиска, выходит за рамки традиционного тестирования с помощью симуляций и обеспечивает бесперебойную работу на сложных физических устройствах.

Производительность, превосходящая показатели лидеров отрасли
Qwen-UI-Agent продемонстрировал исключительные возможности как в авторитетных тестах, так и в реальных условиях:
Производительность на мобильных устройствах: модель достигла впечатляющего результата в 82,1 % в тесте MobileWorld, превзойдя по производительности несколько ведущих международных флагманских моделей. В специально разработанном тесте MobileWorld-Real, охватывающем более 100 реальных устройств, показатель успешности достиг 92,2 %, при этом в задачах Android Daily были получены практически идеальные результаты. Производительность на настольных устройствах: набрав 79,5 % в тесте OSWorld-Verified, модель значительно сократила количество шагов выполнения при решении различных задач по сравнению с базовыми моделями.Веб-возможности и общие способности: модель заняла первое место в веб-тесте WebArena среди всех сравниваемых моделей. Её общие и агентные способности превосходят возможности базовой обучающей модели, что позволяет ей с лёгкостью обрабатывать запросы с длинным хвостом.Преодоление разрыва между симуляцией и реальностью
Чтобы преодолеть разрыв между симуляцией и реальным применением, Qwen-UI-Agent использует реальную мобильную среду, включающую более 100 физических телефонов и свыше 150 приложений. Такая конфигурация поддерживает создание задач, сбор траекторий поведения и обучение модели. Команда также представила MobileWorld-Real — набор тестов на реальных устройствах, включающий более 400 задач, что позволяет точно выбирать модели с учётом реальной производительности устройств.

Оптимизированные инструкции и надежная безопасность
Помимо стандартных операций через графический интерфейс, модель может напрямую выполнять команды из командной строки. Выдавая пакетные действия в рамках одного решения, она сокращает траектории выполнения и повышает эффективность. В весь процесс интегрирован комплексный механизм безопасности: модель отклоняет и прерывает задачи, связанные с недопустимыми или высокорисковыми запросами. При выполнении чувствительных действий, таких как платежи, удаление данных или авторизация доступа к личным данным, она приостанавливается на критических этапах, ожидая подтверждения пользователя.
Кроме того, модель поддерживает онлайн-обучение с подкреплением на траекториях, превышающих 100 шагов. В сочетании с адаптивным обучением по учебной программе она постоянно совершенствует свою способность решать сложные долгосрочные задачи.
Домашняя страница проекта: https://tongyi-mai.github.io/Qwen-UI-Agent/
Связанная статья
Акции США достигли исторической отметки, поскольку гиганты искусственного интеллекта и аэрокосмической отрасли готовятся к дебюту с оценкой в триллион долларов
Илон Маск, Сэм Алтман и Дарио Амодэй, три титана технологического сектора, продвигаются к первичным публичным предложениям акций своих respective компаний. Благодаря SpaceX, OpenAI и Anthropic — трем отраслевым гигантам, чья оценка приближается к три
Шведский стартап в области искусственного интеллекта Lovable Eyes достиг оценки в 13,2 миллиарда долларов после крупного раунда финансирования
По мере того как инструменты для программирования на основе искусственного интеллекта набирают популярность, шведский стартап Lovable привлек крупный раунд финансирования. Компания нацелена на привлечение $3 млрд, что потенциально может увеличить её
Google тестирует агента Remy AI для Gemini по мере смещения фокуса на управление пользователями
Согласно Business Insider, Google тестирует Remy, нового ИИ-персонального агента для Gemini. Этот инструмент предназначен для выполнения задач от имени пользователей, упрощая как профессиональные рабочие процессы, так и повседневные рутины.В настоящ
Рекомендации по связанным специальным темам
Комментарии (0)
Компания Alibaba официально представила Qwen-UI-Agent — базовую модель для агентов графического пользовательского интерфейса (GUI), предназначенную для работы в реальных условиях. Эта модель, охватывающая мобильные, настольные, веб-среды и среды глубокого поиска, выходит за рамки традиционного тестирования с помощью симуляций и обеспечивает бесперебойную работу на сложных физических устройствах.

Производительность, превосходящая показатели лидеров отрасли
Qwen-UI-Agent продемонстрировал исключительные возможности как в авторитетных тестах, так и в реальных условиях:
Производительность на мобильных устройствах: модель достигла впечатляющего результата в 82,1 % в тесте MobileWorld, превзойдя по производительности несколько ведущих международных флагманских моделей. В специально разработанном тесте MobileWorld-Real, охватывающем более 100 реальных устройств, показатель успешности достиг 92,2 %, при этом в задачах Android Daily были получены практически идеальные результаты. Производительность на настольных устройствах: набрав 79,5 % в тесте OSWorld-Verified, модель значительно сократила количество шагов выполнения при решении различных задач по сравнению с базовыми моделями.Веб-возможности и общие способности: модель заняла первое место в веб-тесте WebArena среди всех сравниваемых моделей. Её общие и агентные способности превосходят возможности базовой обучающей модели, что позволяет ей с лёгкостью обрабатывать запросы с длинным хвостом.Преодоление разрыва между симуляцией и реальностью
Чтобы преодолеть разрыв между симуляцией и реальным применением, Qwen-UI-Agent использует реальную мобильную среду, включающую более 100 физических телефонов и свыше 150 приложений. Такая конфигурация поддерживает создание задач, сбор траекторий поведения и обучение модели. Команда также представила MobileWorld-Real — набор тестов на реальных устройствах, включающий более 400 задач, что позволяет точно выбирать модели с учётом реальной производительности устройств.

Оптимизированные инструкции и надежная безопасность
Помимо стандартных операций через графический интерфейс, модель может напрямую выполнять команды из командной строки. Выдавая пакетные действия в рамках одного решения, она сокращает траектории выполнения и повышает эффективность. В весь процесс интегрирован комплексный механизм безопасности: модель отклоняет и прерывает задачи, связанные с недопустимыми или высокорисковыми запросами. При выполнении чувствительных действий, таких как платежи, удаление данных или авторизация доступа к личным данным, она приостанавливается на критических этапах, ожидая подтверждения пользователя.
Кроме того, модель поддерживает онлайн-обучение с подкреплением на траекториях, превышающих 100 шагов. В сочетании с адаптивным обучением по учебной программе она постоянно совершенствует свою способность решать сложные долгосрочные задачи.
Домашняя страница проекта: https://tongyi-mai.github.io/Qwen-UI-Agent/
Акции США достигли исторической отметки, поскольку гиганты искусственного интеллекта и аэрокосмической отрасли готовятся к дебюту с оценкой в триллион долларов
Илон Маск, Сэм Алтман и Дарио Амодэй, три титана технологического сектора, продвигаются к первичным публичным предложениям акций своих respective компаний. Благодаря SpaceX, OpenAI и Anthropic — трем отраслевым гигантам, чья оценка приближается к три
Шведский стартап в области искусственного интеллекта Lovable Eyes достиг оценки в 13,2 миллиарда долларов после крупного раунда финансирования
По мере того как инструменты для программирования на основе искусственного интеллекта набирают популярность, шведский стартап Lovable привлек крупный раунд финансирования. Компания нацелена на привлечение $3 млрд, что потенциально может увеличить её





Дом






