Дом
Microsoft Webwright переводит веб-агент в режим открытого исходного кода, переходя от «клик» к «коду»
Microsoft Research недавно открыла исходный код своей новой платформы для веб-агентов — Webwright. Вместо использования широко распространённой модели прогнозирования на основе «скриншотов и кликов по DOM», эта платформа позволяет моделям искусственного интеллекта напрямую писать код Playwright и выполнять команды Bash в терминале, что обеспечивает более эффективное и логичное выполнение сложных веб-задач.

I. Основная архитектура: минималистичный подход «Terminal-First»
Философия проектирования Webwright проста: «Один терминал лучше тысяч абстракций». Фреймворк состоит из примерно 1 000 строк кода , разбитых на три основных модуля, без сложной координации действий нескольких агентов:
Runner (около 150 строк): управляет основной логикой цикла агента, обрабатывая контекст и выполнение.
Model Endpoint (около 550 строк): унифицированный интерфейс для взаимодействия с моделями, поддерживающий такие бэкенды, как OpenAI, Anthropic и OpenRouter.
Terminal Environment (около 300 строк): предоставляет изолированную среду выполнения в терминале, где модель может запускать скрипты Playwright, просматривать логи, анализировать скриншоты и отлаживать.
Рабочий процесс: Runner отправляет текущий контекст задачи модели → модель генерирует «ход мыслей» и «команду Shell» → среда выполняет их и возвращает результаты (вывод, скриншот, стек ошибок) → цикл продолжается до завершения задачи.

II. Почему стоит перейти от «кликов» к «написанию кода»?
Современные основные агенты управляют браузерами, постоянно предсказывая «клики, прокрутку, ввод данных», что приводит к проблемам с эффективностью и сложностям в управлении состоянием. Подход Webwright, основанный на коде, предлагает явные преимущества:
Повторное использование логики: каждая операция генерирует повторно используемые скрипты RPA (автоматизация робототехнических процессов), а не одноразовые записи кликов. Эти скрипты можно повторно использовать в других инструментах, таких как Claude Code или Codex.
Обработка сложной логики: код естественным образом поддерживает циклы, функции и ветвления. Для задач с длинной цепочкой действий, таких как заполнение форм, межстраничные операции и условные переходы, выражение кода значительно превосходит простое накопление действий.
Исправление инженерных ошибок: анализируя трассировки стека после ошибок выполнения, модель может автономно входить в итеративный цикл «написать код — запустить — обнаружить ошибку — исправить», что значительно повышает показатели успешности задач.
III. Инженерные прорывы: решение проблем «ложного успеха» и «раздувания контекста»
Webwright предлагает целенаправленные решения для двух распространённых проблем агентов:
Механизм самопроверки шлюза: предотвращает ложное заявление модели о завершении задачи. Модель должна сначала сгенерировать «конфигурацию самопроверки» и запустить финальный скрипт в «чистой» среде. Только после того, как саморефлексия подтвердит, что задача действительно выполнена, она может выдать маркер завершения.
Сжатие истории: чтобы справиться с перегрузкой контекста, возникающей при длительных траекториях, система сжимает историю в сводку каждые 20 шагов, обеспечивая, чтобы окно контекста всегда фокусировалось на ключевых этапах прогресса.
IV. Результаты тестирования: превосходство над эталонными показателями
В тестах по эталонным показателям, проведённых в мае 2026 года, Webwright продемонстрировал исключительно высокие результаты:
Online-Mind2Web: Webwright на базе GPT-5.4 достиг точности 86,67 % в рамках бюджета из 100 шагов, войдя в число лучших решений с открытым исходным кодом.
Odysseys (задачи с длинными цепочками): при работе со сложными инструкциями, содержащими в среднем 272 слова, Webwright + GPT-5.4 набрал 60,1%, что на 81,5% превышает результат базового GPT-5.4 (33,5%) и превосходит показатель лидера апрельского рейтинга — Opus4.6 (44,5%).
Отзывы отрасли
Появление Webwright подчеркивает важную тенденцию: по мере улучшения возможностей моделей в области программирования агенты переходят к «парадигме разработчика». Рассматривая браузер как программируемую конечную точку, а не просто интерактивный интерфейс, Webwright успешно поднимает эффективность и надежность выполнения веб-задач с помощью ИИ на новый уровень.
Для разработчиков Webwright — это не просто фреймворк для агентов, а «суперсотрудник», способный автоматически писать, поддерживать и упаковывать скрипты автоматизации. Проект теперь доступен с открытым исходным кодом на GitHub.
Связанная статья
Шесть технологических гигантов поддерживают Linux Foundation с суммой $12,5 млн для борьбы с шумом уязвимостей в ИИ
Для борьбы с потоком низкокачественных отчетов о безопасности, генерируемых инструментами автоматизации на базе ИИ, шесть крупных технологических компаний — Anthropic, Amazon (AWS), GitHub, Google, Microsoft и OpenAI — совместно выделили 12,5 млн дол
Маск рассматривал возможность оставить OpenAI своим детям, пока Альтман давал показания
Утром генеральный директор OpenAI Сэм Альтман выступил в суде, чтобы ответить на иск бывшего сооснователя Илона Маска, оспаривающего корпоративную структуру компании.Когда его спросили об утверждении Маска о том, что другие основатели «похитили благ
Сэм Альтман вызывает споры о замедлении развития ИИ
Слушайте наApple PodcastsСлушайте наSpotifyГенеральный директор OpenAI Сэм Алтман недавно предположил, что, возможно, пришло время «сдерживать темпы развития ИИ», чтобы позволить обществу «укрепиться вокруг некоторых из этих новых уровней возможност
Рекомендации по связанным специальным темам
Комментарии (1)
Microsoft Research недавно открыла исходный код своей новой платформы для веб-агентов — Webwright. Вместо использования широко распространённой модели прогнозирования на основе «скриншотов и кликов по DOM», эта платформа позволяет моделям искусственного интеллекта напрямую писать код Playwright и выполнять команды Bash в терминале, что обеспечивает более эффективное и логичное выполнение сложных веб-задач.

I. Основная архитектура: минималистичный подход «Terminal-First»
Философия проектирования Webwright проста: «Один терминал лучше тысяч абстракций». Фреймворк состоит из примерно 1 000 строк кода , разбитых на три основных модуля, без сложной координации действий нескольких агентов:
Runner (около 150 строк): управляет основной логикой цикла агента, обрабатывая контекст и выполнение.
Model Endpoint (около 550 строк): унифицированный интерфейс для взаимодействия с моделями, поддерживающий такие бэкенды, как OpenAI, Anthropic и OpenRouter.
Terminal Environment (около 300 строк): предоставляет изолированную среду выполнения в терминале, где модель может запускать скрипты Playwright, просматривать логи, анализировать скриншоты и отлаживать.
Рабочий процесс: Runner отправляет текущий контекст задачи модели → модель генерирует «ход мыслей» и «команду Shell» → среда выполняет их и возвращает результаты (вывод, скриншот, стек ошибок) → цикл продолжается до завершения задачи.

II. Почему стоит перейти от «кликов» к «написанию кода»?
Современные основные агенты управляют браузерами, постоянно предсказывая «клики, прокрутку, ввод данных», что приводит к проблемам с эффективностью и сложностям в управлении состоянием. Подход Webwright, основанный на коде, предлагает явные преимущества:
Повторное использование логики: каждая операция генерирует повторно используемые скрипты RPA (автоматизация робототехнических процессов), а не одноразовые записи кликов. Эти скрипты можно повторно использовать в других инструментах, таких как Claude Code или Codex.
Обработка сложной логики: код естественным образом поддерживает циклы, функции и ветвления. Для задач с длинной цепочкой действий, таких как заполнение форм, межстраничные операции и условные переходы, выражение кода значительно превосходит простое накопление действий.
Исправление инженерных ошибок: анализируя трассировки стека после ошибок выполнения, модель может автономно входить в итеративный цикл «написать код — запустить — обнаружить ошибку — исправить», что значительно повышает показатели успешности задач.
III. Инженерные прорывы: решение проблем «ложного успеха» и «раздувания контекста»
Webwright предлагает целенаправленные решения для двух распространённых проблем агентов:
Механизм самопроверки шлюза: предотвращает ложное заявление модели о завершении задачи. Модель должна сначала сгенерировать «конфигурацию самопроверки» и запустить финальный скрипт в «чистой» среде. Только после того, как саморефлексия подтвердит, что задача действительно выполнена, она может выдать маркер завершения.
Сжатие истории: чтобы справиться с перегрузкой контекста, возникающей при длительных траекториях, система сжимает историю в сводку каждые 20 шагов, обеспечивая, чтобы окно контекста всегда фокусировалось на ключевых этапах прогресса.
IV. Результаты тестирования: превосходство над эталонными показателями
В тестах по эталонным показателям, проведённых в мае 2026 года, Webwright продемонстрировал исключительно высокие результаты:
Online-Mind2Web: Webwright на базе GPT-5.4 достиг точности 86,67 % в рамках бюджета из 100 шагов, войдя в число лучших решений с открытым исходным кодом.
Odysseys (задачи с длинными цепочками): при работе со сложными инструкциями, содержащими в среднем 272 слова, Webwright + GPT-5.4 набрал 60,1%, что на 81,5% превышает результат базового GPT-5.4 (33,5%) и превосходит показатель лидера апрельского рейтинга — Opus4.6 (44,5%).
Отзывы отрасли
Появление Webwright подчеркивает важную тенденцию: по мере улучшения возможностей моделей в области программирования агенты переходят к «парадигме разработчика». Рассматривая браузер как программируемую конечную точку, а не просто интерактивный интерфейс, Webwright успешно поднимает эффективность и надежность выполнения веб-задач с помощью ИИ на новый уровень.
Для разработчиков Webwright — это не просто фреймворк для агентов, а «суперсотрудник», способный автоматически писать, поддерживать и упаковывать скрипты автоматизации. Проект теперь доступен с открытым исходным кодом на GitHub.
Шесть технологических гигантов поддерживают Linux Foundation с суммой $12,5 млн для борьбы с шумом уязвимостей в ИИ
Для борьбы с потоком низкокачественных отчетов о безопасности, генерируемых инструментами автоматизации на базе ИИ, шесть крупных технологических компаний — Anthropic, Amazon (AWS), GitHub, Google, Microsoft и OpenAI — совместно выделили 12,5 млн дол
Маск рассматривал возможность оставить OpenAI своим детям, пока Альтман давал показания
Утром генеральный директор OpenAI Сэм Альтман выступил в суде, чтобы ответить на иск бывшего сооснователя Илона Маска, оспаривающего корпоративную структуру компании.Когда его спросили об утверждении Маска о том, что другие основатели «похитили благ
Сэм Альтман вызывает споры о замедлении развития ИИ
Слушайте наApple PodcastsСлушайте наSpotifyГенеральный директор OpenAI Сэм Алтман недавно предположил, что, возможно, пришло время «сдерживать темпы развития ИИ», чтобы позволить обществу «укрепиться вокруг некоторых из этих новых уровней возможност











