Hogar
Microsoft Webwright convierte Web Agent en código abierto y pasa de «clic» a «código»
Microsoft Research ha publicado recientemente como código abierto su nuevo marco de trabajo para agentes web, Webwright. En lugar de basarse en el modelo de predicción convencional de «capturas de pantalla/clics en el DOM», este marco permite a los modelos de IA escribir directamente código Playwright y ejecutar comandos Bash en la terminal, lo que les permite realizar tareas web complejas de forma más eficiente y lógica.

I. Arquitectura central: un enfoque minimalista que da prioridad a la «terminal»
La filosofía de diseño de Webwright es sencilla: «Una terminal vale más que miles de abstracciones». El marco consta de unas 1.000 líneas de código divididas en tres módulos principales, sin ninguna orquestación compleja entre múltiples agentes:
Runner (unas 150 líneas): gestiona la lógica central del bucle del agente, encargándose del contexto y la ejecución.
Model Endpoint (unas 550 líneas): una interfaz unificada para la interacción con modelos, compatible con backends como OpenAI, Anthropic y OpenRouter.
Terminal Environment (unas 300 líneas): proporciona un entorno de ejecución aislado en la terminal donde el modelo puede ejecutar scripts de Playwright, ver registros, analizar capturas de pantalla y depurar.
Flujo de trabajo: El Runner envía el contexto de la tarea actual al modelo → el modelo genera un «proceso de pensamiento» y un «comando de Shell» → el entorno lo ejecuta y devuelve los resultados (salida, captura de pantalla, pila de errores) → el bucle continúa hasta que la tarea se completa.

II. ¿Por qué pasar de «hacer clics» a «escribir código»?
Los agentes más habituales en la actualidad controlan los navegadores prediciendo constantemente «clics, desplazamientos y entradas», lo que conlleva problemas de eficiencia y dificultades en la gestión del estado. El enfoque basado en código de Webwright ofrece claras ventajas:
Reutilización lógica: cada operación genera scripts de RPA (automatización robótica de procesos) reutilizables, en lugar de registros de clics de un solo uso. Estos scripts pueden reutilizarse en otras herramientas como Claude Code o Codex.
Gestión de lógica compleja: el código admite de forma natural bucles, funciones y ramificaciones. Para tareas de cadena larga, como el rellenado de formularios, las operaciones entre páginas y los saltos condicionales, la expresión mediante código supera con creces al simple apilamiento de acciones.
Corrección de errores de ingeniería: al analizar los rastros de pila tras los errores de ejecución, el modelo puede entrar de forma autónoma en un ciclo iterativo de «escribir código – ejecutar – detectar error – corregir», lo que aumenta significativamente las tasas de éxito de las tareas.
III. Avances en ingeniería: resolución del «éxito falso» y la «sobrecarga de contexto»
Webwright introduce soluciones específicas para dos problemas habituales de los agentes:
Mecanismo de autocomprobación de la puerta de control: evita que el modelo afirme falsamente que ha completado una tarea. El modelo debe generar primero una «configuración de autocomprobación» y ejecutar el script final en un entorno limpio. Solo después de que la autorreflexión confirme que la tarea se ha completado realmente, puede generar un marcador de finalización.
Compresión del historial: para gestionar la sobrecarga de contexto derivada de trayectorias largas, el sistema comprime el historial en un resumen cada 20 pasos, lo que garantiza que la ventana de contexto se centre siempre en los avances clave.
IV. Rendimiento en las pruebas: superando el punto de referencia
En las pruebas de referencia realizadas en mayo de 2026, Webwright obtuvo unos resultados excepcionales:
Online-Mind2Web: Webwright, basado en GPT-5.4, alcanzó una precisión del 86,67 % dentro de un presupuesto de 100 pasos, situándose entre las mejores soluciones de código abierto.
Odysseys (tareas de cadena larga): ante instrucciones complejas con una media de 272 palabras, Webwright + GPT-5.4 obtuvo una puntuación del 60,1 %, lo que supone un aumento de aproximadamente el 81,5 % en comparación con el GPT-5.4 básico (33,5 %), superando al campeón de la clasificación de abril, Opus4.6 (44,5 %).
Reacción del sector
La aparición de Webwright pone de relieve una tendencia importante: a medida que mejoran las capacidades de programación de los modelos, los agentes están evolucionando hacia un «paradigma de desarrollador». Al tratar el navegador como un punto final programable en lugar de como una mera interfaz interactiva, Webwright consigue elevar la eficiencia y la solidez de la ejecución de tareas web mediante IA a un nuevo nivel.
Para los desarrolladores, Webwright no es solo un marco de trabajo para agentes, sino un «superempleado» capaz de escribir, mantener y empaquetar automáticamente scripts de automatización. El proyecto ya es de código abierto en GitHub.
Artículo relacionado
Musk Consideró Dejar OpenAI a Sus Hijos Mientras Altman Declaraba
Esta mañana, el director ejecutivo de OpenAI, Sam Altman, prestó declaración para responder a la demanda presentada por su antiguo cofundador, Elon Musk, que cuestiona la estructura corporativa de la empresa.Cuando se le preguntó sobre la afirmación
Sam Altman desata un debate sobre la desaceleración de la IA
Escuchar enApple PodcastsEscuchar enSpotifyEl director ejecutivo de OpenAI, Sam Altman, sugirió recientemente que podría ser el momento de “regular el ritmo del desarrollo de la IA” para permitir que la sociedad “se fortalezca en torno a algunos de
Anthropic abre las puertas a la Agencia de Ciberseguridad de la UE mientras el modelo Mythos5 enfrenta un examen de cumplimiento
Las normativas de cumplimiento de la inteligencia artificial están avanzando considerablemente. La principal empresa de IA, Anthropic, ha otorgado oficialmente a la autoridad de ciberseguridad de la Unión Europea el acceso a su modelo de IA Mythos, u
Recomendaciones de temas especiales relacionados
comentario (1)
0/500
Microsoft Research ha publicado recientemente como código abierto su nuevo marco de trabajo para agentes web, Webwright. En lugar de basarse en el modelo de predicción convencional de «capturas de pantalla/clics en el DOM», este marco permite a los modelos de IA escribir directamente código Playwright y ejecutar comandos Bash en la terminal, lo que les permite realizar tareas web complejas de forma más eficiente y lógica.

I. Arquitectura central: un enfoque minimalista que da prioridad a la «terminal»
La filosofía de diseño de Webwright es sencilla: «Una terminal vale más que miles de abstracciones». El marco consta de unas 1.000 líneas de código divididas en tres módulos principales, sin ninguna orquestación compleja entre múltiples agentes:
Runner (unas 150 líneas): gestiona la lógica central del bucle del agente, encargándose del contexto y la ejecución.
Model Endpoint (unas 550 líneas): una interfaz unificada para la interacción con modelos, compatible con backends como OpenAI, Anthropic y OpenRouter.
Terminal Environment (unas 300 líneas): proporciona un entorno de ejecución aislado en la terminal donde el modelo puede ejecutar scripts de Playwright, ver registros, analizar capturas de pantalla y depurar.
Flujo de trabajo: El Runner envía el contexto de la tarea actual al modelo → el modelo genera un «proceso de pensamiento» y un «comando de Shell» → el entorno lo ejecuta y devuelve los resultados (salida, captura de pantalla, pila de errores) → el bucle continúa hasta que la tarea se completa.

II. ¿Por qué pasar de «hacer clics» a «escribir código»?
Los agentes más habituales en la actualidad controlan los navegadores prediciendo constantemente «clics, desplazamientos y entradas», lo que conlleva problemas de eficiencia y dificultades en la gestión del estado. El enfoque basado en código de Webwright ofrece claras ventajas:
Reutilización lógica: cada operación genera scripts de RPA (automatización robótica de procesos) reutilizables, en lugar de registros de clics de un solo uso. Estos scripts pueden reutilizarse en otras herramientas como Claude Code o Codex.
Gestión de lógica compleja: el código admite de forma natural bucles, funciones y ramificaciones. Para tareas de cadena larga, como el rellenado de formularios, las operaciones entre páginas y los saltos condicionales, la expresión mediante código supera con creces al simple apilamiento de acciones.
Corrección de errores de ingeniería: al analizar los rastros de pila tras los errores de ejecución, el modelo puede entrar de forma autónoma en un ciclo iterativo de «escribir código – ejecutar – detectar error – corregir», lo que aumenta significativamente las tasas de éxito de las tareas.
III. Avances en ingeniería: resolución del «éxito falso» y la «sobrecarga de contexto»
Webwright introduce soluciones específicas para dos problemas habituales de los agentes:
Mecanismo de autocomprobación de la puerta de control: evita que el modelo afirme falsamente que ha completado una tarea. El modelo debe generar primero una «configuración de autocomprobación» y ejecutar el script final en un entorno limpio. Solo después de que la autorreflexión confirme que la tarea se ha completado realmente, puede generar un marcador de finalización.
Compresión del historial: para gestionar la sobrecarga de contexto derivada de trayectorias largas, el sistema comprime el historial en un resumen cada 20 pasos, lo que garantiza que la ventana de contexto se centre siempre en los avances clave.
IV. Rendimiento en las pruebas: superando el punto de referencia
En las pruebas de referencia realizadas en mayo de 2026, Webwright obtuvo unos resultados excepcionales:
Online-Mind2Web: Webwright, basado en GPT-5.4, alcanzó una precisión del 86,67 % dentro de un presupuesto de 100 pasos, situándose entre las mejores soluciones de código abierto.
Odysseys (tareas de cadena larga): ante instrucciones complejas con una media de 272 palabras, Webwright + GPT-5.4 obtuvo una puntuación del 60,1 %, lo que supone un aumento de aproximadamente el 81,5 % en comparación con el GPT-5.4 básico (33,5 %), superando al campeón de la clasificación de abril, Opus4.6 (44,5 %).
Reacción del sector
La aparición de Webwright pone de relieve una tendencia importante: a medida que mejoran las capacidades de programación de los modelos, los agentes están evolucionando hacia un «paradigma de desarrollador». Al tratar el navegador como un punto final programable en lugar de como una mera interfaz interactiva, Webwright consigue elevar la eficiencia y la solidez de la ejecución de tareas web mediante IA a un nuevo nivel.
Para los desarrolladores, Webwright no es solo un marco de trabajo para agentes, sino un «superempleado» capaz de escribir, mantener y empaquetar automáticamente scripts de automatización. El proyecto ya es de código abierto en GitHub.
Musk Consideró Dejar OpenAI a Sus Hijos Mientras Altman Declaraba
Esta mañana, el director ejecutivo de OpenAI, Sam Altman, prestó declaración para responder a la demanda presentada por su antiguo cofundador, Elon Musk, que cuestiona la estructura corporativa de la empresa.Cuando se le preguntó sobre la afirmación
Sam Altman desata un debate sobre la desaceleración de la IA
Escuchar enApple PodcastsEscuchar enSpotifyEl director ejecutivo de OpenAI, Sam Altman, sugirió recientemente que podría ser el momento de “regular el ritmo del desarrollo de la IA” para permitir que la sociedad “se fortalezca en torno a algunos de
Anthropic abre las puertas a la Agencia de Ciberseguridad de la UE mientras el modelo Mythos5 enfrenta un examen de cumplimiento
Las normativas de cumplimiento de la inteligencia artificial están avanzando considerablemente. La principal empresa de IA, Anthropic, ha otorgado oficialmente a la autoridad de ciberseguridad de la Unión Europea el acceso a su modelo de IA Mythos, u











