Descripción
WebVoyager es un innovador agente web impulsado por Modelos Multimodales Grandes (LMM) diseñado para completar instrucciones de usuario de extremo a extremo interactuando con sitios web del mundo real. Este proyecto proporciona el código y los datos para el artículo de WebVoyager, mostrando sus capacidades en navegación web multimodal y finalización de tareas.
El núcleo de WebVoyager reside en su capacidad para integrar información tanto textual como visual, lo que le permite comprender e interactuar con las páginas web de manera más efectiva. Emplea un enfoque de planificación generalista para la navegación, lo que le permite abordar una amplia gama de tareas web. El sistema se basa en un entorno de navegación web en línea, que se implementa utilizando Selenium, proporcionando una plataforma realista para pruebas y desarrollo.
Para facilitar la investigación y el desarrollo, WebVoyager incluye un conjunto de datos curado de consultas de tareas. Este conjunto de datos se generó utilizando un enfoque semi-automatizado, lo que resultó en 643 consultas de tareas distribuidas en 15 sitios web, y cada sitio web presentaba más de 40 consultas. Los datos están disponibles en `data/WebVoyager_data.jsonl`, y las respuestas de referencia se proporcionan en `data/reference_answer.json`. Además, el proyecto incorpora 90 tareas de navegación web extraídas del conjunto de datos GAIA, disponibles en `data/GAIA_web.jsonl`.
Para los usuarios que buscan expandir el conjunto de tareas, el proyecto sugiere usar GPT-4 para generar nuevas tareas. Se proporcionan instrucciones y ejemplos de prompts para guiar este proceso, enfatizando la diversidad y la resolubilidad dentro de sitios web específicos. La configuración implica la creación de un entorno conda, la instalación de dependencias a través de `requirements.txt` y la configuración del script `run.sh` con una clave API de OpenAI.
WebVoyager ofrece flexibilidad en su ejecución, admitiendo modos estándar y solo de texto, con parámetros ajustables para iteraciones máximas, imágenes adjuntas y temperatura del modelo. El proyecto también incluye un protocolo de evaluación automatizado que utiliza GPT-4V, detallado en el directorio `evaluation`, para evaluar el rendimiento del agente en las tareas completadas. Los resultados de las interacciones del agente, incluidos los mensajes y las capturas de pantalla, se guardan para su revisión y análisis humano.
Características principales de WebVoyager
Agente web integral impulsado por Modelos Multimodales Grandes (LMM)
Integra información textual y visual para la finalización de tareas web
Enfoque de planificación generalista para la navegación web
Entorno de navegación web en línea construido con Selenium
Conjunto de datos de 643 consultas de tareas web diversas en 15 sitios web
Tareas extraídas del conjunto de datos GAIA
Soporta la expansión de tareas usando GPT-4
Parámetros de ejecución configurables (iteraciones máximas, temperatura, modo headless)
Incluye un protocolo de evaluación automatizado usando GPT-4V
Guarda registros de interacción y capturas de pantalla para análisis
Primeros pasos con WebVoyager
Configurar Entorno: Cree un entorno conda, actívelo e instale las dependencias usando `pip install -r requirements.txt`.
Preparar Tareas: Copie las tareas de prueba deseadas en `data/tasks_test.jsonl`. Actualice manualmente las fechas para tareas sensibles al tiempo.
Configurar Clave API: Modifique la `api_key` en el script `run.sh` con su clave API de OpenAI.
Ejecutar WebVoyager: Ejecute el agente usando el comando `bash run.sh`.
Monitorear Resultados: Verifique el archivo `test_tasks.log` para ver la salida de ejecución y el `output_dir` para registros de interacción detallados y capturas de pantalla.
Casos de uso de WebVoyager
- Automatización de Tareas Web
- Investigación de Navegación Web
- Recopilación de Datos
- Desarrollo de Agentes de IA
- Pruebas de Interacción de Sitios Web







