Descrição
WebVoyager é um agente web inovador baseado em Modelo Multimodal Grande (LMM) projetado para completar instruções do usuário de ponta a ponta, interagindo com sites do mundo real. Este projeto fornece o código e os dados para o artigo do WebVoyager, demonstrando suas capacidades em navegação multimodal na web e conclusão de tarefas.
O cerne do WebVoyager reside em sua capacidade de integrar informações textuais e visuais, permitindo-lhe compreender e interagir com páginas da web de forma mais eficaz. Ele emprega uma abordagem de planejamento generalista para navegação, permitindo-lhe lidar com uma gama diversificada de tarefas na web. O sistema é construído sobre um ambiente de navegação online, que é implementado usando Selenium, fornecendo uma plataforma realista para testes e desenvolvimento.
Para facilitar a pesquisa e o desenvolvimento, o WebVoyager inclui um conjunto de dados curado de consultas de tarefas. Este conjunto de dados foi gerado usando uma abordagem semi-automatizada, resultando em 643 consultas de tarefas distribuídas por 15 sites, com cada site apresentando mais de 40 consultas. Os dados estão disponíveis em `data/WebVoyager_data.jsonl`, e respostas de referência são fornecidas em `data/reference_answer.json`. Adicionalmente, o projeto incorpora 90 tarefas de navegação na web extraídas do conjunto de dados GAIA, disponíveis em `data/GAIA_web.jsonl`.
Para usuários que buscam expandir o conjunto de tarefas, o projeto sugere o uso do GPT-4 para gerar novas tarefas. Instruções e exemplos de prompts são fornecidos para guiar este processo, enfatizando a diversidade e a solucionabilidade dentro de sites específicos. A configuração envolve a criação de um ambiente conda, a instalação de dependências via `requirements.txt` e a configuração do script `run.sh` com uma chave de API da OpenAI.
WebVoyager oferece flexibilidade em sua execução, suportando modos padrão e apenas texto, com parâmetros ajustáveis para iterações máximas, imagens anexadas e temperatura do modelo. O projeto também inclui um protocolo de avaliação automatizado usando GPT-4V, detalhado no diretório `evaluation`, para avaliar o desempenho do agente nas tarefas concluídas. Os resultados das interações do agente, incluindo mensagens e capturas de tela, são salvos para revisão e análise humana.
Recursos principais de WebVoyager
Agente web end-to-end alimentado por Modelos Multimodais Grandes (LMMs)
Integra informações textuais e visuais para conclusão de tarefas na web
Abordagem de planejamento generalista para navegação na web
Ambiente de navegação online construído com Selenium
Conjunto de dados de 643 consultas de tarefas diversas em 15 sites
Tarefas extraídas do conjunto de dados GAIA
Suporta expansão de tarefas usando GPT-4
Parâmetros de execução configuráveis (iterações máximas, temperatura, modo headless)
Inclui protocolo de avaliação automatizado usando GPT-4V
Salva logs de interação e capturas de tela para análise
Primeiros passos com WebVoyager
Configurar Ambiente: Crie um ambiente conda, ative-o e instale as dependências usando `pip install -r requirements.txt`.
Preparar Tarefas: Copie as tarefas de teste desejadas para `data/tasks_test.jsonl`. Atualize manualmente as datas para tarefas sensíveis ao tempo.
Configurar Chave de API: Modifique a `api_key` no script `run.sh` com sua chave de API da OpenAI.
Executar WebVoyager: Execute o agente usando o comando `bash run.sh`.
Monitorar Resultados: Verifique o arquivo `test_tasks.log` para a saída de execução e o `output_dir` para logs de interação detalhados e capturas de tela.
Casos de uso de WebVoyager
- Automação de Tarefas na Web
- Pesquisa em Navegação na Web
- Coleta de Dados
- Desenvolvimento de Agentes de IA
- Testes de Interação com Sites







