Descrição
IDEFICS (Image-aware Decoder Enhanced à la Flamingo with Interleaved Cross-attention) é um modelo de linguagem visual de acesso aberto desenvolvido para promover a transparência e a democratização na IA. É uma reprodução aberta do Flamingo da DeepMind, um modelo de linguagem visual de ponta que não foi lançado publicamente. Semelhante a modelos como o GPT-4, o IDEFICS pode processar sequências arbitrárias de imagens e texto, gerando saídas de texto coerentes.
Construído exclusivamente com dados e modelos publicamente disponíveis, incluindo LLaMA v1 e OpenCLIP, o IDEFICS está disponível em duas variantes: uma versão base e uma versão instruída. Cada variante vem em dois tamanhos de parâmetros: 9 bilhões e 80 bilhões. O projeto enfatiza a transparência usando apenas dados públicos, fornecendo ferramentas para explorar conjuntos de dados de treinamento, compartilhando lições técnicas aprendidas e realizando avaliações éticas internas por meio de prompting adversarial (red teaming) antes do lançamento.
O IDEFICS se destaca em tarefas como responder perguntas sobre imagens, descrever conteúdo visual e criar histórias fundamentadas em várias imagens. Seu desempenho é comparável ao modelo Flamingo original de código fechado em vários benchmarks de compreensão de imagem-texto. O modelo foi treinado em uma mistura de conjuntos de dados abertamente disponíveis como Wikipedia, Public Multimodal Dataset e LAION, juntamente com um conjunto de dados recém-criado de 115B tokens chamado OBELICS, que compreende 141 milhões de documentos web de imagem-texto intercalados.
A equipe de desenvolvimento está comprometida em promover a pesquisa aberta em sistemas de IA multimodal. O IDEFICS visa servir como uma base robusta para a comunidade de IA, complementando outras reproduções abertas como o OpenFlamingo. A carta ética do projeto guiou as decisões, priorizando a autocrítica, a transparência e a justiça. Os usuários são encorajados a explorar a demonstração, os cartões do modelo e o cartão do conjunto de dados, e fornecer feedback para auxiliar na melhoria contínua desses modelos e na acessibilidade da IA multimodal em larga escala.
Destaques de IDEFICS Visual Language Model
Modelo de linguagem visual de acesso aberto
Reproduz capacidades de ponta
Aceita entradas de imagem e texto intercaladas
Gera saídas de texto
Desempenho comparável a modelos proprietários
Disponível em tamanhos de 9B e 80B parâmetros
Versões base e instruídas oferecidas
Treinado em dados e modelos publicamente disponíveis
Suporta pesquisa em IA multimodal
Inclui avaliação ética através de red teaming
Visualização interativa do conjunto de dados de treinamento disponível
Primeiros passos com IDEFICS Visual Language Model
Acessar modelo: Encontre os modelos IDEFICS no Hugging Face Hub.
Configurar ambiente: Certifique-se de ter a versão mais recente do transformers instalada.
Carregar modelo e processador: Importe as classes necessárias e carregue o checkpoint IDEFICS desejado.
Preparar entradas: Crie prompts com strings de texto intercaladas e URLs de imagem ou Imagens PIL.
Integrar via API: Use o método `generate` com entradas preparadas e argumentos de geração.
Decodificar saída: Processe os IDs gerados para obter texto legível por humanos.
Executar inferência: Execute o código para gerar texto com base em entradas multimodais.
Casos de uso de IDEFICS Visual Language Model
- Resposta a Perguntas sobre Imagens
- Descrição de Conteúdo Visual
- Contação de Histórias Multimodal
- Base para Pesquisa Aberta
- Transparência em IA
- Democratização da IA







