Descrição
UL2 20B representa um avanço significativo no pré-treinamento de modelos de linguagem, oferecendo um framework unificado que aprimora o desempenho em diversas tarefas e configurações. Desenvolvido pelo Google Research, este modelo de código aberto aborda as limitações dos paradigmas existentes, que muitas vezes se destacam em fine-tuning ou aprendizado few-shot in-context, mas lutam com o outro.
Modelos de linguagem tradicionais geralmente se enquadram em duas categorias: arquiteturas autoregressivas apenas de decodificador (como GPT-3) que preveem a próxima palavra, e arquiteturas encoder-decoder baseadas em corrupção de span (como T5) que recuperam texto mascarado. Enquanto modelos autoregressivos são proficientes em geração aberta e aprendizado baseado em prompts, eles podem ter desempenho inferior em tarefas de fine-tuning. Inversamente, modelos do tipo T5 têm bom desempenho em fine-tuning supervisionado, mas são menos eficazes em cenários few-shot. O UL2 preenche essa lacuna unificando essas abordagens.
A inovação central do UL2 reside em seu novo paradigma de pré-treinamento, o Unified Language Learner (UL2). Este framework enquadra diferentes objetivos de treinamento como tarefas de denoising, onde o modelo aprende a reconstruir sub-sequências ausentes do texto de entrada. Durante o pré-treinamento, o UL2 emprega uma mistura única de denoisers, amostrando de uma variedade de objetivos com diferentes configurações. Essa abordagem permite que o modelo se beneficie das forças de múltiplas estratégias de treinamento simultaneamente, mitigando fraquezas individuais.
A mistura de denoisers do UL2 inclui três tarefas principais: R-denoising (corrupção de span padrão), X-denoising (corrupção de span extrema) e S-denoising (PrefixLM sequencial). Ao amostrar dessas tarefas com base em proporções especificadas pelo usuário e anexar um token de paradigma (por exemplo, [R], [X], [S]) para indicar a tarefa, o UL2 treina um modelo de linguagem mais versátil e robusto. Essa abordagem unificada leva a um desempenho aprimorado em geração, compreensão de linguagem, recuperação, compreensão de textos longos e resposta a perguntas.
O modelo UL2 20B, com seus 20 bilhões de parâmetros, demonstra capacidades excepcionais em prompting few-shot e raciocínio chain-of-thought (CoT). Ele supera outros modelos de ponta como PaLM e T5 em tarefas como sumarização 1-shot (XSUM), alcançando pontuações ROUGE superiores. Além disso, o UL2 20B permite prompting e raciocínio CoT em uma escala acessível, tornando técnicas de raciocínio avançadas disponíveis para uma comunidade de pesquisa mais ampla. O lançamento público dos checkpoints do UL2 20B visa acelerar o progresso no desenvolvimento de melhores modelos de linguagem dentro da comunidade de aprendizado de máquina.
Destaques de UL2 20B
Paradigma unificado de aprendizado de linguagem
Objetivo de pré-treinamento de mistura de denoisers
Suporta tarefas R-denoising, X-denoising e S-denoising
Melhora o desempenho em tarefas de fine-tuning
Aprimora as capacidades de aprendizado few-shot in-context
Destaca-se em geração aberta
Forte desempenho em compreensão de linguagem
Eficaz para tarefas de recuperação
Capaz de compreensão de textos longos
Auxilia em tarefas de resposta a perguntas
Checkpoints de modelo de 20 bilhões de parâmetros lançados publicamente
Permite prompting chain-of-thought (CoT)
Facilita o raciocínio em escala acessível
Primeiros passos com UL2 20B
Acessar modelo: Obter os checkpoints do modelo UL2 20B.
Configurar ambiente: Configurar bibliotecas e infraestrutura necessárias.
Integrar via API: Carregar o modelo e preparar os dados de entrada.
Definir tarefa: Especificar a tarefa de linguagem desejada (por exemplo, sumarização, QA).
Executar inferência: Processar os dados de entrada através do modelo.
Avaliar resultados: Analisar as saídas do modelo para desempenho.
Casos de uso de UL2 20B
- Aprendizado Few-Shot
- Geração de Texto
- Compreensão de Linguagem
- Resposta a Perguntas
- Sumarização
- Tarefas de Raciocínio
- Recuperação de Informação





