Descrição
O projeto BERT (Bidirectional Encoder Representations from Transformers) fornece modelos pré-treinados para tarefas de processamento de linguagem natural. Entre suas ofertas estão modelos multilíngues projetados para lidar com uma ampla gama de idiomas, permitindo compreensão e aplicações interlinguísticas. Atualmente, dois modelos multilíngues principais estão disponíveis: BERT-Base, Multilingual Cased (Novo, recomendado) e BERT-Base, Multilingual Uncased (Original, não recomendado).
O modelo BERT-Base, Multilingual Cased suporta 104 idiomas e apresenta uma arquitetura de 12 camadas com 768 unidades ocultas, 12 cabeças de atenção e 110 milhões de parâmetros. Este modelo é recomendado devido à sua normalização aprimorada para muitos idiomas, particularmente aqueles com alfabetos não latinos. Ao usar este modelo, é crucial definir `--do_lower_case=false` nos scripts de execução. O modelo Multilingual Uncased, embora suporte 102 idiomas com a mesma arquitetura, não é recomendado para novos projetos.
Para tarefas de idioma chinês, um modelo BERT-Base, Chinese dedicado também está disponível, suportando chinês simplificado e tradicional. Embora os modelos multilíngues incluam chinês, um modelo apenas para chinês pode render melhores resultados para ajuste fino específico para chinês. O desempenho desses modelos foi avaliado no conjunto de dados XNLI, uma tarefa de inferência de linguagem natural interlinguística. Os resultados indicam que, embora modelos de idioma único possam superar modelos multilíngues para idiomas de alta frequência, estes últimos oferecem uma solução prática para ampla cobertura de idiomas sem a necessidade de manter inúmeros modelos de idioma único.
O ajuste fino dos modelos BERT multilíngues não requer alterações significativas na API. No entanto, atualizações no `BasicTokenizer` podem ser necessárias para a tokenização de caracteres chineses. Os modelos podem ser integrados em fluxos de trabalho usando scripts fornecidos como `run_classifier.py`, que foi atualizado para suportar conjuntos de dados como XNLI. A estratégia de amostragem de dados para pré-treinamento envolveu ponderação exponencialmente suavizada de dados da Wikipedia para equilibrar idiomas de alta e baixa frequência, garantindo melhor representação para todos. A tokenização usa um vocabulário compartilhado WordPiece, com tratamento específico para idiomas CJK para lidar com a ausência de espaços em branco. O modelo multilíngue omite intencionalmente marcadores de idioma para facilitar as capacidades de aprendizado zero-shot.
Destaques de Modelos Multilíngues BERT
Suporta 104 idiomas (Multilingual Cased)
Suporta 102 idiomas (Multilingual Uncased)
Arquitetura Transformer de 12 camadas
768 unidades ocultas
12 cabeças de atenção
110 milhões de parâmetros
Modelo Multilingual Cased recomendado para normalização aprimorada
Capacidade de aprendizado zero-shot
Suporte para ajuste fino para tarefas específicas
Pré-treinado em dados da Wikipedia
Vocabulário compartilhado WordPiece
Lida com idiomas CJK com tokenização de caracteres
Código TensorFlow de código aberto disponível
Primeiros passos com Modelos Multilíngues BERT
Acessar modelo: Baixar modelos BERT multilíngues pré-treinados.
Configurar ambiente: Instalar TensorFlow e dependências necessárias.
Integrar via API: Carregar modelos e tokenizadores usando bibliotecas fornecidas.
Preparar dados: Formatar seus dados de texto multilíngues para treinamento ou inferência.
Ajustar fino: Adaptar o modelo para tarefas específicas downstream, como classificação ou resposta a perguntas.
Executar inferência: Usar o modelo ajustado para processar novos dados de texto.
Avaliar desempenho: Avaliar a precisão do modelo em benchmarks multilíngues relevantes.
Casos de uso de Modelos Multilíngues BERT
- Classificação interlinguística
- Análise de sentimento multilíngue
- Transferência interlinguística zero-shot
- Avaliação de tradução automática
- Resposta a perguntas multilíngue
- Recuperação de informação interlinguística
- Inferência de linguagem natural







