Description
Hugging Face Transformers sert de framework de définition de modèles fondamental pour les modèles d'apprentissage automatique de pointe dans divers domaines, y compris le texte, la vision par ordinateur, l'audio, la vidéo et les applications multimodales. Son objectif principal est de centraliser les définitions de modèles, favorisant ainsi l'accord et la compatibilité dans l'ensemble de l'écosystème de l'IA. Ce framework agit comme un pivot crucial, garantissant que les modèles qui y sont définis sont compatibles avec un large éventail de frameworks d'entraînement tels qu'Axolotl, Unsloth, DeepSpeed, FSDP et PyTorch-Lightning. De plus, il s'intègre de manière transparente avec les moteurs d'inférence comme vLLM, SGLang et TGI, ainsi qu'avec les bibliothèques de modélisation adjacentes comme llama.cpp et mlx, qui exploitent tous les définitions de modèles fournies par Transformers.
Hugging Face s'engage à prendre en charge les nouveaux modèles de pointe et à démocratiser leur accessibilité. Ceci est réalisé en rendant les définitions de modèles simples, personnalisables et efficaces. Le Hugging Face Hub héberge plus d'un million de points de contrôle de modèles Transformers, facilement disponibles pour que les utilisateurs puissent les explorer et les intégrer dans leurs projets. La plateforme propose également une chronologie des modèles, présentant les dernières architectures dans les domaines du texte, de la vision, de l'audio et du multimodal.
Le framework Transformers est conçu pour fournir aux utilisateurs tout ce qui est nécessaire pour l'inférence et l'entraînement avec des modèles pré-entraînés avancés. Les fonctionnalités clés incluent une classe `Pipeline`, qui offre une interface d'inférence simple et optimisée pour de nombreuses tâches d'apprentissage automatique telles que la génération de texte, la segmentation d'images, la reconnaissance automatique de la parole et la réponse aux questions sur documents. Pour l'entraînement, la classe `Trainer` offre un support complet pour des fonctionnalités telles que la précision mixte, torch.compile et FlashAttention, facilitant l'entraînement sur un seul appareil et l'entraînement distribué pour les modèles PyTorch. De plus, la fonction `generate` permet une génération de texte rapide avec les grands modèles linguistiques (LLM) et les modèles vision-langage (VLM), prenant en charge le streaming et diverses stratégies de décodage.
Les principes de conception de Transformers mettent l'accent sur la vitesse et la facilité d'utilisation. Chaque modèle est implémenté à l'aide de trois classes principales : configuration, modèle et préprocesseur, permettant un déploiement rapide dans des scénarios d'inférence ou d'entraînement via `Pipeline` ou `Trainer`. Le framework préconise fortement l'utilisation de modèles pré-entraînés pour réduire l'empreinte carbone, les coûts de calcul et le temps de développement. Chaque modèle pré-entraîné est méticuleusement reproduit pour correspondre le plus fidèlement possible à l'original, offrant des performances de pointe. Pour ceux qui débutent avec Transformers ou qui cherchent à approfondir leur compréhension, Hugging Face propose un cours sur les LLM qui couvre les fondamentaux des modèles, les applications pratiques, la curation de données, le fine-tuning et les capacités de raisonnement, proposant à la fois du contenu théorique et des exercices pratiques.
Fonctionnalités principales de Transformers Hugging Face
Définitions de modèles centralisées pour les modèles texte, vision, audio, vidéo et multimodaux
Compatibilité avec les principaux frameworks d'entraînement (Axolotl, Unsloth, DeepSpeed, FSDP, PyTorch-Lightning)
Intégration avec les moteurs d'inférence (vLLM, SGLang, TGI)
Support pour les bibliothèques de modélisation adjacentes (llama.cpp, mlx)
Plus d'un million de points de contrôle de modèles Transformers disponibles sur Hugging Face Hub
Classe Pipeline pour une inférence simple et optimisée sur diverses tâches ML
Classe Trainer pour des fonctionnalités d'entraînement complètes, y compris la précision mixte et l'entraînement distribué
Génération de texte rapide avec les LLM et VLM, y compris le support du streaming
Modèles implémentés à l'aide des classes de configuration, de modèle et de préprocesseur pour une facilité d'utilisation
Accent mis sur l'utilisation de modèles pré-entraînés pour économiser du calcul et du temps
Accès à une chronologie des dernières architectures de modèles
Cours LLM disponible pour apprendre les modèles Transformers et leurs applications
Premiers pas avec Transformers Hugging Face
Installation : Installez la bibliothèque Transformers à l'aide de votre gestionnaire de paquets préféré.
Configuration : Définissez les configurations des modèles, y compris les paramètres et les détails de l'architecture.
Chargement de modèle : Chargez des modèles pré-entraînés ou des modèles entraînés personnalisés depuis le Hugging Face Hub ou le stockage local.
Inférence : Utilisez la classe Pipeline pour une inférence simple sur diverses tâches.
Entraînement : Employez la classe Trainer pour un entraînement et un fine-tuning efficaces des modèles.
Déploiement : Intégrez les modèles entraînés dans des applications pour une utilisation en production.
Optimisation : Tirez parti de fonctionnalités telles que la précision mixte et FlashAttention pour des gains de performance.
Cas d'utilisation de Transformers Hugging Face
- Génération de texte
- Segmentation d'images
- Reconnaissance vocale
- Réponse aux questions sur documents
- Entraînement de modèles
- Inférence de modèles
- Applications multimodales







