Description
KServe a rejoint la CNCF, consolidant sa position en tant que standard open-source pour l'inférence IA auto-hébergée. Cette plateforme native de Kubernetes fournit une solution unifiée pour l'IA Générative et l'IA Prédictive, conçue pour être suffisamment simple pour des déploiements rapides, tout en étant suffisamment puissante pour les charges de travail de niveau entreprise.
Pour l'IA Générative, KServe propose des backends optimisés tels que vLLM et llm-d pour le service LLM haute performance. Elle dispose d'un protocole compatible OpenAI pour une intégration transparente, d'une accélération GPU avec une gestion optimisée de la mémoire et d'un cache de modèle pour réduire les temps de chargement. Les capacités avancées incluent le déchargement du cache KV pour la gestion de séquences plus longues, la mise à l'échelle automatique basée sur les requêtes, optimisée pour les charges de travail génératives, et le support natif des modèles Hugging Face pour un déploiement simplifié.
Dans le domaine de l'IA Prédictive, KServe prend en charge un large éventail de frameworks, notamment TensorFlow, PyTorch, scikit-learn, XGBoost et ONNX. Elle permet un routage intelligent entre les composants predictor, transformer et explainer, et facilite les déploiements avancés tels que les déploiements canary, les pipelines et les ensembles à l'aide d'InferenceGraph. La mise à l'échelle automatique, y compris le passage à zéro pour les charges de travail prédictives, est une fonctionnalité clé, aux côtés de l'explicabilité intégrée des modèles pour comprendre le raisonnement des prédictions et d'une surveillance avancée pour la journalisation des charges utiles, la détection des valeurs aberrantes, des attaques adverses et de la dérive. Son efficacité en termes de coûts est améliorée par les capacités de passage à zéro sur des ressources coûteuses lorsqu'elles ne sont pas utilisées.
KServe fournit une API simple mais puissante via une définition de ressource personnalisée (CRD) Kubernetes pour le service de modèles de machine learning. Elle abstrait les complexités de la mise à l'échelle automatique, du réseau, de la vérification de l'état et de la configuration du serveur, apportant des fonctionnalités de service de pointe aux déploiements ML.
L'architecture comprend un plan de contrôle qui gère le cycle de vie des modèles ML, y compris le suivi des révisions et les tests A/B, et un plan de données qui offre un protocole d'inférence standardisé pour les serveurs de modèles avec des API de requête/réponse. La ressource Kubernetes principale est l'InferenceService, qui simplifie le déploiement de modèles ML avec une mise à l'échelle automatique, un réseau et des vérifications de l'état. InferenceGraph permet des déploiements avancés avec des pipelines, des ensembles et des flux de travail multi-modèles. KServe est approuvé par les leaders de l'industrie pour une inférence de modèle fiable à grande échelle.
Fonctionnalités principales de KServe
Plateforme native de Kubernetes pour l'inférence IA
Service unifié pour l'IA Générative et Prédictive
Protocole compatible OpenAI pour les LLM
Accélération GPU et gestion optimisée de la mémoire
Mise en cache de modèles et déchargement du cache KV
Mise à l'échelle automatique basée sur les requêtes pour les charges de travail génératives
Support natif des modèles Hugging Face
Support multi-frameworks (TensorFlow, PyTorch, scikit-learn, XGBoost, ONNX)
Routage intelligent pour les prédicteurs, transformateurs et explainers
Déploiements avancés avec InferenceGraph (pipelines, ensembles)
Mise à l'échelle automatique à zéro pour les charges de travail prédictives
Explicabilité intégrée des modèles et attribution des caractéristiques
Surveillance avancée (journalisation des charges utiles, détection des valeurs aberrantes, adverses et de dérive)
API Kubernetes standard pour les frameworks ML
Déploiements canary et tests A/B pour les inférences
Comment utiliser KServe ?
Installer KServe : Déployez KServe et ses dépendances sur votre cluster Kubernetes.
Créer un InferenceService : Définissez une configuration YAML simple pour déployer un modèle pré-entraîné.
Configurer le Predictor : Spécifiez le format du modèle, les ressources (CPU, mémoire, GPU) et l'URI de stockage.
Envoyer des requêtes d'inférence : Effectuez des prédictions à l'aide du modèle déployé via des appels API.
Cas d'utilisation de KServe
- Service LLM
- Déploiement de modèles prédictifs
- Inférence IA à grande échelle
- Explicabilité des modèles
- Stratégies de déploiement avancées
- IA rentable
- Intégration des modèles Hugging Face





