Inférence
Phase où un modèle déjà entraîné traite une entrée pour produire une prédiction, une classification ou du texte.
IntermédiaireSources vérifiées le .
L'inférence est l'exécution d'un modèle déjà entraîné sur une nouvelle entrée afin de produire un résultat. Pour un LLM, elle transforme le prompt en représentations numériques puis génère les tokens de sortie les uns après les autres.
Définition complète
L'entraînement ajuste les poids du modèle à partir de données. L'inférence utilise ces poids sans les réentraîner pour répondre à une requête. Dans un service de génération de texte, le serveur charge le modèle, prépare le prompt, calcule son contexte puis décode la réponse token par token.
Le coût dépend notamment de la taille du modèle, du volume de tokens, de la précision numérique, du matériel et de la stratégie de regroupement des requêtes. Le serving désigne l'ensemble du service qui expose cette inférence à des utilisateurs, avec une API, une file d'attente, des limites, des métriques et parfois plusieurs machines.
Analogie pour comprendre
L'entraînement ressemble à l'apprentissage d'un métier. L'inférence correspond au moment où la personne utilise ce qu'elle a appris pour traiter un nouveau dossier. Le serveur organise les dossiers et les ressources autour d'elle.
En pratique
Pour évaluer une infrastructure d'inférence, le temps avant le premier token, le débit de génération, la mémoire utilisée et le nombre de requêtes simultanées sont plus utiles qu'une vitesse unique. Le même modèle peut présenter des résultats très différents selon le moteur et le matériel.
Termes liés
Pour aller plus loin
Sources primaires
Questions fréquentes
Une inférence standard utilise les poids existants sans les entraîner. Certaines applications enregistrent toutefois le contexte ou les retours dans une mémoire externe, ce qui modifie le système sans changer les poids du modèle.
La taille du modèle, la mémoire disponible, la précision, le moteur et le matériel limitent le débit. Un modèle qui dépasse la mémoire rapide peut provoquer des transferts ou un chargement partiel beaucoup plus lent.