Aller au contenu principal
Accueil Métiers Vidéos Blog Outils Glossaire Voir le programme

Quantification

Réduction de la précision numérique des poids ou activations pour diminuer la mémoire et accélérer certains calculs.

Avancé

Sources vérifiées le .

La quantification réduit la précision numérique utilisée pour représenter les poids ou les activations d'un modèle. Passer vers des formats comme 8 bits ou 4 bits diminue la mémoire nécessaire et peut accélérer l'inférence sur un matériel compatible.

Définition complète

Un modèle peut être entraîné ou stocké avec des nombres en haute précision. La quantification représente ces valeurs avec moins de bits, selon une échelle et une méthode définies. Elle peut être appliquée après l'entraînement ou intégrée à une phase d'adaptation qui apprend à compenser les erreurs d'arrondi.

Le gain dépend du moteur et du matériel. Un fichier plus petit ne garantit pas une génération plus rapide si le processeur doit convertir les valeurs ou ne dispose pas de kernels adaptés. Une compression agressive peut aussi dégrader certains usages, en particulier le raisonnement, le code ou les sorties structurées.

Analogie pour comprendre

Compresser une photographie réduit son poids en représentant moins de nuances. L'image reste exploitable jusqu'à un certain seuil, puis les pertes deviennent visibles. La quantification applique un compromis comparable aux nombres du modèle.

En pratique

Le bon niveau se choisit sur le matériel cible avec un jeu de tâches représentatif. Il faut comparer la mémoire, le temps avant le premier token, le débit et la qualité des sorties. Le nom d'une quantification ne suffit pas, car les méthodes et les kernels diffèrent.

Termes liés

InférenceLLMOpen weight

Pour aller plus loin

Sources primaires

Questions fréquentes

Le poids des paramètres baisse fortement, mais le runtime conserve aussi des métadonnées, des caches et parfois des couches dans une précision différente. La mémoire totale ne suit donc pas une division exacte.

Elle introduit une approximation, mais son impact varie selon la méthode, le modèle et la tâche. Une évaluation sur les usages réels permet de vérifier si la perte est acceptable.