Aller au contenu principal
Accueil Métiers Vidéos Blog Outils Glossaire Voir le programme

Mixture of Experts

Architecture où un routeur active seulement une partie des sous-réseaux experts pour traiter chaque token.

Avancé

Sources vérifiées le .

Une Mixture of Experts, souvent abrégée MoE, est une architecture de modèle qui contient plusieurs sous-réseaux experts. Un routeur interne sélectionne seulement une partie de ces experts pour chaque token au lieu d'activer tous les paramètres à chaque calcul.

Définition complète

Dans un Transformer dense, les mêmes blocs principaux participent à chaque passage. Une architecture MoE remplace certains blocs par plusieurs experts spécialisés et ajoute un mécanisme de routage. Le modèle peut donc posséder beaucoup de paramètres au total tout en n'en activant qu'une fraction pour une entrée donnée.

Cette sparsité réduit le calcul actif par rapport à un modèle dense de taille totale comparable, mais elle ajoute des contraintes d'infrastructure. Les experts doivent être répartis sur le matériel, les tokens équilibrés entre eux et les communications maîtrisées. Le nombre total de paramètres ne suffit donc pas à prédire le coût réel, la latence ou la qualité.

Analogie pour comprendre

Un cabinet réunit plusieurs spécialistes, mais chaque dossier est envoyé aux 2 personnes les plus pertinentes au lieu de mobiliser toute l'équipe. Le cabinet reste large, tandis que le travail actif sur un dossier reste limité.

En pratique

Pour comparer un modèle MoE à un modèle dense, les métriques utiles sont la mémoire nécessaire, le nombre de paramètres activés, le débit sur le matériel visé et la qualité sur tes tâches. Une fiche marketing qui annonce seulement les paramètres totaux ne permet pas de dimensionner un serveur.

Termes liés

TransformerModèle de fondationRoutage de modèles

Pour aller plus loin

Sources primaires

Questions fréquentes

Les experts appartiennent au même modèle et sont coordonnés par son routeur interne. Cette architecture diffère d'un système qui envoie des requêtes à plusieurs API ou modèles indépendants.

Non. La qualité dépend aussi de l'entraînement, du routage, des données et de l'équilibre entre experts. L'infrastructure peut même perdre en efficacité si les communications ou la charge sont mal gérées.