Les plus grands modèles d'IA librement accessibles renferment aujourd'hui des centaines de milliards de nombres ajustables, et parfois plus d'un millier de milliards. Ces nombres, appelés paramètres, sont ce que le modèle a appris pendant son entraînement, et chacun d'eux doit tenir dans la mémoire rapide des puces graphiques avant que le modèle puisse répondre à la moindre question. Cette mémoire est rare et coûteuse, et pour les plus grands modèles, même une machine bien équipée peine à contenir l'ensemble d'un seul coup.
Beaucoup de ces modèles sont construits selon une approche dite du mélange d'experts. Le modèle conserve une vaste collection de sous-réseaux spécialisés et n'en utilise que quelques-uns pour chaque mot qu'il lit ou qu'il écrit. Cela le rend rapide à exécuter, mais ne réduit en rien la masse de poids qui doit rester en mémoire. Un article de recherche paru en 2025 propose une méthode, nommée MoBE, pour réduire cette masse. Polora a soumis cet article à plusieurs modèles d'IA conçus par des entreprises différentes et leur a demandé de l'examiner ensemble : que permet réellement la méthode, et à quoi une équipe faisant tourner un tel modèle devrait-elle renoncer ?
Ce que la méthode change
À l'intérieur d'un de ces modèles, chaque expert possède ses propres grandes tables de nombres. Le point de départ de l'article est le constat que ces tables se recoupent largement. Les experts diffèrent les uns des autres, mais ils partagent aussi une bonne part de structure commune. MoBE conserve une petite table qui reste propre à chaque expert et remplace l'essentiel du reste par un jeu de blocs communs, dans lequel puise chaque expert d'une même couche, chacun selon ses propres proportions.
L'économie vient de là : ranger un seul jeu partagé une fois pour toutes, au lieu d'une copie complète à l'intérieur de chaque expert. La méthode apprend ces blocs communs en les ajustant aux poids existants du modèle, sans avoir besoin de nouvelles données d'entraînement.
Le chiffre mis en avant
Sur des modèles comme Qwen3, DeepSeek-V3 avec ses 671 milliards de paramètres et Kimi-K2 avec ses mille milliards, l'article fait état d'une réduction de 24 à 30 % du nombre total de paramètres tout en conservant environ 98 % de la précision, mesurée sur quinze tests standard. Cela revient à une perte moyenne de un à deux points. Les auteurs affirment que ce résultat tient nettement mieux que les approches de compression antérieures, à compression égale ou supérieure.
Pour donner une idée de l'échelle, un des relecteurs IA a estimé que retrancher 30 % d'un modèle de 671 milliards de paramètres supprime de l'ordre de plusieurs centaines de gigaoctets de poids stockés, ce qui détermine le nombre de puces nécessaires rien que pour contenir le modèle.
Pourquoi c'est plus doux que de retirer des experts
Une famille de méthodes plus ancienne réduit ces modèles en supprimant des experts entiers ou en fusionnant ceux qui se ressemblent. L'article soutient que cela jette définitivement des compétences spécialisées et tend à dégrader la précision. MoBE laisse chaque expert en place et se contente de réécrire la façon dont il est stocké, et les deux relecteurs IA ont désigné ce point comme l'avantage central de la méthode par rapport au retrait d'experts.
Plus petit ne veut pas dire plus rapide
C'est le principal renoncement pour une équipe. Les deux relecteurs IA ont insisté sur le fait que MoBE économise de la mémoire, pas du temps. Reconstruire chaque expert à partir de ses blocs communs ajoute des étapes supplémentaires, de sorte que, sur un logiciel de service ordinaire, le modèle compressé peut en réalité tourner plus lentement, à moins qu'une équipe n'écrive du nouveau code de bas niveau taillé pour lui. L'article le reconnaît lui-même et indique qu'une routine conçue sur mesure est nécessaire pour exploiter tout le potentiel de la méthode.
Ces étapes supplémentaires peuvent même accroître la quantité de calcul par mot. Pour compenser, les auteurs proposent une variante qui utilise moins d'experts pour chaque mot, en passant de huit à six. Cela récupère un peu d'efficacité, mais c'est un nouveau petit compromis au détriment de la qualité.
Où se loge la perte de précision
La baisse moyenne est faible, mais elle n'est pas répartie uniformément, et c'est un point sur lequel les deux relecteurs sont revenus. Sur DeepSeek-V3, un test difficile de mathématiques de compétition est passé d'un score de 56,9 à 52,3, et un second de 47,3 à 40,6. Sur Kimi-K2, un test de sciences de niveau supérieur est descendu de 77,4 à 73,2. Les tests de connaissances générales, à l'inverse, ont à peine bougé.
Les relecteurs en ont tiré la même conclusion : une équipe qui sert de la conversation générale ne remarquera peut-être jamais la différence, tandis qu'une équipe qui s'appuie sur les mathématiques, la programmation ou un raisonnement soigneux étape par étape devrait tester le modèle compressé sur son propre travail plutôt que de se fier à la moyenne mise en avant.

Une partie seulement du modèle rétrécit
MoBE ne compresse que deux des tables à l'intérieur de chaque expert. Elle en laisse volontairement une troisième intacte, au motif qu'elle détient des connaissances essentielles, et elle ne touche ni au mécanisme d'attention du modèle ni à ses tables de vocabulaire. Les relecteurs ont ajouté qu'elle ne fait rien non plus pour la mémoire servant à suivre une longue conversation, qui peut prendre le dessus lorsque de nombreuses personnes sont servies en même temps ou lorsque les documents sont longs. Le soulagement réel sur un système en fonctionnement est donc plus modeste que ne le laisserait croire le seul chiffre de 24 à 30 %.
Qui aurait intérêt à s'en servir
Les relecteurs ont abouti au même endroit. Pour une équipe dont la principale contrainte est de faire tenir un modèle géant dans une mémoire rare et coûteuse, MoBE offre une réduction bien réelle, avec des dommages inhabituellement faibles pour la précision, et sans réentraînement. Pour une équipe dont le vrai problème est la vitesse, le coût par mot ou la qualité de raisonnement au plus haut niveau, ce n'est pas un gain gratuit, car elle réclame une ingénierie sur mesure et une tolérance à de moins bons résultats sur les tâches les plus difficiles.
La façon honnête de lire ce résultat, c'est donc que le chiffre des paramètres est une économie de stockage. Il dit à quel point le modèle devient plus facile à garder en mémoire, et il ne doit pas être pris pour une réponse moins chère ou plus rapide.









