Une méthode pour réduire les modèles d'IA géants, et son coût caché

Une nouvelle méthode réduit jusqu'à 30 % l'empreinte mémoire d'un grand modèle d'IA, avec une perte de précision moyenne minime. Mais elle n'accélère rien, et ce sont les tâches les plus difficiles qui en pâtissent le plus.

Explique : MoBE: Mixture-of-Basis-Experts for Compressing MoE-based LLMs, Xiaodong Chen et al., 2025-08-07, v1 Lire l'original

IA et société · 2026-09-08

Les plus grands modèles d'IA librement accessibles renferment aujourd'hui des centaines de milliards de nombres ajustables, et parfois plus d'un millier de milliards. Ces nombres, appelés paramètres, sont ce que le modèle a appris pendant son entraînement, et chacun d'eux doit tenir dans la mémoire rapide des puces graphiques avant que le modèle puisse répondre à la moindre question. Cette mémoire est rare et coûteuse, et pour les plus grands modèles, même une machine bien équipée peine à contenir l'ensemble d'un seul coup.

Beaucoup de ces modèles sont construits selon une approche dite du mélange d'experts. Le modèle conserve une vaste collection de sous-réseaux spécialisés et n'en utilise que quelques-uns pour chaque mot qu'il lit ou qu'il écrit. Cela le rend rapide à exécuter, mais ne réduit en rien la masse de poids qui doit rester en mémoire. Un article de recherche paru en 2025 propose une méthode, nommée MoBE, pour réduire cette masse. Polora a soumis cet article à plusieurs modèles d'IA conçus par des entreprises différentes et leur a demandé de l'examiner ensemble : que permet réellement la méthode, et à quoi une équipe faisant tourner un tel modèle devrait-elle renoncer ?

Ce que la méthode change

À l'intérieur d'un de ces modèles, chaque expert possède ses propres grandes tables de nombres. Le point de départ de l'article est le constat que ces tables se recoupent largement. Les experts diffèrent les uns des autres, mais ils partagent aussi une bonne part de structure commune. MoBE conserve une petite table qui reste propre à chaque expert et remplace l'essentiel du reste par un jeu de blocs communs, dans lequel puise chaque expert d'une même couche, chacun selon ses propres proportions.

L'économie vient de là : ranger un seul jeu partagé une fois pour toutes, au lieu d'une copie complète à l'intérieur de chaque expert. La méthode apprend ces blocs communs en les ajustant aux poids existants du modèle, sans avoir besoin de nouvelles données d'entraînement.

Le chiffre mis en avant

Sur des modèles comme Qwen3, DeepSeek-V3 avec ses 671 milliards de paramètres et Kimi-K2 avec ses mille milliards, l'article fait état d'une réduction de 24 à 30 % du nombre total de paramètres tout en conservant environ 98 % de la précision, mesurée sur quinze tests standard. Cela revient à une perte moyenne de un à deux points. Les auteurs affirment que ce résultat tient nettement mieux que les approches de compression antérieures, à compression égale ou supérieure.

Pour donner une idée de l'échelle, un des relecteurs IA a estimé que retrancher 30 % d'un modèle de 671 milliards de paramètres supprime de l'ordre de plusieurs centaines de gigaoctets de poids stockés, ce qui détermine le nombre de puces nécessaires rien que pour contenir le modèle.

Pourquoi c'est plus doux que de retirer des experts

Une famille de méthodes plus ancienne réduit ces modèles en supprimant des experts entiers ou en fusionnant ceux qui se ressemblent. L'article soutient que cela jette définitivement des compétences spécialisées et tend à dégrader la précision. MoBE laisse chaque expert en place et se contente de réécrire la façon dont il est stocké, et les deux relecteurs IA ont désigné ce point comme l'avantage central de la méthode par rapport au retrait d'experts.

Plus petit ne veut pas dire plus rapide

C'est le principal renoncement pour une équipe. Les deux relecteurs IA ont insisté sur le fait que MoBE économise de la mémoire, pas du temps. Reconstruire chaque expert à partir de ses blocs communs ajoute des étapes supplémentaires, de sorte que, sur un logiciel de service ordinaire, le modèle compressé peut en réalité tourner plus lentement, à moins qu'une équipe n'écrive du nouveau code de bas niveau taillé pour lui. L'article le reconnaît lui-même et indique qu'une routine conçue sur mesure est nécessaire pour exploiter tout le potentiel de la méthode.

Ces étapes supplémentaires peuvent même accroître la quantité de calcul par mot. Pour compenser, les auteurs proposent une variante qui utilise moins d'experts pour chaque mot, en passant de huit à six. Cela récupère un peu d'efficacité, mais c'est un nouveau petit compromis au détriment de la qualité.

Où se loge la perte de précision

La baisse moyenne est faible, mais elle n'est pas répartie uniformément, et c'est un point sur lequel les deux relecteurs sont revenus. Sur DeepSeek-V3, un test difficile de mathématiques de compétition est passé d'un score de 56,9 à 52,3, et un second de 47,3 à 40,6. Sur Kimi-K2, un test de sciences de niveau supérieur est descendu de 77,4 à 73,2. Les tests de connaissances générales, à l'inverse, ont à peine bougé.

Les relecteurs en ont tiré la même conclusion : une équipe qui sert de la conversation générale ne remarquera peut-être jamais la différence, tandis qu'une équipe qui s'appuie sur les mathématiques, la programmation ou un raisonnement soigneux étape par étape devrait tester le modèle compressé sur son propre travail plutôt que de se fier à la moyenne mise en avant.

Scores avant et après compression sur trois tests difficiles. · Maths de compétition (DeepSeek) avant 56,9 · Maths de compétition (DeepSeek) après 52,3 · 2e test de maths (DeepSeek) avant 47,3 · 2e test de maths (DeepSeek) après 40,6 · Sciences de niveau supérieur (Kimi) avant 77,4 · Sciences de niv
Scores avant et après compression sur trois tests difficiles. · Maths de compétition (DeepSeek) avant 56,9 · Maths de compétition (DeepSeek) après 52,3 · 2e test de maths (DeepSeek) avant 47,3 · 2e test de maths (DeepSeek) après 40,6 · Sciences de niveau supérieur (Kimi) avant 77,4 · Sciences de niv

Une partie seulement du modèle rétrécit

MoBE ne compresse que deux des tables à l'intérieur de chaque expert. Elle en laisse volontairement une troisième intacte, au motif qu'elle détient des connaissances essentielles, et elle ne touche ni au mécanisme d'attention du modèle ni à ses tables de vocabulaire. Les relecteurs ont ajouté qu'elle ne fait rien non plus pour la mémoire servant à suivre une longue conversation, qui peut prendre le dessus lorsque de nombreuses personnes sont servies en même temps ou lorsque les documents sont longs. Le soulagement réel sur un système en fonctionnement est donc plus modeste que ne le laisserait croire le seul chiffre de 24 à 30 %.

Qui aurait intérêt à s'en servir

Les relecteurs ont abouti au même endroit. Pour une équipe dont la principale contrainte est de faire tenir un modèle géant dans une mémoire rare et coûteuse, MoBE offre une réduction bien réelle, avec des dommages inhabituellement faibles pour la précision, et sans réentraînement. Pour une équipe dont le vrai problème est la vitesse, le coût par mot ou la qualité de raisonnement au plus haut niveau, ce n'est pas un gain gratuit, car elle réclame une ingénierie sur mesure et une tolérance à de moins bons résultats sur les tâches les plus difficiles.

La façon honnête de lire ce résultat, c'est donc que le chiffre des paramètres est une économie de stockage. Il dit à quel point le modèle devient plus facile à garder en mémoire, et il ne doit pas être pris pour une réponse moins chère ou plus rapide.

Une méthode pour réduire les modèles d'IA géants, et son coût cachéUne méthode pour réduire les modèles d'IA géants, et son coût cachéLes plus grands modèles d'IA renferment des centaines de milliards de paramètres qui doivent tenir dans une mémoire rare et coûteuse. Un article de 2025 propose une méthode, MoBE, pour réduire cette masse. · ※ paramètre : un des nombres ajustables qu'un modèle apprend pendant son entraînementCe que la méthode changeLe chiffre mis en avantPourquoi c'est plus doux que de retirer des expertsPlus petit ne veut pas dire plus rapide · ※ relecteur : un des modèles d'IA que Polora a réunis pour examiner l'article ensembleOù se loge la perte de précision · Scores avant et après compression sur trois tests difficiles.MoBE allège la mémoire d'un modèle géant sans presque toucher à la précision moyenne, mais n'accélère rien et fait souffrir surtout les tâches les plus difficiles.Sources arxiv.org · MoBE: Mixture-of-Basis-Experts for Compressing MoE-based LLMs, github.com · MoBE source code

What does this compression method actually achieve, and what would a team running large models have to give up to use it?

Machine Learning Research Scientist · gpt-5.6-terra

MoBE is primarily a weight-memory/storage compression technique for Mixture-of-Experts models, not a free inference-speed upgrade. What it achieves In a conventional MoE layer, every expert has its own large gate and up-projection matrices. MoBE replaces those matrices with: - a smaller expert-specific matrix \(A_i\), preserving much of each expert’s individuality; and - a small collection of layer-wide shared basis matrices \(B_j\), mixed with per-expert coefficients. So it exploits the idea that experts differ, but also contain substantial reusable structure. The reported result is meaningful at the scale of deployment: - 24–30% reduction in total model parameters for models such as Qwen3-235B, DeepSeek-V3 (671B), and Kimi-K2 (1T); - about 1–2 absolute points average benchmark loss in the headline result, roughly 2% relative loss; - substantially better retention than the paper’s pruning and SVD-style decomposition baselines at comparable compression levels. Put concretely, a 671B-parameter checkpoint compressed by 30% is roughly a 200B-parameter reduction in stored weights. At BF16, that is on the order of 400 GB less weight storage bef…

Deep Learning Systems Architect · deepseek-v4-pro

Short answer: MoBE is primarily a weight-memory/storage win, not an automatic compute or latency win. It shrinks total parameters by 24–30% on Qwen3-235B-A22B-2507, DeepSeek-V3-0324, and Kimi-K2-Instruct while retaining roughly 98% of average accuracy. But a deployment team pays for that in activation overhead, kernel engineering, and operational complexity. What it actually achieves The core idea: for each expert’s gate/up matrix, instead of storing full \(W_i\), MoBE uses \(W_i \approx A_i \, f\!\left(\sum_j \alpha_{i,j} B_j\right)\). - \(A_i\) is small and expert-specific. - \(B_j\) are shared basis matrices across all experts in a layer. - Down-projection matrices are not compressed, because the authors argue they hold critical knowledge. So the savings come from sharing \(B_j\) and keeping only small \(A_i\) per expert. The paper shows this preserves accuracy much better than prior decomposition methods (MoLAE, D2-MoE) at similar or higher compression rates. It also achieves much lower reconstruction MSE. For very large MoE models, that 24–30% total-parameter reduction is useful because total parameter count is often the deployment bottleneck for GPU/CPU memor…

The Arbiter · gemini-3-7-flash

Round 1 Summary & Synthesis Both participants—the Deep Learning Systems Architect and the Machine Learning Research Scientist—converged on a clear breakdown of what MoBE (Mixture-of-Basis-Experts) accomplishes and the specific engineering and operational trade-offs required to adopt it. --- 1. What the Method Actually Achieves * Targeted Matrix Factorization: Rather than pruning or merging entire experts, MoBE decomposes the gate and up-projection matrices of each expert into a small, expert-specific matrix $A_i$ and a linear combination of shared basis matrices $\{B_j\}$ passed through a non-linear activation (e.g., SiLU/Tanh): $$\hat{W}^i = A^i f\left(\sum_j \alpha^{i,j} B^j\right)$$ Down-projection matrices, attention layers, and embeddings remain uncompressed. * Significant Weight-Memory Reduction: It achieves a 24% to 30% reduction in total parameter count on massive MoE models (e.g., Qwen3-235B, DeepSeek-V3-0324 [671B], Kimi-K2-Instruct [1T]). At BF16 precision, this equates to roughly 400 GB of saved weight storage for a 671B checkpoint. * Superior Quality Retention vs. Baselines: Compared to prior SVD decompositions (MoLAE, D2-MoE) or…

The Arbiter's Final Verdict · gemini-3-7-flash

Final Verdict The proposed method, Mixture-of-Basis-Experts (MoBE), addresses the deployment bottleneck of massive Mixture-of-Experts (MoE) LLMs by trading mathematical purity and runtime simplicity for substantial parameter-memory savings. --- Part 1: What MoBE Actually Achieves 1. Targeted Weight-Memory Compression: * 24% to 30% reduction in total parameters on massive frontier MoEs (e.g., DeepSeek-V3 671B, Qwen3-235B, Kimi-K2 1T). * For a checkpoint like DeepSeek-V3 (671B), this eliminates roughly 350–400 GB of raw weight footprint at BF16 precision, directly reducing the number of high-end GPUs required just to hold model weights in VRAM. 2. Significantly Better Accuracy Retention Than Prior Baselines: * Rather than dropping or merging experts (pruning) or relying on standard truncated SVD (which fails because MoE weight matrices exhibit high effective rank), MoBE factorizes the up/gate matrices into: $$\hat{W}^i = A^i f\left(\sum_{j=1}^m \alpha^{i,j} B^j\right)$$ where $\{B^j\}$ are layer-shared basis matrices, $A^i$ is expert-specific, and $f$ is a non-linear activation (SiLU/Tanh). * It achieves an average retention o…