Una forma de encoger los modelos de IA gigantes, y su coste oculto

Un método nuevo reduce hasta un 30 por ciento la memoria que ocupa un modelo grande de IA, con poca pérdida de precisión en promedio. Pero no acelera nada, y las tareas más difíciles son las que más lo acusan.

Explica : MoBE: Mixture-of-Basis-Experts for Compressing MoE-based LLMs, Xiaodong Chen et al., 2025-08-07, v1 Leer el original

IA y sociedad · 2026-09-08

Los modelos de IA de acceso abierto más grandes almacenan hoy cientos de miles de millones de números ajustables, y en algunos casos más de un billón. Esos números, llamados parámetros, son lo que el modelo aprendió durante su entrenamiento, y cada uno de ellos tiene que estar cargado en la memoria rápida de los chips gráficos antes de que el modelo pueda responder una sola pregunta. Esa memoria es escasa y cara, y con los modelos más grandes hasta una máquina bien equipada puede tener dificultades para alojarlo todo a la vez.

Muchos de estos modelos se construyen con un estilo conocido como mezcla de expertos. El modelo mantiene una gran colección de subredes especializadas y usa solo unas pocas para cada palabra que lee o escribe. Eso hace que el modelo sea rápido de ejecutar, pero no reduce en nada el montón de pesos que debe permanecer en memoria. Un artículo de investigación de 2025 propone un método, llamado MoBE, para recortar ese montón. Polora presentó el artículo a varios modelos de IA construidos por distintas empresas y les pidió que lo examinaran juntos : ¿qué consigue realmente el método y a qué tendría que renunciar un equipo que gestione un modelo así?

Lo que cambia el método

Dentro de uno de estos modelos, cada experto guarda sus propias tablas grandes de números. La observación de partida del artículo es que esas tablas se solapan mucho. Los expertos se diferencian entre sí, pero también comparten buena parte de una estructura común. MoBE conserva una tabla pequeña que sigue siendo exclusiva de cada experto y sustituye la mayor parte del resto por un conjunto de bloques compartidos del que se sirve cada experto de una misma capa, cada uno en sus propias proporciones.

Guardar un único conjunto compartido una sola vez, en lugar de una copia completa dentro de cada experto, es de donde viene el ahorro. El método aprende esos bloques compartidos ajustándolos a los pesos que el modelo ya tiene, de modo que no necesita datos de entrenamiento nuevos.

La cifra que llama la atención

En modelos como Qwen3, DeepSeek-V3 con 671.000 millones de parámetros y Kimi-K2 con un billón, el artículo declara un recorte de entre el 24 y el 30 por ciento en el total de parámetros, conservando en torno al 98 por ciento de la precisión, medida en quince pruebas estándar. Eso equivale a una pérdida media de uno a dos puntos. Los autores sostienen que esto aguanta bastante mejor que los métodos de compresión anteriores con una compresión igual o mayor.

Para hacerse una idea de la escala, uno de los modelos de IA que revisaron el artículo estimó que recortar un 30 por ciento de un modelo de 671.000 millones de parámetros elimina del orden de varios cientos de gigabytes de pesos almacenados, que es lo que determina cuántos chips hacen falta solo para alojar el modelo.

En modelos como Qwen3, DeepSeek-V3 y Kimi-K2, sin reentrenamiento. · 24 a 30 % reducción del total de parámetros
En modelos como Qwen3, DeepSeek-V3 y Kimi-K2, sin reentrenamiento. · 24 a 30 % reducción del total de parámetros

Por qué es más suave que eliminar expertos

Una familia de métodos más antigua encoge estos modelos borrando expertos enteros o fusionando los que se parecen. El artículo sostiene que así se descartan de forma permanente habilidades especializadas y se tiende a dañar la precisión. MoBE mantiene cada experto en su sitio y solo reescribe la forma en que se almacena cada uno, y los dos modelos de IA que lo revisaron señalaron esto como la ventaja central del método frente a eliminar expertos.

Ser más pequeño no significa ser más rápido

Esto es lo principal a lo que renuncia un equipo. Los dos modelos de IA que revisaron el artículo subrayaron que MoBE ahorra memoria, no tiempo. Reconstruir cada experto a partir de sus bloques compartidos añade pasos adicionales, así que en el software habitual de servicio el modelo comprimido puede llegar a funcionar más despacio, a menos que un equipo escriba código nuevo de bajo nivel hecho a su medida. El propio artículo lo reconoce y dice que hace falta una rutina diseñada a propósito para aprovechar todo el potencial del método.

Los pasos adicionales pueden incluso elevar la cantidad de cálculo por palabra. Para compensarlo, los autores ofrecen una variante que usa menos expertos por palabra, bajando de ocho a seis. Eso recupera algo de eficiencia, pero es otro pequeño trueque a costa de la calidad.

Dónde recae la pérdida de precisión

La caída media es pequeña, pero no se reparte por igual, y este fue un punto al que volvieron los dos modelos revisores. En DeepSeek-V3, una prueba difícil de matemáticas de competición bajó de una puntuación de 56,9 a 52,3, y una segunda de 47,3 a 40,6. En Kimi-K2, una prueba de ciencia de nivel de posgrado descendió de 77,4 a 73,2. Las pruebas de conocimiento general, en cambio, apenas se movieron.

Los modelos revisores sacaron la misma conclusión de esto : un equipo que ofrezca conversación general quizá no note nunca la diferencia, mientras que un equipo que se apoye en las matemáticas, la programación o el razonamiento cuidadoso paso a paso debería probar el modelo comprimido con su propio trabajo en lugar de fiarse del promedio que se anuncia.

Solo una parte del modelo encoge

MoBE comprime solo dos de las tablas dentro de cada experto. Deja a propósito una tercera intacta, con el razonamiento de que contiene conocimiento crítico, y no toca la maquinaria de atención del modelo ni sus tablas de vocabulario. Los modelos revisores añadieron que tampoco hace nada por la memoria que se usa para seguir el hilo de una conversación larga, un consumo que puede volverse dominante cuando se atiende a muchas personas a la vez o cuando los documentos son largos. Así que el alivio real en un sistema en funcionamiento es menor de lo que la cifra del 24 al 30 por ciento sugeriría por sí sola.

Quién debería recurrir a él

Los modelos revisores llegaron al mismo punto. Para un equipo cuya principal limitación es meter un modelo gigante en una memoria escasa y cara, MoBE ofrece una reducción real con un daño a la precisión inusualmente pequeño, y sin reentrenar. Para un equipo cuyo problema real es la velocidad, el coste por palabra o la máxima calidad de razonamiento, no es una victoria gratuita, porque exige ingeniería a medida y tolerancia ante resultados más flojos en las tareas más difíciles.

La manera honesta de leer el resultado, entonces, es que la cifra de parámetros es un ahorro de almacenamiento. Indica cuánto más fácil resulta mantener el modelo en memoria, y no debe confundirse con una respuesta más barata o más rápida.

Una forma de encoger los modelos de IA gigantes, y su coste ocultoUna forma de encoger los modelos de IA gigantes, y su coste ocultoLos modelos de IA abiertos más grandes guardan cientos de miles de millones de parámetros que deben caber en la memoria escasa y cara de los chips. Un artículo de 2025 propone un método, MoBE, para reducirlo. · ※ parámetros : los números ajustables que el modelo aprende durante su entrenamientoLo que cambia el métodoLa cifra que llama la atención · 24 a 30 % reducción del total de parámetros En modelos como Qwen3, DeepSeek-V3 y Kimi-K2, sin reentrenamiento.Por qué es más suave que eliminar expertosSer más pequeño no significa ser más rápidoDónde recae la pérdida de precisiónLa cifra de parámetros es un ahorro de almacenamiento : mide cuánto más fácil es mantener el modelo en memoria, no una respuesta más barata ni más rápida.Fuentes arxiv.org · MoBE: Mixture-of-Basis-Experts for Compressing MoE-based LLMs, github.com · MoBE source code

What does this compression method actually achieve, and what would a team running large models have to give up to use it?

Machine Learning Research Scientist · gpt-5.6-terra

MoBE is primarily a weight-memory/storage compression technique for Mixture-of-Experts models, not a free inference-speed upgrade. What it achieves In a conventional MoE layer, every expert has its own large gate and up-projection matrices. MoBE replaces those matrices with: - a smaller expert-specific matrix \(A_i\), preserving much of each expert’s individuality; and - a small collection of layer-wide shared basis matrices \(B_j\), mixed with per-expert coefficients. So it exploits the idea that experts differ, but also contain substantial reusable structure. The reported result is meaningful at the scale of deployment: - 24–30% reduction in total model parameters for models such as Qwen3-235B, DeepSeek-V3 (671B), and Kimi-K2 (1T); - about 1–2 absolute points average benchmark loss in the headline result, roughly 2% relative loss; - substantially better retention than the paper’s pruning and SVD-style decomposition baselines at comparable compression levels. Put concretely, a 671B-parameter checkpoint compressed by 30% is roughly a 200B-parameter reduction in stored weights. At BF16, that is on the order of 400 GB less weight storage bef…

Deep Learning Systems Architect · deepseek-v4-pro

Short answer: MoBE is primarily a weight-memory/storage win, not an automatic compute or latency win. It shrinks total parameters by 24–30% on Qwen3-235B-A22B-2507, DeepSeek-V3-0324, and Kimi-K2-Instruct while retaining roughly 98% of average accuracy. But a deployment team pays for that in activation overhead, kernel engineering, and operational complexity. What it actually achieves The core idea: for each expert’s gate/up matrix, instead of storing full \(W_i\), MoBE uses \(W_i \approx A_i \, f\!\left(\sum_j \alpha_{i,j} B_j\right)\). - \(A_i\) is small and expert-specific. - \(B_j\) are shared basis matrices across all experts in a layer. - Down-projection matrices are not compressed, because the authors argue they hold critical knowledge. So the savings come from sharing \(B_j\) and keeping only small \(A_i\) per expert. The paper shows this preserves accuracy much better than prior decomposition methods (MoLAE, D2-MoE) at similar or higher compression rates. It also achieves much lower reconstruction MSE. For very large MoE models, that 24–30% total-parameter reduction is useful because total parameter count is often the deployment bottleneck for GPU/CPU memor…

The Arbiter · gemini-3-7-flash

Round 1 Summary & Synthesis Both participants—the Deep Learning Systems Architect and the Machine Learning Research Scientist—converged on a clear breakdown of what MoBE (Mixture-of-Basis-Experts) accomplishes and the specific engineering and operational trade-offs required to adopt it. --- 1. What the Method Actually Achieves * Targeted Matrix Factorization: Rather than pruning or merging entire experts, MoBE decomposes the gate and up-projection matrices of each expert into a small, expert-specific matrix $A_i$ and a linear combination of shared basis matrices $\{B_j\}$ passed through a non-linear activation (e.g., SiLU/Tanh): $$\hat{W}^i = A^i f\left(\sum_j \alpha^{i,j} B^j\right)$$ Down-projection matrices, attention layers, and embeddings remain uncompressed. * Significant Weight-Memory Reduction: It achieves a 24% to 30% reduction in total parameter count on massive MoE models (e.g., Qwen3-235B, DeepSeek-V3-0324 [671B], Kimi-K2-Instruct [1T]). At BF16 precision, this equates to roughly 400 GB of saved weight storage for a 671B checkpoint. * Superior Quality Retention vs. Baselines: Compared to prior SVD decompositions (MoLAE, D2-MoE) or…

The Arbiter's Final Verdict · gemini-3-7-flash

Final Verdict The proposed method, Mixture-of-Basis-Experts (MoBE), addresses the deployment bottleneck of massive Mixture-of-Experts (MoE) LLMs by trading mathematical purity and runtime simplicity for substantial parameter-memory savings. --- Part 1: What MoBE Actually Achieves 1. Targeted Weight-Memory Compression: * 24% to 30% reduction in total parameters on massive frontier MoEs (e.g., DeepSeek-V3 671B, Qwen3-235B, Kimi-K2 1T). * For a checkpoint like DeepSeek-V3 (671B), this eliminates roughly 350–400 GB of raw weight footprint at BF16 precision, directly reducing the number of high-end GPUs required just to hold model weights in VRAM. 2. Significantly Better Accuracy Retention Than Prior Baselines: * Rather than dropping or merging experts (pruning) or relying on standard truncated SVD (which fails because MoE weight matrices exhibit high effective rank), MoBE factorizes the up/gate matrices into: $$\hat{W}^i = A^i f\left(\sum_{j=1}^m \alpha^{i,j} B^j\right)$$ where $\{B^j\}$ are layer-shared basis matrices, $A^i$ is expert-specific, and $f$ is a non-linear activation (SiLU/Tanh). * It achieves an average retention o…