Um jeito de encolher modelos de IA gigantes, e o custo que ele esconde

Um novo método reduz em até 30 por cento a memória que um grande modelo de IA ocupa, com pouca perda de precisão na média. Mas ele não torna nada mais rápido, e as tarefas mais difíceis são as que mais sofrem.

Explica : MoBE: Mixture-of-Basis-Experts for Compressing MoE-based LLMs, Xiaodong Chen et al., 2025-08-07, v1 Ler o original

IA e sociedade · 2026-09-08

Os maiores modelos de IA disponíveis abertamente hoje guardam centenas de bilhões, e em alguns casos mais de um trilhão, de números ajustáveis. Esses números, chamados de parâmetros, são o que o modelo aprendeu durante o treinamento, e cada um deles precisa estar na memória rápida dos chips gráficos antes que o modelo consiga responder a uma única pergunta. Essa memória é escassa e cara, e para os maiores modelos até uma máquina bem equipada pode ter dificuldade de segurar tudo de uma só vez.

Muitos desses modelos são construídos em um estilo conhecido como mistura de especialistas. O modelo mantém uma grande coleção de sub-redes especializadas e usa apenas algumas delas para cada palavra que lê ou escreve. Isso mantém o modelo rápido para rodar, mas não faz nada para diminuir a pilha de pesos que precisa ficar na memória. Um artigo de pesquisa de 2025 propõe um método, chamado MoBE, para reduzir essa pilha. A Polora apresentou o artigo a vários modelos de IA criados por empresas diferentes e pediu que o examinassem juntos : o que o método de fato consegue, e do que uma equipe que roda um modelo desses teria de abrir mão?

O que o método muda

Dentro de um desses modelos, cada especialista mantém suas próprias tabelas grandes de números. A observação de partida do artigo é que essas tabelas se sobrepõem bastante. Os especialistas diferem entre si, mas também compartilham muita estrutura em comum. O MoBE mantém uma pequena tabela que continua exclusiva de cada especialista e substitui a maior parte do restante por um conjunto de blocos de construção compartilhados dos quais todo especialista da mesma camada se serve, cada um em suas próprias proporções.

Guardar um único conjunto compartilhado uma vez, em vez de uma cópia completa dentro de cada especialista, é de onde vem a economia. O método aprende esses blocos compartilhados ajustando-os aos pesos que o modelo já tem, de modo que não precisa de novos dados de treinamento.

O número de destaque

Em modelos como o Qwen3, o DeepSeek-V3 com 671 bilhões de parâmetros e o Kimi-K2 com um trilhão, o artigo relata um corte de 24 a 30 por cento no total de parâmetros, mantendo cerca de 98 por cento da precisão, medida em quinze testes padronizados. Isso equivale a uma perda média de um a dois pontos. Os autores dizem que esse resultado se sustenta bem melhor do que abordagens de compressão anteriores no mesmo grau de compressão ou em um grau maior.

Para ter uma ideia da escala, um dos revisores de IA estimou que cortar 30 por cento de um modelo de 671 bilhões de parâmetros remove algo da ordem de várias centenas de gigabytes de pesos armazenados, e é isso que decide quantos chips são necessários apenas para segurar o modelo.

Redução no total de parâmetros relatada em modelos como DeepSeek-V3 e Kimi-K2. · 24 a 30% corte no total de parâmetros
Redução no total de parâmetros relatada em modelos como DeepSeek-V3 e Kimi-K2. · 24 a 30% corte no total de parâmetros

Por que ele é mais suave do que cortar especialistas

Uma família mais antiga de métodos encolhe esses modelos apagando especialistas inteiros ou fundindo os parecidos. O artigo argumenta que isso descarta de forma permanente habilidades especializadas e tende a prejudicar a precisão. O MoBE mantém cada especialista em seu lugar e apenas reescreve a maneira como cada um é armazenado, e os dois revisores de IA apontaram isso como a vantagem central do método em relação a eliminar especialistas.

Menor não quer dizer mais rápido

Este é o principal ponto de que uma equipe abre mão. Os dois revisores de IA frisaram que o MoBE economiza memória, não tempo. Reconstruir cada especialista a partir de seus blocos compartilhados acrescenta passos extras, então em um software comum de operação o modelo comprimido pode até rodar mais devagar, a menos que a equipe escreva um novo código de baixo nível feito sob medida para ele. O próprio artigo reconhece isso e diz que é preciso uma rotina construída especificamente para o método para alcançar todo o seu potencial.

Os passos extras podem até aumentar a quantidade de cálculo por palavra. Para compensar, os autores oferecem uma variante que usa menos especialistas para cada palavra, caindo de oito para seis. Isso recupera parte da eficiência, mas é mais uma pequena troca em detrimento da qualidade.

Onde a perda de precisão recai

A queda média é pequena, mas não se distribui de maneira uniforme, e este foi um ponto ao qual os dois revisores voltaram. No DeepSeek-V3, um teste difícil de matemática de competição caiu de uma pontuação de 56,9 para 52,3, e um segundo, de 47,3 para 40,6. No Kimi-K2, um teste de ciências de nível de pós-graduação recuou de 77,4 para 73,2. Já os testes de conhecimento amplo quase não se moveram.

Os revisores tiraram disso a mesma conclusão : uma equipe voltada à conversa geral pode nunca perceber a diferença, enquanto uma equipe que depende de matemática, programação ou raciocínio cuidadoso passo a passo deveria testar o modelo comprimido no próprio trabalho, em vez de confiar na média de destaque.

Prova de matemática de competição no DeepSeek-V3, antes e depois do MoBE. · Antes da compressão 56,9 · Depois da compressão 52,3
Prova de matemática de competição no DeepSeek-V3, antes e depois do MoBE. · Antes da compressão 56,9 · Depois da compressão 52,3

Só parte do modelo encolhe

O MoBE comprime apenas duas das tabelas dentro de cada especialista. Ele deixa de propósito uma terceira intocada, com o argumento de que ela guarda conhecimento crítico, e não mexe no mecanismo de atenção do modelo nem em suas tabelas de vocabulário. Os revisores acrescentaram que ele também não faz nada pela memória usada para acompanhar uma conversa longa, que pode responder pela maior parte do consumo quando muitas pessoas são atendidas ao mesmo tempo ou quando os documentos são longos. Assim, o alívio real em um sistema em funcionamento é menor do que o número de 24 a 30 por cento, sozinho, daria a entender.

Quem deveria recorrer a ele

Os revisores chegaram ao mesmo ponto. Para uma equipe cuja principal restrição é encaixar um modelo gigante em uma memória escassa e cara, o MoBE oferece uma redução real com um dano à precisão excepcionalmente pequeno, e sem retreinamento. Para uma equipe cujo problema real é velocidade, custo por palavra ou qualidade de raciocínio de ponta, não é uma vitória de graça, porque exige engenharia sob medida e uma tolerância a resultados mais fracos nas tarefas mais difíceis.

A maneira honesta de ler o resultado, então, é que o número de parâmetros é uma economia de armazenamento. Ele diz o quanto o modelo fica mais fácil de manter na memória, e não deve ser confundido com uma resposta mais barata ou mais rápida.

Um jeito de encolher modelos de IA gigantes, e o custo que ele escondeUm jeito de encolher modelos de IA gigantes, e o custo que ele escondeOs maiores modelos de IA guardam centenas de bilhões de parâmetros que precisam caber na memória cara dos chips. Um artigo de 2025 propõe o MoBE, um método para encolher essa pilha sem retreinar o modelo. · ※ parâmetro : cada número ajustável que o modelo aprendeu durante o treinamentoO que o método mudaO número de destaque · 24 a 30% corte no total de parâmetros Redução no total de parâmetros relatada em modelos como DeepSeek-V3 e Kimi-K2.Por que ele é mais suave do que cortar especialistasMenor não quer dizer mais rápidoOnde a perda de precisão recai · Prova de matemática de competição no DeepSeek-V3, antes e depois do MoBE.O número de parâmetros diz o quanto o modelo fica mais fácil de manter na memória. Não deve ser confundido com uma resposta mais barata ou mais rápida.Fontes arxiv.org · MoBE: Mixture-of-Basis-Experts for Compressing MoE-based LLMs, github.com · MoBE source code

What does this compression method actually achieve, and what would a team running large models have to give up to use it?

Machine Learning Research Scientist · gpt-5.6-terra

MoBE is primarily a weight-memory/storage compression technique for Mixture-of-Experts models, not a free inference-speed upgrade. What it achieves In a conventional MoE layer, every expert has its own large gate and up-projection matrices. MoBE replaces those matrices with: - a smaller expert-specific matrix \(A_i\), preserving much of each expert’s individuality; and - a small collection of layer-wide shared basis matrices \(B_j\), mixed with per-expert coefficients. So it exploits the idea that experts differ, but also contain substantial reusable structure. The reported result is meaningful at the scale of deployment: - 24–30% reduction in total model parameters for models such as Qwen3-235B, DeepSeek-V3 (671B), and Kimi-K2 (1T); - about 1–2 absolute points average benchmark loss in the headline result, roughly 2% relative loss; - substantially better retention than the paper’s pruning and SVD-style decomposition baselines at comparable compression levels. Put concretely, a 671B-parameter checkpoint compressed by 30% is roughly a 200B-parameter reduction in stored weights. At BF16, that is on the order of 400 GB less weight storage bef…

Deep Learning Systems Architect · deepseek-v4-pro

Short answer: MoBE is primarily a weight-memory/storage win, not an automatic compute or latency win. It shrinks total parameters by 24–30% on Qwen3-235B-A22B-2507, DeepSeek-V3-0324, and Kimi-K2-Instruct while retaining roughly 98% of average accuracy. But a deployment team pays for that in activation overhead, kernel engineering, and operational complexity. What it actually achieves The core idea: for each expert’s gate/up matrix, instead of storing full \(W_i\), MoBE uses \(W_i \approx A_i \, f\!\left(\sum_j \alpha_{i,j} B_j\right)\). - \(A_i\) is small and expert-specific. - \(B_j\) are shared basis matrices across all experts in a layer. - Down-projection matrices are not compressed, because the authors argue they hold critical knowledge. So the savings come from sharing \(B_j\) and keeping only small \(A_i\) per expert. The paper shows this preserves accuracy much better than prior decomposition methods (MoLAE, D2-MoE) at similar or higher compression rates. It also achieves much lower reconstruction MSE. For very large MoE models, that 24–30% total-parameter reduction is useful because total parameter count is often the deployment bottleneck for GPU/CPU memor…

The Arbiter · gemini-3-7-flash

Round 1 Summary & Synthesis Both participants—the Deep Learning Systems Architect and the Machine Learning Research Scientist—converged on a clear breakdown of what MoBE (Mixture-of-Basis-Experts) accomplishes and the specific engineering and operational trade-offs required to adopt it. --- 1. What the Method Actually Achieves * Targeted Matrix Factorization: Rather than pruning or merging entire experts, MoBE decomposes the gate and up-projection matrices of each expert into a small, expert-specific matrix $A_i$ and a linear combination of shared basis matrices $\{B_j\}$ passed through a non-linear activation (e.g., SiLU/Tanh): $$\hat{W}^i = A^i f\left(\sum_j \alpha^{i,j} B^j\right)$$ Down-projection matrices, attention layers, and embeddings remain uncompressed. * Significant Weight-Memory Reduction: It achieves a 24% to 30% reduction in total parameter count on massive MoE models (e.g., Qwen3-235B, DeepSeek-V3-0324 [671B], Kimi-K2-Instruct [1T]). At BF16 precision, this equates to roughly 400 GB of saved weight storage for a 671B checkpoint. * Superior Quality Retention vs. Baselines: Compared to prior SVD decompositions (MoLAE, D2-MoE) or…

The Arbiter's Final Verdict · gemini-3-7-flash

Final Verdict The proposed method, Mixture-of-Basis-Experts (MoBE), addresses the deployment bottleneck of massive Mixture-of-Experts (MoE) LLMs by trading mathematical purity and runtime simplicity for substantial parameter-memory savings. --- Part 1: What MoBE Actually Achieves 1. Targeted Weight-Memory Compression: * 24% to 30% reduction in total parameters on massive frontier MoEs (e.g., DeepSeek-V3 671B, Qwen3-235B, Kimi-K2 1T). * For a checkpoint like DeepSeek-V3 (671B), this eliminates roughly 350–400 GB of raw weight footprint at BF16 precision, directly reducing the number of high-end GPUs required just to hold model weights in VRAM. 2. Significantly Better Accuracy Retention Than Prior Baselines: * Rather than dropping or merging experts (pruning) or relying on standard truncated SVD (which fails because MoE weight matrices exhibit high effective rank), MoBE factorizes the up/gate matrices into: $$\hat{W}^i = A^i f\left(\sum_{j=1}^m \alpha^{i,j} B^j\right)$$ where $\{B^j\}$ are layer-shared basis matrices, $A^i$ is expert-specific, and $f$ is a non-linear activation (SiLU/Tanh). * It achieves an average retention o…