Os maiores modelos de IA disponíveis abertamente hoje guardam centenas de bilhões, e em alguns casos mais de um trilhão, de números ajustáveis. Esses números, chamados de parâmetros, são o que o modelo aprendeu durante o treinamento, e cada um deles precisa estar na memória rápida dos chips gráficos antes que o modelo consiga responder a uma única pergunta. Essa memória é escassa e cara, e para os maiores modelos até uma máquina bem equipada pode ter dificuldade de segurar tudo de uma só vez.
Muitos desses modelos são construídos em um estilo conhecido como mistura de especialistas. O modelo mantém uma grande coleção de sub-redes especializadas e usa apenas algumas delas para cada palavra que lê ou escreve. Isso mantém o modelo rápido para rodar, mas não faz nada para diminuir a pilha de pesos que precisa ficar na memória. Um artigo de pesquisa de 2025 propõe um método, chamado MoBE, para reduzir essa pilha. A Polora apresentou o artigo a vários modelos de IA criados por empresas diferentes e pediu que o examinassem juntos : o que o método de fato consegue, e do que uma equipe que roda um modelo desses teria de abrir mão?
O que o método muda
Dentro de um desses modelos, cada especialista mantém suas próprias tabelas grandes de números. A observação de partida do artigo é que essas tabelas se sobrepõem bastante. Os especialistas diferem entre si, mas também compartilham muita estrutura em comum. O MoBE mantém uma pequena tabela que continua exclusiva de cada especialista e substitui a maior parte do restante por um conjunto de blocos de construção compartilhados dos quais todo especialista da mesma camada se serve, cada um em suas próprias proporções.
Guardar um único conjunto compartilhado uma vez, em vez de uma cópia completa dentro de cada especialista, é de onde vem a economia. O método aprende esses blocos compartilhados ajustando-os aos pesos que o modelo já tem, de modo que não precisa de novos dados de treinamento.
O número de destaque
Em modelos como o Qwen3, o DeepSeek-V3 com 671 bilhões de parâmetros e o Kimi-K2 com um trilhão, o artigo relata um corte de 24 a 30 por cento no total de parâmetros, mantendo cerca de 98 por cento da precisão, medida em quinze testes padronizados. Isso equivale a uma perda média de um a dois pontos. Os autores dizem que esse resultado se sustenta bem melhor do que abordagens de compressão anteriores no mesmo grau de compressão ou em um grau maior.
Para ter uma ideia da escala, um dos revisores de IA estimou que cortar 30 por cento de um modelo de 671 bilhões de parâmetros remove algo da ordem de várias centenas de gigabytes de pesos armazenados, e é isso que decide quantos chips são necessários apenas para segurar o modelo.

Por que ele é mais suave do que cortar especialistas
Uma família mais antiga de métodos encolhe esses modelos apagando especialistas inteiros ou fundindo os parecidos. O artigo argumenta que isso descarta de forma permanente habilidades especializadas e tende a prejudicar a precisão. O MoBE mantém cada especialista em seu lugar e apenas reescreve a maneira como cada um é armazenado, e os dois revisores de IA apontaram isso como a vantagem central do método em relação a eliminar especialistas.
Menor não quer dizer mais rápido
Este é o principal ponto de que uma equipe abre mão. Os dois revisores de IA frisaram que o MoBE economiza memória, não tempo. Reconstruir cada especialista a partir de seus blocos compartilhados acrescenta passos extras, então em um software comum de operação o modelo comprimido pode até rodar mais devagar, a menos que a equipe escreva um novo código de baixo nível feito sob medida para ele. O próprio artigo reconhece isso e diz que é preciso uma rotina construída especificamente para o método para alcançar todo o seu potencial.
Os passos extras podem até aumentar a quantidade de cálculo por palavra. Para compensar, os autores oferecem uma variante que usa menos especialistas para cada palavra, caindo de oito para seis. Isso recupera parte da eficiência, mas é mais uma pequena troca em detrimento da qualidade.
Onde a perda de precisão recai
A queda média é pequena, mas não se distribui de maneira uniforme, e este foi um ponto ao qual os dois revisores voltaram. No DeepSeek-V3, um teste difícil de matemática de competição caiu de uma pontuação de 56,9 para 52,3, e um segundo, de 47,3 para 40,6. No Kimi-K2, um teste de ciências de nível de pós-graduação recuou de 77,4 para 73,2. Já os testes de conhecimento amplo quase não se moveram.
Os revisores tiraram disso a mesma conclusão : uma equipe voltada à conversa geral pode nunca perceber a diferença, enquanto uma equipe que depende de matemática, programação ou raciocínio cuidadoso passo a passo deveria testar o modelo comprimido no próprio trabalho, em vez de confiar na média de destaque.

Só parte do modelo encolhe
O MoBE comprime apenas duas das tabelas dentro de cada especialista. Ele deixa de propósito uma terceira intocada, com o argumento de que ela guarda conhecimento crítico, e não mexe no mecanismo de atenção do modelo nem em suas tabelas de vocabulário. Os revisores acrescentaram que ele também não faz nada pela memória usada para acompanhar uma conversa longa, que pode responder pela maior parte do consumo quando muitas pessoas são atendidas ao mesmo tempo ou quando os documentos são longos. Assim, o alívio real em um sistema em funcionamento é menor do que o número de 24 a 30 por cento, sozinho, daria a entender.
Quem deveria recorrer a ele
Os revisores chegaram ao mesmo ponto. Para uma equipe cuja principal restrição é encaixar um modelo gigante em uma memória escassa e cara, o MoBE oferece uma redução real com um dano à precisão excepcionalmente pequeno, e sem retreinamento. Para uma equipe cujo problema real é velocidade, custo por palavra ou qualidade de raciocínio de ponta, não é uma vitória de graça, porque exige engenharia sob medida e uma tolerância a resultados mais fracos nas tarefas mais difíceis.
A maneira honesta de ler o resultado, então, é que o número de parâmetros é uma economia de armazenamento. Ele diz o quanto o modelo fica mais fácil de manter na memória, e não deve ser confundido com uma resposta mais barata ou mais rápida.









