거대한 AI 모델을 줄이는 방법, 그리고 숨은 대가

새로운 방법이 큰 AI 모델이 차지하는 메모리를 최대 30퍼센트까지 줄이면서 평균 정확도 손실은 크지 않다. 하지만 속도가 빨라지는 것은 아니고, 가장 어려운 작업이 가장 큰 타격을 받는다.

해설 대상 : MoBE: Mixture-of-Basis-Experts for Compressing MoE-based LLMs, Xiaodong Chen et al., 2025-08-07, v1 원문 보기

AI와 사회 · 2026-09-08

지금 누구나 받아 쓸 수 있는 가장 큰 AI 모델들은 조절할 수 있는 숫자를 수천억 개, 어떤 경우에는 1조 개 넘게 담고 있습니다. 파라미터라고 부르는 이 숫자들은 모델이 훈련 과정에서 배운 것이고, 모델이 질문 하나에 답하려면 이 숫자 하나하나가 먼저 그래픽 칩의 빠른 메모리에 올라와 있어야 합니다. 그 메모리는 양이 적고 비싸서, 가장 큰 모델은 좋은 장비로도 전체를 한 번에 올려 두기가 벅찹니다.

이런 모델의 상당수는 '전문가 혼합(mixture of experts)'이라는 방식으로 만들어집니다. 모델은 저마다 특기가 다른 작은 신경망을 잔뜩 갖춰 두고, 글자 하나를 읽거나 쓸 때마다 그중 몇 개만 골라 씁니다. 덕분에 모델은 빠르게 돌아가지만, 메모리에 계속 올려 두어야 하는 가중치 더미가 줄어들지는 않습니다. 2025년의 한 연구 논문은 그 더미를 줄이는 방법을 내놓고 MoBE라고 이름 붙였습니다. 폴로라는 이 논문을 여러 회사가 만든 여러 AI 모델 앞에 놓고, 이 방법이 실제로 무엇을 이뤄 내는지, 그리고 이런 모델을 돌리는 팀은 그 대가로 무엇을 내놓아야 하는지를 함께 살펴보게 했습니다.

이 방법이 바꾸는 것

이런 모델 안에서 전문가는 저마다 큰 숫자 표를 여러 개 지니고 있습니다. 논문의 출발점이 된 관찰은 이 표들이 서로 상당히 겹친다는 것입니다. 전문가들은 서로 다르지만, 공통된 구조도 많이 나눠 갖고 있습니다. MoBE는 전문가마다 고유하게 남는 작은 표 하나는 그대로 두고, 나머지 대부분은 같은 층의 모든 전문가가 함께 쓰는 공용 조각 묶음으로 바꿉니다. 전문가마다 그 조각들을 저마다 다른 비율로 가져다 씁니다.

공용 묶음을 전문가마다 통째로 복사해 두는 대신 한 번만 저장하는 데서 절약이 나옵니다. 이 방법은 공용 조각을 모델의 기존 가중치에 맞춰 학습하므로, 새로운 훈련 데이터가 필요 없습니다.

내세우는 숫자

Qwen3, 파라미터가 6710억 개인 DeepSeek-V3, 1조 개인 Kimi-K2 같은 모델에서, 논문은 표준 시험 열다섯 개로 측정한 정확도를 약 98퍼센트 지키면서 전체 파라미터를 24~30퍼센트 줄였다고 밝힙니다. 평균으로 따지면 1~2점 떨어진 셈입니다. 저자들은 이 결과가 같거나 더 높은 압축률에서 기존 압축 방식들보다 눈에 띄게 잘 버틴다고 말합니다.

규모를 그려 보면, AI 검토자 한 명은 6710억 파라미터 모델에서 30퍼센트를 덜어 내면 저장된 가중치가 수백 기가바이트 단위로 줄어든다고 어림했습니다. 이 크기가 모델을 올려 두기만 하는 데도 칩이 몇 개나 필요한지를 정합니다.

전문가를 잘라 내는 것보다 덜 아픈 이유

예전부터 있던 방법들은 전문가를 통째로 지우거나 비슷한 것끼리 합쳐서 이런 모델을 줄입니다. 논문은 이렇게 하면 특기 하나가 영영 버려지고 정확도가 떨어지기 쉽다고 지적합니다. MoBE는 전문가를 하나도 없애지 않고 각각을 어떻게 저장할지만 다시 씁니다. 두 AI 검토자 모두, 전문가를 통째로 잘라 내는 방식과 견주면 바로 이것이 MoBE의 핵심 장점이라고 꼽았습니다.

작아진다고 빨라지는 것은 아니다

팀이 내놓아야 하는 대가는 여기서 가장 크게 드러납니다. 두 AI 검토자 모두 MoBE가 아끼는 것은 메모리이지 시간이 아니라고 강조했습니다. 전문가를 공용 조각에서 다시 조립하는 데 추가 단계가 붙기 때문에, 보통의 서비스 소프트웨어에서는 이 방법에 맞춘 새로운 코드를 짜지 않는 한 압축한 모델이 오히려 더 느리게 돌 수 있습니다. 논문 스스로도 이 점을 인정하며, 방법의 잠재력을 온전히 끌어내려면 전용으로 짠 코드가 필요하다고 말합니다.

이 추가 단계는 글자 하나당 계산량을 오히려 늘릴 수도 있습니다. 이를 상쇄하려고 저자들은 글자마다 쓰는 전문가 수를 여덟에서 여섯으로 줄인 변형을 제시합니다. 그러면 효율을 얼마쯤 되찾지만, 이것도 품질과 맞바꾸는 또 하나의 작은 거래입니다.

MoBE가 줄이는 것과 줄이지 못하는 것. · 메모리 두 AI 검토자 모두 MoBE가 아끼는 것은 메모리이지 시간이 아니라고 강조했습니다. · 시간 보통의 서비스 소프트웨어에서는 이 방법에 맞춘 새로운 코드를 짜지 않는 한 압축한 모델이 오히려 더 느리게 돌 수 있습니다.
MoBE가 줄이는 것과 줄이지 못하는 것. · 메모리 두 AI 검토자 모두 MoBE가 아끼는 것은 메모리이지 시간이 아니라고 강조했습니다. · 시간 보통의 서비스 소프트웨어에서는 이 방법에 맞춘 새로운 코드를 짜지 않는 한 압축한 모델이 오히려 더 느리게 돌 수 있습니다.

정확도 손실은 어디에 몰리는가

평균 하락은 작지만 고르게 퍼지지는 않습니다. 두 검토자가 거듭 짚은 대목이 바로 이것입니다. DeepSeek-V3에서는 어려운 경시대회 수학 시험 점수가 56.9에서 52.3으로, 다른 하나는 47.3에서 40.6으로 떨어졌습니다. Kimi-K2에서는 대학원 수준의 과학 시험이 77.4에서 73.2로 내려갔습니다. 반면 폭넓은 지식을 묻는 시험은 거의 움직이지 않았습니다.

검토자들은 여기서 같은 결론에 이르렀습니다. 일반적인 대화를 서비스하는 팀은 그 차이를 끝내 느끼지 못할 수도 있지만, 수학이나 코딩, 혹은 차근차근 밟아 가는 추론에 기대는 팀이라면 내세운 평균을 믿기보다 자기 일감으로 압축한 모델을 직접 시험해 봐야 한다는 것입니다.

모델의 일부만 작아진다

MoBE는 전문가마다 있는 표 가운데 둘만 압축합니다. 세 번째 표는 중요한 지식을 담고 있다고 보아 일부러 건드리지 않고, 모델의 주의(attention) 장치나 어휘 표에도 손대지 않습니다. 검토자들은 여기에, 긴 대화를 따라가려고 쓰는 메모리에도 이 방법이 아무 도움이 되지 않는다고 덧붙였습니다. 그 메모리는 한꺼번에 많은 사람을 상대하거나 문서가 길 때 가장 큰 몫을 차지할 수 있습니다. 그래서 실제로 돌아가는 시스템에서 얻는 여유는 24~30퍼센트라는 숫자만 보고 짐작하는 것보다 작습니다.

누가 이 방법을 집어야 하나

검토자들의 결론은 한곳으로 모였습니다. 거대한 모델을 적고 비싼 메모리에 욱여넣는 것이 가장 큰 고민인 팀에게 MoBE는 정확도를 별로 해치지 않으면서도, 재훈련 없이, 진짜로 크기를 줄여 줍니다. 반대로 진짜 문제가 속도나 글자당 비용, 혹은 최상위 추론 품질인 팀에게는 공짜 이득이 아닙니다. 맞춤 엔지니어링을 요구하고, 가장 어려운 작업에서 결과가 나빠지는 것을 감수해야 하기 때문입니다.

그러니 이 결과를 정직하게 읽으면, 파라미터 숫자는 저장 공간의 절약입니다. 그 숫자는 모델을 메모리에 담아 두기가 얼마나 수월해지는지를 말할 뿐, 더 싸거나 더 빠른 답으로 오해해서는 안 됩니다.

거대한 AI 모델을 줄이는 방법, 그리고 숨은 대가거대한 AI 모델을 줄이는 방법, 그리고 숨은 대가지금 가장 큰 AI 모델은 파라미터라는 숫자를 수천억에서 1조 개 넘게 담습니다. 답하려면 이 숫자들이 그래픽 칩의 빠르고 비싼 메모리에 올라와 있어야 하는데, 가장 큰 모델은 좋은 장비로도 벅찹니다. 2025년 한 논문이 그 숫자 더미를 줄이는 MoBE라는 방법을 내놓았고, 폴로라는 이를 여러 AI 모델 앞에 놓고 무엇을 이루고 무엇을 대가로 치르는지 살펴보게 했습니다. · ※ 파라미터 : 모델이 훈련에서 배워 저장해 둔, 조절할 수 있는 숫자이 방법이 바꾸는 것 · ※ 전문가 : 특기가 다른 작은 신경망으로, 큰 모델은 글자마다 그중 몇 개만 골라 쓴다내세우는 숫자전문가를 잘라 내는 것보다 덜 아픈 이유작아진다고 빨라지는 것은 아니다 · MoBE가 줄이는 것과 줄이지 못하는 것.정확도 손실은 어디에 몰리는가메모리에 거대한 모델을 욱여넣는 것이 가장 큰 고민인 팀에게 MoBE는 재훈련 없이 정확도를 별로 해치지 않고 크기를 줄여 줍니다. 하지만 속도나 글자당 비용, 최상위 추론이 진짜 문제라면 공짜가 아닙니다. 줄어든 파라미터는 저장 공간의 절약일 뿐, 더 싸거나 빠른 답으로 오해해서는 안 됩니다.출처 arxiv.org · MoBE: Mixture-of-Basis-Experts for Compressing MoE-based LLMs, github.com · MoBE source code

What does this compression method actually achieve, and what would a team running large models have to give up to use it?

Machine Learning Research Scientist · gpt-5.6-terra

MoBE is primarily a weight-memory/storage compression technique for Mixture-of-Experts models, not a free inference-speed upgrade. What it achieves In a conventional MoE layer, every expert has its own large gate and up-projection matrices. MoBE replaces those matrices with: - a smaller expert-specific matrix \(A_i\), preserving much of each expert’s individuality; and - a small collection of layer-wide shared basis matrices \(B_j\), mixed with per-expert coefficients. So it exploits the idea that experts differ, but also contain substantial reusable structure. The reported result is meaningful at the scale of deployment: - 24–30% reduction in total model parameters for models such as Qwen3-235B, DeepSeek-V3 (671B), and Kimi-K2 (1T); - about 1–2 absolute points average benchmark loss in the headline result, roughly 2% relative loss; - substantially better retention than the paper’s pruning and SVD-style decomposition baselines at comparable compression levels. Put concretely, a 671B-parameter checkpoint compressed by 30% is roughly a 200B-parameter reduction in stored weights. At BF16, that is on the order of 400 GB less weight storage bef…

Deep Learning Systems Architect · deepseek-v4-pro

Short answer: MoBE is primarily a weight-memory/storage win, not an automatic compute or latency win. It shrinks total parameters by 24–30% on Qwen3-235B-A22B-2507, DeepSeek-V3-0324, and Kimi-K2-Instruct while retaining roughly 98% of average accuracy. But a deployment team pays for that in activation overhead, kernel engineering, and operational complexity. What it actually achieves The core idea: for each expert’s gate/up matrix, instead of storing full \(W_i\), MoBE uses \(W_i \approx A_i \, f\!\left(\sum_j \alpha_{i,j} B_j\right)\). - \(A_i\) is small and expert-specific. - \(B_j\) are shared basis matrices across all experts in a layer. - Down-projection matrices are not compressed, because the authors argue they hold critical knowledge. So the savings come from sharing \(B_j\) and keeping only small \(A_i\) per expert. The paper shows this preserves accuracy much better than prior decomposition methods (MoLAE, D2-MoE) at similar or higher compression rates. It also achieves much lower reconstruction MSE. For very large MoE models, that 24–30% total-parameter reduction is useful because total parameter count is often the deployment bottleneck for GPU/CPU memor…

The Arbiter · gemini-3-7-flash

Round 1 Summary & Synthesis Both participants—the Deep Learning Systems Architect and the Machine Learning Research Scientist—converged on a clear breakdown of what MoBE (Mixture-of-Basis-Experts) accomplishes and the specific engineering and operational trade-offs required to adopt it. --- 1. What the Method Actually Achieves * Targeted Matrix Factorization: Rather than pruning or merging entire experts, MoBE decomposes the gate and up-projection matrices of each expert into a small, expert-specific matrix $A_i$ and a linear combination of shared basis matrices $\{B_j\}$ passed through a non-linear activation (e.g., SiLU/Tanh): $$\hat{W}^i = A^i f\left(\sum_j \alpha^{i,j} B^j\right)$$ Down-projection matrices, attention layers, and embeddings remain uncompressed. * Significant Weight-Memory Reduction: It achieves a 24% to 30% reduction in total parameter count on massive MoE models (e.g., Qwen3-235B, DeepSeek-V3-0324 [671B], Kimi-K2-Instruct [1T]). At BF16 precision, this equates to roughly 400 GB of saved weight storage for a 671B checkpoint. * Superior Quality Retention vs. Baselines: Compared to prior SVD decompositions (MoLAE, D2-MoE) or…

The Arbiter's Final Verdict · gemini-3-7-flash

Final Verdict The proposed method, Mixture-of-Basis-Experts (MoBE), addresses the deployment bottleneck of massive Mixture-of-Experts (MoE) LLMs by trading mathematical purity and runtime simplicity for substantial parameter-memory savings. --- Part 1: What MoBE Actually Achieves 1. Targeted Weight-Memory Compression: * 24% to 30% reduction in total parameters on massive frontier MoEs (e.g., DeepSeek-V3 671B, Qwen3-235B, Kimi-K2 1T). * For a checkpoint like DeepSeek-V3 (671B), this eliminates roughly 350–400 GB of raw weight footprint at BF16 precision, directly reducing the number of high-end GPUs required just to hold model weights in VRAM. 2. Significantly Better Accuracy Retention Than Prior Baselines: * Rather than dropping or merging experts (pruning) or relying on standard truncated SVD (which fails because MoE weight matrices exhibit high effective rank), MoBE factorizes the up/gate matrices into: $$\hat{W}^i = A^i f\left(\sum_{j=1}^m \alpha^{i,j} B^j\right)$$ where $\{B^j\}$ are layer-shared basis matrices, $A^i$ is expert-specific, and $f$ is a non-linear activation (SiLU/Tanh). * It achieves an average retention o…