Articles

2026년 8월 24일Harsh ChandraTech Talk

MoE는 왜 '거대하면서도 저렴한가' — DeepSeek의 혁신을 읽다

『巨大なのに、動かすのは安い』——DeepSeekやKimiに代表されるMoE(Mixture of Experts)モデルは、数千億〜数兆の総パラメータを持ちながら、各トークンはごく一部のエキスパートだけを通るため、実際に動くパラメータは総容量のほんの一部に抑えられます。本スライドでは、この仕組みの基本から、ルーターの負荷分散が抱える課題、DeepSeekが導入した補助損失なしのロードバランシングとその発展形までを、図解で解説します。

이 글을 공유하기