Articles

2026.8.24Harsh ChandraTech Talk

MoEはなぜ『巨大なのに安い』のか — DeepSeekの革新を読み解く

『巨大なのに、動かすのは安い』——DeepSeekやKimiに代表されるMoE(Mixture of Experts)モデルは、数千億〜数兆の総パラメータを持ちながら、各トークンはごく一部のエキスパートだけを通るため、実際に動くパラメータは総容量のほんの一部に抑えられます。本スライドでは、この仕組みの基本から、ルーターの負荷分散が抱える課題、DeepSeekが導入した補助損失なしのロードバランシングとその発展形までを、図解で解説します。

この記事をシェア