Articles
MoE क्यों 'विशाल होने के बावजूद सस्ता' है — DeepSeek के नवाचार को समझें
『巨大なのに、動かすのは安い』——DeepSeekやKimiに代表されるMoE(Mixture of Experts)モデルは、数千億〜数兆の総パラメータを持ちながら、各トークンはごく一部のエキスパートだけを通るため、実際に動くパラメータは総容量のほんの一部に抑えられます。本スライドでは、この仕組みの基本から、ルーターの負荷分散が抱える課題、DeepSeekが導入した補助損失なしのロードバランシングとその発展形までを、図解で解説します。