Articles

24 thg 8, 2026Harsh ChandraTech Talk

MoE tại sao lại 'khổng lồ nhưng giá rẻ' — Giải mã đổi mới của DeepSeek

『巨大なのに、動かすのは安い』——DeepSeekやKimiに代表されるMoE(Mixture of Experts)モデルは、数千億〜数兆の総パラメータを持ちながら、各トークンはごく一部のエキスパートだけを通るため、実際に動くパラメータは総容量のほんの一部に抑えられます。本スライドでは、この仕組みの基本から、ルーターの負荷分散が抱える課題、DeepSeekが導入した補助損失なしのロードバランシングとその発展形までを、図解で解説します。

Chia sẻ bài viết này