MoE(Mixture of Experts)

MoE(専門家混合)は、AIモデルの中に多数の「専門家」を持ち、質問ごとに必要な専門家だけを働かせる設計です。全員を毎回働かせないため、巨大なモデルでも計算が軽く済みます。「35B-A3B」のような型番は、専門家全員で350億(35B)、毎回働くのは30億(A3B)という意味です。

GPUを買わずに、大きいモデルを動かす — クラウドGPUという選択肢(仕組みと手順の解説へ)

大原則: 容量は「総量」、速度は「実効」

決めるのは理由
必要VRAM総パラメータ(35B)どの専門家が呼ばれるかはトークンごとに変わるため、全専門家をメモリに載せておく必要がある
生成速度実効パラメータ(3B)1トークンあたり読み出す重みは起動された専門家の分だけ。速度はメモリ読み出し量で決まる

つまり35B-A3Bは「置き場所は35B級に必要だが、走り出せば3B級に近い速さ」。ただし実効パラメータは速度の一次的な目安であって保証ではありません — 共有層やルーターの処理、疎行列カーネルの実装、メモリアクセスの仕方、オフロードの有無で実際の速度は変わります。当サイトの判定もこの通りに実装しています — 必要VRAMは総量(35.95B実測)から、実測ベンチ後の速度推定は実効3Bから計算します。

なぜこんな設計が流行っているのか

denseモデルでは、賢くする=パラメータを増やす=遅くなる、が直結していました。MoEは「知識の置き場」と「毎回の計算量」を分離することで、大きな知識を保ちながら小型モデル並みの速度を実現します。2025年以降のフラッグシップ(DeepSeek、Kimi K2、GLM、Qwen3.5の大型版)はほぼ全てMoEです。

ローカル実行での現実的な注意

当サイトのモデル名の「35B-A3B」表記や、サーバー級モデル(Kimi K2=総1T・実効32B級など)の判定もすべてこの「容量=総量」原則で計算しています。

関連用語

参考資料(出典)

▶ あなたのPCで動くモデルを自動判定する(スペック送信なし・ブラウザ内完結)

📚 ローカルLLMの入門書・ムックをAmazonで探す

上記はアフィリエイトリンクです。経由して課金された場合、当サイトに紹介料が入ります。