Transformer
Transformerは2017年の論文「Attention Is All You Need」で提案された、現代のLLMほぼすべての土台となるアーキテクチャです。GPTもLlamaもQwenもGemmaも、中身は「Transformerの積み重ね」。仕組みの骨格を知っておくと、VRAMや速度の話が「暗記」から「理解」に変わります。
核心は注意機構(Attention)
文章の意味は語順と関係の網で決まります。「銀行の金利」と「川の土手」— 英語ならどちらも "bank" ですが、周囲の語との関係で意味が定まります。注意機構は、各トークンが文中の他の全トークンを「見て」、関係の強さに応じて情報を混ぜ合わせる仕組みです。これを何十層も重ねることで、文法→意味→文脈→推論と、だんだん抽象的な関係を捉えていきます。
実装上は各トークンがQuery(問い)・Key(見出し)・Value(中身)という3つのベクトルを持ち、QとKの照合で「どこを見るか」を決めてVを集めます。このKとVを再利用のために保存したものがKVキャッシュです — ローカルLLMのメモリ事情に直結する話は、すべてここから生えています。
構造の全体像(ざっくり)
入力文 → トークナイザー → 埋め込み
→ [ 注意機構 → FFN(知識の引き出し) ] × 数十層
→ 次トークンの確率分布 → 1トークン出力 → (先頭に戻って繰り返し)
1トークン出すたびにこの全層を通るので、生成速度は「重み一式をメモリから読む速さ」= メモリ帯域で律速されます。パラメータの大半は各層のFFN側にあり、MoEはこのFFNを専門家群に分割した変種です。
注意機構の弱点と、派生が生まれた理由
素朴な注意機構は「全トークン×全トークン」の照合なので、コンテキストが伸びるほど計算とKVキャッシュが膨らみます。この弱点への回答が近年の派生ラッシュです:
- GQA — K/Vヘッドを減らして共有(現在の標準)
- MLA(DeepSeek系)— K/Vを低次元の潜在ベクトルに圧縮
- Sliding window(Gemma系)— 大半の層は直近だけを見る
- 線形注意ハイブリッド(Qwen3.5系)— 大半の層を固定サイズ状態の別方式に置き換え
どれも「注意の贅沢さをどこまで削っても賢さを保てるか」という同じ問いへの別解で、その差はKVキャッシュのページで実数として確認できます。当サイトの判定はこれらの方式差を織り込み済みです。
関連用語
- KVキャッシュ — 会話の文脈を保持する作業メモリ。GQA・MLA・ハイブリッド注意でサイズが数十倍変わる
- トークンとトークナイザー — LLMが文章を数える単位。日本語は英語よりトークン効率が悪く、体感速度にも効く
- ローカルLLMとは — 自分のPCやスマホの中で動かす大規模言語モデル。会話が外部に送信されない
参考資料(出典)
▶ あなたのPCで動くモデルを自動判定する(スペック送信なし・ブラウザ内完結)
上記はアフィリエイトリンクです。経由して課金された場合、当サイトに紹介料が入ります。