Transformer

GPUを買わずに、大きいモデルを動かす — クラウドGPUという選択肢(仕組みと手順の解説へ)

Transformerは2017年の論文「Attention Is All You Need」で提案された、現代のLLMほぼすべての土台となるアーキテクチャです。GPTもLlamaもQwenもGemmaも、中身は「Transformerの積み重ね」。仕組みの骨格を知っておくと、VRAMや速度の話が「暗記」から「理解」に変わります。

核心は注意機構(Attention)

文章の意味は語順と関係の網で決まります。「銀行の金利」と「川の土手」— 英語ならどちらも "bank" ですが、周囲の語との関係で意味が定まります。注意機構は、各トークンが文中の他の全トークンを「見て」、関係の強さに応じて情報を混ぜ合わせる仕組みです。これを何十層も重ねることで、文法→意味→文脈→推論と、だんだん抽象的な関係を捉えていきます。

実装上は各トークンがQuery(問い)・Key(見出し)・Value(中身)という3つのベクトルを持ち、QとKの照合で「どこを見るか」を決めてVを集めます。このKとVを再利用のために保存したものがKVキャッシュです — ローカルLLMのメモリ事情に直結する話は、すべてここから生えています。

構造の全体像(ざっくり)

入力文 → トークナイザー → 埋め込み
  → [ 注意機構 → FFN(知識の引き出し) ] × 数十層
  → 次トークンの確率分布 → 1トークン出力 → (先頭に戻って繰り返し)

1トークン出すたびにこの全層を通るので、生成速度は「重み一式をメモリから読む速さ」= メモリ帯域で律速されます。パラメータの大半は各層のFFN側にあり、MoEはこのFFNを専門家群に分割した変種です。

注意機構の弱点と、派生が生まれた理由

素朴な注意機構は「全トークン×全トークン」の照合なので、コンテキストが伸びるほど計算とKVキャッシュが膨らみます。この弱点への回答が近年の派生ラッシュです:

どれも「注意の贅沢さをどこまで削っても賢さを保てるか」という同じ問いへの別解で、その差はKVキャッシュのページで実数として確認できます。当サイトの判定はこれらの方式差を織り込み済みです。

関連用語

参考資料(出典)

▶ あなたのPCで動くモデルを自動判定する(スペック送信なし・ブラウザ内完結)

📚 ローカルLLMの入門書・ムックをAmazonで探す

上記はアフィリエイトリンクです。経由して課金された場合、当サイトに紹介料が入ります。