トークンとトークナイザー

トークンは、LLMが文章を処理する最小単位です。コンテキスト長も生成速度(tokens/秒)もAPI料金も、すべてこの単位で数えられます。そして日本語ユーザーには重要な事実がひとつ — 英語中心に学習されたトークナイザーでは、日本語は同じ内容でも多くのトークンを消費します(日本語を多く含むデータで学習されたトークナイザーでは、この差は小さくなります)。

GPUを買わずに、大きいモデルを動かす — クラウドGPUという選択肢(仕組みと手順の解説へ)

トークナイザーの仕事

トークナイザーは文章をトークン列に切り、番号に変換します。単語単位でも文字単位でもなく、頻出パターンをまとめた「よく出る部品」単位(BPE系)で切るのが現代の主流です。例えば英語の "the" は1トークン、"tokenization" は2〜3トークンに分かれます。各モデルは固有の語彙表(数万〜25万種)を持ち、モデルが違えば同じ文章でもトークン数は変わります

日本語の効率問題

語彙表は学習データの頻度で決まるため、英語中心に作られたトークナイザーでは日本語が細切れになります。目安として日本語はおおよそ1〜2文字で1トークンですが、モデルによる差が大きく、固定の換算率はありません。英語なら1トークンで単語1個運べるところ、日本語は同じ内容を伝えるのに1.5〜2倍のトークンを使いがちです。これは実用上3つの意味を持ちます:

tokens/秒の体感目安

当サイトの実測ベンチマークで使っている目安をそのまま載せます: 6〜10 t/s ≒ 人が黙読する速度 / 15 t/s以上 = 快適な対話 / 30 t/s以上 = 非常に快適。生成速度はメモリ帯域律速なので、モデルの重みサイズ(=量子化後のGB数)にほぼ反比例します。

マニアック小ネタ

関連用語

参考資料(出典)

▶ あなたのPCで動くモデルを自動判定する(スペック送信なし・ブラウザ内完結)

📚 ローカルLLMの入門書・ムックをAmazonで探す

上記はアフィリエイトリンクです。経由して課金された場合、当サイトに紹介料が入ります。