ROCm
ROCmは、AMDのGPUで汎用計算を行うための開発基盤で、CUDAに相当する位置づけです。ローカルLLMは主要な実行環境がROCmに対応しており「動きます」。ただし当サイトの実測比較では、同じメモリ帯域から引き出せる速度がCUDAより低く、しかも版によるばらつきが大きいのが実情です。
数字で見る差 — そして順位が逆転する話
同一ベンチマークの計測を、当サイトの理論上限(帯域÷重み)と比べた達成率は、ROCmが56〜67%、CUDAが62〜80%です。ここで実用上いちばん危険なのが、帯域の数字だけで比べると順位が入れ替わることです。
RX 7900 XT(800GB/s)は RTX 4080(717GB/s)より帯域が高く、理論上限も上に出ます。しかし実測はRTX 4080が142.49トークン/秒、RX 7900 XTが116.15トークン/秒で逆転します。カタログスペックだけで選ぶと、この差に気づけません。
ばらつきの大きさも織り込む
ROCmは版・ドライバ・OSによって条件が揃わず、投稿ごとに結果が動きます(公式表の各行もROCm版やOSが明記されていないものが多く、そのまま横並びにはできません)。改善が続いている領域でもあるため、今日の数字が来年も同じとは限りません。当サイトが実現率を「幅」で示し、単一の係数として判定に焼き込んでいないのはこのためです(そんな精度のデータではない、という判断です)。
AMDを選ぶ場合に見るべきこと
- 容量あたりの価格 — 同価格帯でVRAMが多い構成を選べることがあります。そもそも載らないモデルは動かないので、容量が効く場面では有利になりえます。
- 環境構築の手間 — 対応OS・カーネル・ROCm版の組み合わせに制約があります。「買えば動く」度合いはCUDA環境より低いと考えてください。
- Vulkanという別経路 — ROCm非対応の構成でもVulkan経由で動きます。どちらが速いかは一概に言えません: 公式表では RX 9070 XT がVulkanで137.11トークン/秒、ROCmで101.27トークン/秒とVulkanのほうが速い一方、世代・OS・ドライバ・ビルドによって優劣は入れ替わります。Intel Arcでは同じGPUでランタイム選択により処理速度が桁違いに変わる報告もあり、「どの経路で動いているか」を把握し、両方試す価値があります。
当サイトの判定(◎△×)は容量で決まるため、ROCmかCUDAかで結果は変わりません。変わるのは同じ判定のなかでの速度です。
関連用語
- CUDA — NVIDIA GPUの標準的な計算基盤。当サイト収録の実測では理論上限の62〜80%
- メモリ帯域(メモリバンド幅) — メモリを毎秒何GB読み書きできるか。ローカルLLMの生成速度を事実上決めるスペック
- VRAM(ビデオメモリ) — GPUに載っている専用メモリ。ローカルLLMで動くモデルの大きさを決める最重要スペック
参考資料(出典)
- https://rocm.docs.amd.com/en/latest/
- https://github.com/ggml-org/llama.cpp/discussions/15021
- https://github.com/ggml-org/llama.cpp/discussions/10879
▶ あなたのPCで動くモデルを自動判定する(スペック送信なし・ブラウザ内完結)
上記はアフィリエイトリンクです。経由して課金された場合、当サイトに紹介料が入ります。