ROCm

ROCmは、AMDのGPUで汎用計算を行うための開発基盤で、CUDAに相当する位置づけです。ローカルLLMは主要な実行環境がROCmに対応しており「動きます」。ただし当サイトの実測比較では、同じメモリ帯域から引き出せる速度がCUDAより低く、しかも版によるばらつきが大きいのが実情です。

GPUを買わずに、大きいモデルを動かす — クラウドGPUという選択肢(仕組みと手順の解説へ)

数字で見る差 — そして順位が逆転する話

同一ベンチマークの計測を、当サイトの理論上限(帯域÷重み)と比べた達成率は、ROCmが56〜67%、CUDAが62〜80%です。ここで実用上いちばん危険なのが、帯域の数字だけで比べると順位が入れ替わることです。

RX 7900 XT(800GB/s)は RTX 4080(717GB/s)より帯域が高く、理論上限も上に出ます。しかし実測はRTX 4080が142.49トークン/秒、RX 7900 XTが116.15トークン/秒で逆転します。カタログスペックだけで選ぶと、この差に気づけません。

ばらつきの大きさも織り込む

ROCmは版・ドライバ・OSによって条件が揃わず、投稿ごとに結果が動きます(公式表の各行もROCm版やOSが明記されていないものが多く、そのまま横並びにはできません)。改善が続いている領域でもあるため、今日の数字が来年も同じとは限りません。当サイトが実現率を「幅」で示し、単一の係数として判定に焼き込んでいないのはこのためです(そんな精度のデータではない、という判断です)。

AMDを選ぶ場合に見るべきこと

当サイトの判定(◎△×)は容量で決まるため、ROCmかCUDAかで結果は変わりません。変わるのは同じ判定のなかでの速度です。

関連用語

参考資料(出典)

▶ あなたのPCで動くモデルを自動判定する(スペック送信なし・ブラウザ内完結)

📚 ローカルLLMの入門書・ムックをAmazonで探す

上記はアフィリエイトリンクです。経由して課金された場合、当サイトに紹介料が入ります。