BFCL(ツール利用の実力を測る)

GPUを買わずに、大きいモデルを動かす — クラウドGPUという選択肢(仕組みと手順の解説へ)

BFCL(Berkeley Function-Calling Leaderboard)は、モデルが「関数=ツールを正しく呼べるか」を測るベンチマーク/リーダーボードです。与えられた道具の一覧から適切なものを選び、正しい引数で呼び出せるか——つまりツール利用(function calling)の実力を評価します。

何を測っているか

単純な「呼べる/呼べない」だけでなく、複数の関数から正しいものを選ぶ・引数の型を間違えない・呼ぶ必要がない時は呼ばない・複数の呼び出しを組み立てるといった、実際のエージェント運用で必要な精度を細かく採点します。文章生成の巧さとは別の能力で、ここが弱いと「もっともらしく喋るが道具をうまく使えない」モデルになります。

ローカルLLM選びでなぜ見るのか

先にツール利用の項で述べたとおり、ローカルの小型モデルはツール呼び出しや複数手順の計画が苦手な傾向があります。BFCLは、その苦手さを具体的な数字で確かめられる数少ない指標です。用途がこう分かれます:

「ローカルでエージェントを動かしたい」なら、モデルサイズが手元のGPUに収まるか(トップの判定)と、BFCLのようなツール実力の両方を見るのが安全です。

関連用語

参考資料(出典)

▶ あなたのPCで動くモデルを自動判定する(スペック送信なし・ブラウザ内完結)

📚 ローカルLLMの入門書・ムックをAmazonで探す

上記はアフィリエイトリンクです。経由して課金された場合、当サイトに紹介料が入ります。