こんにちは、AIニュースアプリ Morning AI 開発者の矢野哲平です。この記事では、Cloudflareが公開した判断モデル「Clef」と、TypeSafe AIの「Jev」を比較した結果を紹介します。
私は普段、テキストをジャンルごとに自動で振り分ける処理にJevを使っています。そこにCloudflareから新しい判断モデルが出てきたので、乗り換える価値があるのかを実際に測ってみました。
なお、ここで紹介する結果は、あくまで私の環境と私のタスクで試したものです。使い方やデータが変われば結果も変わるので、参考程度に見ていただければと思います。
判断モデル・Jev・Clefとは
本題に入る前に、登場するものを軽く整理しておきます。
判断モデルとは
判断モデルは、文章で答える代わりに、あらかじめ決めた選択肢の中から答えを一つ選ぶAIです。文章を生成しないぶん、速くて安く、答えの形もブレません。
選んだ答えと一緒に、「どれくらい自信があるか」を表す数字(確率)も返してくれます。この数字が、後で出てくる「閾値」の話につながります。
詳しくは 判断モデルとは?の解説記事 にまとめています。
Jevとは
Jevは、TypeSafe AIというスタートアップが9月15日に発表した判断モデルです。判断モデルというジャンルの火付け役で、Jevの登場をきっかけに、各社が次々と判断モデルを公開しました。
Jevはクローズドなモデルです。モデルの中身は公開されておらず、TypeSafe AIが提供するAPIを通して使います。
Clefとは
Clefは、Cloudflareが10月1日に公開した判断モデルです。Jevと同じ種類のモデルで、選択肢から一つを選び、その確率を返します。
Jevとの大きな違いは、Clefがオープンなモデルである点です。モデルの中身がHugging Faceで公開されていて、Apache 2.0ライセンスのもとで誰でも使えます。もちろん、CloudflareのWorkers AIから呼び出して使うこともできます。
Clefには、大きめのモデルの「Clef」と、軽量版の「Clef-flash」の2種類があります。
|
Clef |
Clef-flash |
Jev |
| 提供元 |
Cloudflare |
Cloudflare |
TypeSafe AI |
| 公開形態 |
オープン(Apache 2.0) |
オープン(Apache 2.0) |
クローズド(APIで提供) |
| 元になったモデル |
Qwen 3.8(27B) |
Qwen 3.5(9B) |
非公開 |
| 入力できるもの |
テキスト・画像 |
テキスト・画像 |
テキストのみ |
| 応答時間(中央値・Cloudflare発表) |
209ms |
39ms |
524ms |
| 入力の単価(100万トークンあたり) |
$0.24 |
$0.09 |
$0.042 |
| 一度に読める長さ |
64kトークン |
64kトークン |
64kトークン(※) |
※ Jevは1回のリクエスト全体で64kトークンまで読めますが、本文と1つの質問の合計は32kトークンまでという制限があります。
応答時間は、Cloudflareが自社のブログで発表した測定値です。単価だけを見るとJevがいちばん安く、Cloudflareの発表を見るとClef-flashが圧倒的に速そうに見えます。ただ、Clefの公式ドキュメントには、日本語への対応について書かれていませんでした。
この記事で解説するポイントは、主に次の3つです。
- ClefとJevを、同じ条件でどう比べたのか
- 精度・速さ・コストの測定結果
- 結果を踏まえて、乗り換えないと判断した理由
どう比べたのか
比べたタスクは、テキストを読んで、あらかじめ用意したジャンルのどれに当てはまるかを選ばせるものです。どのジャンルにも当てはまらないテキストのために、「該当なし」という選択肢も用意しています。
テストデータは2種類です。
|
件数 |
ジャンルの数 |
| 易しいセット |
36件 |
8個 |
| 難しいセット |
48件 |
17個 |
合計84件のテキストを、Jev・Clef・Clef-flashの3つのモデルにそれぞれ判断させました。84件 × 3モデルで252回呼び出し、失敗は0回です。
条件はできるだけ普段の使い方とそろえました。質問文は日本語で、各ジャンルには説明文を付けています。また、手元のパソコンとの通信時間が混ざらないように、普段と同じくCloudflare Workersの中から呼び出して時間を測りました。
測定結果
結果は次のとおりです。
|
Jev |
Clef |
Clef-flash |
| 正解率 |
99% |
93% |
98% |
| 閾値0.6での正解 / 誤り / 取りこぼし |
100% / 0% / 0% |
90% / 1% / 8% |
94% / 1% / 5% |
| 「該当なし」の正解率(易しい / 難しい) |
100% / 88% |
67% / 50% |
100% / 75% |
| 応答時間(中央値) |
341ms |
380ms |
185ms |
| 応答時間(p95) |
455ms |
862ms |
307ms |
| 1,000回あたりのコスト |
$0.034 |
$0.127 |
$0.048 |
閾値0.6というのは、「モデルの自信が0.6未満なら振り分けずに残す」というルールです。自信のない答えを採用しないことで、間違ったジャンルに入るのを防ぎます。この閾値をかけたときに、正しく振り分けられた割合、間違ったジャンルに入った割合、振り分けられずに残った割合を並べています。
p95は、100回呼んだうち遅いほうから5番目くらいの時間です。たまに起きる遅さを見るための数字だと思ってください。
ここから、精度・速さ・コストの順に見ていきます。
精度:差が出たのは「該当なし」だけ
まず精度です。結論から言うと、どこかのジャンルに入るべきテキストは、3つのモデルとも全問正解でした。
差が出たのは、どのジャンルにも当てはまらない「該当なし」のテキストだけです。
Clefの系統は、例えば「了解です」「特になし」のような、中身がほとんどないテキストを、「アイデア」などそれらしいジャンルに入れたがる傾向がありました。特に大きいほうのClefは、難しいセットの「該当なし」の正解率が50%まで落ちています。
閾値との相性にも差がありました。
Jevが間違えたのは、日常のひとことを、少し関係のありそうなジャンルに入れた1件だけです。このときのJevの自信は0.48だったので、閾値0.6をかければ振り分けずに残せます。結果として、閾値をかけたJevは誤りも取りこぼしも0%でした。
一方、Clef-flashは同じテキストを、自信0.67で間違えていました。0.6を超えているので、閾値では防げません。
|
間違えたときの自信 |
閾値0.6で防げるか |
| Jev |
0.48 |
防げる |
| Clef-flash |
0.67 |
防げない |
自信のない答えには低い数字をつける。Jevはこの点が素直で、閾値と組み合わせたときに扱いやすいと感じました。
速さ:Clef-flashは約0.16秒速い
次に速さです。
Clef-flashは、中央値でJevより約0.16秒速くなりました。p95でも約0.15秒速く、安定して速いと言えます。
一方、大きいほうのClefは、中央値ではJevとほとんど変わりませんでした。ばらつきが大きく、遅いときは1.1秒かかっています。Cloudflareが発表した中央値209msは、今回の条件では出ませんでした。
反対に、Jevの中央値は341msで、Cloudflareが発表した524msより速い結果でした。応答時間は、測る環境や入力の長さで大きく変わります。発表された数字は目安として見ておくのがよさそうです。
なお、ジャンルの数が8個でも17個でも、応答時間はほとんど変わりませんでした。選択肢が増えても遅くならないのは、判断モデルの良いところだと思います。
コスト:単価は約6倍、実際は3.7倍
最後にコストです。
ClefとJevの入力の単価は、約6倍の差があります。ところが実際に測ると、1,000回あたりのコストの差は3.7倍でした。
理由は、同じ文章でも、Clefのほうが数えるトークンが少なかったからです。1回あたりの入力トークンの平均は、Jevが818、Clefが528でした。
|
1回あたりの入力トークン |
1,000回あたりのコスト |
Jevとの比較 |
| Jev |
818 |
$0.034 |
ー |
| Clef |
528 |
$0.127 |
3.7倍 |
| Clef-flash |
528 |
$0.048 |
1.4倍 |
単価だけで比べると、実際のコストを見誤ることがある。これは今回の測定で得た、ちょっとした学びです。
結論:乗り換えない
結果を踏まえて、Jevから乗り換えないと判断しました。
| モデル |
判断 |
理由 |
| Clef |
乗り換えない |
精度・速さ・コストのすべてでJevを下回った |
| Clef-flash |
乗り換えない |
約0.16秒速いが、「該当なし」の精度が落ち、コストは1.4倍 |
迷ったのはClef-flashです。0.16秒速くなるのは魅力的でした。
ただ、振り分けの処理では、間違ったジャンルに入れる失敗のほうが、振り分けずに残す失敗よりずっと重くなります。間違ったジャンルに入ったテキストは、本来あるはずの場所から消えたように見えてしまうからです。
0.16秒のために、この失敗を増やす理由はない。そう判断しました。
測定の限界
公平のために、今回の測定の限界も書いておきます。
- 84件を1回ずつ測っただけで、差が出た「該当なし」のテキストは14件しかありません
- 質問文の書き方や閾値0.6は、Jevに合わせて調整したものです。Clefに合わせて詰めれば、差が縮む可能性はあります(未検証)
また、Cloudflareの公式の比較では、10個のベンチマークのうち8個でClefがJevを上回っています。一方で、残りの2個ではJevが上でした。どちらが優れているかは、タスクの性質によって変わりそうです。
今回の結論は、あくまで私の環境で試した結果から出したものです。どのモデルが向いているかは、扱うテキストや選択肢の作り方によって変わるので、参考程度にとどめてください。
まとめ
- Cloudflareの判断モデル「Clef」「Clef-flash」と、TypeSafe AIの「Jev」を、テキストをジャンルごとに振り分けるタスクで比較しました。
- どこかのジャンルに入るべきテキストは3つとも全問正解で、差が出たのは「該当なし」のテキストだけでした。Clefの系統は、当てはまらないテキストをそれらしいジャンルに入れたがる傾向がありました。
- Clef-flashは約0.16秒速い一方、「該当なし」の精度が落ち、コストは1.4倍でした。間違ったジャンルに入れる失敗を増やしてまで速さを取る理由はないと考え、Jevを使い続けることにしました。
判断モデルは、発表から短い期間で各社が参入し、選択肢が一気に増えました。ただ、公式の数字と自分のタスクでの結果は、必ずしも一致しません。
乗り換えを検討するときは、自分のデータで、精度・速さ・コストをセットで測ってみることをおすすめします。特に、どの選択肢にも当てはまらない入力をどう扱うかは、モデルごとの差が出やすいポイントだと感じました。