AI活用

Clefとは?Cloudflareの判断モデルの仕組みと公表値の読み方

左の状況のカードから右の3つの選択肢へ矢印が伸び、それぞれに長さの違う確率の棒が付いた、文章を書かずに確率で答える判断モデルを表すアイキャッチ
マワルくん マワルくん
こんな人におすすめ
・CloudflareのClefが何者なのかを短く知りたい
・「Jevに勝った」という紹介を信じてよいか迷っている
・AIの判断に付く確率を、業務の線引きに使いたい

Cloudflareは2026年10月1日、自社で学習させた判断モデル「Clef」を公開しました。翌日には海外のSNSで「Jevを2週間で追い抜いた」という紹介も広まりました。

Clefとは、状況と選択肢つきの質問を受け取り、文章を書かずに各選択肢の確率を返すモデルです。Clefの新しさは速さよりも、確率の当たり具合まで学習で整えようとした点にあります。本記事では、自前で作った理由、仕組み、学習、ベンチマークの勝ち負け、調整と制約を、2026年10月時点の公式情報で整理します。

この記事のゴール(読了目安 約8分)

Clefの仕組みと公表値の強み・弱みを説明でき、自社で使う前に「その確率が本当に当たっているか」を確かめる手順が分かるようになる。

Clefとは

文章ではなく確率を返す

Clefは、問い合わせの文面などの状況と型の決まった質問を受け取り、許された答えそれぞれに確率を付けて返します。モデルは27BのClefと、9BのClef-flashの2つです。判断モデルの基本や返る3つの型は、別記事で解説しています。

2026年10月1日に公開

Workers AIのチームが初めて自ら学習させたモデルで、TypeSafe AIのJevと同じ形で呼べます。重みはApache 2.0でHugging Faceにも公開されました。名前は、楽譜の冒頭で音の高さを決める音部記号に由来します。呼び出し方や料金は、別記事で整理しています。

なぜ自前で作ったのか

社内に判断の仕事が多い

同社の社内には、判断モデルを組み込みたい業務がいくつもありました。

  • サポート: 寄せられた問い合わせの振り分け
  • 利用者の申告: 不正や有害な内容の通報の評価
  • ボット対策: クローラーが良いボットか悪いボットかの判定

同社には15年を超えるネットワークのデータと、長年のラベル付きの判断があります。またJevへの関心を受けて、速く小さい分類モデルを、強化学習の製品を試す場に選んだと説明しています。

脅威情報の分類で試した

脅威情報チームは、ウェブサイトのドメインの分類でClefを試しました。ページを取得して描画する機能と組み合わせ、分類まで2.2秒です。同じ流れで同社最速の汎用LLMのgpt-oss-120bは4.7秒かかり、分類も2つだけでした。結果は「ファッション95%、フィッシング1%未満」のような確率の並びで返ると例示されています。

文章を書かずに答える仕組み

LLMは答えを1語ずつ書き、その文章から結果を読み取ります。Clefは途中の文章を一切書かずに、選択肢へ直接点を付けます。

  • 1回で読む: 土台のQwenが入力を1回だけ読み込む
  • 選択肢ごとに根拠を集める: 各選択肢が、入力の中から自分に関わる部分を拾う
  • まとめて点を付ける: 質問同士と元の入力を突き合わせてから、すべての選択肢に一度に点を付ける

1語ずつ書く手順が無いぶん、汎用のLLMより大幅に速いと同社は説明しています。

左に1語ずつ文章を書いてから答えを読み取るLLMの流れ、右に入力を1回読んで選択肢すべてに一度に点を付けるClefの流れを並べた左右比較の図

確率を当たり率に合わせる学習

判断モデルの確率は、当たる割合と合っていて初めて役に立ちます。0.8と出た答えの約8割が正解という状態で、これを較正と呼びます。Clefの学習を、同社の説明から本記事で整理しました。

段階 何をしたか
土台 Qwen(27Bと9B)は固定し、判断用の小さな部品と追加の層だけを学習
正解の学習 正しい選択肢を当てるように学習
確率の調整 確率と正解のずれを測るブライアスコアで、当たり具合を整える
学習データ 項目の順番・指示文・質問の形を入れ替えた自社の合成データ
強化学習 隣の段階を選んだ答えに部分点、全項目の正解に報酬、元の分布から離れすぎると減点

最後の段階は、同社が独自に作ったRLCD(較正された判断のための強化学習)です。エージェントが人に回すかを確率で決めるなら、その確率が当たり率と合っていることが前提になります。

ベンチマークで勝った所・負けた所

同社はJevを上回ったと発表しました。一方、Hugging Faceのモデルカードの全41評価で首位を数えると、Clef系が27、Jevが11、その他が3です。

評価 何を測るか Clef Clef-flash Jev
BFCL 道具の呼び出しの正確さ 98.5 98.8 95.8
BANKING77 銀行の問い合わせを77の意図に分ける 94.2 90.9 79.7
CLINC150 150の意図と対象外の見分け 97.4 66.8 89.3
GPQA Diamond 専門家向けの科学の難問 48.0 51.0 78.3
BBH 難しい推論の課題 73.7 68.9 92.9

問い合わせの分類や道具選びでは強く、深い推論が要る問題ではJevが大きく上回ります。小さいClef-flashは、対象外の見分けで大きく落ちます。

速さは中央値とp95で見る

同社が43の評価を回して測った応答時間は、中央値でClefが209.3ミリ秒、Clef-flashが38.8ミリ秒、Jevが524.1ミリ秒でした。同社はClefを2.5倍、Clef-flashを13倍速いとしています。

もう1つの目安は、遅いほうの5%の境目のp95です。Clefは238.6ミリ秒で中央値の約1.1倍、Jevは536.0ミリ秒でほぼ同じ水準にそろっています。Clef-flashは122.4ミリ秒で、中央値の約3.2倍まで広がります。ふだんは最速でも、ときどき遅れる幅はClef-flashが最も大きいのです。処理の途中に置くなら、待てる上限はp95で決めます。自社から測るときの分け方は別記事で解説しています。

Clef、Clef-flash、Jevの応答時間を中央値とp95の横棒で並べ、Clefは209.3と238.6ミリ秒、Clef-flashは38.8と122.4ミリ秒、Jevは524.1と536.0ミリ秒であることを示したグラフ

公表値を読むときの注意

数字は次の4点を踏まえて読みます。

  • 測ったのは発表元: 評価も速さも、Cloudflare自身の計測
  • 選ばれた10評価: 発表の表は判断に重要な10評価を選んだもので、そのうち7つでClef系が首位
  • 業務の評価は3勝1敗: TypeSafeの業務評価では、エージェントの記録の監視だけJevが上
  • SNSの要約: 「Jevより4倍速く精度は2倍」という紹介は、公式の2.5倍と合わない

精度が2倍近く開いたのは、家電の操作を模した評価(Clef-flash 97.7、Jev 52.3)など一部です。見出しの倍率ではなく、自社の業務に近い評価の行を探して読むのが確実です。

強化学習で自社向けに調整する

Clefを業務に合わせて調整するサービスも始まりました。最初は同社のFDE(顧客の現場に入る技術者)が伴走し、利用者が自分で調整できる仕組みは後から用意するとしています。FDEの役割は別記事で解説しています。使う部品は次の5つです。

  • AI Gateway: AIへの通信を通し、記録から学習用のデータを作る
  • Workers AI: 元のClefで試しの判断を出す
  • Containers: エージェントの動きを採点し、再生する隔離環境
  • Trainer: 調整したClefの重みを更新する新しい部品
  • 持ち込みモデルの実行: 調整したモデルをWorkers AIに戻して動かす

同社は、調整すると特定の業務の精度と引き換えに、汎用の性能を一部手放すことがあるとも書いています。

使う前に知っておく制約

  • データの扱い: リクエストと応答を読まず、保存せず、学習にも使わないと約束。調整サービスは例外
  • 自前で動かす重さ: モデルカードの動作確認は、データセンター向けのGPU(H200)1枚
  • 動画: モデルカードは動画も読めると書くが、Workers AIで添付できるのは画像だけ
  • 土台はQwen: ライセンスも土台に合わせたApache 2.0

日本語での成績は、2026年10月時点で公表されていません。

【プロの視点】確率は当たり率で検算する

判断モデルの議論は、ベンチマークの順位に向かいがちです。けれど、エージェントに組み込むときに問われるのは0.9と出た答えが本当に9割当たるかどうかです。人に回す線は確率で引くので、確率がずれていれば、線は思った場所に引かれません。

Clefは確率の当たり具合まで整えたと説明していますが、それは同社の合成データでの話です。自社の文面や日本語で同じ当たり具合が出る保証はなく、調整すれば確率の分布も動きます。

確かめ方は単純です。人が正解を付けた過去の判断を流し、出た確率を「0.9以上」「0.7〜0.9」「それ未満」に分け、帯ごとに当たった割合を数えます。0.9以上の帯で当たりが7割なら、その確率は高く出すぎています。線を引くのは、帯ごとの当たり率を見てからです。外れ方の傾向から確認の置き場所を決める考え方は、別記事で解説しています。

明日やる最初の一歩は、いま使っているAIの判断の記録から確率が0.9以上だった件を20件抜き出し、人が見て何件当たっていたかを数えることです。

人が正解を付けた過去の判断を流す、確率の高さで帯に分ける、帯ごとに当たった割合を数える、線を引く、の4段階を左から右へ並べた図

【waltsu視点】人が直した判断を残す

Cloudflareが調整を始められたのは、長年のラベル付きの判断があったからです。同じ材料は小さな会社にもあります。AIの判断を人が承認した、あるいは上書きした記録です。

waltsuが軸にしているのは、時短ではなく試行回数です。人に回ってきた判断を直して終わりにすると、その試行は1回きりで終わります。直した結果を残せば、確率の検算にも、将来の調整にも使える材料に変わります。同社の調整サービスも、日々の通信を記録して学習データにする設計です。

判断モデルを入れる価値は自動化だけでなく、試すたびに改善の材料が増えることにあります。判断モデルで自社の記事を採点した結果は、別記事で紹介しています。

明日やる最初の一歩は、AIから人に回している判断の一覧に「人の最終判断」の列を1つ足すことです。

左に人が直して終わる流れ、右に人が直した結果を記録して確率の検算と将来の調整の材料にする流れを並べた左右比較の図

よくある質問

Clefとは簡単にいうと?

Cloudflareが公開した判断モデルです。文章を書かず、決めた選択肢それぞれに確率を付けて返します。

Jevとの違いは?

同じ形で呼べ、Clefは画像も読めます。同社の計測では速く分類に強い一方、深い推論ではJevが上です。

Clefは無料で使える?

重みはApache 2.0で公開されており、自前のGPUで動かせます。Workers AIで呼ぶ場合は従量課金ですが、2026年10月時点で1日あたりの無料枠があります。

送ったデータは学習に使われる?

同社は、リクエストと応答を読まず、保存せず、学習にも使わないとしています。調整サービスを使う場合は例外です。

自社向けに調整できる?

できます。まず同社の技術者の伴走で提供され、自分で調整できる仕組みは後から出る予定です。

この記事の要点

・Clefは文章を書かず、選択肢に確率を付けて返すCloudflareの判断モデル
・確率の当たり具合をブライアスコアとRLCDで整えたのが学習の要
・分類や道具選びではJevを上回り、深い推論ではJevが上
・確率は自社の過去の判断で、帯ごとの当たり率を検算してから使う

まとめ

Clefは、Cloudflareが自社の判断業務をもとに作った判断モデルです。文章を書かずに選択肢へ点を付けるので速く、確率の当たり具合まで学習で整えています。一方で公表値は同社の計測で、深い推論が要る評価ではJevが上回ります。

エージェントに判断を任せるなら、順位より先に、自社のデータで確率を検算することです。判断モデルの選定や、人に回す線の引き方に迷う場面が出てきたら、waltsuが判断の記録の設計から確率の検算までご支援します。

集客・採用のお悩みは
今すぐプロに相談

60分無料相談はこちら
SHARE

この記事を書いた人

小洞 映

システムエンジニア

小洞 映/ コボラ ハユル

公共系システムのSEとしてキャリアをスタートし、可用性と正確性が最優先される領域で設計・運用の基礎を固める。その後Web業界へ転向し、AWS上のインフラ構築・運用からバックエンド開発、フロントエンド実装までを一貫して担当。70万人規模のユーザーを抱えるtoCサービスを、設計から開発まで一貫して手がけた実績を持つ。 現在はテックリードとして、保険業界向けサービスの技術選定・障害対応・チームの技術判断を担っている。

システム・アプリ開発DX・AI
ブログ一覧へ戻る

集客・採用のお悩みは
今すぐプロに相談

60分無料相談 今すぐプロに相談
資料ダウンロード