ooligo
ENTRY TYPE · framework

How to Read Legal AI Benchmarks

By Marius Bughiu Last updated 2026-08-21 Legal Ops

2026年8月時点で入手できる最も厳しい公開データによれば、首位のモデルは実際の法務成果物に対してルーブリックの個別基準の 94.6% を満たし、すべての基準を満たした成果物を出せたのはタスクの 14.2% です。この2つの数値は同じベンチマーク、同じ harness、同じ実行から出ています。どちらも誤りではありません。この80ポイントの開きこそが legal AI の精度主張の中身のすべてであり、「legal AI はどこまで使えるのか」に単一の答えがない理由です。正直な答えは、成果物が社外に出る前に弁護士が読むかどうかで決まります。このページは、提示されたあらゆる legal AI の数値を読むための5行のスコアカードで、較正用に2026年の実数値を添えています。

いつ使うか

ベンダー、アナリスト資料、あるいはリーダーボードがパーセンテージを提示し、それに基づく判断を求めてきたときに使ってください。パイロットの可否、すでに保有しているプラットフォーム内でのモデル選択、予算計上などです。自社の契約書に対するベンダーの主張を検証する用途には使わないでください。それは別の手順であり、AI 契約レビューの精度主張を評価する方法 にあります。このページが扱うのは公開ベンチマークです。何を測っているのか、公開者がどの数値を前面に出したのか、そしてそのスコアが実務に触れたときに何を保てないのかを見ます。

1行目 — その数値はどの採点基準から出たか

2026年のまともな法務ベンチマークはいずれも2つの指標を報告しており、その差はベンダー間の差より大きいのが実情です。

基準通過率は、モデルが満たしたルーブリック個別基準の割合です。全基準通過率は、部分点なしですべての基準を満たしたタスクの割合です。Artificial Analysis は Harvey LAB-AA について両方を公開しています。これは Harvey の Legal Agent Benchmark を独立に再実装したもので、2026-07-07 に公開されました。

モデル基準通過率全基準通過率タスク単価
Kimi K3 (max)94.6%
Claude Fable 5 (フォールバックあり)93.6%14.2%約 $18.90
Muse Spark 1.1 (xhigh)93.1%
Claude Opus 4.8 (max)7.5%約 $8.20
GLM-5.2 (max)7.5%約 $1.30

Harvey 自身によるフルベンチマークの実行では、首位モデルがタスクを最後まで完了した割合は 7.1% と報告されています。ここに矛盾はありません。20項目のルーブリックのうち19項目を満たしたメモは、一方の指標で 95%、もう一方でゼロになります。満たせなかった20項目目が責任制限条項だったからです。

較正の指針。 送付前にレビュアーが成果物を通読するなら、修正量を予測するのは基準通過率です。通読せずにクライアント、裁判所、相手方へ出すなら、自社のリスクを表すのは全基準通過率だけであり、14.2% という水準では2026年のどのシステムもその使い方を支えられません。レビューなしの運用に対して90%台の数値を挙げるベンダーは、あなたが尋ねていない質問に答えています。

2行目 — 短ホライズンか長ホライズンか

ベンチマークはタスクの長さできれいに分かれ、スコアはこの境界を越えて転用できません。

短ホライズンのベンチマークは、区切られた1つの判断を採点します。LegalBench(法的推論6類型にわたる手作業構築の162タスク、NeurIPS 2023)、CUAD の41条項カテゴリ、LEXam、そして Harvey の旧 BigLaw Bench です。契約書を読む、質問に答える、条項を分類する、といった作業にあたります。

長ホライズンのベンチマークは成果物を採点します。Harvey は 2026-05-06 に LAB を公開しました。24の実務分野にわたる1,200件超のタスクを、専門家が書いた75,000件超のルーブリック基準に対して採点します。各タスクはパートナーからの指示と案件資料をエージェントに渡し、計画し、調査し、資料を横断して作業し、成果物を出すことを求めます。

較正の指針。 買おうとしているものにホライズンを合わせてください。条項抽出のスコアは、メモを起草するエージェントについて何も語りません。逆に長ホライズンの全基準通過率は、抽出用途にしか使わないツールを過小評価します。エージェント製品を売るベンダーが短ホライズンのスコアを挙げているなら、その不一致自体が発見です。

3行目 — 誰の harness で、誰が採点したか

公開された数値は、モデルその周囲の足場をあわせて測っています。Artificial Analysis は LAB-AA を自社のエージェント harness である Stirrup 上で実行し、相違点を明示しています。Harvey 独自のツールと文書生成スクリプトを省き、簡素化した prompt を使い、ファイル名の完全一致を要求し、Harvey の原法ではなく単一の Gemini 3.1 Pro を判定役に使っています。同じ基礎タスクに対する Harvey 自身の数値は、同じ数値にはなりません。

較正の指針。 LAB-AA が採点しているのはモデルです。ベンダー自身のスコアは、モデルに加えて自社で構築した retrieval、ツール、prompt、ガードレールまでを含みます。両者は比較可能な量ではなく、その差こそが製品そのものです。いま見ているのがどちらかを尋ね、ベンダーが自社製品のスコアを素のモデルスコアと同じ表に並べたら、その比較は拒否してください。

4行目 — タスクセットは非公開かつ未公開保持か

LAB-AA は120件の非公開タスクで動きます。Harvey はコードとデータセットの一部を GitHub で公開しました。この線引きは意図的です。公開タスクセットは学習の的になります。問題がインターネット上に出た時点で、高スコアは推論できるモデルと答えを読んだだけのモデルを区別しなくなります。

較正の指針。 第三者が実行する非公開かつ保持されたセットが最も強い証拠水準です。第三者が実行する公開セットは中位で、順位付けには使えますが絶対的な主張には弱いものです。ベンダー自身が実行する公開セットはマーケティング資料です。セットの最終ローテーション時期を尋ねてください。2年変わっていないベンチマークが測っているのは暗記です。

5行目 — タスクあたりいくらかかったか

LAB-AA ではタスク単価が品質と並べて公開されており、一方を他方で割ると内製か購入かの判断を左右する数値が出ます。受理される成果物あたりのコスト = タスク単価 ÷ 全基準通過率です。

モデルタスク単価全基準通過率受理成果物あたりコスト
GLM-5.2 (max)$1.307.5%約 $17
Claude Opus 4.8 (max)$8.207.5%約 $109
Claude Fable 5 (フォールバックあり)$18.9014.2%約 $133

素のモデルコストで 14.5 倍あった開きは、品質を織り込むと約8倍まで縮み、そこから先は判断材料になりません。レビュアーの請求単価を時給 $400 と仮定すると(これは実測値ではなく仮定です)、$133 はその人の20分の注意を買う金額です。リーダーボード上のモデルコストの幅全体が、成果物1件あたり弁護士の3分から20分の時間に相当します。

較正の指針。 モデル支出が成果物あたりレビュアー時間およそ30分に相当する水準を下回るなら、全基準通過率で選び、価格は無視してください。それを上回るなら、モデルコストは実在の費目になり、投資判断の材料に入ります。2026年の法務ワークロードの大半はこの閾値を大きく下回っており、legal AI の支出をトークン単価で最適化しているチームは誤った項を最適化しています。その費用が請求書に届いたときのベンダー側の値付けについては シート課金と従量課金の AI 価格 を参照してください。

人間のベースラインは動く比較対象であって定数ではない

Vals AI の 法務リサーチ・レポート(2025-10-14 公開)は、10種類の質問タイプにわたる200問(うち1問は設問の誤りにより除外)を、正確性 50%、出典の権威性 40%、適切性 10% の加重で採点しました。AI 製品はいずれも互いに4ポイント以内、74% から 78% の範囲に収まり、弁護士のベースラインは 69% でした。複数法域にまたがる設問では、どのシステムも平均で11ポイント落としています。

この結果には2つの但し書きが付きます。Thomson Reuters と LexisNexis は参加を辞退し、vLex は途中で撤退しました。つまり市場で最も強い独立系リサーチ・ベンチマークに、最大手3社の法務リサーチ・プラットフォームが不在です。測られていないベンダーは負けたベンダーではなく、勝ったベンダーでもありません。さらに、優劣はタスクによって反転します。2025年2月の Vals の調査では、同じベンダーと同じ審査パネルで、文書抽出では弁護士の対照群を上回り、redlining では明確に下回りました。

注意点と、それぞれの手当て

見出しのパーセンテージが1つだけ。 数値が1つということは、公開者が2つの指標のどちらを見せるか選んだということです。手当て: 基準通過率と全基準通過率の両方、あるいはどちらであるかの公開者の明示を得るまで、legal AI のスコアで動かないでください。

製品スコアとモデルスコアを並べて比べる。 ベンダーの一覧表は自社プラットフォームを素のフロンティアモデルの隣に置きますが、そこで効いているのは harness の差です。手当て: 両方の行が同一 harness から出ていることを要求するか、別々の表として読んでください。

ベンチマーク順位が自社の案件類型を予測すると考える。 LAB-AA は24の実務分野をカバーし、報告値は平均です。分野間のばらつきはモデル別に公開されていません。手当て: 契約前に自社の実案件20件を候補ツールに通し、自前のルーブリックで採点してください。グラウンディングとハルシネーション の確認も同じ工程に含めます。

スコアに賞味期限があると考えない。 このリーダーボードのモデルは数週間単位で入れ替わり、執筆時点で掲載37モデルのうち14モデルに LAB-AA の結果が付いていました。手当て: 更新のたびにリーダーボードを再確認し、プラットフォーム側が再交渉なしにより良いモデルへ移行できるよう、モデル差し替え権を発注書に書き込んでください。

このフレームワークが機能しない場面

英語圏および米国以外の業務では、判断に足る公開ベンチマークのカバレッジが存在しないため機能しません。重要なルーブリックが専門家パネルではなく自社の先例集である、事務所固有の成果物でも機能しません。答えの正解が存在しない成果物 — 戦略メモ、交渉方針、クライアントへの助言 — でも同じです。そこでベンチマークが示すのはどのモデルがより良い出発点かだけであり、評価は自社案件での監督付きパイロットにするほかありません。

これらのスコアが購買判断のどこに位置するかは、legal AI と legaltech および 垂直特化 AI モデルと GPT ラッパー を読んだうえで、HarveyCoCounselLegoraLexis+ with ProtégévLex Vincent AI の各ベンダーページを参照してください。