ooligo
TIPO · framework

How to Read Legal AI Benchmarks

Por Marius Bughiu Última atualização 2026-08-21 Legal Ops

Com a evidência pública mais dura disponível em agosto de 2026, o modelo líder satisfaz 94,6% dos critérios individuais de uma rubrica em entregáveis jurídicos reais e produz um entregável em que todos os critérios passam em 14,2% das tarefas. Os dois números vêm do mesmo benchmark, do mesmo harness, da mesma rodada. Nenhum dos dois está errado. Esse intervalo de 80 pontos é todo o conteúdo de uma alegação de precisão em AI jurídica, e é por isso que “quão boa é a AI jurídica” não tem resposta única: a resposta honesta depende de um advogado ler o resultado antes de ele sair da empresa. Esta página é o scorecard de cinco linhas para qualquer número de AI jurídica que te apresentarem, com os valores de 2026 para calibrar.

Quando usar isto

Use quando um fornecedor, um deck de analistas ou um leaderboard te entrega um percentual e pede que você aja sobre ele: uma decisão de piloto, a escolha de um modelo dentro de uma plataforma que você já tem, uma linha de orçamento. Não use para interrogar a alegação de um fornecedor sobre os seus contratos; esse é outro procedimento e está em como avaliar alegações de precisão na revisão de contratos com AI. Esta página é sobre benchmarks publicados: o que medem, qual número quem publica escolheu destacar e o que o resultado não sustenta no contato com a realidade.

Linha 1 — Qual padrão de avaliação produziu o número?

Todo benchmark jurídico sério de 2026 reporta duas métricas, e a diferença entre elas é maior do que a diferença entre dois fornecedores quaisquer.

A taxa de critérios aprovados é a proporção de critérios individuais da rubrica que um modelo satisfaz. A taxa de aprovação total é a proporção de tarefas em que todos os critérios passam, sem crédito parcial. A Artificial Analysis publica as duas para o Harvey LAB-AA, sua reimplementação independente do Legal Agent Benchmark da Harvey, lançada em 2026-07-07:

ModeloTaxa de critérios aprovadosTaxa de aprovação totalCusto por tarefa
Kimi K3 (max)94,6%
Claude Fable 5 (com fallback)93,6%14,2%~$18,90
Muse Spark 1.1 (xhigh)93,1%
Claude Opus 4.8 (max)7,5%~$8,20
GLM-5.2 (max)7,5%~$1,30

A própria rodada da Harvey sobre o benchmark completo reporta que o melhor modelo conclui 7,1% das tarefas de ponta a ponta. Nada disso é contraditório. Um memorando com 19 de 20 critérios de rubrica satisfeitos tira 95% em uma métrica e zero na outra, porque o vigésimo critério era a cláusula de limitação de responsabilidade.

A calibração. Se um revisor lê o entregável inteiro antes de enviar, a taxa de critérios aprovados é o número que prevê quanto ele vai editar. Se o resultado vai para um cliente, um tribunal ou uma contraparte sem leitura completa, a aprovação total é o único número que descreve a sua exposição — e a 14,2%, nenhum sistema de 2026 sustenta esse modo de uso. Um fornecedor que cita um número na casa dos 90 para um fluxo sem revisão respondeu a uma pergunta que você não fez.

Linha 2 — Horizonte curto ou horizonte longo?

Os benchmarks se separam com clareza pela duração da tarefa, e as notas não se transferem entre os dois lados.

Benchmarks de horizonte curto avaliam um julgamento delimitado: LegalBench (162 tarefas construídas à mão em seis tipos de raciocínio jurídico, NeurIPS 2023), as 41 categorias de cláusulas do CUAD, o LEXam e o antigo BigLaw Bench da Harvey. Ler um contrato, responder a uma pergunta, classificar uma cláusula.

Benchmarks de horizonte longo avaliam um produto de trabalho. A Harvey abriu o código do LAB em 2026-05-06: mais de 1.200 tarefas em 24 áreas de prática, avaliadas contra mais de 75.000 critérios de rubrica escritos por especialistas. Cada tarefa entrega ao agente uma instrução no estilo de um sócio e os documentos de um caso, e exige que ele planeje, pesquise, trabalhe sobre os materiais e produza um entregável.

A calibração. Case o horizonte com o que você está comprando. Uma nota de extração de cláusulas não diz nada sobre um agente que redige um memorando, e uma taxa de aprovação total de horizonte longo subestima uma ferramenta que você só usa para extração. Quando um fornecedor que vende um produto agêntico cita uma nota de horizonte curto, o descompasso é a descoberta.

Linha 3 — Qual harness e qual juiz?

Um número publicado mede um modelo mais o andaime em volta dele. A Artificial Analysis roda o LAB-AA no seu próprio harness de agente Stirrup e declara as divergências abertamente: omite as ferramentas próprias da Harvey e seus scripts de geração de documentos, usa prompts simplificados, exige correspondência exata de nomes de arquivo e avalia com um único juiz Gemini 3.1 Pro em vez do método original da Harvey. Os números da própria Harvey sobre as mesmas tarefas não são os mesmos números.

A calibração. O LAB-AA avalia um modelo. A nota própria de um fornecedor cobre um modelo mais retrieval, ferramentas, prompts e guardrails que ele construiu. Não são grandezas comparáveis, e a distância entre elas é exatamente o produto. Pergunte qual das duas você está vendo e recuse a comparação quando um fornecedor colocar a nota do produto dele em uma tabela ao lado de notas de modelos crus.

Linha 4 — O conjunto de tarefas é privado e reservado?

O LAB-AA roda sobre 120 tarefas privadas; a Harvey publicou o código e parte do dataset no GitHub. Essa divisão é deliberada. Um conjunto público de tarefas é um alvo de treino: uma vez que as perguntas estão na internet, uma nota alta deixa de distinguir um modelo que raciocina de um que leu as respostas.

A calibração. Um conjunto privado e reservado, rodado por um terceiro, é o nível de evidência mais forte. Um conjunto público rodado por um terceiro é o nível intermediário: útil para ordenar, fraco para afirmações absolutas. Um conjunto público rodado pelo fornecedor é peça de marketing. Pergunte quando o conjunto foi rotacionado pela última vez; um benchmark que não muda há dois anos está medindo memorização.

Linha 5 — Quanto custou por tarefa?

O custo por tarefa é publicado ao lado da qualidade no LAB-AA, e dividir um pelo outro produz o número que decide construir ou comprar: custo por entregável aceito = custo por tarefa ÷ taxa de aprovação total.

ModeloCusto/tarefaAprovação totalCusto por entregável aceito
GLM-5.2 (max)$1,307,5%~$17
Claude Opus 4.8 (max)$8,207,5%~$109
Claude Fable 5 (com fallback)$18,9014,2%~$133

O intervalo de 14,5× no custo bruto de modelo comprime para cerca de 8× depois que a qualidade entra na conta — e aí para de importar. Suponha um revisor faturando $400 por hora, o que é uma premissa e não um valor medido: $133 compram 20 minutos da atenção dessa pessoa. Toda a faixa de custo de modelos do leaderboard vale entre 3 e 20 minutos do tempo de um advogado por entregável.

A calibração. Abaixo de aproximadamente 30 minutos de tempo de revisor por entregável em gasto de modelo, escolha pela taxa de aprovação total e ignore o preço. Acima disso, o custo do modelo virou uma linha real e pertence ao business case. A maior parte das cargas de trabalho jurídicas de 2026 fica bem abaixo desse limite, o que significa que times otimizando gasto de AI jurídica pelo preço do token estão otimizando o termo errado. Preço por assento vs por uso em AI cobre como os fornecedores empacotam esse custo quando ele chega na sua fatura.

A linha de base humana é uma comparação móvel, não uma constante

O relatório de pesquisa jurídica da Vals AI, publicado em 2025-10-14, avaliou 200 perguntas em 10 tipos de pergunta (uma descartada por erro de formulação) com peso de precisão 50%, autoridade das fontes 40%, adequação 10%. Todos os produtos de AI ficaram dentro de quatro pontos entre si, de 74% a 78%, contra uma linha de base de advogados de 69%. Perguntas multijurisdicionais custaram a cada sistema uma média de 11 pontos.

Duas coisas viajam junto com esse resultado. Thomson Reuters e LexisNexis recusaram participar e a vLex se retirou, então as três maiores plataformas de pesquisa jurídica estão ausentes do benchmark independente de pesquisa mais forte do mercado — um fornecedor não medido não é um fornecedor perdedor, e também não é um vencedor. E a direção se inverte conforme a tarefa: o estudo da Vals de fevereiro de 2025 encontrou ferramentas superando o grupo de controle de advogados na extração documental e perdendo feio para ele em redlining, com os mesmos fornecedores e o mesmo painel.

Pontos de atenção, cada um com sua defesa

Um único percentual de manchete. Um número só significa que quem publicou escolheu qual das duas métricas mostrar. Defesa: recuse agir sobre qualquer nota de AI jurídica até ter tanto a taxa de critérios aprovados quanto a de aprovação total, ou a declaração de quem publicou sobre qual das duas é.

Comparar nota de produto com nota de modelo. Painéis de fornecedores colocam a plataforma deles ao lado de modelos frontier crus, onde a diferença de harness faz o trabalho. Defesa: exija que as duas linhas venham de um mesmo harness, ou leia como tabelas separadas.

Supor que o ranking do benchmark prevê o seu tipo de caso. O LAB-AA cobre 24 áreas de prática e reporta uma média; a variância entre áreas não é publicada por modelo. Defesa: passe 20 dos seus casos reais pela lista curta antes do contrato e avalie com a sua própria rubrica — as verificações de grounding e alucinação pertencem a esse mesmo exercício.

Tratar uma nota como se tivesse validade longa. Os modelos desse leaderboard giram em semanas, e 14 de 37 modelos listados tinham resultado de LAB-AA no momento em que isto foi escrito. Defesa: revise o leaderboard antes de cada renovação e escreva direitos de substituição de modelo no pedido, para que a plataforma possa te mover para um modelo melhor sem nova negociação.

Quando este framework quebra

Ele quebra em trabalho fora do inglês e fora dos Estados Unidos, onde nenhum benchmark público tem cobertura que sustente uma decisão, e em produtos de trabalho específicos de uma banca, onde a rubrica que importa é o seu banco de precedentes e não um painel de especialistas. Também quebra onde o entregável não tem gabarito: memorandos de estratégia, postura de negociação, aconselhamento ao cliente. Ali o benchmark diz qual modelo é um ponto de partida melhor e nada mais, e a avaliação tem que ser um piloto supervisionado nos seus próprios casos.

Para ver onde essas notas entram numa decisão de compra, leia AI jurídica vs legaltech e modelo de AI vertical vs GPT wrapper, e depois as páginas de fornecedor de Harvey, CoCounsel, Legora, Lexis+ com Protégé e vLex Vincent AI.