Nenhum número publicado responde à pergunta “qual é a precisão da revisão de contratos com IA” para os seus contratos, porque precisão não é uma medição só: é um score de precision e um score de recall sobre uma tarefa específica, contra um gabarito específico, em um tipo de contrato específico. Um fornecedor que cita uma única cifra colapsou essas quatro decisões em um número e manteve as decisões em sigilo. A pergunta útil nunca é “qual é a sua precisão?”. É “em qual tarefa, pontuada como, contra o gabarito de quem, em quais contratos?”. Esta página traz as cinco perguntas que recuperam esses dados, com limiares do que caracteriza uma boa resposta.
As três substituições escondidas dentro de um número
Substituição de tarefa. A evidência independente mais forte disponível é o Vals Legal AI Report (fevereiro de 2025), o primeiro benchmark a pontuar ferramentas de IA jurídica contra um grupo de controle de advogados em trabalho derivado de bancas Am Law 100. Em extração de documentos, as ferramentas superaram os humanos: Harvey Assistant 75.1, CoCounsel 73.2, contra uma linha de base de advogados de 71.1. Em redlining — a tarefa que de fato é revisão de contratos — a ordem se inverte: linha de base de advogados 79.7, Harvey Assistant 65.0, Vincent AI 53.6. Mesmos fornecedores, mesmo estudo, conclusão oposta. Um fornecedor tem liberdade para citar o número de extração e chamá-lo de precisão de revisão de contratos.
Substituição de métrica. Muitos fornecedores fazem benchmarking com o CUAD, o dataset do Atticus Project com 510 contratos e 41 categorias de cláusulas, com mais de 13.000 anotações de especialistas. A Ivo publica 97% no CUAD. Os próprios criadores do CUAD pontuaram modelos pela área sob a curva de precision-recall, porque extração de cláusulas é um problema de agulha no palheiro em que o desbalanceamento de classes torna a precisão simples inútil: um modelo que não marca nada pontua bem em uma métrica que conta os silêncios corretos. Modelos de pesquisa na métrica pretendida do CUAD ficaram na casa dos 40%. Uma cifra de “precisão” acima de 90% sobre o mesmo dataset está medindo outra coisa, e o fornecedor raramente diz qual.
Substituição de avaliador. A Vals pontuou com LLM como juiz contra respostas de referência decompostas em verificações individuais. O benchmark LAB-AA da Harvey, aberto em maio de 2026 e reimplementado pela Artificial Analysis em 120 tarefas privadas de 24 áreas de prática, reporta dois números por modelo: taxa de aprovação por critério (proporção de critérios individuais da rubrica atendidos) e taxa de aprovação total (proporção de tarefas em que todos os critérios passam, sem crédito parcial). As maiores taxas por critério ficam em torno de 93-95%. A taxa de aprovação total dos mesmos sistemas é bem menor, porque um entregável profissional falha por uma única cláusula ruim. Qual número o fornecedor cita é uma decisão de marketing.
As cinco perguntas
Faça-as na ordem abaixo. Cada uma tem um limiar para uma resposta aprovada.
| # | Pergunta | Resposta aprovada | Resposta reprovada |
|---|---|---|---|
| 1 | Qual tarefa foi pontuada? | Nomeada e restrita: “marcar desvios de um playbook de NDA com 24 posições" | "Revisão de contratos” |
| 2 | Precision ou recall, e qual é o outro? | Ambos citados, ou F-measure com os componentes disponíveis | Uma única cifra de “precisão” |
| 3 | Quem escreveu o gabarito e dá para vê-lo? | Anotadores nomeados, taxa de discordância divulgada, amostra consultável | ”Validado por especialistas” |
| 4 | Quais contratos, e eram inéditos? | Tipo de contrato declarado, separado do treinamento | Dataset não nomeado |
| 5 | Quem executou? | Um terceiro independente, ou o fornecedor com método publicado | O fornecedor, com método sigiloso |
Recall é o que importa para revisão. Precision é a proporção de marcações que eram reais; recall é a proporção de problemas reais que foram marcados. Um teto de indenização perdido é um passivo; uma marcação falsa custa 30 segundos de atenção de um advogado. Exija recall e depois verifique se precision está alta o bastante para que os revisores não passem a ignorar as marcações: abaixo de uns 70% de precision, os times param de lê-las e o número de recall deixa de importar.
Fidelidade ao playbook é a métrica que ninguém publica. Todos os benchmarks acima pontuam contra uma noção geral de correção jurídica. A pergunta do seu time é mais estreita: quando o seu playbook diz que tetos de responsabilidade abaixo de 12 meses de honorários são inaceitáveis, a ferramenta marca um teto de 9 meses todas as vezes? Isso é fidelidade ao playbook: concordância com as suas posições, não com as de um advogado razoável. Nenhum benchmark público mede isso e nenhum número de fornecedor prevê isso. Precisa ser medido nos seus próprios documentos.
A cifra canônica, e por que parar de citá-la
O dado por trás da maior parte do marketing de revisão de contratos com IA é o estudo da LawGeex de 2018: 20 advogados formados nos EUA contra o motor do fornecedor em 5 NDAs inéditos com 153 parágrafos, pontuados por F-measure com supervisão acadêmica de Roland Vogl (Stanford) e Gillian Hadfield (USC). A IA marcou 94% contra 85% dos advogados, em 26 segundos contra uma média humana de 92 minutos.
É um estudo real, tem oito anos, foi executado pelo fornecedor, sobre um único tipo de contrato, contra um gabarito fixo de riscos predefinidos. E descreve um produto que não existe mais: a LawGeex foi desmontada em 2023. Trate “94% de precisão” em uma apresentação de 2026 como uma citação ao marketing de uma empresa morta, e faça a pergunta 1.
Exemplo prático: rodar o seu próprio teste de 50 contratos
Reserve uma semana do tempo de um contract manager.
- Junte 50 contratos executados de um mesmo tipo — o tipo que você de fato processa mais, não uma mistura. Com menos de 30, o intervalo de confiança engole o resultado.
- Peça a dois revisores que marquem problemas de forma independente contra o seu playbook. Onde discordarem, registre. Discordância entre anotadores de 15-25% é normal; acima de 30% o problema é o seu playbook, não a IA, e nenhuma ferramenta vai pontuar bem contra um gabarito que duas pessoas do seu time não conseguem reproduzir.
- Passe os 50 pela ferramenta com o seu playbook carregado, não com a configuração de demo do fornecedor.
- Conte quatro categorias por contrato: verdadeiros positivos, falsos positivos, falsos negativos e — a que os times esquecem — problemas que os dois revisores deixaram passar e a ferramenta pegou.
- Calcule recall e precision. Recall = VP / (VP + FN). Precision = VP / (VP + FP).
Expectativas calibradas para um teste de primeira mão nos seus próprios documentos: recall de 85-95% em posições de playbook de alta frequência (responsabilidade, indenização, prazo, pagamento), 60-75% em posições que aparecem em menos de um quinto dos seus contratos, e precision de 70-85%. Uma ferramenta que supera esses limiares nos seus contratos vale o deploy com revisão humana. Uma ferramenta que marca 97% na demo do fornecedor e 62% de recall aqui está dizendo que o conjunto da demo não eram os seus documentos.
Armadilhas e como se proteger
- Benchmarks migram entre tarefas. Uma cifra de precisão em pesquisa jurídica é citada como precisão de revisão de contratos. Proteção: o estudo do Stanford RegLab sobre ferramentas de pesquisa jurídica constatou que o Lexis+ AI acertou 65% de 202 consultas e o Westlaw AI-Assisted Research 42%, com taxas de alucinação de 17% e 33%; são números de pesquisa e não se transferem para extração de cláusulas em nenhuma direção. Faça o fornecedor nomear a tarefa antes de anotar o número.
- Grounding por recuperação é vendido como cura para alucinação. Proteção: o mesmo estudo constatou que ferramentas construídas sobre retrieval-augmented generation continuavam inventando, que foi o achado que contradisse as alegações dos fornecedores na época. Peça a taxa de fabricação especificamente sobre o texto de cláusula citado, e veja grounding vs alucinação.
- O conjunto da demo é o conjunto de treino. Proteção: rode o piloto com contratos que o fornecedor nunca viu, escolhidos por você depois da demo.
- Precisão é medida, adoção não. Uma ferramenta com 90% de recall que os revisores param de abrir entrega zero. Proteção: acompanhe marcações revisadas junto com marcações geradas nos primeiros 60 dias.
- Um número só cobre todos os tipos de cláusula. O recall agregado esconde que a ferramenta acha condições de pagamento e perde cessão por mudança de controle. Proteção: reporte recall por posição do playbook, não por contrato.
Quando este framework deixa de funcionar
Ele pressupõe que você tem um playbook escrito e volume suficiente de um tipo de contrato para testar. Abaixo de uns 200 contratos por ano, ou sem posições codificadas, o teste de 50 contratos custa mais do que a ferramenta economiza: comece pelo playbook de NDA e por um SOP de revisão de contratos documentado, e só então faça o benchmark. Ele também pressupõe que o trabalho é revisão. Para extração sobre uma carteira de contratos já executados, o resultado da Vals aponta na direção contrária: essa é a tarefa em que essas ferramentas já superam a linha de base dos advogados, e a régua para adotá-las é mais baixa.