ooligo
TIPO · framework

Cómo evaluar las afirmaciones de precisión en la revisión de contratos con IA

Por Marius Bughiu Última actualización 2026-08-02 Legal Ops

Ningún número publicado responde a la pregunta “qué tan precisa es la revisión de contratos con IA” para tus contratos, porque la precisión no es una sola medición: es un puntaje de precision y un puntaje de recall sobre una tarea específica, contra una clave de respuestas específica, en un tipo de contrato específico. Un proveedor que cita una sola cifra ha colapsado esas cuatro decisiones en un número y ha mantenido las decisiones en privado. La pregunta útil nunca es “¿cuál es tu precisión?”. Es “¿en qué tarea, puntuada cómo, contra la clave de respuestas de quién, en qué contratos?”. Esta página te da las cinco preguntas que recuperan esos datos, con umbrales de cómo se ve una buena respuesta.

Las tres sustituciones ocultas dentro de un solo número

Sustitución de tarea. La evidencia independiente más sólida disponible es el Vals Legal AI Report (febrero de 2025), el primer benchmark que puntuó herramientas de IA legal contra un grupo de control de abogados en trabajo derivado de firmas Am Law 100. En extracción de documentos, las herramientas superaron a los humanos: Harvey Assistant 75.1, CoCounsel 73.2, contra una línea base de abogados de 71.1. En redlining —la tarea que es realmente revisión de contratos— el orden se invierte: línea base de abogados 79.7, Harvey Assistant 65.0, Vincent AI 53.6. Mismos proveedores, mismo estudio, conclusión opuesta. Un proveedor tiene libertad de citar el número de extracción y llamarlo precisión de revisión de contratos.

Sustitución de métrica. Muchos proveedores hacen benchmarking con CUAD, el dataset del Atticus Project de 510 contratos y 41 categorías de cláusulas con más de 13,000 anotaciones expertas. Ivo publica un 97% en CUAD. Los propios diseñadores de CUAD puntuaron modelos por área bajo la curva de precision-recall, porque la extracción de cláusulas es un problema de aguja en un pajar donde el desbalance de clases vuelve insignificante la precisión simple: un modelo que no marca nada obtiene buen puntaje en una métrica que cuenta los silencios correctos. Los modelos de investigación en la métrica prevista de CUAD se han situado en los 40 y tantos. Una cifra de “precisión” de más de 90% sobre el mismo dataset está midiendo otra cosa, y el proveedor rara vez dice cuál.

Sustitución de evaluador. Vals puntuó con un LLM como juez contra respuestas de referencia descompuestas en verificaciones individuales. El benchmark LAB-AA de Harvey, liberado como código abierto en mayo de 2026 y reimplementado por Artificial Analysis en 120 tareas privadas de 24 áreas de práctica, reporta dos números por modelo: tasa de aprobación por criterio (proporción de criterios individuales de la rúbrica cumplidos) y tasa de aprobación total (proporción de tareas donde todos los criterios pasan, sin crédito parcial). Las tasas de aprobación por criterio más altas se ubican alrededor de 93-95%. La tasa de aprobación total de esos mismos sistemas es mucho menor, porque un entregable profesional falla por una sola cláusula mala. Qué número cita un proveedor es una decisión de marketing.

Las cinco preguntas

Hazlas en el orden de abajo. Cada una tiene un umbral para una respuesta aprobatoria.

#PreguntaRespuesta aprobatoriaRespuesta reprobatoria
1¿Qué tarea se puntuó?Nombrada y acotada: “marcar desviaciones de un playbook de NDA de 24 posiciones""Revisión de contratos”
2¿Precision o recall, y cuál es el otro?Ambos citados, o F-measure con los componentes disponiblesUna sola cifra de “precisión”
3¿Quién escribió la clave de respuestas y se puede ver?Anotadores nombrados, tasa de desacuerdo divulgada, muestra consultable”Validado por expertos”
4¿Qué contratos y eran inéditos?Tipo de contrato declarado, apartado del entrenamientoDataset sin nombrar
5¿Quién lo ejecutó?Un tercero independiente, o el proveedor con método publicadoEl proveedor, con método privado

Recall es el que importa para la revisión. Precision es la proporción de marcas que eran reales; recall es la proporción de problemas reales que fueron marcados. Un tope de indemnización omitido es una responsabilidad legal; una marca falsa cuesta 30 segundos de atención de un abogado. Exige recall, y luego verifica que precision sea lo bastante alta como para que los revisores no empiecen a ignorar las marcas: por debajo de un 70% de precision, los equipos dejan de leerlas y el número de recall deja de importar.

La fidelidad al playbook es la métrica que nadie publica. Todos los benchmarks anteriores puntúan contra una noción general de corrección legal. La pregunta de tu equipo es más estrecha: cuando tu playbook dice que los topes de responsabilidad por debajo de 12 meses de honorarios son inaceptables, ¿la herramienta marca un tope de 9 meses todas las veces? Eso es fidelidad al playbook: concordancia con tus posiciones, no con las de un abogado razonable. Ningún benchmark público la mide y ningún número de proveedor la predice. Hay que medirla sobre tus propios documentos.

La cifra canónica, y por qué dejar de citarla

El dato detrás de la mayoría del marketing de revisión de contratos con IA es el estudio de LawGeex de 2018: 20 abogados formados en EE. UU. contra el motor del proveedor en 5 NDA inéditos que contenían 153 párrafos, puntuados por F-measure con supervisión académica de Roland Vogl de Stanford y Gillian Hadfield de USC. La IA obtuvo 94% frente al 85% de los abogados, en 26 segundos contra un promedio humano de 92 minutos.

Es un estudio real, y tiene ocho años, fue ejecutado por el proveedor, sobre un solo tipo de contrato, contra una clave de respuestas fija de riesgos predefinidos. También describe un producto que ya no existe: LawGeex fue desmantelado en 2023. Trata el “94% de precisión” en una presentación de 2026 como una cita al marketing de una empresa muerta, y haz la pregunta 1.

Ejemplo trabajado: ejecutar tu propia prueba de 50 contratos

Presupuesta una semana del tiempo de un contract manager.

  1. Reúne 50 contratos ejecutados de un mismo tipo, el tipo que realmente procesas más, no una mezcla. Con menos de 30, tu intervalo de confianza se traga el resultado.
  2. Haz que dos revisores marquen problemas de forma independiente contra tu playbook. Donde discrepen, regístralo. Un desacuerdo entre anotadores de 15-25% es normal; por encima de 30% el problema es tu playbook, no la IA, y ninguna herramienta puntuará bien contra una clave de respuestas que dos de tus propias personas no pueden reproducir.
  3. Pasa los 50 por la herramienta con tu playbook cargado, no con la configuración de demo del proveedor.
  4. Cuenta cuatro categorías por contrato: verdaderos positivos, falsos positivos, falsos negativos y —la que los equipos olvidan— problemas que ambos revisores pasaron por alto y la herramienta detectó.
  5. Calcula recall y precision. Recall = VP / (VP + FN). Precision = VP / (VP + FP).

Expectativas calibradas para una prueba de primera mano sobre tus propios documentos: recall de 85-95% en posiciones de playbook de alta frecuencia (responsabilidad, indemnización, plazo, pago), 60-75% en posiciones que aparecen en menos de una quinta parte de tus contratos, y precision de 70-85%. Una herramienta que supere esos umbrales en tus contratos vale la pena desplegarla con revisión humana. Una herramienta que puntúa 97% en una demo del proveedor y 62% de recall aquí te está diciendo que el conjunto de la demo no eran tus documentos.

Errores frecuentes y sus contramedidas

  • Los benchmarks migran entre tareas. Una cifra de precisión en investigación legal se cita como precisión de revisión de contratos. Contramedida: el estudio de Stanford RegLab sobre herramientas de investigación legal encontró que Lexis+ AI acertó en 65% de 202 consultas y Westlaw AI-Assisted Research en 42%, con tasas de alucinación de 17% y 33%; esos son números de investigación y no se transfieren a la extracción de cláusulas en ninguna dirección. Haz que el proveedor nombre la tarea antes de anotar el número.
  • El grounding por recuperación se vende como solución a las alucinaciones. Contramedida: el mismo estudio encontró que herramientas construidas sobre retrieval-augmented generation seguían fabricando información, que fue el hallazgo que contradijo las afirmaciones de los proveedores en su momento. Pide la tasa de fabricación específicamente sobre el texto de cláusula citado, y consulta grounding vs alucinación.
  • El conjunto de la demo es el conjunto de entrenamiento. Contramedida: ejecuta el piloto con contratos que el proveedor nunca haya visto, elegidos por ti después de la demo.
  • La precisión se mide, la adopción no. Una herramienta con 90% de recall que los revisores dejan de abrir entrega cero. Contramedida: haz seguimiento de marcas revisadas junto a marcas generadas durante los primeros 60 días.
  • Un solo número cubre todos los tipos de cláusula. El recall agregado oculta que la herramienta encuentra condiciones de pago y omite la cesión por cambio de control. Contramedida: reporta recall por posición del playbook, no por contrato.

Cuándo este marco deja de funcionar

Asume que tienes un playbook escrito y suficiente volumen de un tipo de contrato para probarlo. Por debajo de unos 200 contratos al año, o sin posiciones codificadas, la prueba de 50 contratos cuesta más de lo que la herramienta ahorra: empieza por el playbook de NDA y un SOP de revisión de contratos documentado, y luego haz el benchmark. También asume que el trabajo es la revisión. Para extracción sobre una cartera de contratos ya ejecutados, el resultado de Vals apunta en la dirección contraria: esa es la tarea donde estas herramientas ya superan la línea base de abogados, y el listón para adoptarlas es más bajo.