Con la evidencia pública más exigente disponible en agosto de 2026, el modelo líder satisface el 94,6% de los criterios individuales de una rúbrica sobre entregables legales reales y produce un entregable en el que todos los criterios pasan en el 14,2% de las tareas. Ambas cifras salen del mismo benchmark, el mismo harness, la misma ejecución. Ninguna es falsa. Esa brecha de 80 puntos es todo el contenido de una afirmación de precisión sobre AI legal, y por eso “qué tan buena es la AI legal” no tiene una sola respuesta: la respuesta honesta depende de si un abogado lee el resultado antes de que salga de la empresa. Esta página es el scorecard de cinco líneas para cualquier cifra de AI legal que te presenten, con los números de 2026 para calibrar.
Cuándo usar esto
Úsalo cuando un proveedor, un informe de analistas o un leaderboard te entrega un porcentaje y te pide actuar sobre él: una decisión de piloto, la elección de un modelo dentro de una plataforma que ya tienes, una línea de presupuesto. No lo uses para interrogar la afirmación de un proveedor sobre tus contratos; ese es otro procedimiento y vive en cómo evaluar las afirmaciones de precisión en la revisión de contratos con AI. Esta página trata sobre benchmarks publicados: qué miden, qué número eligió destacar quien los publica y qué no resiste el contacto con la realidad.
Línea 1 — ¿Qué estándar de calificación produjo el número?
Todo benchmark legal serio de 2026 reporta dos métricas, y la diferencia entre ellas es mayor que la diferencia entre dos proveedores cualesquiera.
La tasa de criterios aprobados es la proporción de criterios individuales de la rúbrica que un modelo satisface. La tasa de aprobación total es la proporción de tareas en las que pasan todos los criterios, sin crédito parcial. Artificial Analysis publica ambas para Harvey LAB-AA, su reimplementación independiente del Legal Agent Benchmark de Harvey, publicada el 2026-07-07:
| Modelo | Tasa de criterios aprobados | Tasa de aprobación total | Costo por tarea |
|---|---|---|---|
| Kimi K3 (max) | 94,6% | — | — |
| Claude Fable 5 (con fallback) | 93,6% | 14,2% | ~$18,90 |
| Muse Spark 1.1 (xhigh) | 93,1% | — | — |
| Claude Opus 4.8 (max) | — | 7,5% | ~$8,20 |
| GLM-5.2 (max) | — | 7,5% | ~$1,30 |
La propia ejecución de Harvey sobre el benchmark completo reporta que el mejor modelo completa el 7,1% de las tareas de extremo a extremo. Nada de esto se contradice. Un memo con 19 de 20 criterios de rúbrica satisfechos obtiene 95% en una métrica y cero en la otra, porque el vigésimo criterio era la cláusula de limitación de responsabilidad.
La calibración. Si un revisor lee el entregable completo antes de enviarlo, la tasa de criterios aprobados es el número que predice cuánto tendrá que editar. Si el resultado va a un cliente, a un tribunal o a una contraparte sin una lectura completa, la aprobación total es el único número que describe tu exposición — y con 14,2%, ningún sistema de 2026 soporta ese modo de uso. Un proveedor que cita una cifra de mediados de los 90 para un flujo sin revisión ha respondido una pregunta que no hiciste.
Línea 2 — ¿Horizonte corto u horizonte largo?
Los benchmarks se separan limpiamente por duración de la tarea, y los puntajes no se transfieren de un lado al otro.
Los benchmarks de horizonte corto califican un juicio acotado: LegalBench (162 tareas construidas a mano en seis tipos de razonamiento jurídico, NeurIPS 2023), las 41 categorías de cláusulas de CUAD, LEXam y el anterior BigLaw Bench de Harvey. Leer un contrato, responder una pregunta, clasificar una cláusula.
Los benchmarks de horizonte largo califican un producto de trabajo. Harvey liberó LAB el 2026-05-06: más de 1.200 tareas en 24 áreas de práctica, calificadas contra más de 75.000 criterios de rúbrica escritos por expertos. Cada tarea entrega al agente una instrucción al estilo de un socio y los documentos de un asunto, y exige que planifique, busque, trabaje sobre los materiales y produzca un entregable.
La calibración. Haz coincidir el horizonte con lo que estás comprando. Un puntaje de extracción de cláusulas no dice nada sobre un agente que redacta un memo, y una tasa de aprobación total de horizonte largo subestima una herramienta que solo usas para extracción. Cuando un proveedor que vende un producto agéntico cita un puntaje de horizonte corto, el desajuste es el hallazgo.
Línea 3 — ¿Qué harness y qué juez?
Un número publicado mide un modelo más el andamiaje que lo rodea. Artificial Analysis ejecuta LAB-AA sobre su propio harness de agente Stirrup y declara las divergencias con claridad: omite las herramientas propias de Harvey y sus scripts de generación de documentos, usa prompts simplificados, exige coincidencia exacta de nombres de archivo y califica con un único juez Gemini 3.1 Pro en lugar del método original de Harvey. Los números propios de Harvey sobre las mismas tareas subyacentes no son los mismos números.
La calibración. LAB-AA califica un modelo. El puntaje propio de un proveedor cubre un modelo más recuperación, herramientas, prompts y guardrails que ese proveedor construyó. No son cantidades comparables, y la distancia entre ambas es exactamente el producto. Pregunta cuál estás mirando y rechaza la comparación cuando un proveedor pone el puntaje de su producto en una tabla junto a puntajes de modelos crudos.
Línea 4 — ¿El conjunto de tareas es privado y retenido?
LAB-AA corre sobre 120 tareas privadas; Harvey publicó el código y una parte del dataset en GitHub. Esa división es deliberada. Un conjunto de tareas público es un objetivo de entrenamiento: una vez que las preguntas están en internet, un puntaje alto deja de distinguir a un modelo que razona de uno que leyó las respuestas.
La calibración. Un conjunto privado y retenido, ejecutado por un tercero, es el nivel de evidencia más fuerte. Un conjunto público ejecutado por un tercero es el nivel intermedio: útil para ordenar, débil para afirmaciones absolutas. Un conjunto público ejecutado por el proveedor es una pieza de marketing. Pregunta cuándo se rotó el conjunto por última vez; un benchmark que no ha cambiado en dos años está midiendo memorización.
Línea 5 — ¿Cuánto costó por tarea?
El costo por tarea se publica junto con la calidad en LAB-AA, y dividir uno por el otro produce el número que decide construir o comprar: costo por entregable aceptado = costo por tarea ÷ tasa de aprobación total.
| Modelo | Costo/tarea | Aprobación total | Costo por entregable aceptado |
|---|---|---|---|
| GLM-5.2 (max) | $1,30 | 7,5% | ~$17 |
| Claude Opus 4.8 (max) | $8,20 | 7,5% | ~$109 |
| Claude Fable 5 (con fallback) | $18,90 | 14,2% | ~$133 |
La brecha de 14,5× en costo bruto de modelo se comprime a cerca de 8× una vez que se valora la calidad — y ahí deja de importar. Supón un revisor que factura $400 por hora, lo cual es un supuesto y no una cifra medida: $133 compran 20 minutos de la atención de esa persona. Todo el rango de costo de modelos del leaderboard equivale a entre 3 y 20 minutos del tiempo de un abogado por entregable.
La calibración. Por debajo de aproximadamente 30 minutos de tiempo de revisor por entregable en gasto de modelo, elige por tasa de aprobación total e ignora el precio. Por encima de eso, el costo del modelo ya es una línea real y pertenece al caso de negocio. La mayoría de las cargas de trabajo legales de 2026 están muy por debajo de ese umbral, lo que significa que los equipos que optimizan el gasto en AI legal por el precio del token están optimizando el término equivocado. Precios por asiento vs por uso en AI cubre cómo los proveedores empaquetan ese costo cuando llega a tu factura.
La línea base humana es una comparación móvil, no una constante
El informe de investigación jurídica de Vals AI, publicado el 2025-10-14, calificó 200 preguntas en 10 tipos de pregunta (una descartada por un error de formulación) con una ponderación de precisión 50%, autoridad de las fuentes 40%, adecuación 10%. Todos los productos de AI quedaron dentro de cuatro puntos entre sí, entre 74% y 78%, contra una línea base de abogados de 69%. Las preguntas multijurisdiccionales le costaron a cada sistema un promedio de 11 puntos.
Dos cosas viajan con ese resultado. Thomson Reuters y LexisNexis declinaron participar y vLex se retiró, así que las tres mayores plataformas de investigación jurídica están ausentes del benchmark independiente de investigación más fuerte del mercado — un proveedor no medido no es un proveedor perdedor, y tampoco es uno ganador. Y la dirección se invierte según la tarea: el estudio de Vals de febrero de 2025 encontró que las herramientas superaban al grupo de control de abogados en extracción documental mientras perdían con claridad frente a él en redlining, con los mismos proveedores y el mismo panel.
Puntos de vigilancia, cada uno con su resguardo
Un único porcentaje de titular. Un solo número significa que quien publica eligió cuál de las dos métricas mostrar. Resguardo: niégate a actuar sobre cualquier puntaje de AI legal hasta tener tanto la tasa de criterios aprobados como la de aprobación total, o la declaración de quien publica sobre cuál de las dos es.
Comparar un puntaje de producto con un puntaje de modelo. Los tableros de proveedores colocan su plataforma junto a modelos frontier crudos, donde la diferencia de harness hace el trabajo. Resguardo: exige que ambas filas provengan de un mismo harness, o léelas como tablas separadas.
Suponer que el ranking del benchmark predice tu tipo de asunto. LAB-AA abarca 24 áreas de práctica y reporta un promedio; la varianza entre áreas no se publica por modelo. Resguardo: pasa 20 de tus asuntos reales por la lista corta antes de firmar el contrato y califícalos con tu propia rúbrica — las verificaciones de grounding y alucinación pertenecen a ese mismo ejercicio.
Tratar un puntaje como si tuviera vida útil. Los modelos de este leaderboard rotan en semanas, y 14 de 37 modelos listados tenían un resultado de LAB-AA al momento de escribir. Resguardo: revisa el leaderboard antes de cada renovación y escribe derechos de sustitución de modelo en la orden de compra, para que una plataforma pueda moverte a un modelo mejor sin una nueva negociación.
Cuándo se rompe este framework
Se rompe en trabajo que no es en inglés ni de Estados Unidos, donde ningún benchmark público tiene cobertura suficiente para actuar, y en productos de trabajo propios de una firma, donde la rúbrica que importa es tu banco de precedentes y no un panel de expertos. También se rompe donde el entregable no tiene clave de respuesta: memos de estrategia, postura de negociación, asesoramiento al cliente. Ahí el benchmark te dice qué modelo es un mejor punto de partida y nada más, y la evaluación tiene que ser un piloto supervisado sobre tus propios asuntos.
Para ver dónde caen estos puntajes en una decisión de compra, lee AI legal vs legaltech y modelo de AI vertical vs GPT wrapper, y luego las páginas de proveedor de Harvey, CoCounsel, Legora, Lexis+ con Protégé y vLex Vincent AI.