No lo sabes por lo que afirma el proveedor. Lo sabes por una prueba de aceptación de 50 consultas que tú diseñas, ejecutas y calificas — porque toda medición publicada de las herramientas de investigación legal fundamentadas quedó por debajo de lo que decía su marketing. El estudio de Stanford RegLab detrás de esas cifras ejecutó 202 consultas preregistradas contra las dos plataformas insignia y encontró que Lexis+ AI respondió con precisión el 65% de las veces mientras alucinaba en el 17% de las consultas, y que Westlaw AI-Assisted Research respondió con precisión el 41% mientras alucinaba en el 33%. Ambas se vendían entonces como libres de alucinaciones. Ambas recuperan de los mismos corpus de jurisprudencia que señala su marketing.
Ese es el problema entero en una frase: la fundamentación por recuperación reduce la fabricación, y no elimina la alucinación. Esta página es el protocolo de prueba a ejecutar antes de firmar.
Qué significa “fundamentado” y qué no significa
Fundamentado significa que cada proposición que sostiene la respuesta se remonta a un documento que el sistema realmente recuperó y leyó, no a la memoria de entrenamiento del modelo. La tipología de Stanford divide las respuestas en tres, y la categoría intermedia es donde el comprador sale perjudicado:
- Fundamentada — las proposiciones fácticas clave hacen referencias válidas a documentos legales relevantes.
- No fundamentada — las proposiciones fácticas clave no llevan cita alguna.
- Mal fundamentada — las proposiciones están citadas, pero la fuente no respalda la afirmación, o la fuente no aplica a la jurisdicción consultada.
Una respuesta cuenta como alucinación si es incorrecta o está mal fundamentada. Esa segunda mitad es la que los proveedores omiten.
Entonces, esto es lo que la fundamentación no es. No es un hipervínculo que funcione. Una cita que resuelve a un caso real en una base de datos real, con enlace activo, referencia correcta al repertorio y una cita textual real, sigue siendo una alucinación si el caso no sostiene la proposición a la que la respuesta lo adjuntó. La resolución del enlace es verificable por máquina y todo proveedor serio ya la aprueba. El respaldo de la proposición no es verificable por máquina, y ahí vive el error residual. Cualquier piloto que califique “¿funcionó el enlace?” está midiendo lo que ya estaba resuelto.
Los cinco modos de fallo
| Modo | Qué ocurrió | Quién puede detectarlo |
|---|---|---|
| Autoridad fabricada | El caso o la norma no existe | Máquina — consulta al citador |
| Cita textual fabricada | Caso real, texto citado inventado | Máquina — coincidencia de cadena contra la fuente |
| Mala fundamentación | Caso real, cita real, no respalda la proposición | Abogado — leer la cita puntual |
| Mala fundamentación jurisdiccional | Proposición correcta, circuito o estado equivocado | Abogado — verificar el tribunal contra la pregunta |
| Autoridad obsoleta | Real y pertinente, pero revocada, sustituida o distinguida hasta la irrelevancia | Alerta de máquina, criterio del abogado |
Los modos 1 y 2 son los que los proveedores quieren decir cuando dicen “libre de alucinaciones”. Los modos 3 a 5 son los que pierden una moción. Presupuesta tu tiempo de evaluación en consecuencia: las verificaciones baratas ya están automatizadas, así que gasta tus horas de abogado leyendo citas puntuales.
El protocolo: una prueba de aceptación de 50 consultas
Construye tú el conjunto de consultas, a partir de tus propios asuntos. Nunca dejes que lo aporte el proveedor — un conjunto de demo está afinado al corpus de recuperación, y el objetivo del ejercicio es encontrar los bordes que el proveedor no afinó. Compón las 50 consultas en estas proporciones, que reflejan la estructura del conjunto de datos de Stanford:
- 20 preguntas generales de investigación en las áreas de práctica que realmente cubres.
- 15 preguntas específicas de jurisdicción o fecha, donde la respuesta correcta cambia según el circuito o el año. Esta es la categoría que separa un recuperador con filtros de metadatos reales de uno que hace similitud semántica.
- 10 preguntas de premisa falsa — pregunta por una doctrina que no existe, o atribuye a un caso una resolución que no contiene. Aquí aflora la adulación. Una herramienta que construye respaldo para tu premisa falsa hará lo mismo con la de un socio.
- 5 preguntas de recuperación factual con una respuesta verificable (una resolución, una fecha, un recuento de votos).
Califica cada respuesta en tres ejes binarios — correcta, fundamentada, completa — y aplica estos umbrales:
| Métrica | Umbral de aprobación | Por qué esta cifra |
|---|---|---|
| Citas o textos fabricados | 0 de 50 | No negociable. Una fabricación en 50 predice una fabricación en un escrito. |
| Tasa de mala fundamentación | ≤ 2 de 50 (4%) | Por debajo del piso del 17% que registró la mejor herramienta medida, y lo bastante bajo para que un SOP de revisión lo absorba. |
| Rechazo de premisa falsa | ≥ 8 de 10 | La herramienta debe rechazar la premisa, no construir respaldo para ella. |
| Incompletas o rechazadas | ≤ 25% | Igualar la mejor de las dos plataformas insignia en lugar de la peor. |
Esa última fila es la calibración que nadie publica. La precisión y el rechazo se compensan entre sí, y los proveedores compran precisión con silencio. En la corrida de Stanford, las tasas de respuesta incompleta fueron 18% para Lexis+ AI, 25% para Westlaw AI-Assisted Research y 62% para Ask Practical Law AI — esta última con la precisión más baja, 19%. Califica la precisión sin calificar el rechazo y colocarás por encima a una herramienta que se niega a responder frente a una que responde.
Ejemplo trabajado: qué compran las cifras publicadas
Normaliza las tres herramientas medidas a una corrida de 50 consultas y la decisión de compra se vuelve concreta.
| Herramienta | Respuestas utilizables | Alucinadas | Incompletas |
|---|---|---|---|
| Lexis+ AI | ~33 | ~9 | ~9 |
| Westlaw AI-Assisted Research | ~21 | ~17 | ~13 |
| Ask Practical Law AI | ~10 | ~9 | ~31 |
La columna del medio es tu costo real. Diecisiete respuestas alucinadas de 50 no significan 17 consultas desperdiciadas — significan que las 50 respuestas ahora requieren que un abogado las verifique, porque desde la salida no puedes saber cuáles son las 17. Esa es la economía de una herramienta por debajo del 95%: el costo de verificación escala con el volumen total, no con la tasa de error.
Ponle precio antes de que termine el piloto. Haz que un abogado verifique 10 respuestas de principio a fin contra las citas puntuales y cronométralo, luego multiplica por cinco. Si esa cifra supera las horas de investigación que la herramienta debería ahorrar, la herramienta tiene valor negativo a cualquier precio de licencia, y conviene decirlo en el memo de renovación y no un año después.
Cinco preguntas para el proveedor
- ¿Cada cita enlaza a un documento que tu recuperador realmente leyó, o a un resultado de búsqueda generado después?
- ¿El citador se ejecuta sobre cada cita antes de que se muestre la respuesta, o solo cuando hago clic?
- ¿Cuál es el corte del corpus, y qué hace el sistema cuando la respuesta requiere autoridad más reciente?
- ¿Cuál es tu tasa de rechazo en consultas que no puedes fundamentar, y me la vas a mostrar?
- ¿Puedo ver los documentos recuperados junto a la respuesta?
Un proveedor que rechaza la pregunta 5 te quitó la capacidad de auditar la mala fundamentación. Trátalo como descalificante para trabajo de litigio, sin importar cómo se viera la demo.
Errores comunes y sus contramedidas
- Calificar la resolución del enlace en lugar del respaldo de la proposición. Contramedida: quien califica lee la cita puntual, no el destino del enlace.
- Probar con preguntas de respuesta célebre. Contramedida: al menos 15 de 50 consultas específicas de jurisdicción o fecha.
- Dejar que el proveedor aporte el conjunto de consultas. Contramedida: las consultas salen de asuntos cerrados cuyas respuestas tu equipo ya conoce.
- Tratar “fundamentado en contenido de Westlaw” como una afirmación de precisión. Contramedida: ambas plataformas medidas alucinaron estando fundamentadas en exactamente ese contenido.
- Delegar la verificación al propio verificador de citas de la herramienta. Contramedida: separa el generador del verificador; un examen autocalificado no es evidencia.
- Saltarse las consultas de premisa falsa porque parecen injustas. Contramedida: 10 de 50, como mínimo — la contraparte tampoco será justa.
- Tratar la verificación como un problema de ingeniería. Contramedida: la Opinión Formal 512 de la ABA (julio de 2024) pone la verificación independiente de la salida de IA sobre el abogado bajo las Reglas Modelo 1.1 y 3.3. No es delegable al SLA de un proveedor. Escríbelo en la política de IA para equipos legales y en el SOP de revisión contractual, no en la lista de compras.
Lo que está en juego está documentado, no es teórico. La base de datos AI Hallucination Cases de Damien Charlotin registró 1.668 resoluciones judiciales en el mundo con material fabricado por IA al 2 de julio de 2026, 1.163 de ellas en Estados Unidos. En 653 el responsable fue un abogado en ejercicio. Esto no es un problema de litigantes autorrepresentados.
Dónde deja de aplicar este marco
El protocolo de 50 consultas prueba salidas de investigación que citan autoridad. No se traslada sin cambios a tres casos adyacentes:
- Trabajo fundamentado en documentos — revisión contractual, extracción, due diligence. No hay citador que ejecutar. Sustitúyelo por procedencia de fragmento exacto: la herramienta debe resaltar el fragmento fuente en el documento fuente, y tú calificas si el fragmento respalda la extracción. Ve extracción de datos contractuales para esa forma de calificación.
- Asistentes de corpus cerrado sobre tu propio DMS o archivos de asuntos. La misma sustitución, más una prueba de permisos — haz una pregunta cuya respuesta esté detrás de una revisión de privilegio y confirma que la recuperación la rechaza.
- Monitoreo posterior a la compra. Esto es una compuerta, no un régimen. Los proveedores cambian el modelo subyacente sin aviso, y un cambio de modelo invalida tu medición. Vuelve a ejecutar las 50 consultas en cada cambio de modelo anunciado y en cada renovación.
Relacionado
- Política de IA para equipos legales — dónde se documenta el deber de verificación
- IA legal vs legaltech — la frontera de categoría en la que se ubica esta evaluación
- Harvey, Thomson Reuters CoCounsel, LexisNexis Protégé — las plataformas contra las que ejecutar el protocolo
- SOP de revisión contractual — la capa de revisión que absorbe una tasa de mala fundamentación distinta de cero