Una proposición citada plantea tres preguntas. ¿Existe esa autoridad? ¿Sigue siendo derecho vigente? ¿Y la fuente dice realmente lo que el escrito afirma que dice? Un citator responde las dos primeras contra el corpus de una editorial, un trabajo que ningún modelo de lenguaje debería asumir. Nada responde la tercera, y ahí es donde se concentra hoy buena parte del daño.
Las cifras están en la base de datos AI Hallucination Cases que mantiene Damien Charlotin, que en su actualización del 19 de agosto de 2026 reúne 1.934 resoluciones en todo el mundo en las que un tribunal constató que una parte se apoyó en material alucinado — 1.325 de ellas en Estados Unidos. En los 1.832 casos con hallazgos etiquetados, la base registra 5.748 defectos individuales: 3.238 fabricados, 1.538 tergiversados, 937 citas textuales falsas, 35 desactualizados. La fabricación es la clase mayoritaria y es la que KeyCite y Shepard’s detectan. Los otros 2.475 defectos — el 43% del total — son autoridades reales y vigentes citadas para proposiciones que no sostienen, o transcritas con palabras que no contienen. Un citator devuelve señal limpia en todas ellas.
Este Claude Skill revisa esa tercera pregunta, y solo esa. Lee un borrador, arma una fila por cada instancia de cita y busca el texto que la sustenta en las fuentes que tú aportas. Cuando lo encuentra, copia el pasaje al registro de forma literal. Cuando no lo encuentra, lo dice. Nunca confirma una cita a partir de lo que el modelo reconoce.
El bundle está en apps/web/public/artifacts/citation-verification-claude-skill/ e incluye:
SKILL.md— la definición del Skill con los inputs, el método de tres pasadas, un extracto literal del registro y los puntos de atenciónreferences/1-source-index-template.md— el índice de fuentes rellenable, con el vocabulario cerrado de procedencia y las reglas de extracciónreferences/2-verification-log-template.md— el registro listo para certificación, con la declaración de alcance y el bloque de firma del revisorreferences/3-status-vocabulary.md— los seis estados y sus reglas de promoción, la tabla de correspondencia de señales del Bluebook y las reglas de fidelidad de las citas textuales
Cuándo usarlo
Ejecútalo sobre un borrador sustancialmente terminado, después de la pasada del citator, después de haber descargado a texto cada autoridad citada, y antes de presentar.
- Cualquier presentación en la que una herramienta de IA haya intervenido en la redacción. La ABA Formal Opinion 512 (29 de julio de 2024) sitúa el deber de verificación en el abogado con independencia de qué herramienta produjo el texto, y trata la confianza acrítica en el output generativo como algo próximo a la mala praxis. Un registro es la forma de demostrar que la indagación existió.
- Tribunales con requisito de certificación sobre IA. La standing order del juez Brantley Starr de mayo de 2023 en el Distrito Norte de Texas exigía a los abogados certificar o bien que ninguna parte del escrito fue redactada por IA generativa, o bien que toda porción redactada por IA fue contrastada contra una base de datos jurídica tradicional; desde entonces cientos de jueces federales y estatales han dictado sus propias versiones. El certificado es en sí mismo sancionable si es falso, así que el expediente necesita algo que lo respalde.
- Escritos armados desde un banco de escritos. Las secciones recicladas arrastran pin cites redactados contra un expediente anterior y una versión anterior del derecho. Nadie las relee, y las filas por instancia son lo que hace aflorar el cuarto uso de un caso cuyo pin cite se desplazó tres borradores atrás.
- Escritos de la contraparte dentro de la ventana de safe harbor. La Rule 11(c)(2) exige notificar la moción de sanciones 21 días antes de presentarla. Pasar el escrito del adversario por la misma revisión convierte esa ventana en una lista documentada y no en una corazonada.
- Presentaciones con mucho expediente. Las afirmaciones fácticas citadas a rangos Bates y a página:línea de transcripción reciben el mismo tratamiento que las autoridades jurídicas, que es la mitad del cite-check que ningún citator cubre.
Cuándo NO usarlo
- En lugar de un citator. El Skill no tiene corpus editorial, ni datos de historia posterior, ni forma de establecer que un caso existe. Ejecuta KeyCite, Shepard’s o equivalente primero, siempre. Esto es una segunda pasada, no un sustituto, y usarlo como sustituto reproduce exactamente el fallo que viene a atrapar.
- Sobre un borrador cuyas autoridades no se han descargado. Sin nada que leer, cada fila devuelve
NO-SOURCEy el registro es una lista de tareas pendientes. La descarga es el trabajo; el Skill es la revisión. - Sobre material bajo secreto u orden de protección antes de revisar los términos de retención. La Opinion 512 deja ese análisis en manos del abogado, y corresponde hacerlo antes del primer pegado, no después.
- Para decidir si un argumento gana. La verificación pregunta si la fuente sostiene la proposición tal como está redactada. Si esa proposición gana la moción es criterio del abogado y ahí se queda.
- Sobre PDF escaneados. La comparación es a nivel de carácter. Convierte a texto primero o la ejecución estará revisando una imagen.
Puesta en marcha
- Descarga el bundle desde
apps/web/public/artifacts/citation-verification-claude-skill/y colócalo en~/.claude/skills/para Claude Code, o súbelo a un proyecto de Claude. - Rellena
references/1-source-index-template.md. Una fila por fuente aportada, cada una con un valor deprovenancede la lista cerrada —westlaw,lexis,courtlistener,govinfo,pacer,production,reporter_pdf— y una fecha real de descarga enretrieved_on. - Descarga cada autoridad a texto como extracto: la página del pin cite más dos a cada lado. Registra el rango real en
pages_included. Esa columna decide si un pin cite fuera de rango vuelve comoNO-SOURCEo comoUNSUPPORTED, y equivocarla es la vía más rápida para convertir un problema real en un registro de aspecto limpio. - Fija
citator_run_onycitator_toolen la cabecera. Déjalos en blanco si no corrió ningún citator — el registro lo declarará en su propia cara, que es lo que un socio revisor necesita ver. - Ejecútalo una vez contra un escrito ya presentado que hayas revisado a mano, y compara los dos. Estás probando una sola cosa: que cada fila
SUPPORTEDlleve un pasaje que puedas abrir en la fuente. - Para cada borrador nuevo: aporta el borrador, el índice de fuentes y el directorio de fuentes. Lee la sección de no resueltos, resuélvela y presenta.
Qué hace realmente el Skill
Tres pasadas, y la separación entre las dos primeras es la garantía.
La pasada 1 construye la tabla de proposiciones — una fila por cada instancia de cita, no por autoridad. Una herramienta de tabla de autoridades deduplica, y la deduplicación es justo lo que oculta esta clase de fallo. Un caso citado cinco veces sostiene cinco proposiciones distintas. El caso existe, es derecho vigente, aparece una vez en la tabla de autoridades, y el cuarto pin cite apunta a una página que dice lo contrario. Las filas indexadas por autoridad no pueden mostrar eso; las indexadas por proposición sí. El registro imprime el recuento de instancias junto al de autoridades distintas, de modo que una lectura que colapsó las repeticiones queda visible en vez de silenciosa.
La pasada 2 contrasta solo contra el texto aportado. Para cada fila, el Skill abre el archivo indicado en el índice de fuentes y copia el pasaje que la sustenta, literal, con su localizador. La regla de rechazo es todo el diseño: sin pasaje, no hay promoción de estado. Una fila llega a SUPPORTED únicamente con un pasaje dentro. El modelo reconocerá muchas de estas citas — ha leído mucho derecho público — y cada uno de esos reconocimientos aquí no vale nada, porque el reconocimiento es el mismo mecanismo que produce una cita segura de sí misma a un caso que nunca existió.
La pasada 3 escribe el registro, agrupado por estado, con las filas no resueltas primero, y abriendo con una declaración de alcance que nombra lo que no se revisó.
Dos comprobaciones viajan de vuelta porque los pasajes ya están localizados. La fidelidad de la cita textual es a nivel de carácter, no semántica — la comparación semántica califica una paráfrasis entre comillas como coincidencia, y esa paráfrasis es el patrón de cita falsa que aparece en el historial de sanciones. Las alteraciones deliberadas se agrupan en su propia tabla: unos puntos suspensivos que eliminan una cláusula limitativa cambian la proposición, y (cleaned up) cubre comillas internas y citas sin autorizar una reescritura. La correspondencia de señales compara la relación real de sustento contra la señal introductoria. Una cita sin señal cuya fuente solo sostiene la proposición por inferencia pide un see. Ese error no es sancionable por sí solo, y se agrupa con la clase de tergiversación, porque una proposición que necesitaba señal y no la recibió es una donde la lectura del redactor y el texto de la fuente ya se separaron.
El coste real
El coste sigue a cuánto texto fuente entregas, y el extracto marca la diferencia entre una ejecución barata y una que no cabe.
Un escrito de 30 páginas ronda los 20.000 tokens. Cuarenta extractos de autoridad de cinco páginas cada uno añaden unos 120.000, así que una ejecución completa aterriza cerca de 140.000 tokens de entrada contra 4.000 a 8.000 de salida. Al precio de lista de Claude Sonnet 5 (3 USD por millón de entrada, 15 USD por millón de salida) eso son 0,45 a 0,70 USD por escrito; en Claude Opus 5 (5 y 25 USD), 0,80 a 1,20 USD.
Las descargas a texto completo cambian la forma más que el precio. Cuarenta sentencias completas superan los 600.000 tokens, que no entran en una ventana de contexto estándar — la ventana de 1M tokens es una capacidad de la API de Anthropic, no algo disponible en las apps de Claude — así que la ejecución hay que trocearla, y trocear rompe la garantía de que la pasada 2 vio todas las fuentes aportadas antes de asignar un estado. La descarga amplia es la correcta en dos sitios: proposiciones sobre lo que un tribunal resolvió, donde la postura procesal queda lejos del pin cite, y las citas see generally, que no tienen pin cite alrededor del cual construir una ventana.
El coste que importa son las horas. Revisar las citas de un escrito de 30 páginas con 40 autoridades a mano es un trabajo de 4 a 8 horas de paralegal o asociado (estimación, basada en descargar y leer cada página citada). El Skill no lo elimina. Convierte una búsqueda en la revisión de una tabla, y esa revisión sigue teniendo que ocurrir — la comprobación por muestreo del bloque de firma es el control que prueba si la regla del pasaje se sostuvo, y es el único paso que una máquina no puede ejecutar sobre su propio output.
Métrica de éxito
- Tasa de no resueltos en la primera pasada —
NO-SOURCEmásUNSUPPORTEDsobre el total de instancias. Obsérvala entre borradores, no dentro de uno. Una tasa que sigue alta cuando la disciplina de descarga ya está asentada es un problema del índice de fuentes que vive enpages_included, no un problema del modelo, y insistir con el prompt no lo moverá. - Instancias por autoridad distinta. Por debajo de 1,3 en un escrito de cualquier extensión significa que la pasada 1 dedujo cuando no debía. Ese número es el chequeo de salud de la propia garantía.
- Impugnaciones a una cita tras la presentación. Objetivo cero. Una sola obliga a revisar todo el circuito, no el escrito.
Frente a las alternativas
Frente a un citator solo. KeyCite y Shepard’s responden existencia y tratamiento contra el corpus de una editorial con autoridad de máquina. Sigue pagando por eso; nada de esto lo reemplaza. Lo que no hacen es leer tu frase, y el 43% de los defectos etiquetados en la base de Charlotin es exactamente esa brecha. La regla: ejecuta ambos, el citator primero, en ese orden. Ninguno de los dos cubre solo el escrito.
Frente a Clearbrief. Un complemento de Word que revisa si una cita existe, si la fuente sostiene la afirmación y si ha sido revocada, y construye una tabla de autoridades hipervinculada. El plan Solo se publica a 300 USD por usuario y mes (consultado el 20 de agosto de 2026), es decir 3.600 USD por puesto y año. Si la redacción ocurre en Word y puedes aprobar los puestos, cómpralo — cubre la mitad de existencia que este Skill no cubre, y vive donde ya se escribe. Usa el Skill cuando la compra no salga adelante, cuando el escrito cite una producción que el proveedor no tiene, o cuando quieras el registro de verificación como archivo portátil en la carpeta del asunto en vez de un estado dentro de la sesión de Word de alguien.
Frente a Lexis+ con Protégé. Los Shepard’s Verify Trust Markers, añadidos en mayo de 2026, escanean texto generado por IA y redactado por abogados, contrastan cada cita jurídica contra las fuentes de Lexis y marcan lo que no se puede verificar. Un despacho Lexis ya lo compró — úsalo. Contrasta citas contra el corpus y no contra tu expediente, así que deja intactas las afirmaciones fácticas citadas a Bates, que es donde este Skill y aquel dejan de solaparse.
Frente a Paxton AI. Su Citator declara un 94% en CaseHold de Stanford — una cifra medida por el propio proveedor, y un análisis de PNAS de 2025 sostiene que partes de ese benchmark son lo bastante fáciles como para que modelos de bolsa de palabras puntúen casi perfecto, así que trátala como un suelo y no como una calificación. Misma regla que los otros dos: responde existencia y tratamiento.
Frente al statu quo de un asociado descargando cada cita. Es lo que hace la mayoría de los despachos, es la línea base correcta, y el Skill no la reemplaza. Lo que cambia es qué lee ese asociado: una tabla con las filas no resueltas ya ordenadas, en lugar de cuarenta PDF y un marcador.
Puntos de atención
- El Skill certifica de memoria. Preguntado si una cita es buena, un modelo responde desde el reconocimiento, con seguridad — el mecanismo detrás de la autoridad fabricada. Guardarraíl:
SUPPORTEDexige un pasaje literal copiado de un archivo indexado e impreso en la fila, de modo que el registro muestra pasajes y no veredictos y un revisor puede comprobar que la garantía se sostuvo. La comprobación por muestreo de 10 filas del bloque de firma existe para esto y para nada más. - Fuentes circulares. Una “fuente” que es a su vez un resumen de IA verifica una fabricación contra su propia fabricación. Guardarraíl:
provenancees un vocabulario cerrado sin valorothery sin forma de expresar una sinopsis; las filas fuera de él se rechazan en la pasada 1. Los headnotes y los extractos de banco de escritos no son fuentes — descarga la sentencia. - La deduplicación oculta la tergiversación. Guardarraíl: filas indexadas por instancia de cita, con el recuento de instancias impreso junto al de autoridades, de modo que un par igual se lee como fallo de lectura y no como escrito limpio.
- El registro se toma por la certificación. Guardarraíl: la declaración de alcance encabeza cada registro, nombra existencia e historia posterior como fuera de alcance, y el bloque de firma queda sin firmar hasta que una persona lo firme. La Rule 11(b) certifica una indagación razonable dadas las circunstancias; el registro es prueba de que ocurrió, no la cosa misma. Lo que está en juego está documentado — en Whiting v. City of Athens, resuelto en el Sexto Circuito en marzo de 2026 sobre un escrito con más de dos docenas de citas fabricadas, el tribunal impuso honorarios, costas dobles, 15.000 USD de sanción punitiva a cada uno y una remisión disciplinaria.
- Descargas caducadas. Un caso que era derecho vigente al descargarlo y fue revocado la semana pasada se lee igual que uno que nadie revisó. Guardarraíl:
retrieved_ones obligatorio por fuente y se compara contrafiling_date, y toda brecha superior a 30 días marca[STALE-PULL]en cada fila que cite esa fuente. - Confidencialidad. Guardarraíl: revisa los términos de retención de datos aceptados por el despacho antes del primer documento bajo secreto que pegues. El Skill no tiene criterio sobre lo que permite tu orden de protección, y la Opinion 512 deja ese análisis contigo.
Stack
- Claude — extracción de la tabla de proposiciones, contraste de pasajes, diff de citas textuales, montaje del registro
- Lexis+ con Protégé o Thomson Reuters CoCounsel — la pasada del citator que va primero y responde existencia y tratamiento
- Paxton AI — la opción de citator más económica para despachos sin contrato de Westlaw ni de Lexis
Relacionado: grounding vs alucinación en IA jurídica para el test de aceptación que conviene correr antes de comprar cualquiera de las herramientas de arriba, y el Skill de esquema de declaración para la misma garantía de citas en dos pasadas aplicada a la preparación del interrogatorio.