Un skill de Claude que lee una carpeta de contratos firmados y deriva el playbook de negociación que esos contratos sustentan: la posición estándar por cláusula con la aritmética que la respalda, el rango completo de puntos donde realmente cierras, el peor término que has firmado alguna vez y un informe de cobertura que nombra cada campo que el corpus no puede aportar. El bundle está en apps/web/public/artifacts/playbook-from-precedent-claude-skill/ y contiene SKILL.md más tres archivos de referencia, uno de los cuales completas antes de la primera ejecución.
El skill es de solo lectura. Propone posiciones con evidencia adjunta y no aprueba ninguna, porque una posición de playbook es una delegación de facultades de firma y pertenece a una persona con nombre y apellido.
El vacío que cierra
Los playbooks se escriben de memoria. Alguien con experiencia recuerda dónde suele cerrar la empresa, lo escribe en un documento de Word y ese documento se convierte en el estándar — lo cual funciona hasta que esa persona se va o hasta que el recuerdo resulta describir tres operaciones de 2023. La corrección obvia es derivar el playbook de los contratos, y la corrección obvia tiene un defecto fácil de pasar por alto y caro de publicar.
Una carpeta de contratos firmados es una muestra censurada. Contiene todas las negociaciones que terminaron en firma y ninguna que terminó en abandono. Esa propiedad no es un problema de calidad de datos que puedas limpiar; es lo que la carpeta es. Y cae justo sobre el campo para el que existe un playbook. El punto de abandono es por definición la posición que no produce ningún contrato firmado, así que es lo único que el corpus tiene garantizado no contener. Cualquier herramienta que lea contratos firmados y emita una línea roja con confianza se la ha inventado.
Lo que el corpus sí sustenta es el límite que corre en sentido contrario. El término más adverso del archivo es un límite superior de tu tolerancia demostrada: no abandonaste ahí, porque hay una firma encima. La fase 5 lo emite como worst_signed con un identificador de contrato y una fecha, y se niega a emitir walk_away del todo. La fase 7 aplica luego la prueba en reversa — si alguien fija una línea roja en 12 meses de honorarios y el corpus contiene una indemnización de PI sin tope ya firmada, esa contradicción se marca con el contrato y la fecha. Importa comercialmente, no editorialmente: una contraparte que tenga tu contrato anterior puede exhibirlo, y una línea que ya cruzaste no es una línea.
Cuándo usarlo
Cuando se está escribiendo o reescribiendo un playbook y quienes lo redactan trabajan de memoria. Cuando se audita un playbook existente contra la práctica y la pregunta es dónde se separaron el estándar escrito y la realidad firmada. Cuando las facultades de firma pasan a un equipo de negocio y los umbrales de escalación tienen que sobrevivir a ser cuestionados. Cuando una implementación de CLM necesita posiciones iniciales y la extracción del proveedor produjo frecuencias de cláusulas sin ninguna segmentación detrás.
Cuándo NO usarlo
- Menos de unos 25 contratos firmados sobre tu propio papel para ese tipo de acuerdo. Por debajo de eso la aritmética de la fase 4 no puede separar una posición de una coincidencia, y la ejecución devuelve un informe de cobertura casi vacío. Lee los contratos.
- Necesitas el punto de abandono. El corpus no puede producirlo, por la razón anterior. Si ese es el entregable, esta es la herramienta equivocada.
- El corpus es mayormente papel de la contraparte y nadie puede etiquetar cuál es cuál. La fase 1 se niega en lugar de producir una respuesta plausible.
- Quieres posiciones aprobadas, no redactadas. La salida es una propuesta con citas. Aprobar es una decisión legal.
- Nadie va a completar el manifiesto.
references/1-corpus-manifest.mdes lo que hace posible toda segmentación. Sin él la ejecución tiene un único montón indiferenciado y reporta una posición mezclada de negociaciones que no tienen relación entre sí.
Qué hace realmente el skill
Siete fases, orden fijo, con rechazos duros en dos de ellas.
La fase 1 une cada contrato con su fila del manifiesto y se niega si más del 10% del corpus carece de paper_of_origin. No adivina el campo a partir del documento. Ese rechazo existe porque el fallo característico aquí es silencioso: un término aparece en el 78% de los contratos firmados, se anota como estándar de la empresa y en realidad es un artefacto de que el 78% de esos contratos se firmó sobre el formulario de la otra parte. Una frecuencia medida sobre papel mezclado es una medición de las preferencias de redacción de tus contrapartes reportada bajo tu nombre.
Las fases 2 y 3 separan extracción de normalización — primero la cita textual con puntero de página, después el valor comparable en una unidad declarada. Una sola pasada confunde «la cláusula dice X» con «X equivale a Y en nuestras unidades», y una vez fusionadas, los errores de normalización se esconden dentro de citas que nadie vuelve a leer. Un slot de cláusula sin coincidencia se renderiza como absent, que es un valor que participa en la estadística y no un fallo de parseo que se descarta.
La fase 4 es donde vive el umbral. Las celdas son (clause, paper_of_origin, agreement_type, counterparty_tier), y el valor modal se reporta con el intervalo de puntuación de Wilson sobre su proporción, no con el porcentaje crudo. Un candidato gana la etiqueta standard solo cuando el límite inferior al 95% supera 0.60. Esa regla es lo que hace que las muestras pequeñas se comporten, y vale la pena ver la aritmética: un término que aparece en 8 de 10 contratos es 80% por conteo y arrastra un intervalo del 95% de aproximadamente 49% a 94%, que abarca «casi siempre» y «apenas más de la mitad» y por tanto no puede llamarse estándar. Ese mismo 80% en 20 de 25 tiene un límite inferior cercano al 61% y pasa. Unas 25 instancias sobre el mismo papel por cláusula es el piso práctico; las celdas más cortas se renderizan como insufficient-evidence con el tamaño de muestra que necesitarían, nunca como una posición suavizada.
La fase 6 condiciona la escalera de fallbacks a dos requisitos — que se aporte el historial de redlines y que la distribución sea genuinamente multimodal y no un solo grupo con ruido. El texto firmado registra dónde cerraste, no con qué abriste, así que derivar una escalera fallback_1 / fallback_2 de PDF finales afirma una intención que la evidencia no contiene. Cuando los requisitos fallan, la salida dice observed_range con ese nombre, y un campo obligatorio fallback_ladder_reason impide que «no teníamos historial de versiones» sea indistinguible de «aquí no hay escalera».
La fase 7 divide cada celda en una ventana de recencia de 24 meses y reporta las celdas divergentes como dos posiciones con fechas en lugar de promediarlas, porque un tope de responsabilidad de 2022 promediado con uno de 2026 no describe ninguno de los dos. El informe se escribe en references/3-coverage-report-template.md, que abre con las filas no inferibles y de evidencia insuficiente y deja las posiciones derivadas al final, ya que son las que menos revisión necesitan.
Costo y rendimiento
El gasto de modelo no es la restricción. Un MSA de 15 páginas ronda entre 8.000 y 12.000 tokens — una estimación, no una cifra medida —, así que un corpus de 60 contratos está en el orden de 600.000 tokens de entrada. A la tarifa publicada por Anthropic para Claude Opus 5 de 5 USD por millón de tokens de entrada, eso son unos 3 USD de entrada más la salida de extracción, dejando la pasada completa por debajo de 10 USD.
El costo humano es la cifra que importa. Completar el manifiesto toma de 1 a 3 minutos por contrato si los metadatos ya están en un CLM y de 5 a 10 si alguien tiene que abrir cada archivo, así que un corpus de 60 contratos son medio día de ingesta antes de la primera ejecución. Súmale unas 2 a 4 horas revisando el informe de cobertura, la mayor parte en las secciones de contradicción y deriva. El manifiesto persiste, así que la segunda ejecución es un diff y cuesta una fracción de la primera. Reejecutar cada trimestre es la cadencia que vale la pena comprometer — la encuesta de DocJuris a unos 300 departamentos legales, publicada en octubre de 2024, encontró que incluso en la etapa más madura el fallo recurrente es la titularidad, con la primera versión del playbook sin mejorar nunca.
Modos de fallo
- La confusión del papel de origen. Una frecuencia construida sobre papel mezclado se lee como tu estándar y es el de tus contrapartes. Guarda: la fase 1 se niega por encima de un 10% de campos faltantes, y
paper_of_origines una dimensión de celda y no un filtro, así que una posición de papel de la contraparte nunca puede fusionarse silenciosamente con la de papel propio. - Falsa confianza con n pequeño. Ocho instancias de diez parece decisivo y no lo es. Guarda: la etiqueta
standardexige un límite inferior de Wilson al 95% por encima de 0.60, y las celdas que fallan reportann_requireden lugar de una posición matizada. - Inventar el punto de abandono. El campo más valioso de un playbook es el que el corpus no puede aportar, que es exactamente la presión que produce uno fabricado. Guarda:
walk_awayes un enum de un solo valor enreferences/2-clause-position-schema.md— no existe ninguna ruta de código que derive uno. - Una línea roja que tu propio archivo ya cruzó. Guarda: la fase 7 prueba en reversa cualquier punto de abandono afirmado contra
worst_signedy marca las contradicciones con el identificador y la fecha del contrato. - Poder de negociación leído como preferencia. Las posiciones se ven más débiles en el segmento enterprise porque ahí es donde cediste, no porque el estándar sea distinto allí. Guarda:
counterparty_tieres una dimensión de celda, y cuando los segmentos discrepan de forma material la posición mezclada se suprime y la supresión se nombra en el informe. - Dar por sentada la exactitud de la extracción. La identificación de cláusulas no es un problema resuelto — CUAD, el benchmark anotado por expertos con más de 13.000 etiquetas sobre 510 contratos comerciales y 41 tipos de cláusula, existe porque el rendimiento de los modelos en exactamente esta tarea tiene margen de mejora. Guarda: cada valor normalizado conserva su cita de origen y su puntero de página, así que la segunda pasada es auditable contra la primera sin reabrir el PDF.
vs alternativas
vs DraftWise Playbook Studio. La respuesta directa de estantería, lanzada el 25 de febrero de 2026, y la afirmación del proveedor es que comprime la creación de un playbook de más de seis horas manuales a cinco minutos extrayendo posiciones del historial de operaciones. Si ya estás en DraftWise, úsalo — está integrado con la redacción, cosa que este bundle no está. Lo que su material de lanzamiento no declara es un tamaño mínimo de corpus, un requisito de segmentación ni qué hace cuando la evidencia es escasa, y esos tres son toda la sustancia del problema. Corre este skill sobre el mismo corpus como verificación de las posiciones, no como reemplazo del producto.
vs Spellbook Benchmarks. El trabajo State of Contracts 2026 de Spellbook publica más de 270 benchmarks de cláusulas sobre 13 tipos de contrato extraídos de cientos de miles de contratos en 30 países, con un modelo de datos de reciprocidad. Eso responde otra pregunta — dónde está el mercado — y es el mejor instrumento para argumentar que la petición de una contraparte está fuera de mercado. No puede decirte dónde estás tú, y la brecha entre ambas cosas suele ser el hallazgo más útil disponible. Usa las dos; no sustituyas una por otra.
vs la biblioteca de cláusulas de tu CLM. Tanto Ironclad como Juro te mostrarán frecuencias de cláusulas en tu repositorio, y si ya tienes el repositorio ese es el punto de partida más barato. Lo que normalmente no te dan es la segmentación por papel de origen, el límite de confianza que separa una posición de una coincidencia y la negativa explícita a declarar un punto de abandono. Esas tres cosas son lo que este bundle agrega encima.
vs escribirlo en un documento de Word desde la memoria. La comparación honesta, ya que es lo que hace la mayoría de los equipos, y funciona bien con diez contratos donde una persona los ha leído todos. Más allá de eso, el fallo no es que la memoria se equivoque sino que nada distingue las posiciones bien evidenciadas de las recordadas, así que todo el documento carga la misma autoridad. El valor del informe de cobertura es que se califica a sí mismo.
Relacionado: clause-extraction-claude-skill para la capa de extracción sobre la que esto se construye, clause-library-design para estructurar la biblioteca donde aterrizan las posiciones, y contract-redline-claude-skill para aplicar el playbook una vez que existe.