ooligo
claude-skill

Inventory your AI tools for preservation scope

Dificultad
avanzado
Tiempo de setup
3-6 hours
Para
legal-ops-manager · in-house-counsel
Legal Ops

Stack

Un skill de Claude que convierte el inventario de herramientas de IA de una organización en un mapa de alcance de preservación: para cada herramienta, dónde persisten los prompts y las respuestas, qué las elimina y bajo qué reloj, si una retención legal vigente ya alcanza esos datos, y qué lenguaje del cuestionario a custodios y de la notificación de retención hay que cambiar según la respuesta. El bundle se publica en apps/web/public/artifacts/ai-data-source-inventory-skill/ y contiene SKILL.md más tres archivos de referencia, uno de los cuales completas antes de la primera ejecución.

El skill es de solo lectura. No coloca ni levanta ninguna retención, porque ambas son decisiones legales que corresponden a una persona con nombre y apellido.

El hueco que cierra

Los mapas de datos construidos antes de 2023 listan correo, chat, repositorios de archivos y sistemas de negocio. La capa de IA se sumó a esos mismos sistemas sin sumarse al mapa, y las dos respuestas habituales a eso son erróneas de maneras que parecen responsables.

La primera es tratar las herramientas de IA como un problema de seguridad ya resuelto. Un ejercicio de descubrimiento de shadow AI produce una lista de aplicaciones y un conjunto de bloqueos, y la lista se archiva. Esa lista responde quién usa qué. No dice nada sobre qué registro deja ese uso, que es la única pregunta que le importa a la preservación.

La segunda es asumir que retención y preservación son el mismo hecho. Son independientes, y las filas interesantes son aquellas donde divergen. El chat de Microsoft 365 Copilot queda preservado por controles que la mayoría de las organizaciones ya opera: los prompts y las respuestas se copian a una carpeta oculta en el propio buzón de Exchange Online del usuario, y Microsoft documenta que la eliminación permanente se suspende cuando ese buzón está bajo Litigation Hold, un delay hold, una retención de eDiscovery u otra política de retención para la misma ubicación. Es decir, un custodio con retención sobre su buzón ya tiene su chat de Copilot preservado, lo haya decidido alguien o no. La memoria de Copilot, dentro del mismo producto, va en sentido contrario: Microsoft declara que las políticas y etiquetas de retención de Purview no aplican a la memoria de Copilot y que ningún control de administrador impone retención sobre ella, mientras que las memorias guardadas e inferidas siguen siendo detectables mediante eDiscovery y Graph Explorer. Detectable y desprotegido es el peor par de propiedades que puede tener una fuente de datos.

Cuándo usarlo

Cuando va a salir una retención y la lista de fuentes por custodio es anterior a la capa de IA. Cuando la contraparte presenta una solicitud de ESI o una propuesta bajo la Regla 26(f) que nombra registros de chatbot o historial de prompts. Cuando un programa de eliminación defendible está a punto de empezar a borrar y nadie ha establecido qué copia o qué deja atrás la capa de IA. Cuando seguridad termina un barrido de shadow AI y el resultado necesita una lectura de gestión documental en lugar de una lectura de seguridad.

Cuándo NO usarlo

  • La retención ya va tarde. Emite la notificación con el alcance más amplio defendible primero, e inventaría después. Un inventario no es motivo para retrasar una notificación.
  • Menos de unas ocho herramientas de IA, un solo proveedor de identidad, todo detrás de SSO. Lee las cuatro consolas de administración directamente. El esquema es sobrecarga a ese tamaño.
  • Necesitas recolectar los datos, no delimitarlos. references/2-retention-behavior-profiles.md registra si existe una vía de exportación y quién puede ejecutarla; no la ejecuta.
  • No tienes acceso a ninguna consola de administración. Todas las fases posteriores al descubrimiento dependen de configuración del tenant que debes poder leer. Sin eso, la ejecución produce una lista de afirmaciones de marketing del proveedor con aspecto de inventario.
  • Nadie va a completar la Parte D. El registro de herramientas conocidas en references/1-ai-tool-discovery-sources.md es lo que hace que una herramienta no descubierta se reporte como no registrada. Sin él, todos los hallazgos se leen igual.

Qué hace realmente el skill

Seis fases, orden fijo, con rechazos duros en dos de ellas.

La fase 1 recolecta de cuatro planos de descubrimiento: concesiones del proveedor de identidad, gasto, telemetría de endpoint y navegador, y el registro de herramientas conocidas. Son deliberadamente redundantes porque cada uno es ciego en una dirección distinta: el proveedor de identidad no ve una herramienta que alguien paga con tarjeta personal, el gasto no ve los planes gratuitos, la telemetría no ve la configuración del tenant, y el registro solo ve lo que la gente anotó. Una herramienta encontrada por un plano pertenece a otra clase de confianza que una encontrada por tres, y son los hallazgos de un solo plano los que traen los problemas, porque una herramienta que nadie compró es una herramienta que nadie configuró.

La fase 2 se niega a continuar con menos de tres planos, o si algún plano devuelve cero registros. Un plano con cero registros se renderiza como COLLECTION FAILED, nunca como un resultado limpio. El fallo característico de este trabajo es un inventario prolijo de las doce herramientas que fue fácil encontrar.

La fase 3 construye un perfil de retención por herramienta únicamente a partir de documentación del proveedor y configuración del tenant. Cada campo lleva un source_url y una fecha checked_on; un campo al que le falte alguno de los dos se renderiza como unknown en lugar de caer a un valor por defecto, porque un valor por defecto plausible es la forma en que un inventario se equivoca en silencio. Los perfiles se dividen por funcionalidad, no solo por herramienta: el chat de Copilot y la memoria de Copilot son dos filas con respuestas opuestas.

La fase 4 clasifica el alcance en cuatro estados, y esa es la decisión de diseño que separa el resultado de un mapa de datos. held significa que un control existente ya se adhiere. retained-not-held significa que los datos existen y son detectables pero ningún mecanismo de retención los alcanza, de modo que preservar es una tarea afirmativa de recolección con fecha, no algo que colocas y olvidas. not-retained significa que la interacción no deja registro duradero: Google declara que el soporte de Vault para la aplicación Gemini no aplica a las funciones de Gemini integradas en otras aplicaciones de Google Workspace, como “Help me write” en Gmail y Docs, porque esas interacciones no se retienen de la misma forma. vendor-held-only significa que el registro vive únicamente en sistemas del proveedor que tus retenciones no pueden tocar, lo que es una cuestión de posesión, custodia o control para los abogados y no una tarea de configuración para IT.

Luego ejecuta la prueba al revés, listando qué fuentes de IA barre silenciosamente cada retención existente. La sobrepreservación es un hallazgo reportable: infla el volumen de revisión y contradice cualquier calendario escrito que afirme que las interacciones de IA no se preservan.

Las fases 5 y 6 derivan los deltas del cuestionario y de la notificación a partir de references/3-custodian-questionnaire-deltas.md y reportan, encabezando con las filas retained-not-held y vendor-held-only porque esas exigen una decisión esta semana.

Costo y throughput

El cómputo no es el presupuesto. El skill lee exportaciones y documentación del proveedor; la redacción de cada perfil consume aproximadamente 600-900 tokens de salida, así que un parque de 40 herramientas cuesta bastante menos de un dólar en gasto de modelo.

El costo humano es la cifra completa, y es una estimación más que una medición: prevé 2-4 horas para extraer los cuatro planos si las exportaciones existen, y luego 15-30 minutos por herramienta entre documentación y verificación en el tenant. Un inventario de 40 herramientas es una primera pasada de 10-20 horas, la mayor parte en la fase 3. La Parte D de la referencia de descubrimiento persiste, así que la segunda ejecución es un diff y cuesta una fracción de la primera. Vuelve a ejecutarlo por asunto, y trimestralmente como preparación permanente.

Modos de fallo

  • Confundir “se retiene” con “una retención lo alcanza”. El equipo reporta una cobertura que ninguna retención produce realmente. Guarda: reachable_by_existing_hold no se puede inferir; el esquema obliga a nombrar el control específico que hace el alcance, y la retención del lado del proveedor para sus propios fines no califica.
  • Verificar la preservación mirando la aplicación. Guarda: Microsoft declara que los mensajes visibles en las aplicaciones de IA no reflejan con exactitud si están retenidos o eliminados de forma permanente. La verificación de la fase 4 es una búsqueda de eDiscovery que devuelve un conteo de coincidencias contra un custodio conocido, nunca una captura de pantalla.
  • Leer el período de retención configurado como la fecha de eliminación. El propio ejemplo trabajado de Microsoft muestra que una política de eliminar-tras-un-día puede tardar hasta 16 días antes de que los elementos dejen de aparecer en eDiscovery, porque el timer job corre en un ciclo de 1-7 días y la carpeta SubstrateHolds añade al menos un día más. Guarda: el esquema separa policy_period de observed_deletion_lag, y las certificaciones de eliminación defendible citan el segundo.
  • Asumir que una licencia equivale a captura. Las ubicaciones de retención de Purview alcanzan ChatGPT, Google Gemini, el Copilot de consumo y DeepSeek solo cuando hay configurada una collection policy con captura de contenido, lo que exige la condición Content contains classifiers puesta en All, y Microsoft declara que no incluye el contenido de los archivos compartidos con la IA generativa. Guarda: el estado de la collection policy es un campo de configuración del tenant por herramienta, no una suposición a nivel de organización.
  • Tratar los términos del proveedor como estables. La orden de preservación en el caso del New York Times obligó a OpenAI a conservar datos de registro de salida que de otro modo se habrían eliminado; esa obligación terminó el 2025-09-26 y la orden se dio por terminada por estipulación el 2025-10-09. Google Vault recién incorporó reglas de retención y litigation holds para la aplicación Gemini el 2026-06-11. Un inventario escrito a un lado de esas fechas es incorrecto del otro lado. Guarda: cada perfil lleva checked_on, y todo lo que supere el intervalo de reverificación se renderiza como unverified y se cuenta en el encabezado del informe.
  • El inventario se convierte en un documento de RR. HH. en el momento en que nombra a personas haciendo algo no aprobado, y la cooperación se derrumba. Guarda: la fase 1 agrega por herramienta y conteo; el detalle por custodio se escribe en run_dir/custodians/ y se referencia por ruta, nunca incrustado en el informe.

Frente a las alternativas

Frente a un conector de fuentes de IA de un proveedor de eDiscovery. Onna, Exterro y Reveal venden recolección desde fuentes en la nube, y cuando tienes un asunto y necesitas sacar los datos, un conector le gana a hacerlo a mano siempre. Resuelve el problema contiguo. Igual necesitas el inventario para saber qué conectores comprar, y no existen conectores para las fuentes que no tienen ninguna vía de exportación, que es justo donde viven las filas retained-not-held.

Frente a Purview DSPM for AI por sí solo. Para un parque centrado en Microsoft es el plano de descubrimiento más fuerte disponible, y el bundle lo usa como uno de ellos. Dos límites impiden que sea la respuesta: reporta el uso de aplicaciones de IA en lugar de lo que sobrevive a ese uso, y su alcance sobre herramientas ajenas a Microsoft depende del plano del navegador más una collection policy que la mayoría de los tenants no ha configurado.

Frente a pedirle a IT la lista de aplicaciones. Es la opción más rápida, y la respuesta es la lista de SSO, que estructuralmente excluye el uso sin SSO y con cuentas personales. Esa población excluida es precisamente la que tiene la peor postura de preservación, así que el método más rápido tiene su punto ciego exactamente donde están los hallazgos.

Frente a una hoja de cálculo. La comparación honesta, ya que es lo que hace la mayoría de los equipos. Sirve con diez herramientas. Lo que vale la pena no reescribir es el esquema de perfil con su source_url obligatorio, la clasificación de cuatro estados y la prueba inversa de retención, porque esas tres son las que la gente hace mal cuando construye la hoja por su cuenta.

Relacionado: ediscovery-custodian-questionnaire-skill para la entrevista que alimenta este inventario, legal-hold-process para la mecánica de la notificación, y microsoft-purview-ediscovery para el instrumental del lado del tenant por el que pasa la mayoría de estos hallazgos.

Archivos de este artefacto

Descargar todo (.zip)