Un piloto de IA para GTM se evalúa contra un documento que escribiste antes de empezarlo. Un piloto que arranca sin una métrica principal preregistrada, un umbral de cancelación, un grupo de control y una fecha de decisión calculada hacia atrás desde la ventana de preaviso del contrato no produce una evaluación: produce un dashboard, y el dashboard es del proveedor. Cuatro decisiones de diseño determinan si el piloto responde algo: qué preregistras, cómo aíslas un control, cómo cuentas el retrabajo humano y dónde cae la fecha de decisión respecto al reloj de la renovación. Esta página le da a cada una un valor por defecto desde el que puedes partir.
El fallo está aguas arriba del modelo
En todos los comités de dirección de IA se citan dos cifras. El Project NANDA del MIT reportó en The GenAI Divide: State of AI in Business 2025 que el 95 % de los pilotos empresariales de IA generativa no produjeron impacto medible en el P&L, a partir de 52 entrevistas estructuradas, 153 líderes encuestados y una revisión de 300 despliegues divulgados públicamente entre enero y junio de 2025. Por separado, una investigación de IDC con Lenovo encontró que el 88 % de las pruebas de concepto de IA nunca llegan a producción: cuatro pasan por cada 33 lanzadas.
Ambas cifras son más blandas de lo que parecen. El documento de NANDA está etiquetado como hallazgos preliminares y no como trabajo revisado por pares, y su metodología recibió críticas públicas por la construcción de la muestra y por el salto de «sin impacto medible en el P&L» a «fracaso». No cites ninguna de las dos cifras como evidencia de que tu piloto va a fracasar. Cítalas por lo que ambos equipos de investigación sí señalan como obstáculo principal: no la calidad del modelo, sino criterios de éxito poco claros y ninguna definición acordada de «suficientemente bueno». Ese fallo ocurre en la primera semana, antes de que salga un solo mensaje, y es la única parte del piloto que controlas por completo.
1. Preregistra cuatro líneas
Escríbelas antes de la primera ejecución, en un documento con fecha, distribuido a quien vaya a sentarse en la reunión de renovación.
La métrica principal, exactamente una. Para un agente de outbound es el costo totalmente cargado por reunión calificada efectivamente realizada. No reuniones agendadas, porque agendadas y realizadas divergen justo en la población que un agente de IA sobreproduce. No tasa de respuesta, porque una respuesta no es ingreso y una respuesta molesta cuenta igual que una positiva. Recolectar métricas secundarias está bien; solo una decide.
El umbral, expresado contra tu propia línea base. Mide los 90 días previos al piloto con la misma métrica y escribe la nota de aprobación como una razón respecto a ella. Las tasas de respuesta de benchmarks publicados no sirven aquí: codifican la calidad de lista, la oferta, la reputación de dominio y el segmento de otra persona. Tu línea base es la única comparación que mantiene todo eso constante.
Criterios de cancelación que terminan el piloto antes de tiempo. Son condiciones de incumplimiento, no resultados flojos: una tasa de quejas de spam que cruza tu techo, un incidente de cumplimiento o de marca, un agente que escribe datos malos en el CRM a un ritmo que cuesta más limpiar de lo que el piloto puede devolver. Nombra el umbral y a la persona que puede detenerlo sin convocar un comité.
La fecha de decisión. La sección 4 la fija. No es «fin del Q3».
Falta una línea más, y es la que se salta: la regla de enmienda. Criterios cambiados después de que empiezan a llegar datos invalidan la comparación. Si hay que enmendarlos, el memo registra ambas versiones y reporta el resultado como retrospectivo.
2. Construye el grupo de control
Este es el paso que casi todo piloto de GTM se salta, y saltárselo significa que ningún resultado del piloto puede atribuirse a la herramienta. Un trimestre con un agente nuevo es también un trimestre con otra estacionalidad, un competidor que cambió precios, dos SDR en rampa y una oferta modificada. Sin un brazo de control estás midiendo todo eso a la vez.
- Aleatoriza a nivel de cuenta, no de lead. Dos contactos de la misma cuenta que caen en brazos distintos contaminan ambos: hablan entre ellos, y el multithreading hace que el tratamiento alcance al control.
- Reserva entre 20 % y 30 % de las cuentas elegibles. Por debajo del 20 % el brazo de control produce muy pocos eventos de resultado para resolver un efecto realista. Por encima del 30 % pagas más costo de piloto por unidad de aprendizaje sin cambiar la respuesta.
- Estratifica por lo que prediga el resultado — normalmente nivel de ICP o segmento — para que los dos brazos no queden accidentalmente distintos en la variable que más importa.
- Corre ambos brazos en la misma ventana. Antes-y-después no es un control; es un control más todo lo demás que cambió.
- Fija un piso de resultados. Si el brazo de control arroja menos de unos 30 eventos de resultado en la ventana, el hallazgo honesto es «no hay señal suficiente para decidir», y ese es un resultado legítimo del piloto. También es razón para negociar un plazo mes a mes en lugar de firmar uno anual a cara o cruz.
3. Cuenta el retrabajo humano
La evidencia publicada más fuerte de que la productividad con IA autorreportada corre en la dirección equivocada viene del ensayo aleatorizado de METR con 16 desarrolladores open-source experimentados en 246 tareas reales. Pronosticaron que las herramientas de IA los acelerarían un 24 %. Se midieron un 19 % más lentos. Después, habiendo vivido la desaceleración, seguían estimando que la IA los había hecho un 20 % más rápidos.
METR califica ese resultado como histórico y descarta generalizarlo más allá del desarrollo de software, así que no importes el 19 % a un modelo GTM. Importa el error de signo. Los participantes no se equivocaron sobre la magnitud del efecto; se equivocaron sobre su dirección, en su propio trabajo, inmediatamente después. Cualquier decisión de renovación que reconstruya el retrabajo de memoria está corriendo el mismo experimento.
Así que regístralo durante el piloto, en cuatro categorías: configuración y ajuste de prompts, revisión y edición de salidas, manejo de escalamientos y respuestas, y limpieza — escrituras malas en el CRM, disculpas por contacto equivocado, secuencias detenidas a media ejecución. Muestrea en lugar de registrar todo; dos horas rastreadas por semana por rep participante bastan para construir una tasa. Las horas de retrabajo van en el numerador del costo por resultado a tarifas totalmente cargadas, junto a la licencia y el gasto en créditos. Para la mitad de consumo de ese número, ver precios de IA por asiento frente a por uso.
4. Calcula el calendario hacia atrás desde la ventana de preaviso
La trampa de la fecha de renovación se repite igual siempre. El piloto termina, los resultados son ambiguos, alguien pide con razón un mes más, y el plazo de preaviso de no renovación vence durante la extensión. El contrato se renueva a precio de lista, y la extensión que concediste para reunir más evidencia se convirtió en la decisión.
Programa hacia atrás, en este orden:
- Lee la ventana de preaviso en tu propio MSA. Los plazos de preaviso de no renovación en SaaS van de 30 a 90 días antes del fin del término. El único número que importa es el de tu contrato, y vale la pena confirmar que el reloj arranca al fin del término y no en una fecha de aniversario.
- Fecha de decisión = plazo de preaviso menos 14 días. Esa quincena es escribir el memo, la revisión de finanzas y un resbalón de agenda de un ejecutivo.
- Fin del piloto = fecha de decisión menos 14 días. Las reuniones agendadas en la última semana todavía no se realizaron, y el daño a la entregabilidad aparece con retraso. Un piloto puntuado en su última fecha de envío se puntúa antes de que lleguen sus propias consecuencias.
- Inicio del piloto = fin del piloto menos la duración del piloto. De 6 a 8 semanas para email outbound; más solo si tu ciclo de venta hace más raro el evento de resultado.
- Línea base = los 90 días previos al inicio del piloto. Ya tienes estos datos; extraerlos toma una hora, y omitirlos es lo que vuelve ilegible el resultado.
No hay respaldo regulatorio debajo de esto. La Negative Option Rule de la FTC — la regla de «click-to-cancel» — fue anulada por el Octavo Circuito el 8 de julio de 2025 por motivos procedimentales, días antes de entrar en vigor, y la Comisión envió a OIRA un borrador de aviso previo de propuesta normativa el 30 de enero de 2026 para reiniciar el proceso. Incluso si hubiera sobrevivido, regía planes de negative option de consumo y no habría alcanzado un contrato SaaS B2B. La ventana de preaviso de tu contrato es toda la protección que tienes.
Valores por defecto calibrados
Parte de aquí y mueve un número solo cuando puedas decir qué de tu motion lo hace incorrecto.
| Decisión | Por defecto | Muévelo cuando |
|---|---|---|
| Métrica principal | Costo totalmente cargado por reunión calificada realizada | La salida del agente no es un resultado contable |
| Comparación | Tu línea base de los 90 días previos | Nunca — los benchmarks publicados no controlan por tu dominio ni tu lista |
| Unidad de aleatorización | Cuenta | Nunca en outbound; el multithreading filtra el tratamiento |
| Porción de control | 25 % de las cuentas elegibles | Bajo 20 % solo con una tasa de resultado alta para alcanzar el piso |
| Piso de resultados | 30 eventos en el brazo de control | Súbelo cuando el efecto esperado sea menor al 20 % |
| Duración del piloto | 6-8 semanas | Más largo en ciclos donde el evento de resultado es raro |
| Muestreo de retrabajo | 2 horas rastreadas por rep por semana | Súbelo las primeras dos semanas, cuando la carga de configuración es máxima |
| Cola antes de puntuar | 14 días tras el último envío | Más donde las reuniones se agendan a 3+ semanas |
| Fecha de decisión | Plazo de preaviso menos 14 días | Antes cuando el memo necesita un ciclo de directorio o de compras |
Trampas y sus guardas
- El dashboard del proveedor se vuelve el marcador. Cuenta envíos, respuestas y agendamientos — las tres cosas que puede ver — y no puede ver reuniones realizadas, horas de retrabajo ni limpieza. Guarda: puntúa desde tu CRM, tu export de finanzas y tus registros de horas, y acuerda las fuentes de datos en el preregistro antes de que alguien tenga interés en la respuesta.
- Ventas elige a dedo las cuentas del piloto. El agente recibe la lista tibia, el control se queda con el resto, y la comparación está muerta antes del primer envío. Guarda: aleatoriza programáticamente desde el pool elegible y que la asignación la revise alguien que no cargue con el número.
- «Extender el piloto» reemplaza a «decidir». Guarda: una extensión solo se permite cuando el plazo de preaviso sigue cayendo después de la nueva fecha de decisión. De lo contrario, extender es renovar, y el memo debe decirlo con esas palabras.
- Agendadas sustituidas por realizadas. Guarda: la definición de la métrica nombra el evento realizado y fija el tratamiento de los no-shows antes de que empiece el piloto, porque un agente afinado para volumen mueve agendadas y realizadas en direcciones opuestas.
- Retrabajo reconstruido en la reunión de renovación. Guarda: el registro muestreado de horas, mantenido cada semana. Los participantes de METR juzgaron mal la dirección del efecto sobre su propio trabajo horas después de hacerlo.
- Un piloto sin señal se lee como aprobado. Guarda: el piso de resultados se escribe por adelantado, y «bajo el piso» es un veredicto con nombre y con su propia acción: un plazo mes a mes, no uno anual.
Dónde deja de funcionar este marco
Supone volumen suficiente para dividir. Si tocas menos de unas 200 cuentas al mes, un grupo de control lo bastante grande para resolver algo deja un brazo de tratamiento demasiado pequeño para valer la pena, y el aparato de medición cuesta más que la herramienta. Compra por criterio, dilo explícitamente y pon la disciplina en el plazo del contrato — mes a mes o un término inicial corto con ventana de preaviso negociada — en lugar de en un grupo de control que no puede sostener una conclusión.
También supone un resultado contable. Para un asistente de investigación o un copiloto dentro del CRM, el costo por reunión es el marco equivocado; descártalo y corre solo el registro de retrabajo como estudio de tiempos a nivel de tarea contra un conjunto pareado de tareas hechas sin la herramienta. Y para el paso de puntuación una vez cerrado el piloto, la skill de scorecard de piloto de AI SDR implementa los cuatro ejes y se niega a dar veredicto cuando los criterios se enmendaron a media ejecución o la muestra es corta. Para la pregunta de arquitectura que decide qué deberías estar pilotando, empieza por AI SDR y AI SDR guiado por señales frente a autónomo.
Una última señal que no cuesta nada leer. Si un proveedor no vende un plazo que termine después de tu fecha de decisión, o se resiste a un piloto que incluya grupo de control, eso es información sobre la confianza del proveedor en el resultado, y llega antes de que hayas gastado nada.