Você avalia um piloto de IA para GTM contra um documento que escreveu antes de ele começar. Um piloto que arranca sem uma métrica principal pré-registrada, um limite de cancelamento, um grupo de controle e uma data de decisão calculada de trás para frente a partir da janela de aviso prévio do contrato não produz uma avaliação: produz um dashboard, e o dashboard é do fornecedor. Quatro decisões de design determinam se o piloto responde alguma coisa: o que você pré-registra, como isola um controle, como conta o retrabalho humano e onde a data de decisão cai em relação ao relógio da renovação. Esta página dá a cada uma um valor padrão do qual você pode partir.
A falha está a montante do modelo
Dois números aparecem em todo comitê de IA. O Project NANDA do MIT relatou em The GenAI Divide: State of AI in Business 2025 que 95% dos pilotos corporativos de IA generativa não produziram impacto mensurável no P&L, a partir de 52 entrevistas estruturadas, 153 líderes pesquisados e uma revisão de 300 implantações divulgadas publicamente entre janeiro e junho de 2025. Separadamente, uma pesquisa da IDC com a Lenovo apurou que 88% das provas de conceito de IA nunca chegam à produção — quatro passam para cada 33 lançadas.
Os dois números são mais frágeis do que parecem. O documento da NANDA está rotulado como achados preliminares, não como trabalho revisado por pares, e sua metodologia recebeu críticas públicas quanto à construção da amostra e ao salto de “sem impacto mensurável no P&L” para “fracasso”. Não cite nenhuma das duas cifras como evidência de que o seu piloto vai fracassar. Cite-as pelo que ambas as equipes de pesquisa de fato apontam como obstáculo principal: não a qualidade do modelo, mas critérios de sucesso pouco claros e nenhuma definição acordada de “bom o suficiente”. Essa falha acontece na primeira semana, antes de sair uma única mensagem, e é a única parte do piloto que você controla por completo.
1. Pré-registre quatro linhas
Escreva-as antes da primeira execução, num documento datado, distribuído a quem vai sentar na reunião de renovação.
A métrica principal — exatamente uma. Para um agente de outbound é o custo totalmente carregado por reunião qualificada efetivamente realizada. Não reuniões agendadas, porque agendadas e realizadas divergem justamente na população que um agente de IA superproduz. Não taxa de resposta, porque uma resposta não é receita e uma resposta irritada conta igual a uma positiva. Coletar métricas secundárias é aceitável; só uma decide.
O limite, expresso contra a sua própria linha de base. Meça os 90 dias anteriores ao piloto na mesma métrica e escreva a nota de aprovação como uma razão em relação a ela. Taxas de resposta de benchmarks publicados não servem aqui: elas codificam a qualidade de lista, a oferta, a reputação de domínio e o segmento de outra pessoa. Sua linha de base é a única comparação que mantém isso constante.
Critérios de cancelamento que encerram o piloto antes da hora. São condições de violação, não resultados fracos: uma taxa de reclamação de spam que cruza seu teto, um incidente de compliance ou de marca, um agente gravando dados ruins no CRM a um ritmo que custa mais para limpar do que o piloto pode devolver. Nomeie o limite e a pessoa que pode puxar o freio sem convocar um comitê.
A data de decisão. A seção 4 a define. Não é “fim do Q3”.
Falta mais uma linha, e é a que todo mundo pula: a regra de emenda. Critérios alterados depois que os dados começam a chegar invalidam a comparação. Se for preciso emendar, o memo registra as duas versões e reporta o resultado como retrospectivo.
2. Construa o grupo de controle
Este é o passo que quase todo piloto de GTM pula, e pular significa que nenhum resultado do piloto pode ser atribuído à ferramenta. Um trimestre com um agente novo é também um trimestre com outra sazonalidade, um concorrente que mudou preços, dois SDRs em ramp-up e uma oferta alterada. Sem um braço de controle você está medindo tudo isso de uma vez.
- Randomize por conta, não por lead. Dois contatos da mesma conta caindo em braços diferentes contaminam os dois: eles conversam entre si, e o multithreading faz o tratamento alcançar o controle.
- Separe de 20% a 30% das contas elegíveis. Abaixo de 20% o braço de controle produz eventos de resultado em número insuficiente para resolver um efeito realista. Acima de 30% você paga mais custo de piloto por unidade de aprendizado sem mudar a resposta.
- Estratifique pelo que prediz o resultado — em geral tier de ICP ou segmento — para que os dois braços não fiquem acidentalmente diferentes na variável que mais importa.
- Rode os dois braços na mesma janela. Antes-e-depois não é controle; é controle mais tudo o mais que mudou.
- Defina um piso de resultados. Se o braço de controle render menos de cerca de 30 eventos de resultado na janela, o achado honesto é “sinal insuficiente para decidir”, e esse é um resultado legítimo do piloto. Também é motivo para negociar um prazo mês a mês em vez de assinar um anual no cara ou coroa.
3. Conte o retrabalho humano
A evidência publicada mais forte de que a produtividade com IA autorreportada corre na direção errada vem do ensaio randomizado da METR com 16 desenvolvedores open-source experientes em 246 tarefas reais. Eles previram que as ferramentas de IA os acelerariam em 24%. Foram medidos 19% mais lentos. Depois, tendo vivido a desaceleração, ainda estimavam que a IA os havia deixado 20% mais rápidos.
A própria METR classifica esse resultado como histórico e recusa generalização para fora do desenvolvimento de software, então não importe os 19% para um modelo de GTM. Importe o erro de sinal. Os participantes não erraram a magnitude do efeito; erraram a direção dele, no próprio trabalho, imediatamente depois. Qualquer decisão de renovação que reconstrua o retrabalho de memória está rodando o mesmo experimento.
Então registre durante o piloto, em quatro categorias: configuração e ajuste de prompts, revisão e edição de saídas, tratamento de escalonamentos e respostas, e limpeza — gravações ruins no CRM, desculpas por contato errado, sequências interrompidas no meio. Faça amostragem em vez de registrar tudo; duas horas rastreadas por semana por rep participante bastam para construir uma taxa. As horas de retrabalho entram no numerador do custo por resultado a taxas totalmente carregadas, ao lado da licença e do gasto em créditos. Para a metade de consumo desse número, veja precificação de IA por assento versus por uso.
4. Monte o calendário de trás para frente a partir da janela de aviso prévio
A armadilha da data de renovação se repete sempre igual. O piloto termina, os resultados são ambíguos, alguém pede com razão mais um mês — e o prazo de aviso de não renovação vence durante a extensão. O contrato renova a preço de tabela, e a extensão que você concedeu para juntar mais evidência virou a decisão.
Programe de trás para frente, nesta ordem:
- Leia a janela de aviso prévio no seu próprio MSA. Prazos de aviso de não renovação em SaaS vão de 30 a 90 dias antes do fim do termo. O único número que importa é o do seu contrato, e vale confirmar se o relógio começa no fim do termo ou numa data de aniversário.
- Data de decisão = prazo de aviso menos 14 dias. Essa quinzena é escrita do memo, revisão de finanças e um deslize de agenda de um executivo.
- Fim do piloto = data de decisão menos 14 dias. Reuniões agendadas na última semana ainda não aconteceram, e o dano à entregabilidade aparece com atraso. Um piloto pontuado na data do último envio é pontuado antes de as próprias consequências chegarem.
- Início do piloto = fim do piloto menos a duração do piloto. De 6 a 8 semanas para email outbound; mais só se o seu ciclo de vendas tornar o evento de resultado mais raro.
- Linha de base = os 90 dias anteriores ao início do piloto. Você já tem esses dados; extraí-los leva uma hora, e pular isso é o que torna o resultado ilegível.
Não há respaldo regulatório embaixo disso. A Negative Option Rule da FTC — a regra do “click-to-cancel” — foi anulada pelo Oitavo Circuito em 8 de julho de 2025 por vícios procedimentais, dias antes de entrar em vigor, e a Comissão enviou à OIRA um rascunho de aviso prévio de proposta normativa em 30 de janeiro de 2026 para reiniciar o processo. Mesmo se tivesse sobrevivido, ela regia planos de negative option de consumo e não alcançaria um contrato SaaS B2B. A janela de aviso prévio do seu contrato é toda a proteção que existe.
Padrões calibrados
Comece aqui e mova um número apenas quando puder dizer o que no seu motion o torna errado.
| Decisão | Padrão | Mude quando |
|---|---|---|
| Métrica principal | Custo totalmente carregado por reunião qualificada realizada | A saída do agente não é um resultado contável |
| Comparação | Sua linha de base dos 90 dias anteriores | Nunca — benchmarks publicados não controlam pelo seu domínio nem pela sua lista |
| Unidade de randomização | Conta | Nunca em outbound; multithreading vaza o tratamento |
| Fatia de controle | 25% das contas elegíveis | Abaixo de 20% só com taxa de resultado alta o bastante para bater o piso |
| Piso de resultados | 30 eventos no braço de controle | Aumente quando o efeito esperado for menor que 20% |
| Duração do piloto | 6-8 semanas | Mais longo em ciclos onde o evento de resultado é raro |
| Amostragem de retrabalho | 2 horas rastreadas por rep por semana | Aumente nas duas primeiras semanas, quando a carga de configuração é máxima |
| Cauda antes de pontuar | 14 dias após o último envio | Mais onde reuniões são agendadas a 3+ semanas |
| Data de decisão | Prazo de aviso menos 14 dias | Antes, quando o memo exige ciclo de conselho ou de compras |
Armadilhas e proteções
- O dashboard do fornecedor vira o placar. Ele conta envios, respostas e agendamentos — as três coisas que consegue enxergar — e não enxerga reuniões realizadas, horas de retrabalho nem limpeza. Proteção: pontue a partir do seu CRM, do seu export de finanças e dos seus apontamentos de horas, e acorde as fontes de dados no pré-registro antes de alguém ter interesse na resposta.
- Vendas escolhe a dedo as contas do piloto. O agente recebe a lista morna, o controle fica com o resto, e a comparação morre antes do primeiro envio. Proteção: randomize programaticamente a partir do pool elegível e faça a atribuição ser revisada por alguém que não carregue a meta.
- “Estender o piloto” substitui “decidir”. Proteção: uma extensão só é permitida quando o prazo de aviso ainda cai depois da nova data de decisão. Caso contrário, estender é renovar, e o memo deve dizer isso com essas palavras.
- Agendadas substituídas por realizadas. Proteção: a definição da métrica nomeia o evento realizado e fixa o tratamento de no-shows antes de o piloto começar, porque um agente afinado para volume move agendadas e realizadas em direções opostas.
- Retrabalho reconstruído na reunião de renovação. Proteção: o registro amostrado de horas, mantido toda semana. Os participantes da METR erraram a direção do efeito sobre o próprio trabalho horas depois de fazê-lo.
- Um piloto sem sinal é lido como aprovação. Proteção: o piso de resultados é escrito antecipadamente, e “abaixo do piso” é um veredito com nome e ação própria: um prazo mês a mês, não um anual.
Onde este framework para de funcionar
Ele pressupõe volume suficiente para dividir. Se você toca menos de cerca de 200 contas por mês, um grupo de controle grande o bastante para resolver algo deixa um braço de tratamento pequeno demais para valer a pena, e o aparato de medição custa mais que a ferramenta. Compre por julgamento, diga isso explicitamente e coloque a disciplina no prazo do contrato — mês a mês ou um termo inicial curto com janela de aviso negociada — em vez de num grupo de controle que não sustenta conclusão.
Ele também pressupõe um resultado contável. Para um assistente de pesquisa ou um copiloto dentro do CRM, custo por reunião é o enquadramento errado; descarte-o e rode só o registro de retrabalho como estudo de tempos por tarefa contra um conjunto pareado de tarefas feitas sem a ferramenta. E para a etapa de pontuação depois de fechado o piloto, a skill de scorecard de piloto de AI SDR implementa os quatro eixos e recusa veredito quando os critérios foram emendados no meio ou a amostra é curta. Para a pergunta de arquitetura que decide o que você deveria estar pilotando, comece por AI SDR e AI SDR guiado por sinais versus autônomo.
Um último sinal que não custa nada ler. Se um fornecedor não vende um prazo que termine depois da sua data de decisão, ou resiste a um piloto com grupo de controle, isso é informação sobre a confiança do fornecedor no resultado — e chega antes de você ter gasto qualquer coisa.