ooligo
claude-skill

Score an AI SDR pilot against pre-registered kill criteria and produce a keep/kill memo

Dificuldade
avançado
Tempo de setup
2-4 hours
Para
revops · sdr-leader · gtm-engineer
RevOps

Stack

Um Claude Skill que transforma um piloto de AI SDR encerrado em um memo de manter, matar ou estender, avaliado contra critérios que o time escreveu antes do primeiro envio. Ele calcula quatro eixos — custo totalmente carregado por reunião qualificada, reuniões por resposta positiva, horas humanas de retrabalho e delta de reputação de envio — e se recusa a devolver um veredito quando os critérios foram alterados no meio do piloto ou quando a amostra é pequena demais para sustentá-lo. O bundle em apps/web/public/artifacts/ai-sdr-pilot-scorecard-skill/ traz SKILL.md mais quatro arquivos de referência: o template de pré-registro que o time preenche antes de o piloto começar, o modelo de custos de cinco linhas, as definições de métricas e dois memos de exemplo literais.

O problema que ele resolve não é medição. É que quase ninguém escreve a linha de corte primeiro. Um piloto termina, o dashboard do vendor mostra reuniões agendadas, alguém divide a licença por esse número, e o resultado passa por um limiar que ninguém registrou antes. Três meses depois o contrato renova automaticamente porque ninguém produziu um documento dizendo como o fracasso teria sido.

Quando usar

Rode 14 dias após o último envio do piloto, com o export completo. A cauda de 14 dias é deliberada: reuniões agendadas na semana final ainda não aconteceram, e a filtragem por reclamações se degrada com atraso, então um piloto avaliado na data de encerramento é avaliado antes de suas próprias consequências chegarem.

Outros dois modos. Um checkpoint no meio do piloto com checkpoint: true calcula os eixos e devolve no_verdict — essa rodada existe para pegar uma quebra de reputação na semana três, não para decidir nada. E uma revisão de renovação sobre um deploy já em produção trata os últimos 90 dias como a janela; é o único modo em que um pré-registro escrito depois dos fatos é aceitável, e o memo carrega retrospective: true permanentemente.

O skill serve igualmente a 11x, Artisan, aisdr e agentes próprios, porque ele avalia seus sistemas e não os do vendor. Tudo o que ele lê vem do seu CRM, do seu export de finanças, dos seus apontamentos de horas e do Google Postmaster Tools.

Quando NÃO usar

Não existe pré-registro. O skill devolve no_preregistration e para. Escrever os critérios agora e retroagir a data produz um artefato pior do que nenhum memo — transforma um julgamento posterior em algo que parece medição. O modo de revisão de renovação é a única exceção, e ele se rotula sozinho.

Abaixo da amostra mínima registrada. Devolve insufficient_sample com as contagens observada e exigida. Com n reuniões qualificadas, adicionar ou remover uma move o custo por reunião em cerca de 1/n — 12,5% com oito reuniões, 5% com vinte. Um piloto de seis semanas que produziu nove reuniões realizadas não consegue distinguir uma taxa resposta-para-reunião de 4% de uma de 7%, e um veredito calculado sobre isso é ruído com uma casa decimal.

Escolher entre dois vendors. Isto avalia um deploy contra um limiar, não dois entre si. Um confronto direto exige os dois rodando em segmentos comparáveis com uma lista de exclusão compartilhada, o que é outro desenho.

A revisão trimestral de um time humano de SDR. O modelo de custos assume um medidor por lead ou por contato e uma linha de retrabalho que não existe do mesmo jeito para headcount.

Setup

De duas a quatro horas, na maior parte decidindo limiares em vez de conectar coisas.

  1. Preencha o pré-registro antes do primeiro envio. Copie references/1-preregistration-template.md, substitua cada placeholder, faça commit. Defina min_held_meetings de modo que mover uma reunião para dentro ou para fora mude o custo por reunião menos do que a margem entre seu limiar e seu valor esperado — se você espera cair perto de 700 contra um teto de 750, essa margem é de cerca de 7% e vinte reuniões é o piso.
  2. Defina max_cost_per_qualified_meeting contra o seu motion atual, não contra o preço de tabela do vendor. Preços publicados só dão a linha de assinatura. A AiSDR publica 250 por mês para 200 contatos pesquisados por AI, 900 para 800 e 2.500 para 2.500, com os dois tiers maiores em compromisso trimestral. A 11x publica 3.750 por mês faturado anualmente no Growth — 45.000 no ano — cobrindo 2.000 prospects novos por mês e até cinco usuários finais, e declara que cobra por lead e não por envio. A Artisan não publica preço e descreve seus tiers em aproximadamente 2.500 e aproximadamente 6.000 leads contatados por mês.
  3. Defina max_spam_rate em 0,0030 e deixe assim. Esse é o requisito publicado do Google para remetentes de mais de 5.000 mensagens por dia para contas Gmail: manter a taxa de spam reportada no Postmaster Tools abaixo de 0,30%. O Google recomenda separadamente ficar abaixo de 0,10% para que um pico normal de reclamações não alcance a linha dura. Numa lista com muito Gmail, defina o limiar de trabalho em 0,0010 e trate 0,0030 como o corte.
  4. Defina as regras de exclusão agora. exclude_open_opp_at_booking e exclude_prior_human_touch_within_days: 90 são as duas que decidem o que conta como reunião do agente. Afrouxe aqui, por escrito, antes de saber para que lado isso pesa.
  5. Instrumente as horas de retrabalho desde o primeiro dia. Um número semanal auto-reportado pelas duas pessoas que fazem o trabalho é impreciso e honesto. Um número reconstruído no fim por quem defende a ferramenta é preciso e inútil.
  6. Instale o skill. Coloque SKILL.md e references/ em .claude/skills/ai-sdr-pilot-scorecard/, ou faça upload como Skill no claude.ai. Monte o payload de entrada a partir do export do CRM, de finanças, dos apontamentos de horas e do Postmaster.

Por que os quatro eixos são construídos assim

O custo por reunião qualificada é emitido duas vezes. Uma sobre as cinco linhas de custo — assinatura, dados e enriquecimento, infraestrutura de envio, implementação amortizada e horas de retrabalho precificadas a uma taxa carregada — e outra só sobre assinatura. As duas vão para o memo. A cifra de só-assinatura é o número do business case do vendor; ela não está errada, responde outra pergunta, e imprimir as duas torna a base visível em vez de discutível. No exemplo trabalhado em references/2-cost-model.md, um piloto de 42 dias com 14 reuniões qualificadas dá 851 por reunião carregado e 370 só sobre assinatura, e 6.035 dos 6.735 que separam os dois são uma única linha: 71 horas de retrabalho humano. Essa distinção muda o próximo passo. “Caro demais” é uma negociação; “seis horas de trabalho humano por reunião produzida” é um problema de produto que desconto nenhum resolve.

Resposta-para-reunião conta apenas respostas positivas. Uma resposta negativa, um fora-do-escritório e um pedido de descadastro não são oportunidades de conversão, e juntá-los no mesmo denominador é como um gráfico de taxa de resposta fica plano enquanto a lista queima. Quando o classificador do próprio vendor rotulou as respostas, references/3-metric-definitions.md aplica um desconto de 0,80 e marca a cifra como unaudited — uma convenção que aquele arquivo estabelece para que as rodadas continuem comparáveis, não um número medido do mercado. Forneça uma amostra estratificada de 50 respostas rotuladas por humanos e o skill calcula a precisão real.

O retrabalho é avaliado por tendência além do nível. Cair semana a semana significa que o time está aprendendo a ferramenta; plano ou subindo significa que a ferramenta não converge. Mesmo nível, veredictos opostos.

Reputação é um corte duro, avaliado independentemente da economia. Se a janela de cauda cruzar a linha absoluta, o veredito é kill independentemente do que o custo por reunião disser. A reputação de remetente é compartilhada com tudo o que a empresa envia daqueles domínios — faturas, renovações, respostas de suporte — então um piloto não pode gastá-la e lançar a economia como resultado.

Modos de falha e guardas

  • A linha de corte se move no meio do piloto. É a forma mais comum de um piloto que fracassa sobreviver, e raramente é desonesta — é um limiar suavizado em silêncio num doc por alguém que já começou a acreditar. Guarda: o passo 1 faz hash do pré-registro e se recusa a avaliar contra um alterado, devolvendo um diff em nível de campo em vez de um veredito. Alterar é permitido; re-registre com um hash novo e o memo carrega retrospective: true permanentemente.
  • Inflação de atribuição. Vendors contam reuniões em contas que já estavam em ciclo ou com contato humano recente. Guarda: reuniões excluídas saem do numerador por regra e não por desconto negociado, e a contagem de exclusões e a distribuição de motivos são reportadas como achado. Um vendor cujas reuniões atribuídas são 32% contas já abertas está te dizendo algo sobre o sourcing dele que desconto nenhum resolve.
  • O denominador de só-assinatura. Guarda: a rodada é rejeitada com incomplete_cost_model se qualquer uma das cinco linhas for null. Uma linha que você acredita ser zero precisa ser informada como 0, o que é uma afirmação e não uma lacuna.
  • O dano que chega depois da data de avaliação. Guarda: a janela de cauda de 14 dias é obrigatória e o eixo de reputação pode matar um piloto que passou por todos os limiares de custo.
  • keep lido como “escalar”. O skill avalia uma configuração em um volume. Volume é o input com maior chance de quebrar o eixo de reputação. Guarda: a seção final do memo nomeia o volume avaliado e torna a reavaliação uma condição de qualquer aumento.

Contra as alternativas

O deck de QBR do vendor reporta o numerador. Ele não tem acesso às suas horas de retrabalho, nenhum incentivo para aplicar suas regras de exclusão, e rotula as próprias respostas positivas. Leia, e depois rode isto.

A planilha de um analista de RevOps acerta a aritmética e ainda assim perde para o desvio de critérios, porque a planilha é montada depois que os resultados são visíveis e os limiares são escolhidos junto com eles. O hash é a única parte deste workflow que uma planilha estruturalmente não consegue replicar.

Deixar o contrato renovar sozinho é o default de verdade, e é o que isto existe para deslocar. Sobre um compromisso 11x Growth, esse default custa 45.000 por um ano que ninguém decidiu comprar.

Combine com ai-sdr-draft-qa-skill, que controla a qualidade do output durante o piloto, e email-deliverability-monitor-n8n, que monitora o eixo de reputação continuamente em vez de em dois checkpoints. Para a pergunta de seleção de vendor que antecede tudo isso, veja ai-sdr-stack e AI SDR signal-driven vs autônomo.

Arquivos deste artefato

Baixar tudo (.zip)