ooligo
claude-skill

Score an AI SDR pilot against pre-registered kill criteria and produce a keep/kill memo

Difficulty
avancé
Setup time
2-4 hours
For
revops · sdr-leader · gtm-engineer
RevOps

Stack

Un Claude Skill qui transforme un pilote AI SDR terminé en mémo de maintien, d’arrêt ou de prolongation, évalué contre des critères que l’équipe a écrits avant le premier envoi. Il calcule quatre axes — coût pleinement chargé par réunion qualifiée, réunions par réponse positive, heures humaines de reprise et delta de réputation d’envoi — et refuse de rendre un verdict lorsque les critères ont été modifiés en cours de pilote ou que l’échantillon est trop petit pour en porter un. Le bundle situé dans apps/web/public/artifacts/ai-sdr-pilot-scorecard-skill/ fournit SKILL.md plus quatre fichiers de référence : le template de pré-enregistrement que l’équipe remplit avant le démarrage du pilote, le modèle de coûts à cinq lignes, les définitions de métriques et deux mémos d’exemple littéraux.

Le problème qu’il résout n’est pas la mesure. C’est que presque personne n’écrit d’abord la ligne d’arrêt. Un pilote se termine, le dashboard du vendor affiche des réunions réservées, quelqu’un divise la licence par ce nombre, et le résultat franchit un seuil que personne n’avait enregistré à l’avance. Trois mois plus tard le contrat se renouvelle automatiquement parce que personne n’a produit un document décrivant à quoi l’échec aurait ressemblé.

Quand l’utiliser

Lancez-le 14 jours après le dernier envoi du pilote, avec l’export complet. Cette traîne de 14 jours est délibérée : les réunions réservées la dernière semaine n’ont pas encore eu lieu, et le filtrage piloté par les plaintes se dégrade avec retard, donc un pilote évalué à sa date de fin est évalué avant que ses propres conséquences n’arrivent.

Deux autres modes. Un checkpoint à mi-parcours avec checkpoint: true calcule les axes et renvoie no_verdict — ce run existe pour attraper une rupture de réputation en semaine trois, pas pour décider quoi que ce soit. Et une revue de renouvellement sur un déploiement déjà en production traite les 90 derniers jours comme la fenêtre ; c’est le seul mode où un pré-enregistrement écrit après coup est acceptable, et le mémo porte retrospective: true de façon permanente.

Le skill convient de la même manière à 11x, Artisan, aisdr et aux agents maison, parce qu’il évalue vos systèmes et non ceux du vendor. Tout ce qu’il lit vient de votre CRM, de votre export finance, de vos relevés d’heures et de Google Postmaster Tools.

Quand NE PAS l’utiliser

Aucun pré-enregistrement n’existe. Le skill renvoie no_preregistration et s’arrête. Écrire les critères maintenant et les antidater produit un artefact pire que pas de mémo du tout — cela déguise un jugement postérieur en mesure. Le mode revue de renouvellement ci-dessus est la seule exception, et il s’étiquette lui-même.

En dessous de l’échantillon minimum enregistré. Renvoie insufficient_sample avec les comptes observé et requis. Avec n réunions qualifiées, ajouter ou retirer une réunion déplace le coût par réunion d’environ 1/n — 12,5% à huit réunions, 5% à vingt. Un pilote de six semaines ayant produit neuf réunions tenues ne peut pas distinguer un taux réponse-vers-réunion de 4% d’un taux de 7%, et un verdict calculé là-dessus est du bruit avec une décimale.

Choisir entre deux vendors. Ceci évalue un déploiement contre un seuil, pas deux l’un contre l’autre. Un face-à-face demande les deux tournant sur des segments comparables avec une liste d’exclusion partagée, ce qui est un autre design.

La revue trimestrielle d’une équipe SDR humaine. Le modèle de coûts suppose un compteur par lead ou par contact et une ligne de reprise qui n’existe pas sous la même forme pour un effectif.

Setup

Deux à quatre heures, essentiellement à décider des seuils plutôt qu’à brancher quoi que ce soit.

  1. Remplissez le pré-enregistrement avant le premier envoi. Copiez references/1-preregistration-template.md, remplacez chaque placeholder, committez. Réglez min_held_meetings de sorte qu’une réunion en plus ou en moins change le coût par réunion moins que la marge entre votre seuil et votre valeur attendue — si vous attendez d’atterrir près de 700 contre un plafond de 750, cette marge est d’environ 7% et vingt réunions constituent le plancher.
  2. Réglez max_cost_per_qualified_meeting contre votre motion actuelle, pas contre le prix catalogue du vendor. Les prix publiés ne donnent que la ligne d’abonnement. AiSDR publie 250 par mois pour 200 contacts recherchés par AI, 900 pour 800 et 2 500 pour 2 500, les deux tiers supérieurs étant sur engagement trimestriel. 11x publie 3 750 par mois facturé annuellement pour Growth — 45 000 sur l’année — couvrant 2 000 nouveaux prospects par mois et jusqu’à cinq utilisateurs finaux, et déclare facturer par lead plutôt que par envoi. Artisan ne publie aucun prix et décrit ses tiers autour de 2 500 et de 6 000 leads contactés par mois.
  3. Réglez max_spam_rate à 0,0030 et laissez-le là. C’est l’exigence publiée par Google pour les expéditeurs de plus de 5 000 messages par jour vers des comptes Gmail : maintenir le taux de spam rapporté dans Postmaster Tools en dessous de 0,30%. Google recommande séparément de rester en dessous de 0,10% pour qu’un pic ordinaire de plaintes n’atteigne pas la ligne dure. Sur une liste très orientée Gmail, fixez le seuil de travail à 0,0010 et traitez 0,0030 comme l’arrêt.
  4. Fixez les règles d’exclusion maintenant. exclude_open_opp_at_booking et exclude_prior_human_touch_within_days: 90 décident de ce qui compte comme réunion de l’agent. Assouplissez-les ici, par écrit, avant de savoir dans quel sens cela vous arrange.
  5. Instrumentez les heures de reprise dès le premier jour. Un chiffre hebdomadaire auto-déclaré par les deux personnes qui font le travail est imprécis et honnête. Un chiffre reconstruit à la fin par la personne qui défend l’outil est précis et inutile.
  6. Installez le skill. Déposez SKILL.md et references/ dans .claude/skills/ai-sdr-pilot-scorecard/, ou uploadez-le comme Skill sur claude.ai. Assemblez le payload d’entrée depuis votre export CRM, la finance, les relevés d’heures et Postmaster.

Pourquoi les quatre axes sont construits ainsi

Le coût par réunion qualifiée est émis deux fois. Une fois sur les cinq lignes de coût — abonnement, données et enrichissement, infrastructure d’envoi, implémentation amortie, et heures de reprise valorisées à un taux chargé — et une fois sur le seul abonnement. Les deux figurent au mémo. Le chiffre abonnement-seul est celui du business case du vendor ; il n’est pas faux, il répond à une autre question, et imprimer les deux côte à côte rend la base visible plutôt que discutable. Dans l’exemple travaillé de references/2-cost-model.md, un pilote de 42 jours avec 14 réunions qualifiées donne 851 par réunion en chargé et 370 sur le seul abonnement, et 6 035 des 6 735 qui les séparent tiennent à une seule ligne : 71 heures de reprise humaine. Cette distinction change l’étape suivante. « Trop cher » est une négociation ; « six heures de travail humain par réunion produite » est un problème produit qu’aucune remise ne résout.

Réponse-vers-réunion ne compte que les réponses positives. Une réponse négative, une absence du bureau et une demande de désabonnement ne sont pas des opportunités de conversion, et les regrouper dans un même dénominateur est la raison pour laquelle une courbe de taux de réponse reste plate pendant que la liste brûle. Là où le classifieur du vendor a lui-même étiqueté les réponses, references/3-metric-definitions.md applique une décote de 0,80 et marque le chiffre unaudited — une convention posée par ce fichier pour que les runs restent comparables, pas un chiffre de marché mesuré. Fournissez un échantillon stratifié de 50 réponses étiquetées par des humains et le skill calcule la précision réelle.

La reprise est évaluée sur la tendance autant que sur le niveau. En baisse semaine après semaine signifie que l’équipe apprend l’outil ; plate ou en hausse signifie que l’outil ne converge pas. Même niveau, verdicts opposés.

La réputation est un arrêt dur, évalué indépendamment de l’économie. Si la fenêtre de traîne franchit la ligne absolue, le verdict est kill quoi que dise le coût par réunion. La réputation d’expéditeur est partagée par tout ce que l’entreprise envoie depuis ces domaines — factures, renouvellements, réponses support — un pilote ne peut donc pas la dépenser et comptabiliser l’économie comme un résultat.

Modes de défaillance et garde-fous

  • La ligne d’arrêt bouge en cours de pilote. C’est la façon la plus fréquente dont un pilote qui échoue survit, et c’est rarement malhonnête — c’est un seuil discrètement adouci dans un doc par quelqu’un qui a déjà commencé à y croire. Garde-fou : l’étape 1 hashe le pré-enregistrement et refuse d’évaluer contre une version modifiée, en renvoyant un diff au niveau du champ plutôt qu’un verdict. Modifier est permis ; ré-enregistrez avec un nouveau hash et le mémo porte retrospective: true de façon permanente.
  • Inflation d’attribution. Les vendors comptent des réunions sur des comptes déjà en cycle ou touchés récemment par un humain. Garde-fou : les réunions exclues quittent le numérateur par règle et non par décote négociée, et le nombre d’exclusions ainsi que la distribution des motifs sont rapportés comme un résultat à part entière. Un vendor dont les réunions attribuées sont à 32% des comptes déjà ouverts vous dit quelque chose sur son sourcing qu’aucune remise ne corrige.
  • Le dénominateur abonnement-seul. Garde-fou : le run est rejeté avec incomplete_cost_model si l’une des cinq lignes est null. Une ligne que vous croyez nulle doit être saisie comme 0, ce qui est une affirmation et non un vide.
  • Les dégâts qui arrivent après la date d’évaluation. Garde-fou : la fenêtre de traîne de 14 jours est obligatoire et l’axe réputation peut tuer un pilote ayant franchi tous les seuils de coût.
  • keep lu comme « passer à l’échelle ». Le skill évalue une configuration à un volume. Le volume est l’input le plus susceptible de casser l’axe réputation. Garde-fou : la section finale du mémo nomme le volume évalué et fait de la ré-évaluation une condition de toute augmentation.

Face aux alternatives

Le deck de QBR du vendor rapporte le numérateur. Il n’a pas accès à vos heures de reprise, aucune incitation à appliquer vos règles d’exclusion, et il étiquette ses propres réponses positives. Lisez-le, puis lancez ceci.

Le tableur d’un analyste RevOps fait l’arithmétique correctement et perd quand même face à la dérive des critères, parce que le tableur est construit après que les résultats sont visibles et que les seuils sont choisis à côté d’eux. Le hash est la seule partie de ce workflow qu’un tableur ne peut structurellement pas répliquer.

Laisser le contrat se renouveler tout seul est le vrai défaut, et c’est ce que ceci existe pour déplacer. Sur un engagement 11x Growth, ce défaut coûte 45 000 pour une année que personne n’a décidé d’acheter.

Associez-le à ai-sdr-draft-qa-skill, qui contrôle la qualité de l’output pendant le pilote, et à email-deliverability-monitor-n8n, qui surveille l’axe réputation en continu plutôt qu’à deux checkpoints. Pour la question de sélection du vendor qui précède tout cela, voyez ai-sdr-stack et AI SDR signal-driven vs autonome.

Files in this artifact

Download all (.zip)