ooligo
claude-skill

Score an AI SDR pilot against pre-registered kill criteria and produce a keep/kill memo

Difficulty
Profi
Setup time
2-4 hours
For
revops · sdr-leader · gtm-engineer
RevOps

Stack

Ein Claude Skill, der einen abgeschlossenen AI SDR Pilot in ein Keep-, Kill- oder Extend-Memo verwandelt, bewertet gegen Kriterien, die das Team vor dem ersten Versand aufgeschrieben hat. Er berechnet vier Achsen — vollständig belastete Kosten pro qualifiziertem Meeting, Meetings pro positiver Antwort, menschliche Nacharbeitsstunden und Delta der Versandreputation — und verweigert ein Urteil, wenn die Kriterien mitten im Pilot geändert wurden oder die Stichprobe zu klein ist, um eines zu tragen. Das Bundle unter apps/web/public/artifacts/ai-sdr-pilot-scorecard-skill/ liefert SKILL.md sowie vier Referenzdateien: das Vorregistrierungs-Template, das das Team vor Pilotstart ausfüllt, das Kostenmodell mit fünf Zeilen, die Metrikdefinitionen und zwei wörtliche Beispiel-Memos.

Das Problem, das er löst, ist nicht die Messung. Es ist, dass fast niemand die Abbruchlinie zuerst aufschreibt. Ein Pilot endet, das Dashboard des Anbieters zeigt gebuchte Meetings, jemand teilt die Lizenzgebühr durch diese Zahl, und das Ergebnis übertrifft eine Schwelle, die niemand vorab registriert hat. Drei Monate später verlängert sich der Vertrag automatisch, weil niemand ein Dokument erstellt hat, das beschreibt, wie Scheitern ausgesehen hätte.

Wann Sie ihn einsetzen

Führen Sie ihn 14 Tage nach dem letzten Pilotversand mit dem vollständigen Export aus. Der 14-Tage-Nachlauf ist Absicht: In der letzten Woche gebuchte Meetings haben noch nicht stattgefunden, und beschwerdegetriebene Filterung verschlechtert sich zeitversetzt. Ein Pilot, der an seinem Enddatum bewertet wird, wird also bewertet, bevor seine eigenen Folgen eintreffen.

Zwei weitere Modi. Ein Checkpoint zur Halbzeit mit checkpoint: true berechnet die Achsen und liefert no_verdict — dieser Lauf existiert, um in Woche drei einen Reputationsbruch zu erkennen, nicht um etwas zu entscheiden. Und ein Renewal-Review auf einem bereits laufenden Deployment behandelt die letzten 90 Tage als Fenster. Das ist der einzige Modus, in dem eine nachträglich geschriebene Vorregistrierung akzeptabel ist, und das Memo trägt retrospective: true dauerhaft.

Der Skill passt gleichermaßen zu 11x, Artisan, aisdr und selbst gebauten Agenten, weil er Ihre Systeme bewertet und nicht die des Anbieters. Alles, was er liest, kommt aus Ihrem CRM, Ihrem Finanzexport, Ihren Zeiterfassungen und Google Postmaster Tools.

Wann Sie ihn NICHT einsetzen

Es gibt keine Vorregistrierung. Der Skill gibt no_preregistration zurück und stoppt. Die Kriterien jetzt zu schreiben und rückzudatieren erzeugt ein schlechteres Artefakt als gar kein Memo — es tarnt ein nachträgliches Urteil als Messung. Der Renewal-Review-Modus oben ist die einzige Ausnahme, und er kennzeichnet sich selbst.

Unterhalb der registrierten Mindeststichprobe. Liefert insufficient_sample mit beobachteter und geforderter Anzahl. Bei n qualifizierten Meetings verschiebt das Hinzufügen oder Entfernen eines einzelnen die Kosten pro Meeting um etwa 1/n — 12,5% bei acht Meetings, 5% bei zwanzig. Ein sechswöchiger Pilot mit neun stattgefundenen Meetings kann eine Antwort-zu-Meeting-Rate von 4% nicht von einer von 7% unterscheiden, und ein darauf berechnetes Urteil ist Rauschen mit Nachkommastelle.

Auswahl zwischen zwei Anbietern. Dies bewertet ein Deployment gegen eine Schwelle, nicht zwei gegeneinander. Ein direkter Vergleich braucht beide auf vergleichbaren Segmenten mit gemeinsamer Ausschlussliste, was ein anderes Design ist.

Das Quartalsreview eines menschlichen SDR-Teams. Das Kostenmodell setzt einen Zähler pro Lead oder pro Kontakt voraus sowie eine Nacharbeitszeile, die es für Headcount so nicht gibt.

Setup

Zwei bis vier Stunden, überwiegend Schwellenentscheidungen statt Verkabelung.

  1. Füllen Sie die Vorregistrierung vor dem ersten Versand aus. Kopieren Sie references/1-preregistration-template.md, ersetzen Sie jeden Platzhalter, committen Sie. Setzen Sie min_held_meetings so, dass ein Meeting mehr oder weniger die Kosten pro Meeting um weniger verändert als die Marge zwischen Ihrer Schwelle und Ihrem Erwartungswert — wenn Sie nahe 700 gegen eine Obergrenze von 750 erwarten, beträgt diese Marge rund 7% und zwanzig Meetings sind der Boden.
  2. Setzen Sie max_cost_per_qualified_meeting gegen Ihre heutige Motion, nicht gegen den Listenpreis des Anbieters. Veröffentlichte Preise geben nur die Abo-Zeile. AiSDR veröffentlicht 250 pro Monat für 200 AI-recherchierte Kontakte, 900 für 800 und 2.500 für 2.500, wobei die beiden größeren Tiers eine Quartalsbindung haben. 11x veröffentlicht 3.750 pro Monat bei jährlicher Abrechnung für Growth — 45.000 im Jahr — für 2.000 neue Prospects pro Monat und bis zu fünf Endnutzer, und erklärt, pro Lead statt pro Versand abzurechnen. Artisan veröffentlicht keinen Preis und beschreibt seine Tiers mit rund 2.500 und rund 6.000 kontaktierten Leads pro Monat.
  3. Setzen Sie max_spam_rate auf 0,0030 und lassen Sie es dort. Das ist die veröffentlichte Anforderung von Google für Absender von mehr als 5.000 Nachrichten pro Tag an Gmail-Konten: die in Postmaster Tools gemeldete Spam-Rate unter 0,30% halten. Google empfiehlt zusätzlich, unter 0,10% zu bleiben, damit ein gewöhnlicher Beschwerdeausschlag die harte Linie nicht erreicht. Bei einer Gmail-lastigen Liste setzen Sie die Arbeitsschwelle auf 0,0010 und behandeln 0,0030 als Stopp.
  4. Setzen Sie die Ausschlussregeln jetzt. exclude_open_opp_at_booking und exclude_prior_human_touch_within_days: 90 entscheiden, was als Meeting des Agenten zählt. Lockern Sie sie hier, schriftlich, bevor Sie wissen, wie es ausgeht.
  5. Erfassen Sie Nacharbeitsstunden ab Tag eins. Eine wöchentliche Selbstmeldung der zwei Personen, die die Arbeit machen, ist ungenau und ehrlich. Eine am Ende rekonstruierte Zahl von der Person, die das Tool befürwortet, ist genau und nutzlos.
  6. Installieren Sie den Skill. Legen Sie SKILL.md und references/ in .claude/skills/ai-sdr-pilot-scorecard/ ab oder laden Sie ihn als Skill in claude.ai hoch. Bauen Sie das Eingabe-Payload aus CRM-Export, Finanzen, Zeiterfassung und Postmaster.

Warum die vier Achsen so gebaut sind

Kosten pro qualifiziertem Meeting werden zweimal ausgegeben. Einmal über alle fünf Kostenzeilen — Abo, Daten und Anreicherung, Versandinfrastruktur, amortisierte Implementierung und Nacharbeitsstunden zum belasteten Stundensatz — und einmal nur über das Abo. Beide stehen im Memo. Die Nur-Abo-Zahl ist die Zahl aus dem Business Case des Anbieters. Sie ist nicht falsch, sie beantwortet eine andere Frage, und beide nebeneinander zu drucken macht die Basis sichtbar statt strittig. Im ausgearbeiteten Beispiel in references/2-cost-model.md ergibt ein 42-Tage-Pilot mit 14 qualifizierten Meetings 851 pro Meeting belastet und 370 nur auf Abo-Basis, und 6.035 der 6.735 Differenz sind eine einzige Zeile: 71 Stunden menschliche Nacharbeit. Dieser Unterschied ändert den nächsten Schritt. “Zu teuer” ist eine Verhandlung; “sechs Stunden menschliche Arbeit pro erzeugtem Meeting” ist ein Produktproblem, das ein Rabatt nicht löst.

Antwort-zu-Meeting zählt nur positive Antworten. Eine negative Antwort, eine Abwesenheitsnotiz und eine Abmeldeanfrage sind keine Konversionschancen, und sie in einen Nenner zu werfen ist der Grund, warum eine Antwortratenkurve flach bleibt, während die Liste verbrennt. Wo der Klassifikator des Anbieters selbst die Antworten gelabelt hat, wendet references/3-metric-definitions.md einen Abschlag von 0,80 an und markiert die Zahl als unaudited — eine Konvention, die diese Datei setzt, damit Läufe vergleichbar bleiben, keine gemessene Branchenzahl. Liefern Sie eine geschichtete Stichprobe von 50 menschlich gelabelten Antworten, und der Skill berechnet die tatsächliche Precision.

Nacharbeit wird nach Trend und nicht nur nach Niveau bewertet. Wöchentlich fallend heißt, das Team lernt das Tool; flach oder steigend heißt, das Tool konvergiert nicht. Gleiches Niveau, entgegengesetzte Urteile.

Reputation ist ein harter Stopp, unabhängig von der Ökonomie bewertet. Überschreitet das Nachlauffenster die absolute Linie, lautet das Urteil kill, egal was die Kosten pro Meeting sagen. Absenderreputation wird von allem geteilt, was das Unternehmen über diese Domains versendet — Rechnungen, Verlängerungen, Support-Antworten — ein Pilot kann sie also nicht ausgeben und die Ersparnis als Ergebnis verbuchen.

Fehlermodi und Guards

  • Die Abbruchlinie verschiebt sich mitten im Pilot. Das ist die häufigste Art, wie ein scheiternder Pilot überlebt, und sie ist selten unehrlich — es ist eine Schwelle, die jemand in einem Doc leise aufweicht, der bereits angefangen hat zu glauben. Guard: Schritt 1 hasht die Vorregistrierung und verweigert die Bewertung gegen eine geänderte Fassung, mit einem Diff auf Feldebene statt eines Urteils. Ändern ist erlaubt; registrieren Sie mit neuem Hash neu, und das Memo trägt dauerhaft retrospective: true.
  • Attributionsinflation. Anbieter zählen Meetings auf Accounts, die bereits im Zyklus waren oder kürzlich menschlich berührt wurden. Guard: Ausgeschlossene Meetings verlassen den Zähler per Regel statt per verhandeltem Abschlag, und die Ausschlussanzahl samt Gründeverteilung wird als eigener Befund berichtet. Ein Anbieter, dessen zugeschriebene Meetings zu 32% bereits offene Accounts sind, sagt Ihnen etwas über sein Sourcing, das kein Rabatt behebt.
  • Der Nur-Abo-Nenner. Guard: Der Lauf wird mit incomplete_cost_model abgelehnt, wenn eine der fünf Zeilen null ist. Eine Zeile, die Sie für null halten, muss als 0 eingetragen werden — das ist eine Aussage, keine Lücke.
  • Schaden, der nach dem Bewertungsstichtag eintrifft. Guard: Das 14-Tage-Nachlauffenster ist Pflicht, und die Reputationsachse kann einen Piloten killen, der jede Kostenschwelle bestanden hat.
  • keep gelesen als “skalieren”. Der Skill bewertet eine Konfiguration bei einem Volumen. Volumen ist der Input, der die Reputationsachse am ehesten bricht. Guard: Der Schlussabschnitt des Memos nennt das bewertete Volumen und macht eine Neubewertung zur Bedingung jeder Erhöhung.

Gegen die Alternativen

Das QBR-Deck des Anbieters berichtet den Zähler. Es hat keinen Zugriff auf Ihre Nacharbeitsstunden, keinen Anreiz, Ihre Ausschlussregeln anzuwenden, und labelt seine eigenen positiven Antworten. Lesen Sie es, und führen Sie dann dies aus.

Die Tabelle eines RevOps-Analysten rechnet richtig und verliert trotzdem gegen Kriteriendrift, weil die Tabelle gebaut wird, nachdem die Ergebnisse sichtbar sind, und die Schwellen daneben gewählt werden. Der Hash ist der einzige Teil dieses Workflows, den eine Tabelle strukturell nicht nachbilden kann.

Den Vertrag automatisch verlängern lassen ist der tatsächliche Default, und genau den soll dies verdrängen. Bei einer 11x-Growth-Bindung kostet dieser Default 45.000 für ein Jahr, das niemand zu kaufen entschieden hat.

Kombinieren Sie ihn mit ai-sdr-draft-qa-skill, das die Output-Qualität während des Piloten prüft, und email-deliverability-monitor-n8n, das die Reputationsachse laufend statt an zwei Checkpoints überwacht. Für die Anbieterauswahl, die all dem vorausgeht, siehe ai-sdr-stack und Signal-getriebener vs autonomer AI SDR.

Files in this artifact

Download all (.zip)