ooligo

Codility

technical-assessment coding-assessment · technical-screening · live-coding-interviews · skills-intelligence
MCP API
Recruiting & TA
7.6 /10

Was es ist

Codility ist eine Plattform für technische Assessments im Engineering-Recruiting und der dritte Pol neben HackerRank und CodeSignal: asynchrone Coding-Screenings, Live-Interviews in einer echten VS-Code-Umgebung und ein Belegschafts-Skills-Modul, das dieselben Aufgaben auf Ihre bestehenden Mitarbeitenden richtet. Codility macht das seit 2009 und nahm im Januar 2020 eine Series A über $22M auf, angeführt von Oxx und Kennet Partners — die erste institutionelle Runde nach einem Jahrzehnt aus eigenem Umsatz. Danach kam keine weitere Runde, und das Produkt zeigt es: Tiefe in der Assessment-Methodik, keine Ausbreitung in benachbarte HR-Software. Die Kundenwand nennt GitHub, SpaceX, Tesla, EY, LSEG, SAP, Barclays und Citi.

Drei Module. Screen führt asynchrone Assessments gegen eine Bibliothek aus, die der Anbieter mit 1.300+ Aufgaben angibt, jede von Assessment-Engineers geschrieben, von Arbeitspsychologen geprüft und auf ihre Lösbarkeit durch AI getestet. Interview ist Live-Coding in VS Code mit Aufzeichnung, Transkripten und einem gemeinsamen Bewertungsrahmen. Skills Intelligence wendet dieselben Aufgaben auf Ihre aktuellen Engineers an, um Fähigkeiten und Besetzungslücken zu kartieren statt Kandidaten zu filtern. Codility führt auf der eigenen Website SOC 2, ISO 27001, CCPA/GDPR und WCAG 2.2 AA.

Warum es in Recruiting-Stacks auftaucht

  • Es ist das einzige der drei großen Produkte mit veröffentlichtem Preis. HackerRank und CodeSignal halten ihr komplettes Pricing hinter einem Formular — heute erneut geprüft, keine der beiden Seiten zeigt eine Zahl. Codility veröffentlicht $1.200/Jahr und $6.000/Jahr und lässt Sie ohne Vertriebsgespräch buchen. Für ein Team, das nächste Woche mit dem Assessment starten muss, ist das das ganze Argument.
  • Eigene Aufgaben entstehen aus Ihrer Codebasis über MCP. Codility liefert einen MCP-Server — “Build with MCP” im Tasks-Menü — sodass ein MCP-fähiger Coding-Agent auf Ihr Repo, einen Pull Request oder eine Stellenbeschreibung zeigt und eine validierte Aufgabe über mehrere Dateien samt Testfällen schreibt, direkt veröffentlicht in Ihrer Aufgabenbibliothek. Das erfordert Admin-Rechte und beginnt im Scale-Tier. Weder HackerRank noch CodeSignal haben einen MCP-Weg. Im Custom-Tier nennt Codility die Claude Code CLI ausdrücklich, mit pro Assessment nachvollziehbarer Agent-Aktivität des Kandidaten.
  • Der AI-Einsatz im Assessment ist ein Regler, den Sie setzen. Codilitys Position: Die Frage ist nicht, ob jemand AI nutzt, sondern ob er damit bauen kann. Entsprechend verkauft der Anbieter AI-spezifische Aufgaben und pro Assessment Einblick in das, was der Kandidat den Assistenten gefragt hat. Der agentische AI-Copilot ist ab Starter dabei, Cody — der Chatbot auf Kandidatenseite — ab Scale.
  • Integrität zielt auf Identität, nicht auf Werkzeuge. Identitätsprüfung, Impersonation-Erkennung, Plagiatserkennung und Proctoring-Signale, mit einer Desktop-App im Custom-Tier, die unautorisierte Anwendungen markiert, auch die als unentdeckbar vermarkteten. Das ist das richtige Bedrohungsmodell für 2026: AI-Interviewbetrug erklärt, warum der untergeschobene Interviewpartner und nicht der Copilot der teure Fehlerfall ist.
  • Die Bewertung ist regelbasiert, und das ist juristisch relevant. Codility beschreibt auditierbare Bewertung über die eigene Evaluation Engine plus automatisierte Codeanalyse für Qualität, Wartbarkeit und Komplexität — die AI-Funktionen sitzen auf der Kandidatenseite des Assessments, nicht in der Entscheidung. Wenn Ihre Rechtsabteilung an Illinois HB 3773 oder NYC LL 144 arbeitet, ist diese Unterscheidung das Erste, was zu bestätigen ist: schriftlich, vom Anbieter, für genau die Konfiguration, die Sie kaufen.

Was es real kostet

  • Starter — $1.200/Jahr, ausschließlich Jahresabrechnung. 120 Invite-Credits pro Jahr, 1 Plattform-User, unbegrenzte Collaborator-Sitze, begrenzte Aufgabenbibliothek, Plagiatserkennung, einfaches Proctoring mit Kandidaten-Snapshots, Self-Serve-Support. Das ergibt $10 pro Invite.
  • Scale — $600/Monat oder $6.000/Jahr bei Jahresabrechnung (zwei Monate gratis). 300 Credits pro Jahr mit einer Obergrenze von 25 pro Monat, 3 Plattform-User, breitere Bibliothek über Engineering, AI und Systemdesign, plus Aufgabenerstellung über MCP. $20 pro Invite im Jahrestarif, $24 im Monatstarif.
  • Custom — nur auf Anfrage. Fast alles, was ein Assessment-Programm belastbar macht, liegt hier: ATS-Integrationen (Greenhouse, Lever, Ashby, Workday, SAP), SSO und SAML, volle API, gewichtete Bewertung, Premium-Video-Proctoring mit Identitätsprüfung, die Desktop-App, Interview-Aufzeichnung und -Transkripte, Code Health, Skills Intelligence, die Business-Aufgabenbibliotheken sowie Validitäts- und Adverse-Impact-Studien von internen Arbeitspsychologen.

Ein Invite-Credit deckt einen Kandidaten in Screen oder Interview ab — gezählt werden also Kandidaten, nicht Sitze. Die 300 Credits von Scale tragen etwa 8–12 Engineering-Einstellungen pro Jahr bei einem angenommenen Funnel von 25:1 zwischen Screens und Hires. Was Teams zum Angebot treibt, sind meist die Grenzen von 3 Sitzen und 25 Invites pro Monat, nicht eine fehlende Funktion.

Am besten geeignet für

Engineering- und TA-Verantwortliche, die 5 bis 30 Engineers pro Jahr einstellen und strukturiertes, belastbares technisches Screening diese Woche per Karte wollen statt eines Einkaufszyklus — und die bereit sind, Einsendungen selbst zu prüfen, denn hier rankt nichts Kandidaten automatisch.

Nichts für Sie, wenn der Engpass die Terminplanung ist und nicht die Screening-Qualität: kaufen Sie GoodTime oder Modernloop. Nichts für Sie, wenn der Rückschrieb in das ATS bei Self-Serve-Budget nicht verhandelbar ist: bei Starter oder Scale liegen die Ergebnisse in Codility, und jemand überträgt das Ergebnis manuell in Ihr ATS. Und nichts für Recruiting außerhalb des Engineerings, wo TestGorilla für $75/Monat deutlich mehr Rollentypen abdeckt.

Gegen die Alternativen

HackerRank ist der Volumenführer und oberhalb von etwa 50 Engineering-Einstellungen pro Jahr die sicherere Antwort: größere Bibliothek, mehr Vertrautheit bei Recruitern, Pricing nur auf Anfrage, das jährlich im unteren bis mittleren fünfstelligen Bereich landet. Nehmen Sie es, wenn das Assessment-Programm schon besetzt ist und der Engpass Durchsatz heißt. CodeSignal ist die Wahl, wenn Sie einen zertifizierten Assessment-Score wollen, der über Rollen und Req-Zyklen hinweg gilt, und sein Detection-Stack ist beim Thema Täuschung der nähere Vergleich; HackerRank vs CodeSignal entscheidet dieses Paar. micro1 ist der am schnellsten wachsende Neueinsteiger und ein anderer Kauf: Zara führt das Interview, statt Ihren Interviewer auszustatten. Die Regel ist klar — Codility misst Kandidaten, damit Menschen urteilen, micro1 ersetzt den Menschen im Raum. Nehmen Sie micro1, wenn Interviewer-Stunden der Engpass sind; nehmen Sie Codility, wenn es Fragenqualität und Auditierbarkeit sind.

Worauf zu achten ist

  • Fast jede Compliance-relevante Funktion hängt am Custom-Tier: SSO, API, ATS-Rückschrieb, Identitätsprüfung, die Desktop-App, die Fairness-Studien. Absicherung: Notieren Sie vor einem Self-Serve-Kauf, welche davon Ihre Sicherheitsprüfung und Ihr ATS tatsächlich verlangen. Steht auch nur eine auf der Liste, gehen Sie direkt ins Angebot; ein späteres Nachrüsten der Integration heißt, das Rollout zu wiederholen.
  • Credits gelten jährlich, und Scale begrenzt auf 25 pro Monat. Absicherung: Dimensionieren Sie über den Spitzenmonat des Vorjahres, nicht über den Durchschnitt. Eine Req-Spitze im Januar verbrennt ein Budget von 300 Credits deutlich vor Q3, und die Obergrenze blockiert den naheliegenden Ausweg.
  • Aufgaben-Leaks sind bei jeder veröffentlichten Bibliothek ein reales Risiko. Codility entfernt geleakte Aufgaben und schreibt das in jedem Tier aus. Absicherung: Rotieren Sie Aufgaben pro Req-Zyklus und bauen Sie 2–3 über MCP erzeugte Aufgaben aus Ihrem eigenen Repo für die Endrunden, wo ein Leak am meisten kostet.
  • Ohne AI-Bewertung lesen weiterhin Menschen jede Einsendung. Absicherung: Planen Sie Prüfzeit vor dem Rollout ein — rund 10–15 Minuten pro Einsendung — und benennen Sie den Prüfer pro Req, sonst wird die Warteschlange zum neuen Engpass und Screenings bleiben ungelesen.
  • Skills Intelligence, der Grund Codility einem reinen Screener vorzuziehen, gibt es nur im Custom-Tier. Absicherung: Wenn das Kartieren interner Fähigkeiten der Business Case ist, pilotieren Sie nicht auf Starter; der Pilot kann genau das nicht zeigen, was Sie kaufen.