ooligo

Codility

technical-assessment coding-assessment · technical-screening · live-coding-interviews · skills-intelligence
MCP API
Recruiting & TA
7.6 /10

Ce que c’est

Codility est une plateforme d’évaluation technique pour le recrutement d’ingénieurs, et le troisième pôle aux côtés de HackerRank et CodeSignal : tests de code asynchrones, entretiens en direct dans un véritable environnement VS Code, et un module de compétences internes qui applique les mêmes exercices aux personnes que vous employez déjà. L’entreprise fait cela depuis 2009 et a levé une Série A de $22M en janvier 2020, menée par Oxx et Kennet Partners, sa première levée institutionnelle après dix ans de croissance sur ses propres revenus. Aucun tour depuis, et le produit le montre : de la profondeur sur la méthodologie d’évaluation, aucune dispersion vers les logiciels RH adjacents. Le mur de clients cite GitHub, SpaceX, Tesla, EY, LSEG, SAP, Barclays et Citi.

Trois modules. Screen exécute des évaluations asynchrones sur une bibliothèque que l’éditeur chiffre à 1 300+ exercices, chacun écrit par des ingénieurs d’évaluation, relu par des psychologues du travail et testé quant à sa résolubilité par l’AI. Interview est du code en direct dans VS Code, avec enregistrement, transcriptions et un cadre de notation partagé. Skills Intelligence applique les mêmes exercices à vos ingénieurs actuels pour cartographier les compétences et les manques d’affectation au lieu de filtrer des candidats. Codility affiche sur son propre site SOC 2, ISO 27001, CCPA/GDPR et WCAG 2.2 AA.

Pourquoi cet outil apparaît dans les stacks Recruiting

  • C’est le seul des trois grands à publier un prix. HackerRank et CodeSignal gardent la totalité de leur pricing derrière un formulaire : revérifié aujourd’hui, aucune des deux pages n’affiche de chiffre. Codility publie $1 200/an et $6 000/an et vous laisse souscrire sans parler au commercial. Pour une équipe qui doit commencer à évaluer la semaine prochaine, c’est tout l’argument.
  • Les exercices maison sont générés depuis votre code via MCP. Codility fournit un serveur MCP — “Build with MCP” dans le menu Tasks — de sorte qu’un agent de code compatible MCP pointe vers votre repo, une pull request ou une fiche de poste et écrit un exercice validé, multi-fichiers, avec ses cas de test, publié directement dans votre bibliothèque. Cela exige des droits admin et démarre au palier Scale. Ni HackerRank ni CodeSignal n’offrent de voie MCP. Au palier Custom, Codility nomme explicitement le Claude Code CLI, avec l’activité de l’agent du candidat consultable par évaluation.
  • L’usage de l’AI dans l’évaluation est un curseur que vous réglez. La position de Codility : la question n’est pas de savoir si un candidat utilise l’AI mais s’il sait construire avec elle. L’éditeur vend donc des exercices spécifiques à l’AI et une visibilité, par évaluation, sur ce que le candidat a demandé à l’assistant. Le copilot agentique est présent dès Starter ; Cody, le chatbot côté candidat, à partir de Scale.
  • L’intégrité vise l’identité, pas l’outillage. Vérification d’identité, détection d’usurpation, détection de plagiat et signaux de proctoring, avec une application de bureau au palier Custom qui signale les applications non autorisées, y compris celles vendues comme indétectables. C’est le bon modèle de menace pour 2026 : la fraude aux entretiens par AI explique pourquoi c’est l’imposteur à la place du candidat, et non le copilot, qui coûte cher.
  • La notation est fondée sur des règles, et cela compte juridiquement. Codility décrit une notation auditable via son evaluation engine, complétée d’une analyse automatique du code sur la qualité, la maintenabilité et la complexité — les fonctions d’AI se tiennent du côté candidat de l’évaluation, pas dans la décision. Si votre direction juridique travaille sur l’Illinois HB 3773 ou la NYC LL 144, cette distinction est la première chose à confirmer : par écrit, auprès de l’éditeur, pour la configuration exacte que vous achetez.

La réalité tarifaire

  • Starter — $1 200/an, facturation annuelle uniquement. 120 crédits d’invitation par an, 1 utilisateur de plateforme, sièges collaborateurs illimités, bibliothèque d’exercices restreinte, détection de plagiat, proctoring basique avec captures du candidat, support en self-serve. Soit $10 par invitation.
  • Scale — $600/mois, ou $6 000/an en facturation annuelle (deux mois offerts). 300 crédits par an plafonnés à 25 par mois, 3 utilisateurs de plateforme, bibliothèque plus large couvrant l’ingénierie, l’AI et le design système, et création d’exercices via MCP. $20 par invitation en annuel, $24 en mensuel.
  • Custom — sur devis uniquement. Presque tout ce qui rend un programme d’évaluation défendable se trouve ici : intégrations ATS (Greenhouse, Lever, Ashby, Workday, SAP), SSO et SAML, API complète, notation pondérée, video proctoring premium avec vérification d’identité, l’application de bureau, enregistrement et transcription des entretiens, Code Health, Skills Intelligence, les bibliothèques d’exercices métier, ainsi que des études de validité et d’impact disparate menées par des psychologues du travail internes.

Un crédit d’invitation couvre un candidat dans Screen ou dans Interview : le compteur porte sur les candidats, pas sur les sièges. Les 300 crédits de Scale soutiennent environ 8–12 recrutements d’ingénieurs par an avec un funnel approximatif de 25:1 entre screens et embauches. Ce qui pousse les équipes vers un devis, ce sont le plus souvent les plafonds de 3 sièges et de 25 invitations par mois, pas une capacité manquante.

Pour qui c’est le bon choix

Les responsables engineering et TA qui recrutent de 5 à 30 ingénieurs par an, veulent un screening technique structuré et défendable payé par carte cette semaine plutôt qu’un cycle d’achat, et acceptent de relire eux-mêmes les livrables, puisque rien ici ne classe les candidats automatiquement.

Ce n’est pas pour vous si le goulot est la prise de rendez-vous et non la qualité du screening : achetez GoodTime ou Modernloop. Ce n’est pas pour vous si l’écriture des résultats dans l’ATS est non négociable avec un budget self-serve : en Starter ou Scale, les résultats vivent dans Codility et quelqu’un recopie l’issue dans votre ATS à la main. Et ce n’est pas pour le recrutement hors ingénierie, où TestGorilla couvre bien plus de types de postes pour $75/mois.

Face aux alternatives

HackerRank est le leader en volume et la réponse la plus sûre au-delà d’environ 50 recrutements d’ingénieurs par an : bibliothèque plus vaste, plus grande familiarité chez les recruteurs, pricing sur devis qui atterrit dans le bas à moyen des cinq chiffres annuels. Prenez-le quand le programme d’évaluation est déjà doté en personnel et que la contrainte est le débit. CodeSignal est le choix si vous voulez un score d’évaluation certifié réutilisable d’un poste et d’un cycle à l’autre, et son dispositif de détection est la comparaison la plus proche sur la triche ; HackerRank vs CodeSignal tranche ce duo. micro1 est l’entrant à la croissance la plus rapide et un achat différent : Zara mène l’entretien au lieu d’équiper votre intervieweur. La règle est nette : Codility mesure les candidats pour que des humains jugent, micro1 remplace l’humain dans la pièce. Prenez micro1 quand la contrainte est le temps d’intervieweur ; prenez Codility quand ce sont la qualité des questions et l’auditabilité.

Points de vigilance

  • Presque toute fonction de niveau conformité dépend du palier Custom : SSO, API, écriture dans l’ATS, vérification d’identité, l’application de bureau, les études d’équité. Garde-fou : listez celles que votre revue de sécurité et votre ATS exigent réellement avant d’acheter en self-serve. S’il y en a ne serait-ce qu’une, allez directement au devis ; rattraper l’intégration plus tard signifie refaire le déploiement.
  • Les crédits sont annuels et Scale plafonne à 25 par mois. Garde-fou : dimensionnez sur le mois de pointe de l’an dernier, pas sur la moyenne. Un pic de postes en janvier consomme une dotation de 300 crédits bien avant le Q3, et le plafond bloque le contournement évident.
  • La fuite d’exercices est un risque réel sur toute bibliothèque publiée. Codility retire les exercices fuités et l’annonce à chaque palier. Garde-fou : faites tourner les exercices à chaque cycle de recrutement et créez 2–3 exercices construits via MCP depuis votre propre repo pour les tours finaux, là où la fuite coûte le plus.
  • Sans notation par AI, des humains lisent encore chaque livrable. Garde-fou : budgétez les heures de relecture avant le déploiement — de l’ordre de 10–15 minutes par livrable — et nommez le relecteur par poste, sinon la file devient le nouveau goulot et les screens restent non lus.
  • Skills Intelligence, la raison de préférer Codility à un simple outil de screening, n’existe qu’en Custom. Garde-fou : si la cartographie des compétences internes est le business case, ne pilotez pas sur Starter ; le pilote ne peut pas démontrer ce que vous achetez.