Qué es
Codility es una plataforma de evaluación técnica para contratación de ingeniería y el tercer polo junto a HackerRank y CodeSignal: pruebas de código asincrónicas, entrevistas en vivo dentro de un entorno VS Code real y un módulo de skills de plantilla que aplica las mismas tareas a la gente que ya empleas. Lleva en esto desde 2009 y levantó una Serie A de $22M en enero de 2020 liderada por Oxx y Kennet Partners, su primera ronda institucional después de una década creciendo con sus propios ingresos. No hubo ronda posterior, y el producto lo refleja: profundidad en metodología de evaluación, sin expansión hacia software de RR.HH. adyacente. El muro de clientes nombra a GitHub, SpaceX, Tesla, EY, LSEG, SAP, Barclays y Citi.
Tres módulos. Screen ejecuta evaluaciones asincrónicas contra una biblioteca que el proveedor sitúa en 1.300+ tareas, cada una escrita por ingenieros de evaluación, revisada por psicólogos ocupacionales y probada frente a su resolubilidad con AI. Interview es código en vivo en VS Code con grabación, transcripciones y un marco de puntuación compartido. Skills Intelligence aplica las mismas tareas a tus ingenieros actuales para mapear capacidad y brechas de asignación en lugar de filtrar candidatos. Codility declara en su propio sitio SOC 2, ISO 27001, CCPA/GDPR y WCAG 2.2 AA.
Por qué aparece en los stacks de Recruiting
- Es la única de las tres grandes que publica un precio. HackerRank y CodeSignal mantienen todo su pricing detrás de un formulario: revisado otra vez hoy, ninguna de las dos páginas muestra una cifra. Codility publica $1.200/año y $6.000/año y te deja registrarte sin hablar con ventas. Para un equipo que tiene que empezar a evaluar la semana que viene, ese es todo el argumento.
- Las tareas propias se generan desde tu código vía MCP. Codility incluye un servidor MCP — “Build with MCP” en el menú Tasks — así que un agente de código compatible con MCP apunta a tu repo, a un pull request o a una descripción de puesto y escribe una tarea validada de varios archivos con casos de prueba, publicada directo en tu biblioteca. Requiere permiso de admin y arranca en el tier Scale. Ni HackerRank ni CodeSignal tienen ruta MCP. En el tier Custom, Codility nombra directamente el Claude Code CLI, con la actividad del agente del candidato revisable por evaluación.
- El uso de AI en la evaluación es un dial que tú configuras. La postura de Codility es que la pregunta no es si el candidato usa AI sino si puede construir con ella, así que vende tareas específicas de AI y visibilidad por evaluación de lo que el candidato le preguntó al asistente. El copilot agéntico aparece desde Starter; Cody, el chatbot de cara al candidato, desde Scale.
- La integridad apunta a la identidad, no a las herramientas. Verificación de identidad, detección de suplantación, detección de plagio y señales de proctoring, con una app de escritorio en el tier Custom que marca aplicaciones no autorizadas, incluidas las que se comercializan como indetectables. Ese es el modelo de amenaza correcto para 2026: fraude en entrevistas con AI explica por qué el entrevistado suplantado, y no el copilot, es la falla cara.
- La puntuación es basada en reglas, y eso importa legalmente. Codility describe una puntuación auditable a través de su evaluation engine más análisis automático de código para calidad, mantenibilidad y complejidad, con las funciones de AI del lado del candidato y no dentro de la decisión. Si tu área legal está trabajando la Illinois HB 3773 o la NYC LL 144, esa distinción es lo primero que hay que confirmar: por escrito, del proveedor, para la configuración exacta que compras.
La realidad del pricing
- Starter — $1.200/año, solo facturación anual. 120 créditos de invitación al año, 1 usuario de plataforma, asientos de colaborador ilimitados, biblioteca de tareas limitada, detección de plagio, proctoring básico con capturas del candidato y soporte self-serve. Sale a $10 por invitación.
- Scale — $600/mes, o $6.000/año con facturación anual (dos meses gratis). 300 créditos al año con tope de 25 por mes, 3 usuarios de plataforma, biblioteca más amplia que cubre ingeniería, AI y diseño de sistemas, y autoría de tareas vía MCP. $20 por invitación en anual, $24 en mensual.
- Custom — solo cotización. Casi todo lo que hace defendible un programa de evaluación vive aquí: integraciones con ATS (Greenhouse, Lever, Ashby, Workday, SAP), SSO y SAML, API completa, puntuación ponderada, video proctoring premium con verificación de identidad, la app de escritorio, grabación y transcripción de entrevistas, Code Health, Skills Intelligence, las bibliotecas de tareas de negocio, y estudios de validez e impacto adverso de psicólogos ocupacionales internos.
Un crédito de invitación cubre un candidato en Screen o en Interview, así que el medidor son candidatos, no asientos. Los 300 créditos de Scale sostienen alrededor de 8–12 contrataciones de ingeniería al año con un funnel aproximado de 25:1 entre screens y hires. Lo que empuja a los equipos a pedir cotización suelen ser los topes de 3 asientos y 25 invitaciones al mes, no una capacidad ausente.
Mejor para
Líderes de ingeniería y de TA que contratan de 5 a 30 ingenieros al año y quieren screening técnico estructurado y defendible con tarjeta esta semana en lugar de un ciclo de compras, y que aceptan revisar las entregas ellos mismos, porque aquí nada rankea candidatos de forma automática.
No es para ti si el cuello de botella es el agendamiento y no la calidad del screening: compra GoodTime o Modernloop. No es para ti si la escritura de resultados de vuelta al ATS es no negociable con presupuesto self-serve: en Starter o Scale los resultados viven en Codility y alguien copia el desenlace a tu ATS a mano. Y no es para contratación fuera de ingeniería, donde TestGorilla cubre muchos más tipos de rol por $75/mes.
Frente a las alternativas
HackerRank es el líder en volumen y la respuesta más segura por encima de unas 50 contrataciones de ingeniería al año: biblioteca más grande, más familiaridad entre recruiters, pricing solo por cotización que aterriza en cinco cifras bajas a medias al año. Elígelo cuando el programa de evaluación ya tiene gente asignada y la restricción es el throughput. CodeSignal es la elección cuando quieres una puntuación de evaluación certificada que se transfiera entre roles y ciclos de requisición, y su stack de detección es la comparación más cercana en materia de trampas; HackerRank vs CodeSignal resuelve ese par. micro1 es el entrante de crecimiento más rápido y una compra distinta: Zara conduce la entrevista en lugar de equipar a tu entrevistador. La regla es limpia: Codility mide candidatos para que humanos juzguen, micro1 reemplaza al humano en la sala. Elige micro1 cuando la restricción son las horas de entrevistador; elige Codility cuando lo son la calidad de las preguntas y la auditabilidad.
Puntos a vigilar
- Casi toda función de grado compliance está detrás del tier Custom: SSO, API, escritura de vuelta al ATS, verificación de identidad, la app de escritorio, los estudios de equidad. Guarda: lista cuáles de esas exige realmente tu revisión de seguridad y tu ATS antes de comprar self-serve. Si aparece siquiera una, ve directo a la cotización; adaptar la integración después implica repetir el rollout.
- Los créditos son anuales y Scale tiene tope de 25 al mes. Guarda: dimensiona con el mes pico de screening del año pasado, no con el promedio. Un pico de requisiciones en enero quema una asignación de 300 créditos bastante antes del Q3, y el tope bloquea el atajo obvio.
- La fuga de tareas es un riesgo real en cualquier biblioteca publicada. Codility retira las tareas filtradas y lo declara en todos los tiers. Guarda: rota tareas por ciclo de requisición y crea 2–3 tareas construidas con MCP desde tu propio repo para las rondas finales, donde la fuga cuesta más.
- Sin puntuación por AI, los humanos siguen leyendo cada entrega. Guarda: presupuesta horas de revisión antes del rollout — unos 10–15 minutos por entrega — y nombra al revisor por requisición, o la cola se convierte en el nuevo cuello de botella y los screens quedan sin leer.
- Skills Intelligence, la razón para preferir Codility sobre un screener puro, es solo Custom. Guarda: si el caso de negocio es mapear capacidad interna, no hagas el piloto en Starter; el piloto no puede demostrar aquello que estás comprando.