O que é
Codility é uma plataforma de avaliação técnica para contratação de engenharia e o terceiro polo ao lado de HackerRank e CodeSignal: testes de código assíncronos, entrevistas ao vivo dentro de um ambiente VS Code real e um módulo de skills de quadro que aplica as mesmas tarefas a quem você já emprega. Está nisso desde 2009 e levantou uma Série A de $22M em janeiro de 2020 liderada por Oxx e Kennet Partners, sua primeira rodada institucional depois de uma década crescendo com a própria receita. Não houve rodada depois, e o produto mostra isso: profundidade em metodologia de avaliação, sem espalhar para software de RH adjacente. O mural de clientes cita GitHub, SpaceX, Tesla, EY, LSEG, SAP, Barclays e Citi.
Três módulos. Screen roda avaliações assíncronas contra uma biblioteca que o fornecedor coloca em 1.300+ tarefas, cada uma escrita por engenheiros de avaliação, revisada por psicólogos ocupacionais e testada quanto à solubilidade por AI. Interview é código ao vivo no VS Code com gravação, transcrições e um framework de pontuação compartilhado. Skills Intelligence aplica as mesmas tarefas aos engenheiros atuais para mapear capacidade e lacunas de alocação em vez de filtrar candidatos. A Codility declara no próprio site SOC 2, ISO 27001, CCPA/GDPR e WCAG 2.2 AA.
Por que aparece em stacks de Recruiting
- É a única das três grandes que publica preço. HackerRank e CodeSignal mantêm todo o pricing atrás de um formulário: verificado de novo hoje, nenhuma das duas páginas mostra um número. A Codility publica $1.200/ano e $6.000/ano e deixa você assinar sem falar com vendas. Para um time que precisa começar a avaliar na semana que vem, esse é o argumento inteiro.
- As tarefas próprias são geradas a partir do seu código via MCP. A Codility inclui um servidor MCP — “Build with MCP” no menu Tasks — então um agente de código compatível com MCP aponta para o seu repo, um pull request ou uma descrição de vaga e escreve uma tarefa validada com múltiplos arquivos e casos de teste, publicada direto na sua biblioteca. Exige permissão de admin e começa no tier Scale. Nem HackerRank nem CodeSignal têm caminho MCP. No tier Custom a Codility cita diretamente o Claude Code CLI, com a atividade do agente do candidato revisável por avaliação.
- O uso de AI na avaliação é um dial que você define. A posição da Codility é que a pergunta não é se o candidato usa AI, mas se ele consegue construir com ela, então vende tarefas específicas de AI e visibilidade por avaliação sobre o que o candidato perguntou ao assistente. O copilot agêntico aparece desde o Starter; o Cody, chatbot voltado ao candidato, desde o Scale.
- A integridade mira a identidade, não as ferramentas. Verificação de identidade, detecção de impersonation, detecção de plágio e sinais de proctoring, com um app de desktop no tier Custom que sinaliza aplicações não autorizadas, inclusive as vendidas como indetectáveis. Esse é o modelo de ameaça correto para 2026: fraude em entrevistas com AI explica por que o entrevistado impostor, e não o copilot, é a falha caríssima.
- A pontuação é baseada em regras, e isso pesa juridicamente. A Codility descreve pontuação auditável através do seu evaluation engine mais análise automática de código para qualidade, manutenibilidade e complexidade, com os recursos de AI do lado do candidato e não dentro da decisão. Se o seu jurídico está trabalhando a Illinois HB 3773 ou a NYC LL 144, essa distinção é a primeira coisa a confirmar: por escrito, com o fornecedor, para a configuração exata que você compra.
A realidade do pricing
- Starter — $1.200/ano, apenas faturamento anual. 120 créditos de convite por ano, 1 usuário de plataforma, assentos de colaborador ilimitados, biblioteca de tarefas limitada, detecção de plágio, proctoring básico com capturas do candidato e suporte self-serve. Dá $10 por convite.
- Scale — $600/mês, ou $6.000/ano no faturamento anual (dois meses grátis). 300 créditos por ano com teto de 25 por mês, 3 usuários de plataforma, biblioteca mais ampla cobrindo engenharia, AI e design de sistemas, e autoria de tarefas via MCP. $20 por convite no anual, $24 no mensal.
- Custom — só cotação. Quase tudo que torna um programa de avaliação defensável mora aqui: integrações com ATS (Greenhouse, Lever, Ashby, Workday, SAP), SSO e SAML, API completa, pontuação ponderada, video proctoring premium com verificação de identidade, o app de desktop, gravação e transcrição de entrevistas, Code Health, Skills Intelligence, as bibliotecas de tarefas de negócio e estudos de validade e impacto adverso feitos por psicólogos ocupacionais internos.
Um crédito de convite cobre um candidato em Screen ou em Interview, então o medidor são candidatos, não assentos. Os 300 créditos do Scale sustentam por volta de 8–12 contratações de engenharia por ano com um funnel aproximado de 25:1 entre screens e hires. O que empurra os times para a cotação normalmente são os tetos de 3 assentos e 25 convites por mês, não alguma capacidade ausente.
Melhor para
Líderes de engenharia e de TA contratando de 5 a 30 engenheiros por ano que querem screening técnico estruturado e defensável no cartão esta semana em vez de um ciclo de compras, e que aceitam revisar as entregas eles mesmos, porque aqui nada ranqueia candidatos automaticamente.
Não é para você se o gargalo é agendamento e não qualidade de screening: compre GoodTime ou Modernloop. Não é para você se a escrita dos resultados de volta no ATS é não negociável com orçamento self-serve: no Starter ou no Scale os resultados vivem na Codility e alguém copia o desfecho para o seu ATS na mão. E não é para contratação fora de engenharia, onde a TestGorilla cobre muito mais tipos de vaga por $75/mês.
Frente às alternativas
HackerRank é a líder em volume e a resposta mais segura acima de cerca de 50 contratações de engenharia por ano: biblioteca maior, mais familiaridade entre recruiters, pricing só por cotação que aterrissa em cinco dígitos baixos a médios ao ano. Escolha ela quando o programa de avaliação já tem gente alocada e a restrição é throughput. CodeSignal é a escolha quando você quer uma pontuação de avaliação certificada que se transfira entre vagas e ciclos de requisição, e o stack de detecção dela é a comparação mais próxima em matéria de cola; HackerRank vs CodeSignal resolve esse par. micro1 é a entrante que cresce mais rápido e uma compra diferente: a Zara conduz a entrevista em vez de equipar o seu entrevistador. A regra é limpa: a Codility mede candidatos para humanos julgarem, a micro1 substitui o humano na sala. Escolha micro1 quando a restrição são horas de entrevistador; escolha Codility quando são qualidade das perguntas e auditabilidade.
Pontos de atenção
- Quase todo recurso de nível compliance está atrás do tier Custom: SSO, API, escrita de volta no ATS, verificação de identidade, o app de desktop, os estudos de equidade. Guarda: liste quais deles a sua revisão de segurança e o seu ATS realmente exigem antes de comprar self-serve. Se aparecer um só, vá direto para a cotação; adaptar a integração depois significa repetir o rollout.
- Os créditos são anuais e o Scale tem teto de 25 por mês. Guarda: dimensione pelo mês de pico de screening do ano passado, não pela média. Um pico de vagas em janeiro queima uma alocação de 300 créditos bem antes do Q3, e o teto bloqueia o atalho óbvio.
- Vazamento de tarefas é risco real em qualquer biblioteca publicada. A Codility remove tarefas vazadas e declara isso em todos os tiers. Guarda: rotacione tarefas por ciclo de requisição e crie 2–3 tarefas construídas com MCP a partir do seu próprio repo para as rodadas finais, onde o vazamento custa mais.
- Sem pontuação por AI, humanos continuam lendo cada entrega. Guarda: orce horas de revisão antes do rollout — cerca de 10–15 minutos por entrega — e nomeie o revisor por vaga, ou a fila se torna o novo gargalo e os screens ficam sem leitura.
- Skills Intelligence, a razão para preferir Codility a um screener puro, é só Custom. Guarda: se o business case é mapear capacidade interna, não faça o piloto no Starter; o piloto não consegue demonstrar exatamente o que você está comprando.