ooligo

Braintrust

ai-evaluation-observability llm-evals · agent-observability · tracing · llm-as-judge · prompt-playground · online-scoring
AI-NATIVE MCP API
RevOpsLegal OpsRecrutamento e TACustomer Success
8.2 /10

O que é

Braintrust é onde você descobre se a mudança que acabou de fazer em uma funcionalidade de IA melhorou ou piorou as coisas. Você instrumenta a aplicação, os traces chegam ao Braintrust, e as falhas que você encontra neles viram datasets, scorers e experimentos que rodam de novo a cada mudança seguinte. Ankur Goyal fundou a empresa no verão de 2023, depois que o Figma comprou sua empresa anterior, a Impira. Levantou um seed de $5.1M liderado pela Greylock e depois uma Série B de $80M liderada pela ICONIQ em 2026-02-17 — com participação de Andreessen Horowitz, Greylock e Elad Gil — a um valuation de $800M e cerca de $121M captados no total. Notion, Replit, Cloudflare, Ramp e Dropbox aparecem como clientes.

O problema delimitado, nas palavras que um líder de ops usa de verdade: seu agente de suporte ou seu assistente de revisão de contratos estava bom no mês passado, alguém editou um prompt ou trocou o modelo, e ninguém sabe dizer o que regrediu nem quanto. A resposta do Braintrust é uma suíte de regressão com pontuação para sistemas não determinísticos — a disciplina de uma suíte de testes unitários, só que as asserções são avaliadores em vez de comparações de igualdade, e a nota vem de um juiz LLM, de um scorer em código ou de um revisor humano.

O que você está comprando de fato

Três peças fazem o trabalho, e a maioria dos times só precisa das duas primeiras no primeiro dia.

Tracing para o Brainstore. O Braintrust escreveu o próprio armazenamento para dados de trace em vez de jogar os spans num backend de observabilidade genérico, e o motivo aparece quando você filtra alguns milhões de traces por um campo de texto. Ele ingere OpenTelemetry — o BraintrustSpanProcessor encaixa num tracer provider existente com um filtro para enviar só os spans de IA, e implementa as convenções semânticas GenAI do OTel. Os SDKs cobrem Python, TypeScript, Go, Ruby, C# e Java. O AI proxy coloca OpenAI, Anthropic, Google e os modelos de pesos abertos atrás de um único endpoint.

Loop. A parte que mais mudou ao longo de 2026 e a que exige a avaliação mais rigorosa. Loop é um agente apontado para os seus próprios dados de trace: descreva uma falha em prosa e ele lê os traces, propõe um dataset com os casos que a exibem e escreve um scorer. Em setembro de 2026 passou para um runtime gerenciado com threads persistentes e escopo de projeto inteiro, e ganhou automações agendadas que rodam com instruções próprias e permissões de escrita. Patterns e Debugger saíram junto: o primeiro procura falhas recorrentes que nenhum scorer ainda mede, o segundo reporta os prováveis modos de falha de um trace isolado com a evidência.

Revisão humana. Filas de anotação com atribuição e notificação no Slack, mais revisões cegas que escondem as notas dos colegas até o revisor terminar a dele — o que importa mais do que parece, porque estatística de concordância ancorada na resposta visível de um colega não é estatística de concordância.

Preços

Publicados em braintrust.dev/pricing, verificados em 2026-09-20. O fato estrutural que decide a maioria das avaliações: todos os planos têm usuários ilimitados. A medição é sobre dados processados e scores executados, nunca sobre assentos.

  • Starter — $0/mês. $10 em créditos de modelo, 1 GB de dados processados e depois $4/GB, 10k scores e depois $2.50 por 1k, retenção de 14 dias. Usuários, projetos, datasets, playgrounds e experimentos ilimitados. Não pede cartão.
  • Pro — $249/mês. $100 em créditos, 5 GB e depois $3/GB, 50k scores e depois $1.50 por 1k, retenção de 30 dias com retenção maior a $0.50/GB/mês — estendida para 180 dias em julho de 2026. Adiciona gráficos customizados, environments, RBAC e suporte prioritário.
  • Enterprise — sob consulta. Retenção e exportação customizadas, suporte premium e deploy self-hosted ou na sua própria nuvem.

Compare o formato com o LangSmith, que publica $39 por assento por mês no Plus com 10k traces base inclusos e pagamento por uso acima disso. Num time de 12 pessoas isso dá $468/mês só de assentos antes de guardar um único trace; essas mesmas 12 pessoas custam zero no Braintrust e a conta é puro volume. Inverte com pouca gente e muito tráfego: duas pessoas empurrando volume pesado de produção vão pagar mais no Braintrust do que dois assentos de LangSmith. Modele a razão entre pessoas e traces antes de assumir que não cobrar por assento sai mais barato.

Ideal para

Um time de engenharia ou ops que já colocou uma funcionalidade de IA em produção, tem uma reclamação de qualidade que não consegue quantificar e tem mais revisores do que engenheiros. A contagem de revisores é o sinal: os especialistas de domínio — a CSM que sabe como é uma boa resposta de suporte, o paralegal que reconhece um resumo ruim de cláusula — precisam de contas para rotular, e numa plataforma por assento cada um deles é uma linha na fatura. O Braintrust precifica esse time do jeito certo, e nada nele pressupõe um framework, então um stack que não seja LangChain não custa trabalho extra de integração.

Não é para

Times que ainda não subiram para produção. Sem tráfego produtivo não existem traces, e uma plataforma de evals sem traces é uma planilha com um editor pior — escreva 20 casos de teste na mão e rode num script até existir uso real. Também não é para times cuja necessidade real é monitoramento clássico de modelos sobre ML tabular: drift, feature skew e PSI são território de Arize e W&B. E não é para uma organização cuja revisão de segurança não aceita um terceiro guardando credenciais de provedores de modelo — leia o primeiro alerta antes de começar essa compra.

Frente às alternativas

  • LangSmith — o padrão se você já constrói sobre LangChain ou LangGraph, porque ali o tracing não custa trabalho de integração e os produtos de deploy ficam ao lado. Escolha quando o framework é LangChain e o time é pequeno. Escolha Braintrust quando o time é agnóstico de framework, ou quando o número de revisores torna o custo por assento dominante.
  • Langfuse — a opção open source e o entrante que mais cresce no segmento. O repositório central é licenciado sob MIT e o self-hosting é gratuito, que é a resposta quando residência de dados não se negocia ou quando o volume é alto o bastante para qualquer fornecedor medido perder na aritmética. Escolha Langfuse quando você tem um time de plataforma disposto a operá-lo. Escolha Braintrust quando não tem, e principalmente quando o ciclo de investigação do Loop é a funcionalidade que você quer — essa é a lacuna de capacidade mais clara entre os dois.
  • Arize Phoenix — open source e nativo de OpenTelemetry, e a escolha para times que já rodam Arize em ML tradicional e querem um fornecedor só para os dois casos. Encaixa pior quando o trabalho diário é desenvolver juízes LLM.
  • Weights & Biases Weave — escolha quando o mesmo time faz fine-tuning de modelos e já vive no W&B para acompanhar experimentos.

Se nenhum servir, o plano B honesto é um diretório de casos de teste versionado e um job de CI que os pontue com uma função escrita por você. É mais ou menos o que o Braintrust automatiza, não custa nada, e para uma funcionalidade com 50 casos de teste ele compete.

Alertas

  • Um atacante chegou a uma conta AWS do Braintrust em maio de 2026 e chaves de provedores de IA em nível de organização provavelmente foram expostas. O Braintrust detectou a atividade em 2026-05-04, notificou os clientes em 05-05, divulgou publicamente em 05-06 e mandou todo mundo rotacionar as chaves de provedor em nível de organização. Um cliente foi confirmado como afetado; outros três relataram picos inexplicados de uso de provedores. A divulgação foi rápida e direta, que é o comportamento certo — o ponto é a classe de exposição. Proteção: a documentação de self-hosting diz que os segredos de provedor em nível de projeto ficam no seu data plane enquanto os segredos em nível de organização ficam no control plane do Braintrust, então configure as chaves por projeto e não por organização, limite-as a uma conta de provedor com teto de gasto e coloque validade — expiração de chave e um controle que impede membros de criar chaves novas saíram os dois em julho de 2026. Faça isso no primeiro dia, não depois do segundo incidente.
  • Dois medidores independentes e um relógio de retenção deixam a conta difícil de prever. Dados processados e scores executados são cobrados separadamente, e cada scorer online que você habilita multiplica o segundo contra o tráfego de produção: quatro juízes LLM com amostragem total quadruplicam o volume de scores sem mudar uma linha do código da aplicação. Proteção: comece o scoring online sobre uma porcentagem amostrada, coloque em revisão recorrente o detalhamento de uso por projeto que saiu em setembro de 2026, e exporte o que precisar além dos 30 dias antes que a retenção leve embora.
  • As automações do Loop têm permissão de escrita. Execuções agendadas que criam e atualizam objetos com instruções próprias são convenientes, e também são um agente editando sua infraestrutura de scoring sem supervisão. Se um scorer muda em silêncio, todo experimento posterior é medido com outra régua. Proteção: mantenha o histórico de versões anotado em scorers e prompts para que cada save leve uma descrição, revise as mudanças feitas por automações na mesma cadência de uma revisão de código, e pause as automações durante um incidente — pausar e retomar saiu em agosto de 2026 justamente para a configuração sobreviver a isso.
  • Dois rivais open source críveis aceitam o mesmo formato de dados que você já está enviando. Langfuse e Phoenix têm licenças permissivas e ambos ingerem OpenTelemetry, então o custo de troca é qualquer chamada de SDK específica do Braintrust que você tenha escrito. Proteção: instrumente com spans OTel neutros em relação ao fornecedor sempre que o SDK der a opção, e teste uma exportação completa de traces durante o trial. Portabilidade só é real se você construiu para ela.