ooligo

Braintrust

ai-evaluation-observability llm-evals · agent-observability · tracing · llm-as-judge · prompt-playground · online-scoring
AI-NATIVE MCP API
RevOpsLegal OpsRecruiting & TACustomer Success
8.2 /10

Ce que c’est

Braintrust est l’endroit où vous découvrez si la modification que vous venez d’apporter à une fonctionnalité d’IA l’a améliorée ou dégradée. Vous instrumentez l’application, les traces arrivent dans Braintrust, et les défaillances que vous y trouvez deviennent des datasets, des scorers et des expériences qui se rejouent à chaque changement suivant. Ankur Goyal a fondé la société à l’été 2023, après le rachat de sa société précédente, Impira, par Figma. Elle a levé un seed de $5.1M mené par Greylock, puis une Série B de $80M menée par ICONIQ le 2026-02-17 — avec Andreessen Horowitz, Greylock et Elad Gil — sur une valorisation de $800M et environ $121M levés au total. Notion, Replit, Cloudflare, Ramp et Dropbox sont cités comme clients.

Le problème délimité, dans les mots qu’emploie vraiment un responsable ops : votre agent de support ou votre assistant de revue contractuelle fonctionnait bien le mois dernier, quelqu’un a modifié un prompt ou changé de modèle, et personne ne sait dire ce qui a régressé ni de combien. La réponse de Braintrust est une suite de régression notée pour systèmes non déterministes — la discipline d’une suite de tests unitaires, sauf que les assertions sont des évaluateurs plutôt que des tests d’égalité, et que la note vient d’un juge LLM, d’un scorer en code ou d’un relecteur humain.

Ce que vous achetez réellement

Trois briques font le travail, et la plupart des équipes n’ont besoin que des deux premières le premier jour.

Le tracing vers Brainstore. Braintrust a écrit son propre stockage pour les données de trace plutôt que de placer les spans dans un backend d’observabilité généraliste, et la raison apparaît dès que vous filtrez quelques millions de traces sur un champ texte. Il ingère OpenTelemetry — le BraintrustSpanProcessor s’insère dans un tracer provider existant, avec un filtre qui ne transmet que les spans d’IA, et il implémente les conventions sémantiques GenAI d’OTel. Les SDK couvrent Python, TypeScript, Go, Ruby, C# et Java. L’AI proxy place OpenAI, Anthropic, Google et les modèles à poids ouverts derrière un seul endpoint.

Loop. La partie qui a le plus changé en 2026, et celle à évaluer le plus sévèrement. Loop est un agent braqué sur vos propres données de trace : décrivez une défaillance en prose, et il lit les traces, propose un dataset des cas concernés et rédige un scorer. En septembre 2026 il est passé dans un runtime managé, avec des threads persistants et une portée sur tout le projet, et a gagné des automatisations planifiées qui tournent avec leurs propres instructions et des droits d’écriture. Patterns et Debugger sont sortis en même temps : le premier cherche les défaillances récurrentes qu’aucun scorer ne mesure encore, le second rapporte les modes de défaillance probables d’une trace isolée, preuves à l’appui.

La revue humaine. Des files d’annotation avec affectation et notification Slack, plus des revues en aveugle qui masquent les notes des collègues jusqu’à ce que le relecteur ait rendu la sienne — ce qui pèse plus qu’il n’y paraît, car des statistiques de concordance ancrées sur la réponse visible d’un collègue ne sont pas des statistiques de concordance.

Tarifs

Publiés sur braintrust.dev/pricing, vérifiés le 2026-09-20. Le fait structurel qui tranche la plupart des évaluations : tous les plans incluent un nombre illimité d’utilisateurs. La facturation porte sur les données traitées et les scores exécutés, jamais sur les sièges.

  • Starter — $0/mois. $10 de crédits modèle, 1 Go de données traitées puis $4/Go, 10k scores puis $2.50 par tranche de 1k, rétention de 14 jours. Utilisateurs, projets, datasets, playgrounds et expériences illimités. Sans carte bancaire.
  • Pro — $249/mois. $100 de crédits, 5 Go puis $3/Go, 50k scores puis $1.50 par tranche de 1k, rétention de 30 jours, rétention plus longue à $0.50/Go/mois — portée à 180 jours en juillet 2026. S’y ajoutent les graphiques personnalisés, les environnements, le RBAC et le support prioritaire.
  • Enterprise — sur devis. Rétention et export sur mesure, support premium, et déploiement self-hosted ou dans votre propre cloud.

Comparez la forme avec LangSmith, qui affiche $39 par siège et par mois sur Plus, 10k traces de base incluses et paiement à l’usage au-delà. Pour une équipe de 12 personnes, cela fait $468 par mois de sièges avant d’avoir stocké la moindre trace ; ces mêmes 12 personnes ne coûtent rien chez Braintrust et la facture n’est que du volume. L’inverse se produit avec peu de monde et beaucoup de trafic : deux personnes poussant un gros volume de production paieront plus chez Braintrust que deux sièges LangSmith. Calculez le rapport entre effectif et traces avant de supposer que l’absence de facturation au siège revient moins cher.

Idéal pour

Une équipe engineering ou ops qui a déjà mis une fonctionnalité d’IA en production, qui a une plainte qualité qu’elle n’arrive pas à quantifier, et qui compte plus de relecteurs que d’ingénieurs. Le nombre de relecteurs est le signal : les experts métier — la CSM qui sait à quoi ressemble une bonne réponse de support, le paralegal qui repère un mauvais résumé de clause — ont besoin de comptes pour annoter, et sur une plateforme facturée au siège chacun d’eux est une ligne de facture. Braintrust tarife cette équipe correctement, et rien n’y présuppose un framework, donc un stack qui n’est pas LangChain ne coûte aucun travail d’intégration supplémentaire.

Pas fait pour

Les équipes qui n’ont pas encore livré. Sans trafic de production il n’y a pas de traces, et une plateforme d’évaluation sans traces est un tableur avec un moins bon éditeur — écrivez 20 cas de test à la main et exécutez-les dans un script jusqu’à ce qu’un usage réel existe. Pas fait non plus pour les équipes dont le besoin réel est le monitoring classique de modèles sur du ML tabulaire : dérive, feature skew et PSI sont le terrain d’Arize et de W&B. Et pas fait pour une organisation dont la revue sécurité n’accepte pas qu’un tiers détienne les identifiants des fournisseurs de modèles — lisez le premier point de vigilance avant d’engager cet achat.

Face aux alternatives

  • LangSmith — le choix par défaut si vous construisez déjà sur LangChain ou LangGraph, car le tracing n’y demande aucun travail d’intégration et les produits de déploiement sont juste à côté. Prenez-le quand le framework est LangChain et que l’équipe est petite. Prenez Braintrust quand l’équipe est agnostique au framework, ou quand le nombre de relecteurs fait de la facturation au siège le poste dominant.
  • Langfuse — l’option open source et l’entrant qui croît le plus vite sur le segment. Le dépôt principal est sous licence MIT et l’auto-hébergement est gratuit, ce qui est la réponse quand la résidence des données ne se négocie pas ou quand le volume est assez élevé pour que tout fournisseur facturé à l’usage perde à l’arithmétique. Prenez Langfuse si vous avez une équipe plateforme prête à l’exploiter. Prenez Braintrust sinon, et en particulier si la boucle d’investigation de Loop est la fonctionnalité que vous voulez — c’est l’écart de capacité le plus net entre les deux.
  • Arize Phoenix — open source et natif OpenTelemetry, le choix des équipes qui font déjà tourner Arize sur du ML traditionnel et veulent un seul fournisseur pour les deux. Moins adapté quand le développement de juges LLM est le travail quotidien.
  • Weights & Biases Weave — à prendre quand la même équipe fait du fine-tuning de modèles et vit déjà dans W&B pour le suivi d’expériences.

Si rien ne convient, le repli honnête est un répertoire de cas de test versionné et un job de CI qui les note avec une fonction que vous avez écrite. C’est en gros ce que Braintrust automatise, cela ne coûte rien, et pour une seule fonctionnalité avec 50 cas de test c’est compétitif.

Points de vigilance

  • Un attaquant a atteint un compte AWS de Braintrust en mai 2026, et des clés de fournisseurs d’IA au niveau organisation ont probablement été exposées. Braintrust a détecté l’activité le 2026-05-04, prévenu ses clients le 05-05, publié l’information le 05-06 et demandé à tout le monde de faire tourner les clés fournisseur au niveau organisation. Un client a été confirmé touché ; trois autres ont signalé des pics inexpliqués d’usage fournisseur. La divulgation a été rapide et directe, ce qui est le bon comportement — l’enjeu est la classe d’exposition. Garde-fou : la documentation d’auto-hébergement indique que les secrets fournisseur au niveau projet restent dans votre data plane tandis que les secrets au niveau organisation restent dans le control plane de Braintrust ; configurez donc les clés par projet plutôt que par organisation, cantonnez-les à un compte fournisseur plafonné en dépense et donnez-leur une date d’expiration — l’expiration des clés et un contrôle empêchant les membres d’en créer de nouvelles sont sortis tous les deux en juillet 2026. Faites-le le premier jour, pas après le deuxième incident.
  • Deux compteurs indépendants et une horloge de rétention rendent la facture difficile à prévoir. Les données traitées et les scores exécutés se facturent séparément, et chaque scorer en ligne que vous activez multiplie le second poste par le trafic de production : quatre juges LLM en échantillonnage complet quadruplent le volume de scores sans qu’une ligne de code applicatif change. Garde-fou : démarrez le scoring en ligne sur un pourcentage échantillonné, mettez en revue récurrente la ventilation d’usage par projet sortie en septembre 2026, et exportez ce dont vous avez besoin au-delà de 30 jours avant que la rétention ne l’efface.
  • Les automatisations de Loop détiennent des droits d’écriture. Des exécutions planifiées qui créent et modifient des objets selon leurs propres instructions sont pratiques, et sont aussi un agent qui édite votre infrastructure de scoring sans surveillance. Si un scorer change en silence, toutes les expériences suivantes sont mesurées à une autre aune. Garde-fou : tenez l’historique de versions annoté sur les scorers et les prompts pour que chaque enregistrement porte une description, revoyez les changements écrits par les automatisations au même rythme qu’une revue de code, et mettez les automatisations en pause pendant un incident — la pause et la reprise sont sorties en août 2026 précisément pour que la configuration y survive.
  • Deux concurrents open source crédibles acceptent le format que vous envoyez déjà. Langfuse et Phoenix sont sous licences permissives et ingèrent tous deux OpenTelemetry, si bien que le coût de sortie se résume aux appels SDK propres à Braintrust que vous avez écrits. Garde-fou : instrumentez avec des spans OTel neutres vis-à-vis du fournisseur partout où le SDK vous laisse le choix, et testez un export complet de traces pendant l’essai. La portabilité n’est réelle que si vous l’avez construite.