Was es ist
Braintrust ist die Stelle, an der Sie erfahren, ob die Änderung, die Sie gerade an einem KI-Feature vorgenommen haben, es besser oder schlechter gemacht hat. Sie instrumentieren die Anwendung, die Traces landen in Braintrust, und die Fehler, die Sie darin finden, werden zu Datasets, Scorern und Experimenten, die bei jeder weiteren Änderung erneut laufen. Ankur Goyal gründete das Unternehmen im Sommer 2023, nachdem Figma seine vorherige Firma Impira übernommen hatte. Es folgte eine Seed-Runde über $5.1M unter Führung von Greylock und am 2026-02-17 eine Series B über $80M unter Führung von ICONIQ — mit Andreessen Horowitz, Greylock und Elad Gil — bei einer Bewertung von $800M und rund $121M Gesamtkapital. Notion, Replit, Cloudflare, Ramp und Dropbox werden als Kunden genannt.
Das abgegrenzte Problem, in den Worten, die ein Ops-Verantwortlicher tatsächlich benutzt: Ihr Support-Agent oder Ihr Assistent für die Vertragsprüfung lief letzten Monat sauber, jemand hat einen Prompt geändert oder das Modell getauscht, und niemand kann sagen, was sich verschlechtert hat und um wie viel. Die Antwort von Braintrust ist eine bewertete Regressionssuite für nicht-deterministische Systeme — die Disziplin einer Unit-Test-Suite, nur dass die Assertions Bewerter statt Gleichheitsprüfungen sind und die Benotung von einem LLM-Judge, einem Scorer im Code oder einem menschlichen Reviewer kommt.
Was Sie tatsächlich kaufen
Drei Bausteine erledigen die Arbeit, und die meisten Teams brauchen am ersten Tag nur die ersten beiden.
Tracing in Brainstore. Braintrust hat einen eigenen Speicher für Trace-Daten geschrieben, statt die Spans in ein allgemeines Observability-Backend zu legen, und der Grund zeigt sich, sobald Sie einige Millionen Traces über ein Textfeld filtern. Es nimmt OpenTelemetry entgegen — der BraintrustSpanProcessor fügt sich in einen bestehenden Tracer Provider ein, mit einem Filter, der nur KI-Spans weiterleitet, und implementiert die GenAI-Semantikkonventionen von OTel. Die SDKs decken Python, TypeScript, Go, Ruby, C# und Java ab. Der AI Proxy stellt OpenAI, Anthropic, Google und die Open-Weight-Modelle hinter einen einzigen Endpunkt.
Loop. Der Teil, der sich 2026 am stärksten verändert hat, und der Teil, den Sie am gründlichsten prüfen sollten. Loop ist ein Agent, der auf Ihre eigenen Trace-Daten gerichtet ist: Beschreiben Sie einen Fehler in Prosa, und er liest die Traces, schlägt ein Dataset der betroffenen Fälle vor und entwirft einen Scorer. Im September 2026 zog er in eine verwaltete Runtime mit persistenten Threads und projektweitem Zugriff um und erhielt geplante Automatisierungen, die mit eigenen Anweisungen und Schreibrechten laufen. Patterns und Debugger kamen zeitgleich dazu — das erste sucht wiederkehrende Fehler, die noch kein Scorer misst, das zweite meldet die wahrscheinlichen Fehlermodi eines einzelnen Trace samt Belegen.
Menschliches Review. Annotations-Queues mit Zuweisung und Slack-Benachrichtigung, dazu Blind Reviews, die die Bewertungen der Kollegen verbergen, bis ein Reviewer seine eigene abgeschlossen hat — was mehr wiegt, als es klingt, denn Übereinstimmungsstatistiken, die an der sichtbaren Antwort eines Kollegen verankert sind, sind keine Übereinstimmungsstatistiken.
Preise
Veröffentlicht auf braintrust.dev/pricing, geprüft am 2026-09-20. Der strukturelle Punkt, der die meisten Evaluierungen entscheidet: jeder Plan hat unbegrenzt Nutzer. Abgerechnet werden verarbeitete Daten und ausgeführte Scores, niemals Seats.
- Starter — $0/Monat. $10 Modell-Credits, 1 GB verarbeitete Daten und danach $4/GB, 10k Scores und danach $2.50 je 1k, 14 Tage Aufbewahrung. Unbegrenzt Nutzer, Projekte, Datasets, Playgrounds und Experimente. Ohne Kreditkarte.
- Pro — $249/Monat. $100 Credits, 5 GB und danach $3/GB, 50k Scores und danach $1.50 je 1k, 30 Tage Aufbewahrung, längere Aufbewahrung für $0.50/GB/Monat — im Juli 2026 auf 180 Tage erweitert. Dazu eigene Charts, Environments, RBAC und priorisierter Support.
- Enterprise — auf Anfrage. Individuelle Aufbewahrung und Export, Premium-Support sowie Self-Hosted- oder Bring-your-own-Cloud-Deployment.
Vergleichen Sie die Form mit LangSmith: dort $39 pro Seat und Monat im Plus-Tarif, 10k Basis-Traces inklusive, darüber nutzungsabhängig. Bei einem Team von 12 Personen sind das $468 im Monat an Seats, bevor ein einziger Trace gespeichert ist; dieselben 12 Personen kosten bei Braintrust nichts, und die Rechnung besteht ausschließlich aus Volumen. Bei wenig Personal und viel Traffic kehrt sich das um — zwei Personen mit schwerem Produktionsvolumen zahlen bei Braintrust mehr als für zwei LangSmith-Seats. Rechnen Sie das Verhältnis von Personen zu Traces durch, bevor Sie annehmen, seat-freie Abrechnung sei günstiger.
Am besten geeignet für
Ein Engineering- oder Ops-Team, das ein KI-Feature bereits in Produktion gebracht hat, eine Qualitätsbeschwerde hat, die es nicht quantifizieren kann, und mehr Reviewer als Entwickler beschäftigt. Die Zahl der Reviewer ist das Signal: Fachexperten — die CSM, die weiß, wie eine gute Support-Antwort aussieht, der Paralegal, der eine schlechte Klauselzusammenfassung erkennt — brauchen Accounts zum Labeln, und auf einer Seat-Plattform ist jeder davon ein Posten auf der Rechnung. Braintrust bepreist dieses Team richtig, und nichts daran setzt ein Framework voraus, sodass ein Stack jenseits von LangChain keine zusätzliche Integrationsarbeit kostet.
Nicht geeignet für
Teams, die noch nicht live sind. Ohne Produktionsverkehr gibt es keine Traces, und eine Eval-Plattform ohne Traces ist eine Tabelle mit schlechterem Editor — schreiben Sie 20 Testfälle von Hand und lassen Sie sie in einem Skript laufen, bis es echte Nutzung gibt. Auch nicht für Teams, deren eigentlicher Bedarf klassisches Modell-Monitoring auf tabellarischem ML ist: Drift, Feature Skew und PSI sind das Terrain von Arize und W&B. Und nicht für eine Organisation, deren Sicherheitsprüfung es nicht akzeptiert, dass ein Dritter Zugangsdaten für Modellanbieter verwahrt — lesen Sie den ersten Warnpunkt, bevor Sie diese Beschaffung beginnen.
Gegenüber den Alternativen
- LangSmith — die Standardwahl, wenn Sie ohnehin auf LangChain oder LangGraph bauen, denn dort kostet das Tracing keine Integrationsarbeit und die Deployment-Produkte liegen direkt daneben. Nehmen Sie es, wenn das Framework LangChain heißt und das Team klein ist. Nehmen Sie Braintrust, wenn das Team framework-agnostisch arbeitet oder wenn die Zahl der Reviewer die Seat-Abrechnung zum dominierenden Kostenblock macht.
- Langfuse — die Open-Source-Option und der am schnellsten wachsende Neueinsteiger im Segment. Das Kern-Repository steht unter MIT-Lizenz und Self-Hosting ist kostenlos, was die Antwort ist, wenn Datenresidenz nicht verhandelbar ist oder das Volumen so hoch liegt, dass jeder nutzungsabhängige Anbieter rechnerisch verliert. Nehmen Sie Langfuse, wenn Sie ein Plattformteam haben, das es betreiben will. Nehmen Sie Braintrust, wenn nicht — und besonders dann, wenn Sie den Untersuchungszyklus von Loop wollen; das ist die deutlichste Funktionslücke zwischen beiden.
- Arize Phoenix — Open Source und OpenTelemetry-nativ, die Wahl für Teams, die Arize bereits für klassisches ML betreiben und einen Anbieter für beides wollen. Schwächer, wenn die Entwicklung von LLM-Judges das Tagesgeschäft ist.
- Weights & Biases Weave — die Wahl, wenn dasselbe Team Modelle feinjustiert und für Experiment-Tracking ohnehin in W&B lebt.
Passt nichts davon, ist der ehrliche Rückfallplan ein eingecheckter Ordner mit Testfällen und ein CI-Job, der sie mit einer selbst geschriebenen Funktion bewertet. Das ist ungefähr das, was Braintrust automatisiert, es kostet nichts, und für ein Feature mit 50 Testfällen hält es mit.
Worauf Sie achten müssen
- Im Mai 2026 hat ein Angreifer einen AWS-Account von Braintrust erreicht, und KI-Anbieterschlüssel auf Organisationsebene waren wahrscheinlich offengelegt. Braintrust bemerkte die Aktivität am 2026-05-04, informierte Kunden am 05-05, machte den Vorfall am 05-06 öffentlich und forderte alle auf, die Anbieterschlüssel auf Organisationsebene zu rotieren. Ein Kunde war bestätigt betroffen; drei weitere meldeten unerklärte Ausschläge bei der Anbieternutzung. Die Offenlegung war schnell und direkt, also richtig — entscheidend ist die Art der Offenlegung. Schutz: die Self-Hosting-Dokumentation hält fest, dass Anbietergeheimnisse auf Projektebene in Ihrer Data Plane bleiben, während Geheimnisse auf Organisationsebene in der Control Plane von Braintrust liegen. Konfigurieren Sie Schlüssel deshalb pro Projekt statt pro Organisation, binden Sie sie an einen Anbieter-Account mit Ausgabenlimit und versehen Sie sie mit einem Ablaufdatum — Schlüsselablauf und eine Sperre gegen das Anlegen neuer Schlüssel durch Mitglieder kamen beide im Juli 2026. Machen Sie das am ersten Tag, nicht nach dem zweiten Vorfall.
- Zwei unabhängige Zähler und eine Aufbewahrungsuhr machen die Rechnung schwer prognostizierbar. Verarbeitete Daten und ausgeführte Scores werden getrennt berechnet, und jeder aktivierte Online-Scorer multipliziert den zweiten Posten gegen den Produktionsverkehr: vier LLM-Judges bei voller Abtastung vervierfachen das Score-Volumen, ohne dass sich eine Zeile Anwendungscode ändert. Schutz: starten Sie Online-Scoring auf einem abgetasteten Prozentsatz, setzen Sie die projektbezogene Nutzungsaufschlüsselung vom September 2026 auf eine wiederkehrende Prüfung, und exportieren Sie alles, was Sie über 30 Tage hinaus brauchen, bevor die Aufbewahrung es löscht.
- Die Automatisierungen von Loop haben Schreibrechte. Geplante Läufe, die nach eigenen Anweisungen Objekte anlegen und ändern, sind bequem — und zugleich ein Agent, der Ihre Scoring-Infrastruktur unbeaufsichtigt bearbeitet. Ändert sich ein Scorer still, wird jedes spätere Experiment an einem anderen Maßstab gemessen. Schutz: führen Sie die kommentierte Versionshistorie für Scorer und Prompts, damit jeder Speicherstand eine Beschreibung trägt, prüfen Sie von Automatisierungen verfasste Änderungen im Takt eines Code-Reviews, und pausieren Sie Automatisierungen während eines Vorfalls — Pausieren und Fortsetzen kam im August 2026 genau dafür.
- Zwei ernstzunehmende Open-Source-Konkurrenten akzeptieren dasselbe Datenformat, das Sie ohnehin senden. Langfuse und Phoenix stehen unter freizügigen Lizenzen und nehmen beide OpenTelemetry entgegen, sodass die Wechselkosten genau in den Braintrust-spezifischen SDK-Aufrufen stecken, die Sie geschrieben haben. Schutz: instrumentieren Sie mit anbieterneutralen OTel-Spans, wo immer das SDK Ihnen die Wahl lässt, und testen Sie während der Testphase einen vollständigen Trace-Export. Portabilität ist nur real, wenn Sie dafür gebaut haben.