ooligo

Braintrust

ai-evaluation-observability llm-evals · agent-observability · tracing · llm-as-judge · prompt-playground · online-scoring
AI-NATIVE MCP API
RevOpsLegal OpsRecruiting & TACustomer Success
8.2 /10

概要

Braintrust は、AI 機能に加えた変更が品質を上げたのか下げたのかを確かめる場所です。アプリケーションを計装するとトレースが Braintrust に届き、そこで見つかった不具合がデータセット、スコアラー、実験になり、以降のすべての変更で再実行されます。創業者は Ankur Goyal で、前に立ち上げた Impira を Figma が買収した後、2023年夏に設立しました。Greylock がリードした $5.1M のシードに続き、2026-02-17 には ICONIQ がリードする $80M のシリーズ B を実施しています。Andreessen Horowitz、Greylock、Elad Gil が参加し、評価額は $800M、累計調達額はおよそ $121M です。顧客として Notion、Replit、Cloudflare、Ramp、Dropbox の名前が挙がっています。

対象となる課題を、現場のオペレーション責任者が実際に使う言葉で言えばこうです。先月まで問題なく動いていたサポートエージェントや契約レビューアシスタントがあり、誰かがプロンプトを直したかモデルを差し替えた。しかし何がどれだけ劣化したのかを誰も説明できない。これに対する Braintrust の答えは、非決定的なシステム向けの採点付きリグレッションスイートです。ユニットテストスイートと同じ規律ですが、アサーションは等価比較ではなく評価器であり、採点を担うのは LLM ジャッジ、コードによるスコアラー、あるいは人間のレビュアーです。

実際に買っているもの

この仕事を担うのは3つの要素で、多くのチームが初日に必要とするのは最初の2つだけです。

Brainstore へのトレーシング。 Braintrust はスパンを汎用の可観測性バックエンドに置かず、トレースデータ専用のストアを自前で書きました。その理由は、数百万件のトレースをテキストフィールドで絞り込むときに表れます。OpenTelemetry を取り込むことができ、BraintrustSpanProcessor は既存の tracer provider に差し込めて、AI のスパンだけを転送するフィルタを備え、OTel の GenAI セマンティック規約を実装しています。SDK は Python、TypeScript、Go、Ruby、C#、Java をカバーします。AI proxy は OpenAI、Anthropic、Google とオープンウェイトのモデルを単一のエンドポイントの背後にまとめます。

Loop。 2026年に最も変化した部分であり、最も厳しく評価すべき部分です。Loop は自社のトレースデータに向けられたエージェントで、不具合を文章で説明すると、トレースを読み、その症状を示すケースからなるデータセットを提案し、スコアラーを起草します。2026年9月にはマネージドランタイムへ移り、スレッドが永続化され、プロジェクト全体を対象にできるようになり、独自の指示と書き込み権限で動くスケジュール実行の自動化も加わりました。同時期に Patterns と Debugger も出荷されています。前者はまだどのスコアラーも測っていない再発性の不具合を探し、後者は単一トレースについて考えられる失敗モードを根拠付きで報告します。

人によるレビュー。 担当者の割り当てと Slack 通知を伴うアノテーションキューに加え、レビュアーが自分の採点を終えるまで他者の点数を隠すブラインドレビューがあります。これは見た目以上に重要です。同僚の見えている回答に引きずられた一致率は、一致率ではないからです。

料金

braintrust.dev/pricing で公開されている内容を 2026-09-20 に確認しました。多くの検討を左右する構造的な事実は、どのプランでもユーザー数は無制限という点です。課金対象は処理データ量と実行したスコアの数であり、席数ではありません。

  • Starter — $0/月。 モデルクレジット $10、処理データ 1 GB まで、以降 $4/GB、スコア 10k まで、以降 1k あたり $2.50、保持期間は14日。ユーザー、プロジェクト、データセット、プレイグラウンド、実験はいずれも無制限。カード登録は不要です。
  • Pro — $249/月。 クレジット $100、5 GB まで、以降 $3/GB、スコア 50k まで、以降 1k あたり $1.50、保持期間は30日で、延長は $0.50/GB/月。2026年7月に最長180日まで拡張されました。カスタムチャート、environments、RBAC、優先サポートが付きます。
  • Enterprise — 個別見積もり。 保持期間とエクスポートの個別設定、プレミアムサポート、セルフホストまたは自社クラウドへのデプロイに対応します。

この形を LangSmith と比べてください。LangSmith は Plus で1席あたり月 $39 を掲示し、基本トレース 10k を含み、それを超えると従量課金です。12人のチームなら、トレースを1件も保存しないうちに席料だけで月 $468 になります。同じ12人が Braintrust では無料で、請求はすべて処理量で決まります。人数が少なくトラフィックが多い場合は逆転します。2人で重い本番トラフィックを流すなら、LangSmith の2席分より Braintrust のほうが高くつきます。席課金がないほうが安いと決めつける前に、人数とトレース量の比率を試算してください。

向いているチーム

すでに AI 機能を本番投入していて、定量化できない品質上の不満を抱えており、エンジニアよりレビュアーの人数が多い開発またはオペレーションのチームです。判断の決め手はレビュアーの人数です。良いサポート回答の姿を知っている CSM、条項要約の出来不出来を見抜けるパラリーガルといった領域の専門家はラベル付けのためにアカウントを必要とし、席課金のプラットフォームではその一人ひとりが請求項目になります。Braintrust はそうしたチームに対して妥当な値付けをしています。加えて特定のフレームワークを前提としないため、LangChain 以外の stack でも追加の統合作業は発生しません。

向いていないチーム

まだ本番リリースしていないチームです。本番トラフィックがなければトレースも存在せず、トレースのない評価基盤は編集機能の劣ったスプレッドシートにすぎません。実利用が生まれるまでは、テストケースを20件手で書いてスクリプトで回すほうが妥当です。実際に必要なのが表形式の機械学習に対する従来型のモデル監視であるチームにも向きません。ドリフト、feature skew、PSI は Arize や W&B の領域です。そして、モデルプロバイダーの認証情報を第三者が保持することをセキュリティレビューが認めない組織にも向きません。その調達を始める前に、最初の注意点を読んでください。

代替ツールとの比較

  • LangSmith — すでに LangChain や LangGraph の上で開発しているなら既定の選択肢です。その環境ではトレーシングに統合作業がかからず、デプロイ系のプロダクトも隣接しています。フレームワークが LangChain でチームが小さいときはこちらを選んでください。チームがフレームワークに依存しない場合、あるいはレビュアーの人数によって席課金が支配的なコストになる場合は Braintrust を選んでください。
  • Langfuse — オープンソースの選択肢であり、この領域で最も速く伸びている新規参入です。中核リポジトリは MIT ライセンスでセルフホストは無料なので、データレジデンシーが譲れない場合や、従量課金のベンダーが計算上不利になるほど処理量が大きい場合の答えになります。運用を引き受けるプラットフォームチームがいるなら Langfuse を選んでください。いないなら Braintrust を選んでください。とくに Loop の調査サイクルが欲しい機能である場合はそうです。両者の機能差が最も明確に出るのがここです。
  • Arize Phoenix — オープンソースで OpenTelemetry ネイティブです。従来型の機械学習ですでに Arize を運用していて、両方を1社にまとめたいチームに向きます。LLM ジャッジの開発が日々の仕事である場合は相性が落ちます。
  • Weights & Biases Weave — 同じチームがモデルのファインチューニングも行い、実験管理で W&B を日常的に使っているなら、こちらを選んでください。

どれも合わないなら、正直な代替案はテストケースをリポジトリに置き、自分で書いた採点関数で評価する CI ジョブを回すことです。それは Braintrust が自動化している内容とおおむね同じで、費用はかからず、機能1つとテストケース50件の規模なら十分に戦えます。

注意点

  • 2026年5月、攻撃者が Braintrust の AWS アカウントの1つに到達し、組織レベルの AI プロバイダーキーが露出した可能性があります。 Braintrust は 2026-05-04 に不審な挙動を検知し、05-05 に顧客へ通知、05-06 に公表し、組織レベルのプロバイダーキーをすべてローテーションするよう求めました。影響が確認された顧客は1社で、別の3社がプロバイダー利用量の説明のつかない急増を報告しています。開示は迅速かつ率直で、対応としては正しいものでした。問題は露出したものの種類です。対策:セルフホストのドキュメントによれば、プロジェクトレベルのプロバイダーシークレットは自社の data plane に留まる一方、組織レベルのシークレットは Braintrust の control plane に置かれます。したがってキーは組織単位ではなくプロジェクト単位で設定し、支出上限を設けた専用のプロバイダーアカウントに紐付け、有効期限を設定してください。キーの有効期限と、メンバーによる新規キー作成を禁止する制御は、いずれも2026年7月に出荷されています。2度目のインシデントの後ではなく、初日に設定してください。
  • 独立した2つの課金メーターと保持期間の時計が、請求額の予測を難しくします。 処理データ量と実行スコア数は別々に課金され、オンラインスコアラーを有効にするたびに後者が本番トラフィックの分だけ増えます。LLM ジャッジを4つ全件サンプリングで動かせば、アプリケーションのコードを1行も変えずにスコア量は4倍になります。対策:オンラインスコアリングは全トラフィックではなく一定割合のサンプリングから始め、2026年9月に出荷されたプロジェクト単位の利用内訳を定例でレビューし、30日を超えて必要なデータは保持期間が消す前にエクスポートしてください。
  • Loop の自動化は書き込み権限を持ちます。 独自の指示でオブジェクトを作成・更新するスケジュール実行は便利であると同時に、採点基盤を無人で編集するエージェントでもあります。スコアラーが気づかれずに変われば、それ以降の実験はすべて別の物差しで測られます。対策:スコアラーとプロンプトには注記付きのバージョン履歴を残し、保存のたびに説明を添えてください。自動化が書いた変更はコードレビューと同じ頻度で確認し、インシデント中は自動化を一時停止してください。一時停止と再開は、まさに設定を失わずに済むよう2026年8月に出荷されています。
  • 有力なオープンソースの競合2社が、あなたがすでに送っているのと同じ形式を受け取れます。 Langfuse と Phoenix はいずれも寛容なライセンスで、どちらも OpenTelemetry を取り込めます。つまり乗り換えコストは、自分で書いた Braintrust 固有の SDK 呼び出しの分だけです。対策:SDK が選択の余地を与える箇所では、ベンダー中立な OTel スパンで計装し、トライアル中にトレースの全件エクスポートを試してください。可搬性は、そのように作った場合にのみ実在します。