Qué es
Braintrust es donde te enteras de si el cambio que acabas de hacer en una función de IA la mejoró o la empeoró. Instrumentas la aplicación, las trazas llegan a Braintrust, y las fallas que encuentras en esas trazas se convierten en datasets, scorers y experimentos que se vuelven a ejecutar con cada cambio posterior. Ankur Goyal lo fundó en el verano de 2023, después de que Figma comprara su empresa anterior, Impira. Levantó una ronda seed de $5.1M liderada por Greylock y luego una Serie B de $80M liderada por ICONIQ el 2026-02-17 — con participación de Andreessen Horowitz, Greylock y Elad Gil — con una valuación de $800M y unos $121M levantados en total. Notion, Replit, Cloudflare, Ramp y Dropbox figuran como clientes.
El problema acotado, en las palabras que usa realmente un líder de ops: tu agente de soporte o tu asistente de revisión de contratos funcionaba bien el mes pasado, alguien editó un prompt o cambió de modelo, y nadie puede decir qué se degradó ni cuánto. La respuesta de Braintrust es una suite de regresión con puntaje para sistemas no deterministas — la disciplina de una suite de pruebas unitarias, salvo que las aserciones son evaluadores en lugar de comparaciones de igualdad, y la calificación la hace un juez LLM, un scorer en código o un revisor humano.
Qué estás comprando en realidad
Tres piezas hacen el trabajo, y la mayoría de los equipos solo necesitan las dos primeras el primer día.
Tracing hacia Brainstore. Braintrust escribió su propio almacén para datos de trazas en vez de meter los spans en un backend de observabilidad de propósito general, y la razón se nota cuando filtras algunos millones de trazas por un campo de texto. Ingiere OpenTelemetry — el BraintrustSpanProcessor se acopla a un tracer provider existente con un filtro para que solo se envíen los spans de IA, e implementa las convenciones semánticas GenAI de OTel. Los SDK cubren Python, TypeScript, Go, Ruby, C# y Java. El AI proxy pone a OpenAI, Anthropic, Google y los modelos de pesos abiertos detrás de un solo endpoint.
Loop. La parte que más cambió durante 2026 y la que hay que evaluar con más rigor. Loop es un agente apuntado a tus propios datos de trazas: describe una falla en prosa y lee las trazas, propone un dataset con los casos que la exhiben y redacta un scorer. En septiembre de 2026 pasó a un runtime gestionado con hilos persistentes y alcance a todo el proyecto, y ganó automatizaciones programadas que corren con sus propias instrucciones y con permisos de escritura. Patterns y Debugger salieron junto con él: el primero busca fallas recurrentes que ningún scorer mide todavía, el segundo reporta los modos de falla probables de una sola traza con su evidencia.
Revisión humana. Colas de anotación con asignación y notificación por Slack, más revisiones ciegas que ocultan los puntajes de los demás hasta que el revisor termina el suyo — lo cual importa más de lo que parece, porque las estadísticas de concordancia ancladas en la respuesta visible de un colega no son estadísticas de concordancia.
Precios
Publicados en braintrust.dev/pricing, verificados el 2026-09-20. El hecho estructural que define la mayoría de las evaluaciones: todos los planes tienen usuarios ilimitados. Se te mide por datos procesados y scores ejecutados, nunca por asientos.
- Starter — $0/mes. $10 en créditos de modelo, 1 GB de datos procesados y luego $4/GB, 10k scores y luego $2.50 por cada 1k, retención de 14 días. Usuarios, proyectos, datasets, playgrounds y experimentos ilimitados. No pide tarjeta.
- Pro — $249/mes. $100 en créditos, 5 GB y luego $3/GB, 50k scores y luego $1.50 por cada 1k, retención de 30 días con retención más larga a $0.50/GB/mes — extendida a 180 días en julio de 2026. Suma gráficos personalizados, entornos, RBAC y soporte prioritario.
- Enterprise — a medida. Retención y exportación a medida, soporte premium y despliegue self-hosted o en tu propia nube.
Compara la forma con LangSmith, que publica $39 por asiento al mes en Plus con 10k trazas base incluidas y pago por uso por encima. En un equipo de 12 personas eso son $468/mes en asientos antes de guardar una sola traza; esas mismas 12 personas no cuestan nada en Braintrust y la factura es puro volumen. Se invierte con poca gente y mucho tráfico: dos personas empujando volumen de producción pesado pagarán más en Braintrust que dos asientos de LangSmith. Modela la proporción entre personas y trazas antes de asumir que no cobrar por asiento sale más barato.
Ideal para
Un equipo de ingeniería u ops que ya puso una función de IA en producción, tiene una queja de calidad que no logra cuantificar y tiene más revisores que ingenieros. La cantidad de revisores es la señal: los expertos de dominio — la CSM que sabe cómo se ve una buena respuesta de soporte, la paralegal que reconoce un mal resumen de cláusula — necesitan cuentas para etiquetar, y en una plataforma por asiento cada uno de ellos es una línea en la factura. Braintrust cotiza bien a ese equipo, y nada en él asume un framework, así que un stack que no sea LangChain no cuesta trabajo extra de integración.
No es para
Equipos que todavía no salieron a producción. Sin tráfico productivo no hay trazas, y una plataforma de evals sin trazas es una hoja de cálculo con peor editor — escribe 20 casos de prueba a mano y córrelos en un script hasta que haya uso real. Tampoco para equipos cuya necesidad real es monitoreo clásico de modelos sobre ML tabular: drift, feature skew y PSI son territorio de Arize y W&B. Y no para una organización cuya revisión de seguridad no acepte que un tercero custodie credenciales de proveedores de modelos — lee la primera advertencia antes de empezar esa compra.
Frente a las alternativas
- LangSmith — la opción por defecto si ya construyes sobre LangChain o LangGraph, porque ahí el tracing no cuesta trabajo de integración y los productos de despliegue quedan al lado. Elígelo cuando el framework es LangChain y el equipo es chico. Elige Braintrust cuando el equipo es agnóstico al framework, o cuando la cantidad de revisores vuelve dominante el costo por asiento.
- Langfuse — la opción open source y el entrante que más rápido crece en el segmento. El repositorio central tiene licencia MIT y el self-hosting es gratis, que es la respuesta cuando la residencia de datos no se negocia o cuando el volumen es tan alto que cualquier proveedor medido pierde por aritmética. Elige Langfuse cuando tienes un equipo de plataforma dispuesto a operarlo. Elige Braintrust cuando no lo tienes, y en particular cuando el ciclo de investigación de Loop es la función que quieres — esa es la brecha de capacidad más clara entre los dos.
- Arize Phoenix — open source y nativo de OpenTelemetry, y la elección para equipos que ya corren Arize sobre ML tradicional y quieren un solo proveedor para ambos. Encaja peor cuando el trabajo diario es desarrollar jueces LLM.
- Weights & Biases Weave — elígelo cuando el mismo equipo hace fine-tuning de modelos y ya vive en W&B para seguimiento de experimentos.
Si ninguno encaja, el plan B honesto es un directorio de casos de prueba versionado y un job de CI que los puntúe con una función que escribiste tú. Eso es a grandes rasgos lo que Braintrust automatiza, no cuesta nada, y para una sola función con 50 casos de prueba compite.
Advertencias
- Un atacante llegó a una cuenta AWS de Braintrust en mayo de 2026 y probablemente quedaron expuestas claves de proveedores de IA a nivel organización. Braintrust detectó la actividad el 2026-05-04, notificó a los clientes el 05-05, lo divulgó públicamente el 05-06 y le dijo a todo el mundo que rotara las claves de proveedor a nivel organización. Se confirmó un cliente afectado; otros tres reportaron picos inexplicados de uso de proveedores. La divulgación fue rápida y directa, que es el comportamiento correcto — el punto es la clase de exposición. Resguardo: la documentación de self-hosting indica que los secretos de proveedor a nivel proyecto se quedan en tu data plane mientras que los secretos a nivel organización se quedan en el control plane de Braintrust, así que configura las claves por proyecto y no por organización, acótalas a una cuenta de proveedor con tope de gasto y ponles vencimiento — el vencimiento de claves y un control que impide a los miembros crear claves nuevas salieron ambos en julio de 2026. Haz esto el primer día, no después del segundo incidente.
- Dos medidores independientes y un reloj de retención vuelven difícil de proyectar la factura. Datos procesados y scores ejecutados se facturan por separado, y cada scorer online que habilitas multiplica el segundo contra el tráfico de producción: cuatro jueces LLM con muestreo completo cuadruplican el volumen de scores sin que cambie una línea de código de la aplicación. Resguardo: arranca el scoring online sobre un porcentaje muestreado, pon en revisión recurrente el desglose de uso por proyecto que salió en septiembre de 2026, y exporta lo que necesites más allá de 30 días antes de que la retención se lo lleve.
- Las automatizaciones de Loop tienen permisos de escritura. Las corridas programadas que crean y actualizan objetos con sus propias instrucciones son cómodas, y también son un agente editando tu infraestructura de scoring sin supervisión. Si un scorer cambia en silencio, todos los experimentos posteriores se miden con otra vara. Resguardo: mantén el historial de versiones anotado en scorers y prompts para que cada guardado lleve una descripción, revisa los cambios hechos por automatizaciones con la misma cadencia que una revisión de código, y pausa las automatizaciones durante un incidente — pausar y reanudar salió en agosto de 2026 justamente para que la configuración sobreviva a eso.
- Dos rivales open source creíbles aceptan el mismo formato de datos que ya estás enviando. Langfuse y Phoenix tienen licencias permisivas y ambos ingieren OpenTelemetry, así que el costo de cambiar es cualquier llamada de SDK específica de Braintrust que hayas escrito. Resguardo: instrumenta con spans OTel neutrales al proveedor siempre que el SDK te dé la opción, y prueba una exportación completa de trazas durante el trial. La portabilidad es real solo si la construiste.