ooligo
TIPO · definition

Modelo de AI vertical vs wrapper de GPT

Por Marius Bughiu Última actualización 2026-08-10 RevOpsLegal OpsReclutamiento y TA

No, por sí solo no — y la pregunta apunta al lugar equivocado. Que un proveedor entrene su propio modelo es un dato sobre su estructura de costos, su latencia y dónde puede desplegar, no un predictor de si el resultado alcanza tu estándar. Un “modelo de AI vertical” significa que el proveedor modificó los pesos con datos del dominio. Un “wrapper de GPT” significa que no lo hizo y, en su lugar, construyó prompts, retrieval, herramientas y un producto alrededor de la API de otro. Ambas descripciones cubren productos que funcionan y productos que no.

No es un nivel de calidad y, por sí sola, tampoco es una ventaja defendible. Los pesos propios no certifican la precisión, y una llamada a una API no la condena. La pregunta de compra es más estrecha: qué posee este proveedor que un competidor con la misma API key no pueda reconstruir en un trimestre — y esa respuesta, ¿sobrevive al próximo lanzamiento de un modelo frontier?

Cuatro cosas distintas que los proveedores llaman “nuestro propio modelo”

La frase cubre una escalera con unas 1000x de diferencia entre peldaños en costo y defensibilidad.

  1. Ingeniería de prompts y contexto. System prompts, definiciones de herramientas, esquemas de salida, estrategia de chunking. Esto es un wrapper, y llamarlo modelo es marketing. También es de donde proviene la mayor parte de la diferencia de calidad observable entre dos productos montados sobre el mismo modelo base.
  2. Retrieval y embeddings propios. El proveedor entrena la capa de búsqueda, no el generador. Harvey trabajó con Voyage AI en voyage-law-2-harvey, un modelo de embeddings ajustado sobre más de 20 mil millones de tokens de texto jurídico estadounidense, con una reducción reportada del 25% en resultados de búsqueda irrelevantes frente a embeddings estándar.
  3. Post-entrenamiento sobre datos propios de la tarea. Fine-tuning supervisado o por refuerzo sobre un modelo base. Esto es lo que en 2026 es realmente casi todo “modelo construido a medida” en software de ops.
  4. Pre-entrenamiento desde cero. Un modelo base nuevo. Casi nadie en software de ops lo hace, y el único intento famoso explica por qué.

La lección de BloombergGPT

Bloomberg pre-entrenó un modelo financiero de 50 mil millones de parámetros sobre su propio corpus y lo publicó en marzo de 2023. Superó a modelos abiertos de tamaño comparable — GPT-NeoX, OPT, BLOOM — en tareas de NLP financiero. Después GPT-4, sin acceso a ningún dato de Bloomberg, lo superó: evaluaciones independientes posteriores al lanzamiento de GPT-4 reportaron 68,79% frente a 43% en FinQA zero-shot, 76% frente a 43% en ConvFinQA, y un F1 de 83% frente a 61% en reconocimiento de entidades nombradas FIN3.

La lectura generalizable no es “los modelos de dominio pierden”. Es que un modelo de tamaño medio pre-entrenado con datos de dominio gana en su propia categoría de peso y pierde contra el siguiente lanzamiento frontier, y los lanzamientos frontier llegan más rápido de lo que se amortiza una corrida de pre-entrenamiento. Cualquier proveedor que te venda el tamaño de su corpus propietario está describiendo una posición que se vuelve a disputar cada pocos meses.

Harvey recorrió la escalera entera en tres años

Harvey es el caso más claro porque ha ocupado todas las posiciones de este debate:

  • 2023 — ajustó un modelo de jurisprudencia con OpenAI tras concluir que el fine-tuning vía API pública y el RAG simple no bastaban. En pruebas ciegas, los abogados prefirieron el modelo ajustado sobre GPT-4 el 97% de las veces.
  • Mayo de 2025 — sumó modelos de Anthropic y Google, terminando con la dependencia exclusiva de OpenAI. Las razones que declaró Harvey merecen leerse como comprador: enrutamiento por tarea porque ningún modelo lidera en todo, redundancia para que una caída o un límite de capacidad de un proveedor redirija en lugar de fallar, y elección de modelo a nivel de administrador por workspace.
  • 18 de junio de 2026 — anunció su propia serie de modelos legales: modelos open-source post-entrenados, construidos con Baseten, Fireworks AI, Applied Compute, Trajectory Labs y Nvidia, con un rendimiento reportado cercano al de los modelos frontier. El cofundador Gabe Pereyra planteó el objetivo como capacidad de nivel frontier en todo el producto a un precio asequible y con una postura de seguridad sólida.

Lee bien la última. El motor declarado es precio y postura de despliegue, no una brecha de capacidad que el modelo general no pudiera cerrar. Esa es la versión honesta del argumento del modelo vertical, y es un argumento distinto del que la mayoría de los proveedores le presenta a los compradores.

Los números que deciden

Resultados del Legal Agent Benchmark de Harvey publicados con Fireworks, sobre un subconjunto de 100 tareas bajo un estándar estricto de aprobación total, donde deben satisfacerse todos los criterios:

ConfiguraciónAprobación totalCosto
Claude Opus 4.7 (línea base frontier cerrada)14/100$954
GLM 5.1 (modelo abierto, solo)12/100$121
Kimi K2.6 con fine-tuning supervisado15/100$84
GLM 5.1 como worker + Opus 4.7 como advisor18/100$368

En la métrica más blanda de puntaje medio, las cuatro configuraciones casi convergen — GLM 5.1 en 0,8921, GPT-5.5 en 0,892, Opus 4.7 en 0,911. De esa tabla salen tres cosas. El post-entrenamiento de dominio compró una reducción de costo de aproximadamente 8x con paridad casi total en puntaje medio. El híbrido superó al modelo frontier en aprobación total a cerca del 39% de su costo. Y ninguna configuración completa más de 20 de 100 tareas de punta a punta, lo que te dice que la categoría está lejos de estar resuelta y que el marketing basado en puntaje medio lo oculta.

Lo que un proveedor posee y tú no puedes copiar

Pon esto por encima de los pesos al evaluar:

  • Derechos sobre los datos. La posición de Gong se apoya en decenas de miles de millones de interacciones de ventas capturadas sobre las que tiene derechos contractuales, y afirma 3x la precisión de los sistemas estándar en sus trackers entrenados. Eightfold se apoya en 1.600 millones de perfiles de carrera y 1,6 millones de habilidades inferidas. Ninguno se reproduce con una API key.
  • Infraestructura de evaluación. Harvey construyó y publicó BigLaw Bench y el Legal Agent Benchmark con Snorkel AI. Un proveedor que no puede decirte cómo sabe que un cambio de modelo ayudó está vendiendo intuiciones.
  • Workflow, permisos y superficie de auditoría. Aquello en lo que viven tus administradores, y que ningún lanzamiento de modelo invalida.

Preguntas diagnósticas para el proveedor

  1. ¿Qué modelo ejecuta esta función hoy y cuál la ejecutaba hace seis meses? Si no hay respuesta, la deriva de versiones no está controlada y tu línea base de precisión no es reproducible.
  2. Muestren una tarea donde su modelo supere al modelo frontier al que tienen acceso — y luego déjennos repetirla con nuestros documentos. Los benchmarks del proveedor sobre datos del proveedor son un punto de partida, no evidencia.
  3. ¿Nuestros datos están en su conjunto de entrenamiento y cuál es la opción de retención cero? “Conjunto de datos propietario” a veces significa tus inputs.
  4. ¿Qué pasa cuando su proveedor discontinúa un modelo? La justificación multi-modelo de Harvey nombra directamente las caídas y los límites de capacidad; los proveedores de un solo modelo cargan ese riesgo por ti.
  5. ¿Cuál es el costo por tarea completada a nuestro volumen? La tabla de arriba es la razón — el mismo resultado tiene una dispersión de precio de 11x según la arquitectura.
  6. ¿Aprobación total o puntaje medio? Exige el número a nivel de criterio. El puntaje medio es donde se esconde el crédito parcial.

Puntos de alerta, cada uno con su resguardo

“Modelo construido a medida” que es un system prompt. La afirmación no cuesta nada. Resguardo: pide por escrito qué peldaño de la escalera anterior aplica — prompt, embeddings, post-entrenamiento o pre-entrenamiento — y lleva esa respuesta a la descripción del producto en el contrato.

Un fine-tune congelado sobre una base en movimiento. Un modelo post-entrenado sobre una base de 2024 se degrada en términos relativos con cada lanzamiento frontier. Resguardo: pide la cadencia de reentrenamiento y la fecha del checkpoint actual, y conviértelo en una pregunta de renovación.

Afirmaciones de modelo propio usadas como lock-in. Si los resultados solo existen dentro de su modelo, el costo de migración es el producto. Resguardo: exige exportación masiva de los resultados más la evidencia de origen en un formato que puedas reingerir.

Comprar el relato del corpus en lugar del corpus. Los proveedores citan el tamaño del conjunto de datos sin decir si tienen derechos para entrenar sobre él. Resguardo: pide la base legal de los derechos sobre los datos, no el número de filas.

Confundir grounding con entrenamiento. La mayoría de los problemas de precisión en legal y GTM son fallas de retrieval, no de pesos. Resguardo: revisa fundamentación vs alucinación en AI legal y RAG antes de aceptar “entrenamos nuestro propio modelo” como respuesta sobre precisión.

Cuándo sí importa

Importa cuando tienes una restricción de despliegue que la API no puede satisfacer: residencia de datos en una jurisdicción que el proveedor no cubre, una instalación aislada o soberana, un piso de latencia para una superficie en tiempo real, o un volumen lo bastante alto como para que una diferencia de 8x en costo unitario sea una línea del presupuesto. En esos casos, un proveedor que controla sus propios pesos tiene opciones que un wrapper no tiene, y debes pedirlas explícitamente.

No importa para un equipo de 40 personas que elige una herramienta de revisión de contratos o de conversation intelligence. Corre la herramienta sobre tus últimos 20 documentos o llamadas, califica el resultado contra lo que tu equipo habría producido y compra con base en eso. Los pesos son el problema de ingeniería del proveedor. Para el patrón más amplio de separar un agente de un paquete de funciones, ve qué hace que una AI sea un agente para ops.