Qué es
Reducto es una API de parsing y extracción de documentos para equipos cuyo workflow de AI falla en el documento y no en el modelo. Adit Abraham y Raunak Chowdhuri lo fundaron saliendo de Y Combinator, después de construir sistemas de memoria de largo plazo para LLM y concluir que la pieza sin resolver era convertir PDF desordenados en datos estructurados sobre los que un agente pueda actuar. Reducto lee el layout, el formato y la estructura como señales de significado en lugar de aplanar la página en un bloque de texto: un redline en un contrato, una dosis escrita a mano, una tabla que se extiende por tres páginas de un reporte regulatorio.
El producto son seis endpoints, no una ventana de chat. Parse convierte un documento en JSON estructurado con chunking consciente del layout, Extract extrae campos nombrados hacia un esquema que tú defines, Split segmenta con reglas en lenguaje natural, Classify enruta por tipo de documento, Pipelines encadena los pasos, y Edit escribe cambios de vuelta en PDF y DOCX, lo que Reducto llama una de las primeras APIs de edición de documentos y es la parte que los competidores no tienen. Debajo está r-1, un modelo de página completa de una sola pasada que maneja texto, tablas, figuras y formato en conjunto en vez de coser la salida de OCR a un detector de layout aparte. Hay SDK de Python, Node y Go, una API REST, un CLI, un servidor MCP y Studio, un espacio visual para probar un pipeline antes de cablearlo en código.
a16z lideró una Serie B de $75M anunciada el 14 de octubre de 2025, llevando el financiamiento total a $108M con participación de Benchmark, First Round Capital, BoxGroup y Y Combinator, seis meses después de una Serie A de $24.5M. Reducto reportó más de 1,000 millones de páginas procesadas y un aumento de 6x en volumen mensual entre ambas rondas, y nombra a Harvey, Mercor y Rogo como clientes. Hizo su primera adquisición el 7 de mayo de 2026, absorbiendo al equipo detrás del cuaderno de estudio con AI Opennote.
Por qué aparece en los stacks de ops
Porque el cuello de botella está antes del prompt. Un asistente de revisión de contratos que se salta una cláusula tachada, un pipeline de facturas que lee una celda combinada en la columna equivocada, un ATS que destroza un CV a dos columnas: nada de eso se arregla con un modelo mejor, y cada hora gastada en ajustar el prompt se gasta en la capa equivocada. Reducto es el argumento de que la extracción se compra en lugar de mantenerse.
Para legal-ops eso es la capa documental debajo de Ironclad o Spellbook, donde el material de origen son copias firmadas escaneadas y no plantillas limpias. Para RevOps son las órdenes de compra, los MSA firmados y los anexos de precios que nunca llegan al CRM. Para recruiting es el parsing de currículums, el eslabón más débil de todo ATS durante una década.
El despliegue es la otra razón por la que pasa la revisión de seguridad: SaaS, VPC híbrida, VPC completa u on-prem aislado, con SOC 2 Type II, un BAA de HIPAA, AES-256 en reposo, TLS 1.2+ en tránsito, residencia de datos en la UE y borrado de documentos a las 24 horas.
Un caso de uso que justifica la compra
El trabajo de extracción contractual que atasca a los equipos legales in-house: varios miles de acuerdos firmados, la mitad escaneados, y la necesidad de sacar ley aplicable, fechas de renovación, términos de cesión y topes de responsabilidad hacia una tabla auditable. Classify enruta por tipo de acuerdo, Split aísla los anexos, Parse produce JSON consciente del layout, Extract llena el esquema. Cada campo se rastrea hasta una coordenada de página, que es lo que hace defendible el resultado donde un modelo general resumiendo un PDF no lo es.
Precios
El precio es por endpoint y por página, vigente desde el 1 de septiembre de 2026, sin licencia por asiento. Parse va de $10 a $30 por cada 1,000 páginas según complejidad, Extract y Split de $20 a $40, Classify de $7.50 a $15, y Edit $60 por cada 1,000 páginas o $15 por cada 1,000 prellenadas. Las hojas de cálculo se miden por celda, y los trabajos en lote tienen 20% de descuento. Standard arranca con $150 de uso gratis, que son 15,000 páginas de Parse a tarifa de lista.
La cifra titular de un centavo por página es el piso, no la factura. Un piloto solo de Parse con 100,000 páginas al mes cuesta $1,000 al mes. Un pipeline de producción de cuatro pasos (classify, split, parse, extract) cobra los cuatro medidores contra la misma página, así que 250,000 páginas al mes aterrizan cerca de $14,400 al mes a tarifa de lista, o unos $173K al año antes de descuentos por volumen. Esa es la banda contra la que hay que presupuestar.
Growth y Enterprise son solo por cotización. Growth agrega descuentos por volumen, residencia de datos y asientos ilimitados en Studio; Enterprise agrega VPC y on-prem, SLA a medida, SSO/SAML y RBAC. La concurrencia es la otra reja entre tiers: 200 páginas en Standard, 350 en Growth, 500+ en Enterprise. Un programa para startups da créditos gratis y tarifas Growth con descuento a equipos por debajo de $15M levantados, $3M de ingresos y 50 empleados.
Mejor para
Líderes de legal-ops y finance-ops con un workflow de AI ya construido, ya estancado en calidad de extracción, quemando tiempo de ingeniería en ajustar prompts de un modelo general contra documentos que nunca iba a leer bien. La economía funciona por encima de unas 50,000 páginas al mes, con documentos genuinamente difíciles: escaneos, tablas densas, layouts a varias columnas, escritura a mano.
No lo compres para formularios limpios, uniformes y generados por máquina: si cada documento es la misma plantilla digital de factura, un servicio de OCR de hyperscaler hace el trabajo por una fracción del costo. Tampoco lo compres como aplicación de usuario final. Reducto entrega APIs y un espacio de construcción; alguien de tu equipo escribe la integración. Si nadie va a ser dueño de ese código, compra un producto de workflow con la extracción adentro.
Alternativas, y cuándo elegirlas
- Azure AI Document Intelligence: el titular por base instalada, y el default cuando la empresa ya tiene un compromiso con Azure. Elígelo cuando los documentos son formularios estándar, facturas e identificaciones, y procurement pesa más que la fidelidad en tablas. El propio RD-TableBench de Reducto pone a Azure en 82.7% frente al 90.2% de Reducto en 1,000 tablas complejas; ese benchmark lo corre el proveedor, así que trata el ranking como una hipótesis a probar.
- AWS Textract: el otro titular, y la elección correcta para un pipeline nativo de AWS que alimenta Bedrock. Ojo: Textract no es la opción barata que se supone que es, la extracción de formularios y tablas cuesta cerca de $0.065 por página, por encima de la tarifa de lista de Parse de Reducto. Sacó 80.9% en el mismo benchmark de tablas corrido por el proveedor.
- Mistral OCR: el entrante de crecimiento más rápido, y el piso de precio. OCR 4 salió el 23 de junio de 2026 a $4 por cada 1,000 páginas ($2 en lote) con bounding boxes a nivel de párrafo, puntajes de confianza y 170 idiomas; OCR 3 se queda en $2 por cada 1,000 ($1 en lote). Elígelo cuando necesitas texto y layout a granel al menor costo unitario y la fidelidad en tablas complejas no es la restricción que manda. Con 1M de páginas al mes la brecha contra un pipeline completo de Reducto es de cinco cifras mensuales.
Advertencias
- La brecha de precisión que estás comprando la midió el proveedor. RD-TableBench es el benchmark propio de Reducto sobre el conjunto de tablas propio de Reducto. Guardia: antes de firmar, corre una evaluación de 200 documentos sobre tus archivos reales más feos contra ground truth etiquetado a mano, calificando los mismos campos que vas a extraer en producción. El tier gratuito de $150 cubre 15,000 páginas de Parse, más que suficiente, y si la ventaja no sobrevive a tus propios documentos, aprendiste lo que importa.
- Cuatro endpoints sobre una página significan cuatro medidores. La tarifa de un centavo por página de Parse es el número que se cita internamente; un pipeline de classify-split-parse-extract queda más cerca de $0.058 por página, una diferencia de 5.8x sobre el mismo documento. Guardia: costea el pipeline completo por página antes del piloto, configura alertas por umbral de dólares en Studio, y manda la API de exportación de uso hacia lo que sea que monitorea tu gasto en nube.
- Todo lo que pide la revisión de seguridad vive en Enterprise. SSO/SAML, RBAC, SLA a medida, VPC y on-prem están todos por encima de la línea de Growth, y los términos de retención cero más el BAA de HIPAA son de Growth para arriba. Guardia: si hay material privilegiado o regulado en juego, cotiza Enterprise desde la primera llamada y deja los términos de retención en el contrato. El tier Standard es para prototipar, no para mandar documentos de clientes.
- Una empresa de dos años ahora sostiene una capa de la que depende tu workflow productivo. Reducto es adquirente y no objetivo de adquisición, lo que baja el riesgo de corto plazo, pero la concentración es real. Guardia: mantén la llamada de extracción detrás de tu propia interfaz para que un cambio a Azure, Textract o Mistral sea un cambio de configuración, y archiva los documentos fuente en crudo, no solo el JSON parseado.