ooligo

Reducto

document-intelligence document-parsing · ocr · data-extraction
AI-NATIVE MCP API
Legal OpsRevOpsRecrutamento e TA
8.0 /10

O que é

Reducto é uma API de parsing e extração de documentos para times cujo workflow de AI quebra no documento, não no modelo. Adit Abraham e Raunak Chowdhuri fundaram a empresa saindo do Y Combinator, depois de construir sistemas de memória de longo prazo para LLM e concluir que a peça não resolvida era transformar PDFs bagunçados em dados estruturados sobre os quais um agente consiga agir. Reducto lê layout, formato e estrutura como sinais de significado em vez de achatar a página num bloco de texto: um redline em um contrato, uma dosagem escrita à mão, uma tabela que atravessa três páginas de um relatório regulatório.

O produto são seis endpoints, não uma janela de chat. Parse converte um documento em JSON estruturado com chunking consciente do layout, Extract puxa campos nomeados para um schema que você define, Split segmenta por regras em linguagem natural, Classify roteia por tipo de documento, Pipelines encadeia os passos, e Edit escreve alterações de volta em PDF e DOCX, o que a Reducto chama de uma das primeiras APIs de edição de documentos e é a parte que os concorrentes não têm. Por baixo está o r-1, um modelo de página inteira de passada única que trata texto, tabelas, figuras e formatação juntos em vez de costurar a saída do OCR a um detector de layout separado. Há SDKs de Python, Node e Go, uma API REST, um CLI, um servidor MCP e o Studio, um espaço visual para testar um pipeline antes de cablear no código.

A a16z liderou um Series B de $75M anunciado em 14 de outubro de 2025, levando o funding total a $108M com participação de Benchmark, First Round Capital, BoxGroup e Y Combinator, seis meses depois de um Series A de $24,5M. A Reducto reportou mais de 1 bilhão de páginas processadas e um aumento de 6x no volume mensal entre as duas rodadas, e cita Harvey, Mercor e Rogo como clientes. Fez sua primeira aquisição em 7 de maio de 2026, absorvendo o time por trás do caderno de estudos com AI Opennote.

Por que aparece nos stacks de ops

Porque o gargalo está antes do prompt. Um assistente de revisão contratual que perde uma cláusula riscada, um pipeline de notas fiscais que lê uma célula mesclada na coluna errada, um ATS que destrói um currículo em duas colunas: nada disso se resolve com um modelo melhor, e cada hora gasta ajustando o prompt é gasta na camada errada. Reducto é o argumento de que extração se compra em vez de manter.

Para legal-ops isso é a camada documental embaixo de Ironclad ou Spellbook, onde o material de origem são cópias assinadas escaneadas e não templates limpos. Para RevOps são pedidos de compra, MSAs assinados e anexos de preço que nunca chegam ao CRM. Para recruiting é o parsing de currículos, o elo mais fraco de todo ATS por uma década.

O deploy é o outro motivo pelo qual ele passa na revisão de segurança: SaaS, VPC híbrida, VPC completa ou on-prem isolado, com SOC 2 Type II, um BAA de HIPAA, AES-256 em repouso, TLS 1.2+ em trânsito, residência de dados na UE e exclusão de documentos em 24 horas.

Um caso de uso que justifica a compra

O trabalho de extração contratual que trava os times jurídicos in-house: vários milhares de contratos assinados, metade escaneados, e a necessidade de puxar lei aplicável, datas de renovação, termos de cessão e tetos de responsabilidade para uma tabela auditável. Classify roteia por tipo de contrato, Split isola os anexos, Parse produz JSON consciente do layout, Extract preenche o schema. Cada campo é rastreável até uma coordenada de página, e é isso que torna o resultado defensável onde um modelo genérico resumindo um PDF não é.

Preços

O preço é por endpoint e por página, vigente desde 1 de setembro de 2026, sem licença por assento. Parse vai de $10 a $30 por 1.000 páginas conforme a complexidade, Extract e Split de $20 a $40, Classify de $7,50 a $15, e Edit $60 por 1.000 páginas ou $15 por 1.000 pré-preenchidas. Planilhas são medidas por célula, e jobs em lote têm 20% de desconto. O Standard começa com $150 de uso gratuito, que são 15.000 páginas de Parse na tarifa de tabela.

O número de manchete de um centavo por página é o piso, não a fatura. Um piloto só de Parse com 100.000 páginas por mês custa $1.000 por mês. Um pipeline de produção de quatro passos (classify, split, parse, extract) cobra os quatro medidores sobre a mesma página, então 250.000 páginas por mês chegam perto de $14.400 por mês na tabela, ou cerca de $173K por ano antes de descontos por volume. Essa é a faixa para orçar.

Growth e Enterprise são só sob cotação. Growth adiciona descontos por volume, residência de dados e assentos ilimitados no Studio; Enterprise adiciona VPC e on-prem, SLA customizado, SSO/SAML e RBAC. A concorrência de processamento é o outro portão entre tiers: 200 páginas no Standard, 350 no Growth, 500+ no Enterprise. Um programa para startups dá créditos gratuitos e tarifas Growth com desconto para times abaixo de $15M captados, $3M de receita e 50 funcionários.

Melhor para

Líderes de legal-ops e finance-ops com um workflow de AI já construído, já estagnado em qualidade de extração, queimando tempo de engenharia ajustando prompts de um modelo genérico contra documentos que ele nunca ia ler direito. A economia fecha acima de cerca de 50.000 páginas por mês, com documentos realmente difíceis: escaneados, tabelas densas, layouts de várias colunas, escrita à mão.

Não compre para formulários limpos, uniformes e gerados por máquina: se todo documento é o mesmo template digital de nota fiscal, um serviço de OCR de hyperscaler resolve por uma fração do custo. Também não compre como aplicação de usuário final. A Reducto entrega APIs e um espaço de construção; alguém do seu time escreve a integração. Se ninguém vai ser dono desse código, compre um produto de workflow com a extração dentro.

Alternativas, e quando escolher cada uma

  • Azure AI Document Intelligence: o incumbente por base instalada, e o default quando a empresa já tem compromisso com a Azure. Escolha quando os documentos são formulários padrão, notas fiscais e documentos de identidade, e procurement pesa mais que fidelidade em tabelas. O próprio RD-TableBench da Reducto coloca a Azure em 82,7% contra 90,2% da Reducto em 1.000 tabelas complexas; esse benchmark é rodado pelo fornecedor, então trate o ranking como hipótese a testar.
  • AWS Textract: o outro incumbente, e a escolha certa para um pipeline nativo de AWS alimentando o Bedrock. Atenção: o Textract não é a opção barata que se supõe, a extração de formulários e tabelas sai por cerca de $0,065 por página, acima da tarifa de tabela do Parse da Reducto. Tirou 80,9% no mesmo benchmark de tabelas rodado pelo fornecedor.
  • Mistral OCR: o entrante que mais cresce, e o piso de preço. O OCR 4 saiu em 23 de junho de 2026 a $4 por 1.000 páginas ($2 em lote) com bounding boxes por parágrafo, scores de confiança e 170 idiomas; o OCR 3 fica em $2 por 1.000 ($1 em lote). Escolha quando você precisa de texto e layout em volume pelo menor custo unitário e a fidelidade em tabelas complexas não é a restrição que manda. Com 1M de páginas por mês a diferença contra um pipeline completo da Reducto é de cinco dígitos por mês.

Pontos de atenção

  • A diferença de acurácia que você está comprando foi medida pelo fornecedor. RD-TableBench é o benchmark próprio da Reducto sobre o conjunto de tabelas próprio da Reducto. Proteção: antes de assinar, rode uma avaliação de 200 documentos nos seus arquivos reais mais feios contra ground truth rotulado à mão, pontuando os mesmos campos que você vai extrair em produção. O tier gratuito de $150 cobre 15.000 páginas de Parse, mais que suficiente, e se a vantagem não sobreviver aos seus próprios documentos, você aprendeu o que importa.
  • Quatro endpoints sobre uma página significam quatro medidores. A tarifa de um centavo por página do Parse é o número que circula internamente; um pipeline de classify-split-parse-extract fica mais perto de $0,058 por página, uma diferença de 5,8x sobre o mesmo documento. Proteção: custeie o pipeline inteiro por página antes do piloto, configure alertas por limite de dólares no Studio, e jogue a API de exportação de uso para dentro do que já monitora seu gasto de nuvem.
  • Tudo o que a revisão de segurança pede mora no Enterprise. SSO/SAML, RBAC, SLA customizado, VPC e on-prem estão todos acima da linha do Growth, e os termos de retenção zero mais o BAA de HIPAA são de Growth para cima. Proteção: se houver material privilegiado ou regulado no escopo, cote Enterprise já na primeira call e deixe os termos de retenção no contrato. O tier Standard é para prototipar, não para mandar documentos de cliente.
  • Uma empresa de dois anos agora sustenta uma camada da qual seu workflow de produção depende. A Reducto é adquirente e não alvo de aquisição, o que reduz o risco de curto prazo, mas a concentração é real. Proteção: mantenha a chamada de extração atrás da sua própria interface para que uma troca por Azure, Textract ou Mistral seja mudança de configuração, e arquive os documentos-fonte brutos, não só o JSON parseado.