ooligo

Reducto

document-intelligence document-parsing · ocr · data-extraction
AI-NATIVE MCP API
Legal OpsRevOpsRecruiting & TA
8.0 /10

Ce que c’est

Reducto est une API de parsing et d’extraction de documents pour les équipes dont le workflow AI échoue sur le document et non sur le modèle. Adit Abraham et Raunak Chowdhuri l’ont fondée en sortant de Y Combinator, après avoir construit des systèmes de mémoire longue pour LLM et conclu que la pièce non résolue consistait à transformer des PDF désordonnés en données structurées sur lesquelles un agent peut agir. Reducto lit la mise en page, le format et la structure comme des signaux de sens au lieu d’aplatir la page en un bloc de texte : un redline dans un contrat, une posologie manuscrite, un tableau qui court sur trois pages d’un rapport réglementaire.

Le produit tient en six endpoints, pas en une fenêtre de chat. Parse convertit un document en JSON structuré avec un chunking sensible à la mise en page, Extract tire des champs nommés vers un schéma que vous définissez, Split segmente selon des règles en langage naturel, Classify route par type de document, Pipelines enchaîne les étapes, et Edit réécrit les modifications dans le PDF et le DOCX, ce que Reducto présente comme l’une des premières API d’édition de documents et qui est la partie que les concurrents n’ont pas. En dessous se trouve r-1, un modèle pleine page en une seule passe qui traite le texte, les tableaux, les figures et la mise en forme ensemble au lieu de coudre la sortie OCR à un détecteur de mise en page séparé. Il existe des SDK Python, Node et Go, une API REST, un CLI, un serveur MCP et Studio, un espace visuel pour tester un pipeline avant de le câbler dans le code.

a16z a mené une Série B de 75 M$ annoncée le 14 octobre 2025, portant le financement total à 108 M$ avec la participation de Benchmark, First Round Capital, BoxGroup et Y Combinator, six mois après une Série A de 24,5 M$. Reducto a déclaré plus de 1 milliard de pages traitées et une hausse de 6x du volume mensuel entre les deux tours, et cite Harvey, Mercor et Rogo comme clients. L’entreprise a réalisé sa première acquisition le 7 mai 2026, en absorbant l’équipe derrière le carnet d’étude AI Opennote.

Pourquoi il apparaît dans les stacks ops

Parce que le goulot d’étranglement se situe en amont du prompt. Un assistant de revue contractuelle qui rate une clause barrée, un pipeline de factures qui lit une cellule fusionnée dans la mauvaise colonne, un ATS qui massacre un CV sur deux colonnes : rien de tout cela ne se répare avec un meilleur modèle, et chaque heure passée à ajuster le prompt est passée sur la mauvaise couche. Reducto est l’argument selon lequel l’extraction s’achète au lieu de s’entretenir.

Pour le Legal Ops, c’est la couche documentaire sous Ironclad ou Spellbook, là où la matière première est faite de copies signées scannées et non de modèles propres. Pour le RevOps, ce sont les bons de commande, les MSA signés et les annexes tarifaires qui n’arrivent jamais dans le CRM. Pour le recruiting, c’est le parsing de CV, le maillon le plus faible de tout ATS depuis une décennie.

Le déploiement est l’autre raison pour laquelle il passe la revue de sécurité : SaaS, VPC hybride, VPC complet ou on-prem isolé, avec SOC 2 Type II, un BAA HIPAA, AES-256 au repos, TLS 1.2+ en transit, résidence des données dans l’UE et suppression des documents sous 24 heures.

Un cas d’usage qui justifie l’achat

Le chantier d’extraction contractuelle sur lequel butent les directions juridiques internes : plusieurs milliers d’accords signés, la moitié scannés, et l’obligation de sortir le droit applicable, les dates de renouvellement, les clauses de cession et les plafonds de responsabilité vers un tableau auditable. Classify route par type d’accord, Split isole les annexes, Parse produit un JSON sensible à la mise en page, Extract remplit le schéma. Chaque champ remonte à une coordonnée de page, et c’est ce qui rend le résultat défendable là où un modèle généraliste qui résume un PDF ne l’est pas.

Tarifs

Le prix se fait par endpoint et par page, en vigueur depuis le 1er septembre 2026, sans licence par siège. Parse va de 10 à 30 $ pour 1 000 pages selon la complexité, Extract et Split de 20 à 40 $, Classify de 7,50 à 15 $, et Edit 60 $ pour 1 000 pages ou 15 $ pour 1 000 pages pré-remplies. Les tableurs se comptent à la cellule, et les jobs en batch bénéficient de 20% de remise. Standard démarre avec 150 $ d’usage gratuit, soit 15 000 pages de Parse au tarif public.

Le centime par page affiché est le plancher, pas la facture. Un pilote Parse seul à 100 000 pages par mois coûte 1 000 $ par mois. Un pipeline de production en quatre étapes (classify, split, parse, extract) facture les quatre compteurs sur la même page, donc 250 000 pages par mois atterrissent autour de 14 400 $ par mois au tarif public, soit environ 173 k$ par an avant remises de volume. C’est la fourchette à budgéter.

Growth et Enterprise sont uniquement sur devis. Growth ajoute les remises de volume, la résidence des données et des sièges Studio illimités ; Enterprise ajoute le VPC et l’on-prem, un SLA sur mesure, le SSO/SAML et le RBAC. La concurrence de traitement est l’autre barrière entre paliers : 200 pages en Standard, 350 en Growth, 500+ en Enterprise. Un programme startup donne des crédits gratuits et des tarifs Growth remisés aux équipes sous 15 M$ levés, 3 M$ de revenus et 50 salariés.

Pour qui

Les responsables Legal Ops et Finance Ops qui ont déjà construit un workflow AI, qui plafonnent déjà sur la qualité d’extraction, et qui brûlent du temps d’ingénierie à ajuster les prompts d’un modèle généraliste face à des documents qu’il n’allait de toute façon jamais lire correctement. L’économie tient au-dessus d’environ 50 000 pages par mois, sur des documents réellement difficiles : scans, tableaux denses, mises en page multicolonnes, écriture manuscrite.

Ne l’achetez pas pour des formulaires propres, uniformes et générés par machine : si chaque document est le même modèle de facture numérique, un service OCR de hyperscaler fait le travail pour une fraction du coût. Ne l’achetez pas non plus comme application pour utilisateur final. Reducto livre des API et un espace de construction ; quelqu’un dans votre équipe écrit l’intégration. Si personne ne va porter ce code, achetez un produit de workflow avec l’extraction incluse.

Alternatives, et quand les préférer

  • Azure AI Document Intelligence : le sortant par base installée, et le choix par défaut quand l’entreprise est déjà engagée sur Azure. Prenez-le quand les documents sont des formulaires standard, des factures et des pièces d’identité, et que le service achats pèse plus que la fidélité sur les tableaux. Le RD-TableBench de Reducto place Azure à 82,7% contre 90,2% pour Reducto sur 1 000 tableaux complexes ; ce benchmark est exécuté par l’éditeur, traitez donc le classement comme une hypothèse à tester.
  • AWS Textract : l’autre sortant, et le bon choix pour un pipeline natif AWS qui alimente Bedrock. Attention : Textract n’est pas l’option bon marché qu’on suppose, l’extraction de formulaires et de tableaux revient à environ 0,065 $ la page, au-dessus du tarif public de Parse chez Reducto. Il obtient 80,9% sur le même benchmark de tableaux exécuté par l’éditeur.
  • Mistral OCR : l’entrant qui croît le plus vite, et le plancher de prix. OCR 4 est sorti le 23 juin 2026 à 4 $ pour 1 000 pages (2 $ en batch) avec des bounding boxes au niveau du paragraphe, des scores de confiance et 170 langues ; OCR 3 reste à 2 $ pour 1 000 (1 $ en batch). Prenez-le quand vous avez besoin de texte et de mise en page en volume au coût unitaire le plus bas et que la fidélité sur les tableaux complexes n’est pas la contrainte qui décide. À 1 M de pages par mois, l’écart avec un pipeline Reducto complet se chiffre à cinq chiffres par mois.

Points de vigilance

  • L’écart de précision que vous achetez est mesuré par l’éditeur. RD-TableBench est le benchmark maison de Reducto sur le jeu de tableaux maison de Reducto. Garde-fou : avant de signer, faites tourner une évaluation sur 200 documents parmi vos fichiers réels les plus laids, face à une vérité terrain annotée à la main, en notant exactement les champs que vous extrairez en production. Le palier gratuit à 150 $ couvre 15 000 pages de Parse, largement de quoi le faire, et si l’avance ne survit pas à vos propres documents, vous avez appris ce qui compte.
  • Quatre endpoints sur une page, cela fait quatre compteurs. Le tarif Parse au centime la page est le chiffre qui circule en interne ; un pipeline classify-split-parse-extract se situe plutôt à 0,058 $ la page, un facteur 5,8 sur le même document. Garde-fou : chiffrez le pipeline complet par page avant le pilote, posez des alertes par seuil en dollars dans Studio, et branchez l’API d’export d’usage sur ce qui surveille déjà vos dépenses cloud.
  • Tout ce que demande la revue de sécurité se trouve en Enterprise. SSO/SAML, RBAC, SLA sur mesure, VPC et on-prem sont tous au-dessus de la ligne Growth, et les clauses de rétention zéro ainsi que le BAA HIPAA sont accessibles à partir de Growth. Garde-fou : si du matériel couvert par le secret professionnel ou par une réglementation est en jeu, faites chiffrer Enterprise dès le premier échange et inscrivez les durées de conservation au contrat. Le palier Standard sert à prototyper, pas à envoyer des documents clients.
  • Une société de deux ans détient désormais une couche dont dépend votre workflow de production. Reducto est acquéreur et non cible, ce qui abaisse le risque à court terme, mais la concentration est réelle. Garde-fou : gardez l’appel d’extraction derrière votre propre interface pour qu’un basculement vers Azure, Textract ou Mistral reste un changement de configuration, et archivez les documents sources bruts, pas seulement le JSON parsé.