ooligo

Reducto

document-intelligence document-parsing · ocr · data-extraction
AI-NATIVE MCP API
Legal OpsRevOpsRecruiting & TA
8.0 /10

Was es ist

Reducto ist eine API für Dokument-Parsing und -Extraktion für Teams, deren AI-Workflow am Dokument scheitert und nicht am Modell. Adit Abraham und Raunak Chowdhuri gründeten das Unternehmen aus Y Combinator heraus, nachdem sie Langzeitgedächtnis-Systeme für LLM gebaut und festgestellt hatten, dass das ungelöste Stück darin besteht, unordentliche PDFs in strukturierte Daten zu verwandeln, auf denen ein Agent handeln kann. Reducto liest Layout, Format und Struktur als Bedeutungssignale, statt die Seite zu einem Textblock zu plätten: ein Redline im Vertrag, eine handschriftliche Dosierung, eine Tabelle, die sich über drei Seiten eines Geschäftsberichts zieht.

Das Produkt sind sechs Endpoints, kein Chatfenster. Parse wandelt ein Dokument in strukturiertes JSON mit layoutbewusstem Chunking, Extract zieht benannte Felder in ein Schema, das Sie definieren, Split segmentiert nach Regeln in natürlicher Sprache, Classify routet nach Dokumenttyp, Pipelines verkettet die Schritte, und Edit schreibt Änderungen zurück in PDF und DOCX. Letzteres nennt Reducto eine der ersten Dokument-Editier-APIs, und es ist der Teil, den die Wettbewerber nicht haben. Darunter liegt r-1, ein Ganzseitenmodell mit einem einzigen Durchlauf, das Text, Tabellen, Abbildungen und Formatierung zusammen behandelt, statt OCR-Ausgabe an einen separaten Layout-Detektor zu nähen. Es gibt SDKs für Python, Node und Go, eine REST-API, ein CLI, einen MCP-Server und Studio, einen visuellen Arbeitsbereich zum Testen einer Pipeline, bevor Sie sie in Code verdrahten.

a16z führte eine Series B über 75 Mio. $ an, angekündigt am 14. Oktober 2025, womit die Gesamtfinanzierung auf 108 Mio. $ stieg, mit Benchmark, First Round Capital, BoxGroup und Y Combinator als Mitinvestoren, sechs Monate nach einer Series A über 24,5 Mio. $. Reducto meldete mehr als 1 Milliarde verarbeitete Seiten und einen Anstieg des Monatsvolumens um das 6-Fache zwischen den beiden Runden und nennt Harvey, Mercor und Rogo als Kunden. Die erste Akquisition erfolgte am 7. Mai 2026 mit der Übernahme des Teams hinter dem AI-Lernnotizbuch Opennote.

Warum es in Ops-Stacks auftaucht

Weil der Engpass vor dem Prompt liegt. Ein Vertragsprüfungs-Assistent, der eine durchgestrichene Klausel übersieht, eine Rechnungs-Pipeline, die eine verbundene Zelle in die falsche Spalte liest, ein ATS, das einen zweispaltigen Lebenslauf zerlegt: nichts davon repariert ein besseres Modell, und jede Stunde Prompt-Tuning geht in die falsche Schicht. Reducto ist das Argument, dass Extraktion gekauft statt gepflegt gehört.

Für Legal Ops ist das die Dokumentschicht unter Ironclad oder Spellbook, wo das Ausgangsmaterial aus gescannten unterzeichneten Ausfertigungen besteht und nicht aus sauberen Vorlagen. Für RevOps sind es Bestellformulare, unterzeichnete MSAs und Preisanhänge, die nie im CRM ankommen. Für Recruiting ist es das Parsing von Lebensläufen, seit einem Jahrzehnt das schwächste Glied in jedem ATS.

Das Deployment ist der zweite Grund, warum es die Sicherheitsprüfung besteht: SaaS, hybride VPC, vollständige VPC oder luftdicht getrenntes On-Prem, mit SOC 2 Type II, einem HIPAA-BAA, AES-256 im Ruhezustand, TLS 1.2+ bei der Übertragung, EU-Datenresidenz und Dokumentlöschung nach 24 Stunden.

Ein Anwendungsfall, für den sich der Kauf lohnt

Die Vertragsextraktion, an der interne Rechtsabteilungen hängenbleiben: mehrere tausend unterzeichnete Verträge, die Hälfte davon Scans, und die Aufgabe, anwendbares Recht, Verlängerungsdaten, Abtretungsklauseln und Haftungsobergrenzen in eine prüfbare Tabelle zu ziehen. Classify routet nach Vertragstyp, Split isoliert die Anlagen, Parse erzeugt layoutbewusstes JSON, Extract füllt das Schema. Jedes Feld lässt sich bis zu einer Seitenkoordinate zurückverfolgen, und genau das macht das Ergebnis belastbar, wo ein allgemeines Modell, das ein PDF zusammenfasst, es nicht ist.

Preise

Der Preis läuft pro Endpoint und pro Seite, gültig ab dem 1. September 2026, ohne Seat-Lizenz. Parse kostet je nach Komplexität 10 bis 30 $ pro 1.000 Seiten, Extract und Split 20 bis 40 $, Classify 7,50 bis 15 $, und Edit 60 $ pro 1.000 Seiten oder 15 $ pro 1.000 vorbefüllte Seiten. Tabellenkalkulationen werden pro Zelle gemessen, Batch-Jobs erhalten 20% Rabatt. Standard startet mit 150 $ Gratisnutzung, das sind 15.000 Seiten Parse zum Listenpreis.

Die Schlagzeile von einem Cent pro Seite ist der Boden, nicht die Rechnung. Ein reiner Parse-Pilot mit 100.000 Seiten im Monat kostet 1.000 $ im Monat. Eine vierstufige Produktions-Pipeline (classify, split, parse, extract) bucht alle vier Zähler gegen dieselbe Seite, sodass 250.000 Seiten im Monat bei etwa 14.400 $ monatlich zum Listenpreis landen, also rund 173 Tsd. $ im Jahr vor Volumenrabatten. Das ist die Bandbreite, gegen die Sie budgetieren.

Growth und Enterprise gibt es nur auf Angebot. Growth ergänzt Volumenrabatte, Datenresidenz und unbegrenzte Studio-Seats; Enterprise ergänzt VPC und On-Prem, individuelles SLA, SSO/SAML und RBAC. Die Nebenläufigkeit ist die zweite Tier-Schranke: 200 Seiten bei Standard, 350 bei Growth, 500+ bei Enterprise. Ein Startup-Programm gibt Gratis-Credits und rabattierte Growth-Konditionen an Teams unter 15 Mio. $ eingesammeltem Kapital, 3 Mio. $ Umsatz und 50 Mitarbeitenden.

Am besten geeignet für

Legal-Ops- und Finance-Ops-Verantwortliche mit einem bereits gebauten AI-Workflow, der bei der Extraktionsqualität steckengeblieben ist, und die Engineering-Zeit damit verbrennen, Prompts eines allgemeinen Modells gegen Dokumente zu tunen, die es ohnehin nie korrekt gelesen hätte. Die Rechnung geht ab etwa 50.000 Seiten im Monat auf, bei wirklich schwierigen Dokumenten: Scans, dichte Tabellen, mehrspaltige Layouts, Handschrift.

Kaufen Sie es nicht für saubere, einheitliche, maschinell erzeugte Formulare: Wenn jedes Dokument dieselbe digitale Rechnungsvorlage ist, erledigt ein Hyperscaler-OCR-Dienst das zu einem Bruchteil der Kosten. Kaufen Sie es auch nicht als Endnutzer-Anwendung. Reducto liefert APIs und einen Arbeitsbereich zum Bauen; jemand in Ihrem Team schreibt die Integration. Wenn niemand diesen Code besitzen wird, kaufen Sie ein Workflow-Produkt mit eingebauter Extraktion.

Alternativen, und wann Sie sie stattdessen wählen

  • Azure AI Document Intelligence: der Platzhirsch nach installierter Basis und die Standardwahl, wenn das Unternehmen ohnehin auf einer Azure-Zusage sitzt. Wählen Sie es, wenn die Dokumente Standardformulare, Rechnungen und Ausweise sind und Procurement schwerer wiegt als Tabellentreue. Reductos eigener RD-TableBench setzt Azure bei 82,7% gegen Reductos 90,2% auf 1.000 komplexen Tabellen; dieser Benchmark stammt vom Anbieter, behandeln Sie das Ranking also als zu prüfende Hypothese.
  • AWS Textract: der zweite Platzhirsch und die richtige Wahl für eine AWS-native Pipeline, die Bedrock speist. Achtung: Textract ist nicht die günstige Option, für die es gehalten wird, die Formular- und Tabellenextraktion kostet rund 0,065 $ pro Seite und liegt damit über Reductos Parse-Listenpreis. Im selben anbietergeführten Tabellen-Benchmark erreichte es 80,9%.
  • Mistral OCR: der am schnellsten wachsende Neueinsteiger und der Preisboden. OCR 4 erschien am 23. Juni 2026 zu 4 $ pro 1.000 Seiten (2 $ im Batch) mit Bounding Boxes auf Absatzebene, Konfidenzwerten und 170 Sprachen; OCR 3 bleibt bei 2 $ pro 1.000 (1 $ im Batch). Wählen Sie es, wenn Sie Text und Layout in Masse zu niedrigsten Stückkosten brauchen und Tabellentreue bei komplexen Tabellen nicht die bindende Nebenbedingung ist. Bei 1 Mio. Seiten im Monat liegt der Abstand zu einer vollen Reducto-Pipeline im fünfstelligen Bereich pro Monat.

Worauf Sie achten müssen

  • Der Genauigkeitsvorsprung, den Sie kaufen, ist vom Anbieter gemessen. RD-TableBench ist Reductos eigener Benchmark auf Reductos eigenem Tabellensatz. Absicherung: Fahren Sie vor der Unterschrift eine Evaluierung über 200 Dokumente auf Ihren hässlichsten echten Dateien gegen handgelabelte Ground Truth, und bewerten Sie genau die Felder, die Sie in Produktion extrahieren werden. Die 150-$-Gratisstufe deckt 15.000 Parse-Seiten ab, mehr als genug, und wenn der Vorsprung Ihre eigenen Dokumente nicht übersteht, haben Sie das Entscheidende gelernt.
  • Vier Endpoints auf einer Seite bedeuten vier Zähler. Der Cent-pro-Seite-Parse-Preis ist die Zahl, die intern zitiert wird; eine Pipeline aus classify-split-parse-extract liegt näher bei 0,058 $ pro Seite, ein Faktor 5,8 auf demselben Dokument. Absicherung: Kalkulieren Sie die vollständige Pipeline pro Seite vor dem Piloten, setzen Sie Dollar-Schwellenwarnungen in Studio, und ziehen Sie die Usage-Export-API in das System, das Ihre Cloud-Ausgaben überwacht.
  • Alles, was die Sicherheitsprüfung verlangt, liegt bei Enterprise. SSO/SAML, RBAC, individuelles SLA, VPC und On-Prem liegen alle oberhalb der Growth-Linie, und Zero-Retention-Konditionen samt HIPAA-BAA gibt es ab Growth. Absicherung: Wenn privilegiertes oder reguliertes Material im Spiel ist, lassen Sie Enterprise ab dem ersten Gespräch bepreisen und schreiben Sie die Aufbewahrungsbedingungen in den Vertrag. Die Standard-Stufe ist zum Prototypen da, nicht für Mandantendokumente.
  • Ein zwei Jahre altes Unternehmen hält jetzt eine Schicht, von der Ihr Produktions-Workflow abhängt. Reducto ist Käufer und nicht Übernahmeziel, was das kurzfristige Risiko senkt, aber die Konzentration ist real. Absicherung: Halten Sie den Extraktionsaufruf hinter Ihrer eigenen Schnittstelle, damit ein Wechsel zu Azure, Textract oder Mistral eine Konfigurationsänderung bleibt, und archivieren Sie die rohen Quelldokumente, nicht nur das geparste JSON.