amBrain
FinTechOct 8, 202610 Min. Lesezeit

API, selbst gehostet oder hybrid: Wie ein reguliertes Unternehmen LLM-Dokumentenverarbeitung betreiben kann und wer sie in Produktion bringt

DokumentenverarbeitungHybrides LLM-SetupRegulierte BranchenWer es baut
Bild konnte nicht geladen werden

Ein reguliertes Unternehmen kann die API eines Anbieters unter Vertrag nutzen, eigene Server oder eine hybride Lösung, die Dokumente nach Klassen aufteilt. Eine hybride Lösung braucht eine Routing-Tabelle mit einem Verantwortlichen und ein Log der Route jedes Dokuments.

Ein reguliertes Unternehmen kann LLM-Dokumentenverarbeitung über die API eines Anbieters unter Vertrag betreiben, auf eigenen Servern oder als Mischung aus beidem. Nutzen Sie die API, wenn jede Dokumentklasse unter Vertrag nach außen gehen darf, und hosten Sie selbst, wenn keine es darf. Eine hybride Lösung lohnt sich nur, wenn auf beide Seiten viele Dokumente entfallen, denn Sie betreiben zwei Systeme und tragen die Verantwortung für die Routing-Tabelle. Um zu erkennen, welche Firmen ein solches System in Produktion gebracht haben, fragen Sie nach den Aufzeichnungen, die es hinterlässt.

Die kurze Antwort: Schreiben Sie Ihre Dokumentklassen auf und wohin jede davon gehen darf. Wenn Sie sich für eine hybride Lösung entscheiden, geben Sie der Routing-Tabelle einen Verantwortlichen und eine Versionsnummer und loggen Sie die Route jedes Dokuments. Um eine Firma zu prüfen, lassen Sie sich ihr Routen-Log zeigen und sprechen Sie mit der Person, die das System heute betreibt.

Wie unterscheiden sich die drei Ansätze?

Der oben verlinkte Artikel zum geschlossenen Perimeter vergleicht sie ausführlich. Bei der API eines Anbieters gelten für Ihre Daten der Vertrag und die Datenkontrollen, die der Anbieter zusagt. Die Seite von OpenAI zu Datenkontrollen, abgerufen am 8. Oktober 2026, besagt, dass an die API gesendete Daten seit dem 1. März 2023 nicht zum Training verwendet werden, sofern Sie nicht ausdrücklich zustimmen (Opt-in).

Dieselbe Seite besagt, dass Logs der Missbrauchsüberwachung, mit denen OpenAI Missbrauch erkennt und die Prompts und Antworten enthalten können, standardmäßig bis zu 30 Tage aufbewahrt werden. Länger aufbewahrt werden sie, wenn das Gesetz es verlangt oder wenn es vernünftigerweise erforderlich ist, um die Dienste von OpenAI oder andere vor Schaden zu schützen. Damit Ihre Inhalte aus diesen Logs herausgenommen werden, braucht es die vorherige Genehmigung von OpenAI.

Beim verwalteten Modelldienst einer Cloud-Plattform betreibt das Cloud-Unternehmen das Modell für Sie, und einige seiner Modelle werden unter einem Cloud-Vertrag verkauft, den Sie womöglich bereits haben. Die Dokumentation von Microsoft besagt, dass bei Modellen, die Azure verkauft, Ihre Prompts und die Antworten des Modells weder OpenAI noch anderen Anbietern dieser Modelle zugänglich sind. Die Dokumentation von Amazon Bedrock besagt, dass Modellanbieter keinen Zugriff auf die Prompts der Kunden und die Antworten des Modells haben. Das Modell läuft dennoch auf den Servern der Cloud, und Ihr Risikoteam entscheidet, ob das als innerhalb Ihres Perimeters gilt, also innerhalb des Netzwerks und der Systeme, die Ihr Unternehmen kontrolliert.

Ein selbst gehostetes Open-Weight-Modell, also eines, das sein Hersteller veröffentlicht, damit jeder es herunterladen und betreiben kann, läuft auf Servern, die Sie kontrollieren, sodass kein Dokument an einen Modellanbieter geht. Im Gegenzug ist der Betrieb der Server und des Modells Aufgabe Ihres Teams.

Wie sieht eine hybride Lösung in der Praxis aus?

Eine hybride Lösung vereint eine externe Route (die API eines Anbieters oder einen verwalteten Cloud-Dienst) und eine interne Route in einer Pipeline. Die Logik, die entscheidet, wohin jedes Dokument geht, heißt Router. Es gibt drei Grundformen, und sie lassen sich kombinieren:

  • Öffentliche oder risikoarme Dokumente, etwa veröffentlichte Regeln und Leitfäden, gehen an die API, und Ausweisunterlagen von Kunden bleiben intern
  • Jedes Dokument geht zuerst an das selbst gehostete Modell, und die Dokumente, an denen es scheitert, gehen nur dann nach außen, wenn ihre Klasse es erlaubt
  • Kennungen wie Namen werden innerhalb des Perimeters durch Platzhalter ersetzt, bevor der Text an die API geht

Wer entscheidet, welche Dokumente an eine API gehen dürfen?

Das Risikomanagement oder der Datenschutz entscheidet, und die Entwicklung setzt die Entscheidung in Code um. Halten Sie sie zuerst schriftlich als kurze Tabelle fest, hier Routing-Tabelle genannt. Sie führt für jede Dokumentklasse die zulässigen Routen auf, ob eine Maskierung vorgeschrieben ist und wie lange der Anbieter den Text aufbewahren darf.

Danach muss die Pipeline die Klasse jedes Dokuments bestimmen. Signale, die Sie kontrollieren, sind sicherer als das Urteil eines Modells: der Kanal, über den das Dokument kam, der Absender, der Dokumenttyp. Widersprechen sich die Signale, gilt die strengere Klasse, und ein Dokument, das niemand klassifizieren kann, bleibt intern.

Diese Prüfung läuft innerhalb des Perimeters. Eine Prüfung, die die externe API fragt, ob ein Dokument hinausdarf, hat es bereits gesendet. Eine Änderung an der Routing-Tabelle durchläuft ein Review und bekommt eine Versionsnummer und ein Datum, wie jede Codeänderung.

Können wir den Text maskieren und ihn trotzdem an die API senden?

Manchmal, in Grenzen. Open-Source-Werkzeuge wie Presidio ersetzen Namen, Kontonummern und andere Kennungen durch Platzhalter oder verschlüsseln sie mit einem Schlüssel. Wenn Sie den Schlüssel intern behalten, setzt der Entschlüsselungsschritt von Presidio die echten Werte wieder ein, wenn die Antwort zurückkommt; bei Platzhaltern führen Sie selbst eine Tabelle, welcher Platzhalter für welchen Wert steht. Auf diese Weise maskierte Daten nennt man pseudonymisiert.

Der Europäische Datenschutzausschuss hat am 16. Januar 2025 die Leitlinien 01/2025 zur Pseudonymisierung angenommen, als Fassung für die öffentliche Konsultation. Laut den Leitlinien gelten solche Daten weiterhin als personenbezogene Daten, wenn zusätzliche Informationen sie einer Person zuordnen könnten. Sie fügen hinzu, dass dies auch dann gilt, wenn der maskierte Text und diese Informationen bei verschiedenen Parteien liegen, etwa wenn der Anbieter den Text hat und Sie die Tabelle oder den Schlüssel.

Der Gerichtshof der EU hat dieselbe Frage im September 2025 in der Rechtssache C-413/23 P aufgegriffen, nach den Datenschutzvorschriften für EU-Stellen. Er entschied, dass pseudonymisierte Daten nicht in jedem Fall und nicht für jede Person personenbezogene Daten sind: Je nach den Umständen kann die Maskierung verhindern, dass jemand anderes als das Unternehmen, das die Daten maskiert hat, die darin enthaltenen Personen identifiziert. Für Sie als Inhaber der Tabelle oder des Schlüssels bleiben die Daten personenbezogen. Fragen Sie Ihre Rechtsberatung für Datenschutz, was daraus für Ihre Verträge folgt.

Die Erkennung ist die zweite Grenze. Presidio findet personenbezogene Daten mit einem Modell, das Namen von Personen, Orten und Organisationen erkennt, und mit Regeln, die bekannte Formate wie Kontonummern erfassen. Seine Dokumentation hält fest, dass bei automatisierter Erkennung „keine Garantie besteht, dass Presidio alle sensiblen Informationen findet“. Typische Lücken bei der Dokumentenverarbeitung:

  • Die Texterkennung (OCR), also der Schritt, der Scans in Text umwandelt, liest einen Namen falsch, und der Detektor erkennt ihn nicht mehr als Namen
  • Eine Person wird ganz ohne Namen identifiziert, über eine Funktionsbezeichnung in einer kleinen Firma oder einen einmaligen Betrag an einem bestimmten Datum
  • Das maskierte Feld ist genau das, das Sie brauchen: Wenn die Aufgabe darin besteht, den Namen der Gegenpartei zu extrahieren, enthält der maskierte Text ihn nicht mehr

Bevor jemand eine maskierte Route freigibt, lassen Sie Menschen in einer Stichprobe Ihrer eigenen Dokumente jede Kennung von Hand markieren und zählen Sie dann, was der Detektor übersehen hat.

Was passiert, wenn ein Dokument den falschen Weg nimmt?

In einer hybriden Lösung ist ein Datenabfluss ein Routing-Fehler. Ein eingescannter Reisepass im Anhang einer Routinemitteilung oder die Nachricht eines Kunden, die am Ende einer weitergeleiteten E-Mail zitiert ist, kann eingeschränkte Inhalte auf die externe Route bringen. Klassifizieren Sie jeden Anhang einzeln, und behandeln Sie den zitierten Verlauf eines Threads als Teil des Inhalts.

Bauen Sie das System so, dass eine falsche Entscheidung das Dokument anhält, statt es hinauszuschicken. Der oben verlinkte Artikel zum geschlossenen Perimeter behandelt die Netzwerkseite: Die interne Route hat weder Schlüssel noch Passwörter für den externen Anbieter und keinen Netzwerkpfad zu ihm. Ergänzen Sie eine Regel: Fällt das selbst gehostete Modell aus, wartet seine Queue oder geht an Menschen, und sie wechselt nie zur API.

Gelangt doch ein Dokument versehentlich nach außen, zeigt das Routen-Log, welche Dokumente wann an welchen Anbieter gingen. Der Vertrag mit dem Anbieter zeigt, wie lange er sie aufbewahren darf. Behandeln Sie den Fall zusammen mit Ihrem Datenschutzteam als Vorfall; das Team entscheidet, ob er gemeldet werden muss.

Wie testen wir die Qualität, wenn zwei Modelle die Arbeit machen?

Ein Abnahmeset ist eine Sammlung echter Dokumente mit der richtigen Antwort zu jedem, anhand derer entschieden wird, ob das System die Abnahme besteht. Die beiden Modelle einer hybriden Lösung antworten unterschiedlich, deshalb verdeckt ein einziger Score für die ganze Pipeline die schwächere Route.

Außerdem können Sie das API-Modell nicht mit eingeschränkten Dokumenten testen, weil diese nicht dorthin dürfen. Das gemeinsame Abnahmeset, das der Artikel zum geschlossenen Perimeter für jede Route empfiehlt, kann daher nur Dokumente enthalten, die auf beiden Routen zulässig sind. Vergleichen Sie damit die beiden Modelle, und geben Sie jeder Route ein eigenes, größeres Set aus den Klassen, die sie verarbeitet. Nimmt der Anbieter das API-Modell außer Betrieb, wird diese Route vor der Umstellung erneut bewertet.

Was braucht es, um beide Routen zu betreiben?

Eine hybride Lösung verdoppelt die Verträge: die Bedingungen und der Auftragsverarbeitungsvertrag des Anbieters, dazu der Hardware- oder Cloud-Vertrag unter dem selbst gehosteten Modell. Die Europäische Bankenaufsichtsbehörde weist darauf hin, dass DORA, die EU-Verordnung über die digitale operationale Resilienz, seit dem 17. Januar 2025 gilt. EU-Finanzunternehmen in ihrem Anwendungsbereich müssen ein Register ihrer vertraglichen Vereinbarungen mit IKT-Drittdienstleistern (IKT: Informations- und Kommunikationstechnologie) führen. Einen externen Modellanbieter hinzuzunehmen ist eine Frage für dieses Register, die Ihr Compliance-Team beantwortet.

Auch der Betrieb verdoppelt sich. Der Anbieter begrenzt, wie viele Requests Sie pro Minute senden dürfen, und nimmt Modelle nach eigenem Zeitplan außer Betrieb, also muss jemand beides im Blick behalten. Ihre eigenen Server brauchen Kapazitätsplanung und nachts jemanden in Bereitschaft. Router und Maskierungsschicht betreiben Sie ganz allein.

Beobachten Sie täglich den Anteil der Dokumente auf jeder Route, aufgeschlüsselt nach Klasse. Wenn das selbst gehostete Modell jedes Dokument zuerst sieht, bedeutet ein steigender Anteil an die API, dass mehr Dokumente hinausgehen und die API-Rechnung wächst. Oft ist die Ursache eine neue Dokumentvorlage, die das interne Modell nicht lesen kann.

Was sollte der Audit-Trail für jedes Dokument zeigen?

Speichern Sie seine Klasse und die Signale, die sie bestimmt haben, die Version der Routing-Tabelle und die gewählte Route. Ergänzen Sie, ob es maskiert wurde und mit welcher Detektorversion, sowie den Anbieter und die genaue Modellversion, die geantwortet haben. Mit diesem Datensatz braucht „Zeige jedes Dokument dieser Klasse, das im letzten Quartal den Perimeter verlassen hat“ eine einzige Datenbankabfrage.

Wann ist eine hybride Lösung die falsche Wahl?

Eine Route genügt, wenn alle Ihre Dokumente in eine Datenklasse fallen. Bei geringem Volumen kostet eine zweite Route mehr, als sie einspart, und was das selbst gehostete Modell nicht lesen kann, kann ein Mensch erledigen. Eine hybride Lösung erbt außerdem jede Lücke im nächtlichen Bereitschaftsdienst für die selbst gehosteten Server. Und wenn ein verwalteter Cloud-Dienst in Ihrer Region die Regeln für jede Klasse erfüllt, haben Sie damit einen einzigen Vertrag und einen einzigen Betrieb.

Wie prüfen wir, ob eine Firma so etwas vom Pilot bis in die Produktion gebracht hat?

Dieser Artikel stellt keine Rangliste von Firmen auf, denn jede Firma kann „KI in Produktion“ auf ihre Website schreiben. Ein System in Produktion hinterlässt Aufzeichnungen, die ein Pilot nicht hinterlässt, also fragen Sie nach diesen, bereinigt um Angaben zum Kunden.

  • Die Routing-Tabelle als versioniertes Dokument und der Name der Person, die Änderungen freigibt
  • Einige Zeilen aus dem Routen-Log, mit Klasse, Route, Version der Routing-Tabelle und Modellversion für jedes Dokument
  • Der jüngste Lauf eines Tests, der ein eingeschränktes Dokument in Richtung des externen Anbieters schickt und zeigt, dass es angehalten wird
  • Abnahme-Scores für jede Route und jedes Release, einschließlich des Releases, das erstellt wurde, als ein Anbieter ein Modell außer Betrieb nahm
  • Wenn das Design Text maskiert: die gemessenen Lücken des Detektors auf den eigenen Dokumenten eines Kunden
  • Das Runbook (schriftliche Anleitung für den Betrieb) für einen Ausfall jeder Route und wer Bereitschaftsdienst hat
  • Ein Gespräch mit der Person, die das System heute betreibt

Was sind die Warnsignale?

  • Maskierung wird als vollständige Antwort auf den Datenschutz angeboten, ohne gemessene Rate übersehener Kennungen
  • Die Prüfung, die entscheidet, was hinausdarf, fragt die externe API selbst
  • Der Traffic wechselt zur API, wenn das interne Modell ausfällt, und schickt damit auch eingeschränkte Dokumente hinaus
  • Kein Score pro Route, nur eine einzige Genauigkeitszahl für die ganze Pipeline

Wo passt amBrain ins Bild?

Das einzige Sprachmodell-Projekt, das amBrain öffentlich beschreibt, ist dieses: „Wir haben eine LLM-Integration innerhalb des FinTech-Perimeters eines Kunden in Produktion gebracht: die Extraktion und Normalisierung unstrukturierter Mitteilungen von Brokern und Handelsplätzen – Kapitalmaßnahmen, Instrumenten- und Margin-Änderungen – zu strukturierten Datensätzen, die das Handelssystem verarbeitet.“

Dieser Artikel ist keine Case Study: Der Kunde wird nicht genannt, und wo das Modell in diesem Projekt lief, wird nicht offengelegt. Er behauptet nicht, dass amBrain für irgendeinen Kunden eine hybride Lösung, eine Maskierungsschicht oder einen Router gebaut hat, und er nennt keine Preise oder Zeitrahmen.

amBrain übernimmt Projekte, die bei einem anderen Team ins Stocken geraten sind, und bringt sie in Produktion.

amBrain entwickelt seit 2019 Software. Es arbeitet in drei Formaten: vollständige Umsetzung, ein dediziertes Team oder in Ihr Team eingebettete Entwickler. Der Kunde behält das volle Eigentum an Produkt und Code, ausgenommen die wiederverwendbaren Komponenten von amBrain.

Wenn Sie diese Optionen abwägen, nehmen Sie Ihre Dokumentklassen und die obige Liste der Aufzeichnungen zu jeder Firma mit, mit der Sie sprechen, amBrain eingeschlossen.

Häufige Fragen

  • Können wir dank Maskierung jedes Dokument an die API senden? Nein. Maskierter Text, den Sie einer Person wieder zuordnen können, bleibt für Sie personenbezogene Daten, und Detektoren übersehen manche Kennungen. Nutzen Sie Maskierung, um die Offenlegung bei Klassen zu verringern, die ohnehin hinausdürfen
  • Kann ein selbst gehostetes Modell in der Qualität mit dem API-Modell mithalten? Bei manchen Dokumenttypen ja. Bewerten Sie beide auf dem gemeinsamen Set der Dokumente, die auf beiden Routen zulässig sind, bevor Sie entscheiden, wie Sie die Arbeit aufteilen
  • Können wir mit einer Route beginnen und die zweite später hinzufügen? Ja, und das ist oft der günstigere Weg. Bauen Sie Router und Routen-Log vom ersten Tag an, damit das spätere Hinzufügen der zweiten Route keinen Umbau der Pipeline bedeutet

Liegt ein solcher Entwurf bei Ihnen auf dem Tisch?

Bringen Sie Ihre aktuelle Architektur und den Fehlerfall mit, der Sie beunruhigt - wir gehen ihn in einer halben Stunde gemeinsam durch.