amBrain
FinTechOct 1, 202610 Min. Lesezeit

Ein privates ChatGPT für Ihr Unternehmen auf eigenen Servern: Was es braucht und wer es einrichten kann

Privates ChatGPTKI auf eigenen ServernVom Pilot zur ProduktionWer es baut
Bild konnte nicht geladen werden

Sie können Ihren Mitarbeitern einen Assistenten im Stil von ChatGPT geben, ohne dass Kundendaten das Unternehmen verlassen. Vor dem täglichen Einsatz sollte Ihnen derjenige, der ihn einrichtet, zeigen, dass der Assistent die Dokumentberechtigungen jeder Person einhält und Chats und Logs so lange aufbewahrt, wie Ihr Compliance-Team es festlegt.

Ein privates ChatGPT ist ein Chat-Assistent, der wie ChatGPT funktioniert, aber auf Servern läuft, die Ihr Unternehmen kontrolliert. Mitarbeiter melden sich in einer Chat-App an, die ihre Fragen an ein Sprachmodell auf diesen Servern schickt, und eine Suche über Ihre eigenen Dokumente ermöglicht es dem Modell, auf deren Grundlage zu antworten. Jeder dieser Teile existiert heute als Open-Source- oder lizenzierte Software.

Die Arbeit besteht darin, diese Teile an die Anmeldung über Ihre Unternehmenskonten, an Ihre Dokumentberechtigungen und an Ihre Logs anzubinden und das System danach zu betreiben. Ihr IT-Team kann einen Testbetrieb aufsetzen. Bevor sich alle Mitarbeiter darauf verlassen, sollte ein reguliertes Unternehmen ein Team beauftragen, das zeigen kann, dass jede der unten genannten Anforderungen auf den eigenen Systemen des Unternehmens funktioniert.

Die kurze Antwort: Ihr IT-Team kann einen Testbetrieb mit Dokumenten fahren, die alle in der Testgruppe lesen dürfen. Für den täglichen Einsatz im ganzen Unternehmen beauftragen Sie ein Team erst, nachdem es den Assistenten mit Ihrer eigenen Anmeldung und Ihren eigenen Dokumenten funktionierend vorgeführt hat. Der Assistent sollte Dokumente verbergen, die eine Person nicht öffnen kann, und Chats und Logs für eine Frist auf Ihren Servern aufbewahren, die Ihr Compliance-Team festlegt.

Warum wollen Unternehmen ein privates ChatGPT?

Mitarbeiter warten nicht darauf, dass ihr Arbeitgeber ihnen KI-Tools bereitstellt. Im Work Trend Index 2024 von Microsoft und LinkedIn, einer Umfrage unter 31.000 Wissensarbeitern in 31 Ländern, gaben 78% der KI-Nutzer an, ihre eigenen KI-Tools mit zur Arbeit zu bringen.

Im Mai 2023 schränkte Samsung generative KI-Tools auf Firmengeräten und in internen Netzwerken vorübergehend ein, nachdem im April versehentlich interne Daten an ChatGPT abgeflossen waren. TechCrunch berichtete über Samsungs Sorge, dass Daten auf externen Servern schwer „abzurufen und zu löschen“ seien. Das Unternehmen erklärte, es „prüfe Maßnahmen, um eine sichere Umgebung für die sichere Nutzung generativer KI zu schaffen“.

In einer Umfrage unter britischen Finanzunternehmen, die die Bank of England und die FCA im November 2024 veröffentlicht haben, galten Datenschutz und Privatsphäre als die größte wahrgenommene regulatorische Einschränkung für den Einsatz von KI.

Woraus besteht ein privates ChatGPT?

„Privates ChatGPT“ ist nicht der Name eines Produkts von OpenAI. Der Begriff beschreibt ein System, das aus einzelnen Teilen zusammengesetzt ist, und ein Modell von OpenAI, dem Unternehmen hinter ChatGPT, kann einer davon sein. Die unten genannten Open-Source-Projekte sind Beispiele, auf die Sie in Angeboten stoßen können, und dieser Artikel bringt sie in keine Rangfolge. Das sind die Teile:

  • Die Chat-App ist die Webseite, auf der sich Mitarbeiter anmelden, Fragen stellen, Dateien hochladen und frühere Chats finden. LibreChat ist ein Open-Source-Beispiel unter der MIT-Lizenz. Seine Projektseite nennt die Anmeldung über Unternehmenskonten per OAuth2 und LDAP, zwei verbreitete Wege, eine App mit den Konten zu verbinden, die Mitarbeiter bereits haben. Außerdem arbeitet es mit jedem Modellserver zusammen, der Anfragen im Format des eigenen Dienstes von OpenAI annimmt, bekannt als OpenAI-kompatible API
  • Der Modellserver betreibt das Sprachmodell auf Ihrer Hardware und beantwortet die Anfragen der Chat-App. vLLM ist ein Open-Source-Beispiel. Seine Dokumentation sagt, es „implementiert die Completions API, die Chat API und mehr von OpenAI“, sodass eine Chat-App, die für den Dienst von OpenAI geschrieben wurde, ihre Fragen stattdessen an Ihren Server schicken kann
  • Das Modell ist ein Satz von Dateien, Gewichte genannt, die der Server lädt. Ein Open-Weight-Modell kann jeder herunterladen und betreiben, zu den Bedingungen der Lizenz dieses Modells. So ist etwa gpt-oss-120b von OpenAI unter der Lizenz Apache 2.0 veröffentlicht, und laut OpenAI passt es auf einen einzelnen Grafikprozessor (GPU) mit 80 GB wie eine NVIDIA H100
  • Die Dokumentensuche ermöglicht es dem Assistenten, auf Grundlage Ihrer eigenen Richtlinien und Verträge zu antworten. Die Dokumente werden in Textpassagen aufgeteilt und in einem Suchindex abgelegt, und die Passagen, die zu einer Frage passen, werden zusammen mit ihr an das Modell übergeben. Engineers nennen das Retrieval-Augmented Generation, kurz RAG
  • Die Anmeldung sollte über die Unternehmenskonten laufen, die die Mitarbeiter bereits nutzen, damit mit dem Schließen des Kontos eines Mitarbeiters auch sein Zugang zum Assistenten endet
  • Chatverlauf und Logs halten fest, wer was wann gefragt hat und was der Assistent geantwortet hat. Beides sind Kopien Ihrer Daten
  • Admin-Einstellungen legen fest, wer welches Modell nutzen darf, welche Dokumentsammlungen jede Gruppe durchsuchen kann, ob Dateien hochgeladen werden können und wie lange Chats aufbewahrt werden

Lizenzen werden wichtig, sobald das ganze Unternehmen das System nutzt. Open WebUI, eine weitere Chat-App mit öffentlichem Code, bringt die Anmeldung über Unternehmenskonten, Benutzergruppen und eine eingebaute Dokumentensuche mit. Seit Version 0.6.6 (April 2025) verlangt seine Lizenz, dass Name und Logo von Open WebUI sichtbar bleiben, sobald ein Deployment mehr als 50 Nutzer in einem Zeitraum von 30 Tagen hat. Eine Enterprise-Lizenz hebt diese Regel auf, ebenso die schriftliche Erlaubnis des Projekts für jemanden, der wesentlich zum Projekt beigetragen hat. Das Projekt sagt selbst, dass seine Lizenz wegen dieser Klausel die Kriterien der Open Source Initiative für Open Source nicht erfüllen würde.

Schließt „unsere eigene Infrastruktur“ ChatGPT Enterprise oder Microsoft Copilot aus?

Ja, wenn mit „eigene“ Server gemeint sind, die Ihr Unternehmen kontrolliert, denn die Server hinter ChatGPT Enterprise betreibt OpenAI und die hinter Copilot betreibt Microsoft. Wenn Ihr Compliance-Team Daten akzeptiert, die ein Anbieter auf vertraglicher Grundlage hält, können beide auf der Liste bleiben. Das Modell hinter einem Unternehmensassistenten kann an drei Orten laufen, und nur der dritte hält jeden Prompt und jede Datei auf Servern, die Sie kontrollieren:

  • Mit einem Business-Tarif eines Anbieters, etwa ChatGPT Enterprise oder Microsoft Copilot, betreibt der Anbieter die Server, und Ihre Daten sind durch seinen Vertrag abgedeckt. Die ChatGPT-Dokumentation von OpenAI, gelesen im Oktober 2026, beschreibt Datenresidenz und Inferenzresidenz für Enterprise-Workspaces. Sie binden den Speicherort der Daten und den Ort, an dem das Modell läuft, an eine gewählte Region, und laut Dokumentation gelten beide „nur für berechtigte Inhalte und unterstützte Workloads“. Außerdem heißt es dort, dass „einige Verarbeitungsvorgänge oder synchronisierte Indizes eigenen Standortregeln folgen können“
  • Cloud-Anbieter verkaufen außerdem Modelldienste wie Azure OpenAI und Amazon Bedrock, die das Modell in den Rechenzentren des Anbieters betreiben. Ihre Chat-App kann in Ihrem eigenen Cloud-Konto liegen, aber jede Frage geht mitsamt den angehängten Dokumentpassagen an diesen Dienst
  • Ein Open-Weight-Modell kann auf Servern laufen, die Sie betreiben, in Ihrem eigenen Rechenzentrum oder auf virtuellen Maschinen in Ihrem eigenen Cloud-Konto. Prompts, hochgeladene Dateien und Logs bleiben dann auf Systemen, die Sie kontrollieren, und die Server und die Sicherheit des Modells werden zu Ihrer Aufgabe oder zur Aufgabe des Teams, das Sie beauftragen

Die Artikel über die Einbindung eines Sprachmodells in Ihre eigenen Systeme und über seinen Betrieb in einem geschlossenen Perimeter, beide oben verlinkt, gehen mehr ins Detail. Sie vergleichen den Dienst eines Anbieters, einen Cloud-Dienst und Server, die Sie selbst betreiben. Die Links unten auf dieser Seite führen zu Seiten über die Kosten und die beiden Cloud-Dienste.

Was unterscheidet einen Testbetrieb von einem Assistenten, den Ihre Mitarbeiter jeden Tag nutzen?

Ein Testbetrieb zeigt, ob die Leute die Antworten nützlich finden. Der tägliche Einsatz in einem regulierten Unternehmen bringt sechs Anforderungen hinzu, und ein Entwicklungspartner sollte vor dem Start zeigen können, dass jede davon funktioniert:

  • Jede Person sieht nur die Dokumente, die sie bereits öffnen kann. Microsoft legt diese Regel für seinen eigenen Assistenten fest und schreibt, dass Copilot „nur Organisationsdaten anzeigt, für die einzelne Benutzer mindestens über Anzeigeberechtigungen verfügen“. Die OWASP Top 10 for LLM Applications, eine Liste der wichtigsten Sicherheitsrisiken in Software mit Sprachmodellen, empfehlen „berechtigungsbewusste Vektor- und Embedding-Speicher“. Das heißt, der Suchindex muss festhalten, wer jede Passage lesen darf
  • Dokumente gelten als nicht vertrauenswürdige Eingabe, denn eine Datei kann versteckte Anweisungen enthalten. In einem Beispiel von OWASP enthält ein Lebenslauf weißen Text auf weißem Hintergrund, der das System anweist, den Kandidaten zu empfehlen, und das Modell folgt dieser Anweisung, wenn später jemand nach dem Kandidaten fragt. OWASP ergänzt: Das Antworten auf Grundlage Ihrer eigenen Dokumente soll die Ergebnisse genauer machen, und laut Forschung schützt es nicht vollständig vor solchen Angriffen. Der Assistent sollte deshalb nur Antworten schreiben, und jede Aktion in einem anderen System, etwa das Senden einer E-Mail, sollte auf die Freigabe durch einen Menschen warten
  • Chats, Uploads und Logs bleiben für eine Frist auf Ihren Servern, die Ihr Compliance-Team festlegt. Microsoft ermöglicht Administratoren, mit seinen Compliance-Tools in Purview „Aufbewahrungsrichtlinien für die Daten festzulegen, die sich auf Chat-Interaktionen mit Copilot beziehen“. Ein privater Assistent braucht dieselbe Kontrolle über die Chat-Datenbank, hochgeladene Dateien, den Suchindex und die Logs des Modellservers, die den vollständigen Text von Fragen enthalten können. Ihr Compliance-Team sollte nachlesen können, wer was gefragt hat, ohne einen Engineer darum bitten zu müssen
  • Ein Satz Ihrer eigenen Fragen, jede mit der richtigen Antwort, läuft nach jeder Änderung erneut durch. Die Leute, die die Antworten kennen, schreiben die Fragen aus ihrer echten Arbeit. Eine Änderung meint hier ein neues Modell, neue Anweisungen an das Modell oder eine große Menge neuer Dokumente. Der oben verlinkte Artikel über Piloten erklärt, wie man einen solchen Satz aufbaut
  • Die Kapazität ist auf die Spitzenstunde ausgelegt, denn ein Testbetrieb mit einer kleinen Gruppe sagt wenig über einen Morgen aus, an dem ein Großteil des Büros gleichzeitig fragt. Ollama ist ein Tool, um ein Modell auf einem einzelnen Rechner zu betreiben. Im Oktober 2026 nannte seine Dokumentation als Standard jeweils eine Anfrage pro Modell, während weitere Anfragen in einer Warteschlange warten. Der Vergleich von vLLM und Ollama, unten auf dieser Seite verlinkt, erklärt, wie beide damit umgehen, wenn viele Menschen gleichzeitig fragen
  • Eine namentlich benannte Person ist für den Assistenten verantwortlich und kann ihn abschalten oder auf das vorherige Modell und die vorherigen Einstellungen zurücksetzen, ohne auf den Anbieter zu warten. Die Mitarbeiter wissen, wo sie eine falsche Antwort melden können

Wer kann ein privates ChatGPT auf unseren eigenen Servern einrichten?

Ihr eigenes IT-Team, ein Softwarehersteller oder ein Engineering-Team kann es einrichten. Welche Variante passt, hängt davon ab, wie viele Menschen den Assistenten nutzen werden und woran er angebunden werden muss.

Für einen Testbetrieb mit einer kleinen Gruppe kann ein IT-Team, das bereits Linux-Server betreibt, eine Open-Source-Chat-App und einen Modellserver installieren und ein Open-Weight-Modell laden. Für den Anfang kann ein kleineres Modell genügen, und laut OpenAI kommt sein gpt-oss-20b mit 16 GB Speicher aus. Lesen Sie zuerst jede Lizenz, auch die der Chat-App, und beschränken Sie den Testbetrieb auf Dokumente, die alle in der Gruppe lesen dürfen, damit Berechtigungen noch keine Rolle spielen.

Ein fertiges Produkt, das ein Hersteller als Software verkauft, die Sie auf Ihren eigenen Servern installieren, kann für einfachen Chat über eine gemeinsame Dokumentenbibliothek passen. Fragen Sie, an welche Ihrer Systeme es sich anbinden lässt und wer seine Updates installiert, und unterziehen Sie es den fünf Vorführungen im nächsten Abschnitt, genau wie eine Individualentwicklung.

Ein Engineering-Team ist nötig, wenn der Assistent mit der Anmeldung über Ihre Unternehmenskonten und den Berechtigungen mehrerer Systeme arbeiten muss. Dasselbe gilt, wenn er an andere Systeme angebunden werden muss, etwa an ein Dokumentenmanagementsystem, oder Logs führen muss, die Ihr Compliance-Team lesen kann. Das Team kann eine externe Firma sein oder Engineers, die zu Ihrem IT-Team stoßen. Vereinbaren Sie vor Beginn der Arbeit, wer das System nach dem Start betreibt.

Wie prüfen wir ein Unternehmen, das anbietet, es einzurichten?

Verlangen Sie vor der Unterschrift von jedem Anbieter fünf Vorführungen. Nutzen Sie dafür nach Möglichkeit eine Testinstallation mit der Anmeldung über Ihre eigenen Unternehmenskonten und mit Dokumenten, die Sie mit dem Anbieter teilen dürfen:

  • Melden Sie sich als jemand an, der ein bestimmtes Dokument nicht öffnen darf, und fragen Sie danach. Der Assistent sollte antworten, als gäbe es das Dokument nicht. Entziehen Sie dann einem Kollegen im Ursprungssystem den Zugriff auf eine Datei und messen Sie, wie lange der Assistent braucht, bis er sie für diesen Kollegen nicht mehr verwendet
  • Lassen Sie sich vom Anbieter zeigen, wo Chats, Uploads und Logs gespeichert werden, und lassen Sie ihn vor Ihren Augen den Verlauf einer Person löschen. Finden Sie dann heraus, was in Backups und Logs übrig bleibt und wann es entfernt wird
  • Sehen Sie sich den Satz Testfragen an, den der Anbieter nach einem Modell-Update erneut durchlaufen lässt, und das Protokoll des letzten Durchlaufs, und finden Sie heraus, wer die richtigen Antworten geschrieben hat
  • Fragen Sie, für wie viele gleichzeitige Nutzer das System ausgelegt wurde, und lassen Sie sich den Lasttest hinter dieser Zahl zeigen. Der Test sollte Fragen und Dokumente wie Ihre verwenden, bei der Zahl von Nutzern, die Sie in Ihrer Spitzenstunde erwarten
  • Prüfen Sie, ob Sie das System ohne den Anbieter betreiben könnten. Der Code, die Konfiguration, die Modelldateien, die Testfragen und die Betriebsanleitung sollten vollständig übergeben werden, und nichts sollte von den Servern oder Lizenzschlüsseln des Anbieters abhängen

Wo passt amBrain ins Bild?

Über seine eigene Arbeit mit Sprachmodellen sagt amBrain: „Wir haben eine LLM-Integration innerhalb des FinTech-Perimeters eines Kunden in Produktion gebracht: die Extraktion und Normalisierung unstrukturierter Mitteilungen von Brokern und Handelsplätzen – Kapitalmaßnahmen, Instrumenten- und Margin-Änderungen – zu strukturierten Datensätzen, die das Handelssystem verarbeitet.“ Der Kunde wird nicht genannt, und zu dem Projekt werden keine Zahlen veröffentlicht.

Dieser Artikel ist keine Case Study. Er sagt nicht, wo das Modell in diesem Projekt lief, und er behauptet nicht, dass amBrain für irgendeinen Kunden ein privates ChatGPT, einen Assistenten für Mitarbeiter oder eine Dokumentensuche gebaut hat. Er nennt weder Preise noch Zeitpläne.

amBrain entwickelt seit 2019 Software. amBrain arbeitet in drei Formaten: vollständige Umsetzung, ein dediziertes Team oder in Ihr Team eingebettete Entwickler. Der Kunde behält das volle Eigentum an Produkt und Code, ausgenommen die wiederverwendbaren Komponenten von amBrain.

Schreiben Sie eine Seite, die sagt, welcher der drei oben beschriebenen Fälle auf Sie zutrifft. Ergänzen Sie für jede der sechs Anforderungen, was sie in Ihrem Unternehmen bedeutet, etwa welche Systeme die Dokumentberechtigungen halten und wie lange Chats aufbewahrt werden müssen. Schicken Sie diese Seite an amBrain oder an jedes andere Team auf Ihrer Liste, und verlangen Sie von jedem Team dieselben fünf Vorführungen.

Häufige Fragen

  • Wird es so gut sein wie ChatGPT? Das kann niemand sagen, bevor es an Ihrer eigenen Arbeit getestet wurde. Lassen Sie Ihren Fragensatz durch jedes Modell laufen, das Sie in Betracht ziehen, und lassen Sie die Leute, die die Antworten kennen, die Ergebnisse bewerten. Für einen Vergleich mit einem öffentlichen Dienst verwenden Sie Fragen, die keine Kundendaten enthalten
  • Können wir mit dem Modell eines Anbieters beginnen und später auf unsere eigenen Server umziehen? Ja, wenn Ihre Chat-App das Modell über die OpenAI-kompatible API anspricht. Schicken Sie dem Anbieter bis zum Umzug nur Daten, die laut Ihrem Compliance-Team das Unternehmen verlassen dürfen. vLLM implementiert dieselbe Chat-API, sodass die App danach nur die Adresse Ihres Servers und den Modellnamen braucht, solange sie keine Funktion nutzt, die nur der Dienst des Anbieters bietet. Lassen Sie Ihre Fragen erneut laufen, bevor die Mitarbeiter umsteigen, denn die Antworten ändern sich mit dem Modell, und fragen Sie den Anbieter, wie die bereits an ihn gesendeten Daten gelöscht werden
  • Können Mitarbeiter eigene Dateien hochladen? Ja. Ein Upload ist eine Kopie der Datei, die die Chat-App aufbewahrt und manchmal in den Suchindex aufnimmt. Er braucht dieselbe Aufbewahrungsfrist wie die Chats und muss zusammen mit ihnen gelöscht werden. Entscheiden Sie, ob ein Upload in den eigenen Chats der Person bleibt, die ihn hochgeladen hat, oder mit einer Gruppe geteilt werden kann

Liegt ein solcher Entwurf bei Ihnen auf dem Tisch?

Bringen Sie Ihre aktuelle Architektur und den Fehlerfall mit, der Sie beunruhigt - wir gehen ihn in einer halben Stunde gemeinsam durch.