amBrain
FinTechSep 18, 202610 Min. Lesezeit

KI auf eigenen Servern: Wie Sie ein LLM in Ihre internen Systeme einbinden und wer es baut

KI auf eigenen ServernLLM-IntegrationVom Pilot zur ProduktionWer es baut
Bild konnte nicht geladen werden

Ein Unternehmen kann ein großes Sprachmodell auf Servern betreiben, die es selbst kontrolliert, und es mit seinen Support-Tickets, Dokumenten und internen Tools verbinden, ohne dass diese Daten nach außen gelangen. Dieser Artikel erklärt in einfachen Worten, welche Aufgaben passen, wo das Modell laufen kann, was Sie entscheiden sollten, bevor Sie jemanden beauftragen, mit welchen Kostenarten Sie rechnen müssen, warum Piloten vor der Produktion stecken bleiben und wie Sie ein Unternehmen prüfen, das anbietet, das System zu bauen.

Ja, ein Unternehmen kann KI für seine Support-Tickets, Dokumente und internen Tools nutzen, ohne dass diese Daten seine eigenen Server verlassen. Ein großes Sprachmodell, kurz LLM, ist die Art von KI, die hinter Chat-Assistenten steckt. Manche dieser Modelle lassen sich herunterladen, auf Servern betreiben, die das Unternehmen kontrolliert, im eigenen Gebäude oder im eigenen Cloud-Konto, und mit den Systemen verbinden, die die Mitarbeiter bereits nutzen.

Das Modell ist der kleinere Teil der Arbeit. Ob das System im Alltag ankommt, entscheiden die Wahl der Aufgabe, eine schriftliche Beschreibung einer richtigen Antwort und eine namentlich benannte Person, die die Antworten prüft und das System nach dem Start betreibt. Der letzte Teil dieses Artikels zeigt, wie Sie ein Unternehmen prüfen, das anbietet, das System zu bauen.

Die kurze Antwort: Betreiben Sie ein Open-Weight-Modell auf Servern, die Sie kontrollieren, und verbinden Sie es zuerst mit einer Aufgabe in einem System, etwa dem Sortieren von Support-Tickets oder dem Auslesen eingehender Dokumente. Bevor Sie jemanden beauftragen, halten Sie schriftlich fest, welche Daten das Modell sehen darf, wie eine richtige Antwort aussieht, wer die Antworten anfangs prüft und wer das System nach dem Start betreibt. Beauftragen Sie dann einen Entwicklungspartner, der nach diesen Antworten fragt, bevor er ein Modell empfiehlt.

Was bedeutet „KI auf unseren eigenen Servern“ eigentlich?

„KI auf unseren eigenen Servern“ bedeutet: Das Modell läuft auf Hardware, die Ihr Unternehmen kontrolliert, und kein Text wird an ein externes KI-Unternehmen gesendet. Ihr Ticket, Ihr Dokument oder Ihre Frage geht von Ihrem System zum Modell und zurück und verlässt dabei nie Ihr Netzwerk oder Ihr Cloud-Konto.

Möglich wird das durch Open-Weight-Modelle. Ein Open-Weight-Modell ist ein Modell, dessen Entwickler die Modelldateien veröffentlicht, sodass jeder sie herunterladen und das Modell gemäß seiner Lizenz betreiben kann. Die KI-Dienste, die Sie im Browser nutzen, funktionieren anders: Ihr Text wandert zu den Servern des Anbieters und wird dort verarbeitet.

Daten im Haus zu halten betrifft mehr als das Modell. Das System umfasst auch Logs, einen Suchindex Ihrer Dokumente, die Beispiele, an denen es getestet wird, und die Bildschirme, auf denen Menschen seine Antworten prüfen. Jeder dieser Teile enthält Kopien Ihrer Daten, und jeder muss ebenfalls auf Ihren Servern bleiben.

Welche Aufgaben in unseren internen Systemen kann ein LLM übernehmen?

Ein LLM ist dort nützlich, wo Menschen heute Text lesen und danach etwas ausfüllen, sortieren oder schreiben. Typische Aufgaben in einem Unternehmen:

  • Eingehende Dokumente auslesen. Formulare, Rechnungen, Verträge und Mitteilungen werden zu Feldern in dem System, das sie braucht
  • Support-Tickets sortieren. Thema, Dringlichkeit und das zuständige Team werden festgelegt, bevor ein Mensch das Ticket öffnet
  • Antworten entwerfen. Das Modell schreibt einen Entwurf, und ein Support-Mitarbeiter bearbeitet und versendet ihn
  • Fragen von Mitarbeitern anhand interner Dokumente beantworten. Richtlinien, Handbücher und frühere Tickets, mit einem Link zur Quelle jeder Antwort. Das ist es, was oft „ein privates ChatGPT“ genannt wird
  • Lange Unterlagen zusammenfassen. E-Mail-Verläufe, Gesprächsnotizen und Fallakten, für die nächste Person, die sie übernimmt
  • Dokumente gegen eine Liste prüfen. Ob ein Vertrag die erforderlichen Klauseln enthält oder ein Antrag alle nötigen Unterlagen hat

Manche Arbeit passt schlecht zu einem LLM, und das sollten Sie besser vor Projektbeginn wissen:

  • Berechnungen und Regeln, die bereits exakt sind. Gewöhnlicher Code erledigt sie schneller und liefert jedes Mal dieselbe Antwort
  • Aufgaben, bei denen niemand sagen kann, wie eine richtige Antwort aussieht. Ohne das kann niemand beurteilen, ob das Modell funktioniert
  • Endgültige Entscheidungen über Menschen mit rechtlichem oder finanziellem Gewicht, etwa die Ablehnung eines Kunden, ohne dass ein Mensch die Entscheidung trifft
  • Handlungen, die sich nicht rückgängig machen lassen und die niemand prüft, etwa das Überweisen von Geld

Ein einfacher Test für jede Aufgabe: Sie passt zu einem LLM, wenn ein Mensch sie heute erledigt, indem er Text liest, wenn sich das richtige Ergebnis aufschreiben lässt und wenn ein falsches Ergebnis abgefangen werden kann, bevor es Schaden anrichtet.

Unsere Daten dürfen unsere Server nicht verlassen. Können wir trotzdem KI nutzen?

Ja. Die Wahl betrifft den Ort, an dem das Modell läuft, und nur zwei der drei üblichen Varianten halten die Daten auf Servern, die Sie kontrollieren:

  • Ein Open-Weight-Modell auf Ihren eigenen Servern. Das Modell läuft auf Hardware in Ihrem eigenen Gebäude oder Rechenzentrum. Sie bekommen: Kein Text verlässt Ihr Netzwerk, und kein externes KI-Unternehmen erhält ihn. Der Preis dafür: Sie kaufen Server mit Grafikprozessoren (GPUs), die Modelle brauchen, um mit brauchbarer Geschwindigkeit zu laufen, und Ihr Team oder ein Partner hält sie am Laufen. Wählen Sie diese Option, wenn: Vorschriften, Kundenverträge oder Ihre eigenen Richtlinien jede Verarbeitung außerhalb des Unternehmens verbieten
  • Ein Open-Weight-Modell in Ihrem eigenen Cloud-Konto. Dieselbe Art von Modell läuft auf Servern, die Sie bei einem Cloud-Anbieter mieten, innerhalb Ihres Kontos und in der Region, die Sie wählen. Sie bekommen: keine Hardware, die Sie kaufen müssen, Kapazität, die Sie später erweitern können, und Daten, die in Ihrem Konto bleiben. Der Preis dafür: Der Cloud-Anbieter betreibt die Gebäude und die Hardware, und das Modell betreiben Sie trotzdem selbst. Wählen Sie diese Option, wenn: Ihr Unternehmen seine Systeme bereits in dieser Cloud betreibt und Ihre Regeln das zulassen
  • Der Dienst eines Modellanbieters. Sie senden Text an ein Modell, das ein KI-Unternehmen betreibt, direkt oder über Ihren Cloud-Anbieter, auf Grundlage eines Vertrags. Sie bekommen: den schnellsten Start, die eigenen Modelle des Anbieters und keine Server, die Sie betreiben müssen. Der Preis dafür: Die Daten verlassen Ihre Server tatsächlich, zu den Bedingungen des Anbieters für Speicherung, Speicherort und Prüfung. Wählen Sie diese Option, wenn: die Daten auf Grundlage eines Vertrags nach außen gehen dürfen, etwa Dokumente, die bereits öffentlich sind. Wenn Ihre Daten wirklich nicht nach außen dürfen, scheidet diese Option aus

Ein Unternehmen kann mehr als eine dieser Varianten nutzen. Öffentliche Dokumente können an den Dienst eines Anbieters gehen, während Kundendatensätze bei einem Modell bleiben, das Sie selbst betreiben. Die Regel, die jede Art von Daten an ihren Platz schickt, muss dann schriftlich festgehalten und durchgesetzt werden. Ein früherer Artikel in diesem Blog über den Betrieb eines LLM in einem geschlossenen Perimeter vergleicht diese Optionen ausführlicher.

Ob ein Modell, das Sie selbst betreiben können, gut genug ist, wird an Ihren eigenen Dokumenten und Tickets gemessen, nicht aus einem öffentlichen Ranking übernommen. Viele interne Aufgaben sind eng umrissen, etwa eine Art von Formular auslesen oder Tickets einer bekannten Liste von Teams zuordnen, und ein Test an echten Beispielen aus Ihrer Arbeit beantwortet die Frage.

Open-Weight-Modelle haben unterschiedliche Lizenzen, deshalb sollte jemand die Lizenz des gewählten Modells lesen. Die Qwen3-Modelle, die Alibaba 2025 veröffentlicht hat, und die gpt-oss-Modelle von OpenAI stehen unter der Lizenz Apache 2.0, während das größte offene Modell des späteren Releases Qwen3.8 mit einer eigenen Qwen3.8-Max-Lizenz kommt. Llama 3.3 von Meta kommt mit Metas eigener Community-Lizenz, die Bedingungen hinzufügt, darunter die Einhaltung von Metas Acceptable Use Policy.

Wie binde ich ein LLM in die internen Systeme meines Unternehmens ein?

Ein LLM ersetzt Ihre Systeme nicht. Es sitzt zwischen ihnen: Es liest Text an einer Stelle und legt ein Ergebnis an einer anderen ab. Es in ein internes System einzubinden heißt, vier einfache Fragen zu beantworten:

  • Woher kommt der Text? Aus dem Helpdesk, einem gemeinsamen Postfach, einer Dokumentenablage oder einer Datenbank
  • Wohin geht das Ergebnis? In die Felder und Bildschirme, die Ihre Mitarbeiter bereits nutzen, als Vorschlag, den sie übernehmen oder ändern können, nicht in ein neues Tool, an dessen Öffnen sie denken müssen
  • Worauf darf es zugreifen? Nur auf die Daten und Aktionen, die die Aufgabe braucht. Ein Modell, das Tickets sortiert, braucht keinen Zugriff auf Erstattungen oder Kundenkonten
  • Wie wird es abgeschaltet? Ein einziger Schalter, der die Arbeit auf den manuellen Weg zurückschickt, in der Hand der Person, die für das System verantwortlich ist

Beginnen Sie mit einer Aufgabe in einem System. Anfangs schlägt das Modell vor, und ein Mensch entscheidet. Selbstständig handeln darf das Modell nur in den Teilen, in denen es bei echter Arbeit dauerhaft richtig liegt, und der manuelle Weg bleibt als Rückfallebene bestehen.

Die Menschen, die die Arbeit heute erledigen, sollten das System mitgestalten. Sie wissen, welche Dokumente schwierig sind, welche Antworten falsch sind und wo ein Fehler Geld kostet. Sie sind auch diejenigen, die in den ersten Monaten die Antworten prüfen werden, deshalb gehört ihre Zeit in den Plan.

Was muss das Unternehmen entscheiden, bevor es jemanden beauftragt?

Bevor jemand ein KI-System für Sie baut, beantworten Sie sieben Fragen schriftlich. Keine davon erfordert einen technischen Hintergrund, und jede Antwort verändert, was gebaut werden muss:

  • Welche Aufgabe, in welchem System? Benennen Sie eine Aufgabe in einem Satz, etwa „eingehende Tickets im Helpdesk nach Team und Dringlichkeit sortieren“
  • Wie sieht ein richtiges Ergebnis aus? Sammeln Sie echte Beispiele mit der richtigen Antwort, aufgeschrieben von den Menschen, die die Arbeit heute erledigen
  • Welche Daten wird das Modell sehen, und wohin dürfen diese Daten gehen? Bitten Sie Ihre Verantwortlichen für Recht, Risiko oder Datenschutz, das für jede Art von Daten schriftlich festzuhalten
  • Wie viel Arbeit, und wann? Die Zahl der Dokumente oder Tickets pro Tag und die Spitzenstunde
  • Wer prüft die Antworten? Anfangs prüft ein Mensch jede Antwort. Benennen Sie, wer das ist und wie viele Stunden pro Woche es kostet
  • Was passiert, wenn die KI nicht verfügbar ist? Die Arbeit geht an Menschen zurück und wartet, statt verloren zu gehen
  • Wer betreibt es nach dem Start, und was gehört am Ende Ihnen? Ihr eigenes Team oder der Entwicklungspartner im Rahmen eines Supportvertrags; und am Ende der Code, die Beispiele und die Dokumentation

Die schriftlichen Antworten auf diese sieben Fragen sind Ihr Briefing. Geben Sie sie drei Entwicklungspartnern, erhalten Sie drei Angebote, die Sie vergleichen können. Ohne sie bekommen Sie drei Vorführungen eines Chatfensters.

Unser KI-Pilot funktioniert in der Demo, ging aber nie in Produktion. Wer kann uns helfen, ihn fertigzustellen?

Eine Demo beantwortet eine Frage: Kann das Modell die Aufgabe an guten Beispielen erledigen? Der tägliche Einsatz fügt vier weitere hinzu, und ein Pilot, der stecken bleibt, hat sie meist übersprungen:

  • Was gilt als richtig? Ein Satz echter Beispiele mit abgestimmten Antworten und eine Abnahmeschwelle, die das System erreichen muss
  • Dürfen die Daten dorthin? Ein Pilot, der auf einem externen KI-Dienst gebaut wurde, lässt sich nicht einfach auf Daten übertragen, die auf Ihren Servern bleiben müssen; ein Modell, das Sie selbst betreiben, muss erneut getestet werden
  • Wohin gehen falsche Antworten? An einen Ort, an dem ein Mensch sie sieht und korrigiert, bevor ein anderes System sie verwendet
  • Wer ist verantwortlich? Eine namentlich benannte Person oder ein benanntes Team, das das System betreibt, seine Antworten im Blick behält und gerufen wird, wenn es stillsteht

Einen steckengebliebenen Piloten fertigzustellen heißt meist, diese vier Dinge um das Modell herum zu bauen, nicht, ein besseres Modell zu kaufen. Ein früherer Artikel in diesem Blog über den KI-Piloten, der nie in Produktion ging, erklärt jedes davon ausführlicher.

Jeder Entwicklungspartner, der einen steckengebliebenen Piloten übernimmt, braucht drei Dinge von Ihnen: die Beispiele des Piloten, die Dokumente, an denen er gescheitert ist, und den Namen der Person, die für das System verantwortlich sein wird. Ein Entwicklungspartner, der nach keinem davon fragt, plant eine neue Demo.

Was kostet es, ein LLM auf eigenen Servern zu betreiben?

Dieser Artikel nennt keine Preise. „Ein KI-System auf unseren eigenen Servern“ umfasst Projekte, die sich in ihrer Größe um ein Vielfaches unterscheiden, und eine Zahl, die genannt wird, bevor jemand Ihre Antworten auf die sieben Fragen oben gehört hat, ist eine Verkaufszahl, keine Schätzung.

Nützlich ist es, die Kostenarten zu kennen, denn die meisten hängen von Entscheidungen ab, die Sie selbst in der Hand haben:

  • Hardware oder Cloud-Kapazität. Server mit GPUs, gekauft oder gemietet, ausgelegt auf Ihre Spitzenstunde statt auf eine durchschnittliche Stunde
  • Anbindungen an Ihre Systeme. Jedes System, aus dem das Modell liest oder in das es schreibt, ist ein eigenes Arbeitspaket, mit eigenen Berechtigungen und Aufzeichnungen
  • Die Zeit Ihrer Mitarbeiter. Die Menschen, die die Beispiele sammeln, die richtigen Antworten schreiben und in den ersten Monaten die Antworten des Modells prüfen
  • Korrektur falscher Antworten. Jede Woche Arbeitsstunden einer Person, so lange das System läuft
  • Betrieb. Sicherheitsupdates, die Überwachung der Antworten ebenso wie der Server und jemand, der gerufen wird, wenn es stillsteht
  • Modellwechsel. Ein neueres Modell wird an Ihren Beispielen getestet, bevor es das alte ersetzt, und der Test wird bei jeder Änderung wiederholt

Die Kosten folgen einem anderen Muster als beim Dienst eines Modellanbieters. Ein Anbieter berechnet die Menge an Text, die das Modell liest und schreibt. Server, die Sie besitzen oder monatlich mieten, kosten ungefähr gleich viel, ob sie ausgelastet sind oder leer laufen, deshalb entscheidet das Arbeitsvolumen, welche Variante für Sie günstiger ist.

Der Umfang ist der Teil der Kosten, den Sie am direktesten steuern. Eine Aufgabe, in einem System, für ein Team ist die kleinste erste Version, die noch zeigt, ob sich ein Ausbau des Systems lohnt.

Wer baut KI-Systeme, die innerhalb der eigenen Infrastruktur eines Unternehmens laufen, und wie prüfe ich diese Anbieter?

Vier Arten von Anbietern melden sich, wenn ein Unternehmen sagt: „Wir wollen KI auf unseren eigenen Servern“:

  • Softwarehersteller. Sie verkaufen ein fertiges KI-Produkt, das Sie installieren, etwa einen Chat-Assistenten für Mitarbeiter. Gut geeignet für einen allgemeinen Assistenten, weniger gut, wenn die Aufgabe von Ihren eigenen Systemen und Regeln abhängt
  • Cloud-Anbieter und ihre Partner. Sie verkaufen Modelle als verwalteten Dienst, bei dem Ihr Text Ihr Konto verlässt, und bieten Werkzeuge, um Open-Weight-Modelle in Ihrem eigenen Cloud-Konto zu betreiben. Manche bieten Hilfe bei der Anbindung an
  • Engineering-Firmen. Sie bauen die Verbindung zwischen einem Modell und Ihren Systemen nach Ihren Vorgaben, und der Vertrag entscheidet, wie viel davon Ihnen gehört
  • Ihr eigenes Team. Manchmal ergänzt um externe Engineers für die erste Version

Verlangen Sie von jedem Anbieter vor allem anderen diese Nachweise:

  • Ein KI-System, das sie innerhalb der Infrastruktur eines Kunden in Produktion gebracht haben, mit Nennung des Kunden, wo der Kunde es erlaubt
  • Was dieses System tut, in einem Satz, und wer es heute betreibt
  • Was in diesem System passiert, wenn das Modell eine falsche Antwort gibt
  • Eine Vorführung mit echten Dokumenten oder Tickets, nicht mit vorbereiteten Beispielen
  • Wohin die Daten während ihrer Arbeit gingen: ob irgendetwas, einschließlich Logs und Testkopien, die Server des Kunden verlassen hat
  • Was sie übergeben werden: den Code, die Beispiele, die Einstellungen und die Dokumentation, und ob etwas bei ihnen bleibt

Hören Sie dann darauf, was der Anbieter Sie fragt. Ein Unternehmen, das so etwas schon gebaut hat, fragt, bevor es ein Angebot macht:

  • Welche Aufgabe, in welchem System, und wer sie heute erledigt
  • Welche Daten das Modell sehen wird und was Ihre Regeln dafür erlauben
  • Ob Sie echte Beispiele mit den richtigen Antworten haben und wer weitere schreiben kann
  • Wer die Antworten prüfen wird und wer ein Jahr nach dem Start für das System verantwortlich sein wird

Ein schneller Test für jeden KI-Anbieter: Fragen Sie, was mit einem Dokument oder Ticket passiert, das das Modell falsch bearbeitet. Ein Anbieter, der so etwas schon gebaut hat, antwortet damit, wohin die falsche Antwort geht und wer sie korrigiert. Ein Anbieter, der das nicht hat, antwortet mit dem Namen eines Modells.

Hat amBrain ein Sprachmodell in Produktion gebracht?

Unter den oben beschriebenen Arten von Anbietern ist amBrain eine Engineering-Firma.

Was amBrain öffentlich über seine eigene Arbeit mit Sprachmodellen sagen kann, hier vollständig: Wir haben eine LLM-Integration innerhalb des FinTech-Perimeters eines Kunden in Produktion gebracht: die Extraktion und Normalisierung unstrukturierter Mitteilungen von Brokern und Handelsplätzen – Kapitalmaßnahmen, Instrumenten- und Margin-Änderungen – zu strukturierten Datensätzen, die das Handelssystem verarbeitet.

Der Kunde wird nicht genannt, wo das Modell in diesem Projekt lief, wird nicht offengelegt, und es werden keine Zahlen zu diesem Projekt genannt. Dieser Artikel ist keine Case Study dazu. Er erklärt, wie man plant und auswählt, und er behauptet nicht, dass amBrain ein Support-Ticket-System, einen Assistenten für Mitarbeiter oder irgendein internes KI-System außer der oben genannten Extraktion von Mitteilungen gebaut hat.

Über diese Integration hinaus: amBrain baut seit 2019 Software. Wir arbeiten in drei Formaten: vollständige Umsetzung, dediziertes Team oder Engineers, die in Ihrem Team mitarbeiten. Der Kunde behält das volle Eigentum an Produkt und Code, ausgenommen unsere wiederverwendbaren Komponenten.

Wenn Sie am Anfang stehen, ist der sinnvolle nächste Schritt keine Anbietersuche. Es ist eine Seite mit schriftlichen Antworten auf die sieben Fragen in diesem Artikel. Geben Sie dieselbe Seite jedem Entwicklungspartner, mit dem Sie sprechen, uns oder jedem anderen, und ihre Angebote lassen sich Zeile für Zeile vergleichen.

Liegt ein solcher Entwurf bei Ihnen auf dem Tisch?

Bringen Sie Ihre aktuelle Architektur und den Fehlerfall mit, der Sie beunruhigt - wir gehen ihn in einer halben Stunde gemeinsam durch.