Lokale KI für Unternehmen: die Modelle laufen im eigenen Netz
Manche Unterlagen dürfen das Unternehmen nicht verlassen: Konstruktionszeichnungen, Preislisten, Verträge, alles, was unter eine Geheimhaltungsvereinbarung fällt. Und manche Anlage hat gar keine Verbindung nach außen, soll aber trotzdem antworten. Dann hilft kein Häkchen in den Einstellungen eines Anbieters, dann muss das Modell dort laufen, wo die Daten liegen: bei Ihnen vor Ort. Das ist eine lokale KI im eigenen Netz. Wir bauen sie auf und übergeben sie Ihrer IT.
Planung
individuell
Was Sie haben, was Sie brauchen, was der Aufbau kostet
- Wir sehen uns an, welche Daten das Unternehmen nicht verlassen dürfen und welche schon
- Am Ende steht die Liste Ihrer Fälle, die Zuordnung zu einer der drei Stufen und der Festpreis für den Aufbau
- Das alles liegt Ihnen vor, bevor Sie sich für den Aufbau entscheiden
Aufbau
Festpreis
Nach der Planung, weil dann der Umfang feststeht
- Server einrichten, Modelle aufsetzen, Anmeldung an Ihr Verzeichnis binden
- Der Festpreis gilt für den Umfang, den die Planung festgelegt hat. Eine spätere Erweiterung ist ein eigenes Angebot
- Alles läuft in Ihrem Netz und gehört Ihnen, einschließlich der Einrichtung
Betrieb
nach Vereinbarung
Wenn Sie ihn nicht selbst übernehmen wollen
- Überwachung, Modellwechsel, Aktualisierungen und Sicherungen
- Die Höhe hängt an der Stufe, an der Zahl der Nutzer und daran, wie viel Ihre IT selbst übernimmt
- Oder wir schulen Ihre IT und sind nur noch im Hintergrund erreichbar
Lokale KI in der Praxis
Eine lokale KI macht dieselbe Arbeit wie ein zugekauftes Modell oder eine API: Sie liest Text, Tabellen und Bilder, ordnet sie ein, beantwortet Fragen und schreibt Entwürfe. Der Unterschied ist der Ort. Das Modell rechnet auf Ihrer Hardware, und was es dabei zu sehen bekommt, bleibt im Unternehmen.
Das Einsatzgebiet ist deshalb nicht kleiner als bei den großen Anbietern. Am stärksten ist der eigene Betrieb dort, wo die Daten vertraulich sind.
Anwendungsfälle, jeweils mit einem Beispiel
- Angebotserstellung: Eine Anfrage kommt per E-Mail, das Modell zieht die passenden Positionen aus der vertraulichen Preisliste und schreibt den Angebotsentwurf. Die Preisliste verlässt dabei nie das Unternehmen.
- Kundenservice: Das Modell liest die eingehende Anfrage, sucht die Antwort in Handbüchern und Servicehistorie und legt dem Mitarbeiter einen Antwortentwurf vor.
- Kunden- und Patientendaten: Aufnahmebögen, Arztbriefe oder Vertragsunterlagen werden ausgelesen, zusammengefasst und in Ihr System übertragen. Personenbezogene Daten gehen dabei zu keinem Anbieter.
- Dokumente durchsuchen: Die Konstruktion fragt nach einer alten Zeichnung und bekommt die Fundstelle im Original, nicht nur einen Ordnernamen.
- Prüfen gegen Vorgaben: Die Qualitätssicherung lässt einen Prüfbericht mit der Vorgabe abgleichen und bekommt die Abweichungen benannt.
- Softwareentwicklung: Ihre Entwickler nutzen das Modell als Programmierhilfe, ohne dass Quellcode das Unternehmen verlässt.
- Sprache, Bild und Scan: Diktate und Besprechungen werden verschriftlicht, Fotos von Typenschildern und gescannte Lieferscheine ausgelesen. Offene Modelle können das inzwischen auch.
- Betrieb ohne Internet: Ein Prüfschritt in der Fertigung läuft weiter, auch wenn die Leitung nach außen ausfällt.
| KI-Server neu | KI-Server generalüberholt | Abos für 20 Mitarbeiter | |
|---|---|---|---|
| Was | Vier Karten NVIDIA RTX PRO 6000 Blackwell mit je 96 GB in einem 4U-Server | Vier gebrauchte NVIDIA A100 mit je 80 GB in einem generalüberholten Gehäuse | 15 Standard- und 5 Premium-Sitze bei einem Anbieter, etwa ChatGPT Business oder Claude Team |
| Einmal | rund 67.000 bis 80.000 € | rund 26.000 bis 43.000 €, zuzüglich Prozessoren, Speicher, Platten und Einfuhr | 0 € |
| Laufend je Jahr | Strom höchstens rund 3.600 €, im Alltag weniger | Strom höchstens rund 1.800 €; Garantie 90 Tage bis 12 Monate | rund 10.300 €; bei beiden Anbietern das Doppelte |
| Nach drei Jahren | rund 78.000 bis 90.000 €, die Hardware gehört Ihnen | rund 31.000 bis 48.000 €, mit dem Risiko gebrauchter Karten | rund 31.000 €, und danach läuft es weiter |
| Ab wann es kippt | Ab etwa 50 Nutzern mit Standard-Sitzen oder etwa 20 Vielnutzern mit Premium-Sitzen, gerechnet über drei Jahre | Ab etwa 20 Nutzern mit Standard-Sitzen oder 8 Vielnutzern | Bis dahin ist das Abo günstiger, es sei denn, die Daten dürfen nicht zum Anbieter |
Beide Server tragen die aktuellen offenen Modelle wie GLM-5.3-Flash, Qwen3.8, DeepSeek V4 Flash oder Gemma 4, der neue mit über 50 Token je Sekunde und Nutzer bei 16 bis 32 gleichzeitigen Anfragen. Nicht in der Rechnung: unsere Arbeitszeit für Planung und Aufbau, ein Serverraum mit Kühlung und die Stunden Ihrer IT.
Wie wir Modellgröße und Hardware an Ihren Fällen ausrechnen, steht unter welche Hardware lokale KI braucht, was ein Server im Einzelnen kostet unter was ein KI-Server kostet.
Wann Modelle im eigenen Netz laufen müssen
Es gibt zwei Gründe, und nur einer davon ist der Datenschutz. Der erste steht in Ihren Vereinbarungen: Wer für Kunden aus Rüstung, Automobil oder Pharma arbeitet, hat Geheimhaltungsvereinbarungen unterschrieben, die eine Weitergabe an Dritte ausschließen. Ein Sprachmodell bei einem Anbieter ist ein Dritter, auch wenn er verspricht, nichts zu speichern. Was Sie für beide Wege belegen müssen, steht unter was Sie bei KI nachweisen müssen.
Der zweite ist praktisch: Wenn die Leitung ausfällt, steht ein zugekauftes Modell still. Für eine Chatoberfläche ist das ärgerlich, für eine Prüfung in der Fertigung ist es ein Produktionsstopp.
Diese Betriebsform heißt on premise. KI on premise bedeutet: Das Modell rechnet auf Ihrer eigenen Hardware, und die Unterlagen bleiben dort, wo sie ohnehin liegen.
Wenn keiner der beiden Gründe zutrifft, ist es eine Kosten-Nutzen-Frage: Die Hardware kaufen Sie einmal, Abos zahlen Sie je Nutzer und Monat. Ab welcher Zahl von Nutzern das kippt, zeigt die Tabelle oben. Wann wir trotzdem abraten, steht weiter unten.
Typische Anlässe
- Geheimhaltungsvereinbarungen, die eine Weitergabe an Dritte ausschließen
- Ein Betriebsrat, der einer Verarbeitung außerhalb des Unternehmens nicht zustimmt (Mitbestimmung nach § 87 Abs. 1 Nr. 6 BetrVG, sobald ein System die Nutzung protokollieren kann; das gilt im eigenen Netz genauso, nur bleibt die Verarbeitung dann bei Ihnen; mehr dazu unter was der Betriebsrat bei KI mitbestimmt)
- Anlagen ohne Netzanbindung, in denen das System trotzdem antworten soll
- Der Wunsch, nicht an einen Anbieter und seine Preisliste gebunden zu sein
Was lokal genau heißt, in drei Stufen
Der Begriff wird für drei verschiedene Dinge benutzt, und die Unterschiede entscheiden über Kosten und Aufwand. Wir klären das vor dem Angebot, damit niemand für Stufe drei bezahlt, wenn Stufe eins reicht.
In der ersten Stufe liegen Ihre Daten im Unternehmen, das Modell wird zugekauft. In der zweiten läuft auch das Modell auf Ihrer Hardware, das System darf aber noch ins Internet, etwa für Aktualisierungen. In der dritten gibt es keinen Weg nach außen mehr. On premise KI ist also kein einzelner Zustand, sondern eine dieser drei Stufen.
| Daten im Unternehmen | Modell im Unternehmen | Ohne Verbindung nach außen | |
|---|---|---|---|
| Stufe 1 | ja | nein | nein |
| Stufe 2 | ja | ja | nein |
| Stufe 3 | ja | ja | ja |
Der Sprung von zwei auf drei ist der teuerste. Ohne Verbindung nach außen muss jede Aktualisierung von Hand eingespielt werden, und ein Fehler lässt sich nicht eben aus der Ferne beheben. Das ist machbar und wir machen es, aber es sollte einen Grund haben.
Was brauche ich für eine lokale KI im eigenen Netz?
Wir rechnen vor dem Kauf aus, welche Modellgröße Ihre Fälle brauchen, und leiten daraus ab, ob eine einzelne Grafikkarte in einem vorhandenen Server reicht oder ein eigener Rechner nötig ist. Ein LLM on premise braucht Rechenleistung bei Ihnen vor Ort, und die richtet sich nach Ihren Fällen, nicht nach einem Datenblatt. Wie diese Rechnung geht, steht unter welche Hardware lokale KI braucht. Was ein eigener Rechner dafür kostet, steht unter was ein KI-Server kostet.
Die Anmeldung läuft über Ihr vorhandenes Verzeichnis, also über das Konto, mit dem Ihre Leute sich morgens ohnehin anmelden, etwa Microsoft Entra ID. Wer das Unternehmen verlässt, verliert den Zugang dort, wo Sie ihn ohnehin entziehen. Eine zweite Benutzerverwaltung entsteht nicht. Was Ihre IT-Leitung vor der Freigabe prüft, steht unter was die IT-Leitung bei lokaler KI prüft.
Für den Betrieb gibt es zwei Wege. Entweder wir übernehmen ihn, oder wir schulen Ihre IT und bleiben im Hintergrund erreichbar. Der zweite Weg ist der günstigere, und er ist der richtige, wenn bei Ihnen jemand Linux-Server verantwortet. Was alles dazugehört, steht unter was zum Betrieb im eigenen Unternehmen gehört.
Wie wir aufbauen und übergeben
Wie lange der Aufbau dauert, legt die Planung fest. Der längste Posten ist selten die Technik, sondern der Termin mit Ihrer IT für die Anmeldung.
- Aufnahme Welche Daten dürfen nicht nach außen, welche Fälle sollen laufen, was steht an Hardware bereits da.
- Größe bestimmen Wir messen an Ihren echten Fällen, welche Modellgröße reicht. Daraus folgt die Hardware, nicht aus einem Datenblatt.
- Aufbau Server einrichten, Modelle aufsetzen, Oberfläche bereitstellen, Anmeldung an Ihr Verzeichnis binden.
- Testbetrieb Eine Abteilung arbeitet damit, bevor jemand über eine Erweiterung entscheidet.
- Übergabe Dokumentation, Zugänge, Einweisung. Danach können Sie es allein betreiben, auch ohne uns.
Was es kostet
Die Planung wird individuell veranschlagt. Der Aufbau ist ein Festpreis, und er steht nach der Planung fest. Der Betrieb läuft nach Vereinbarung.
Der Grund für diese Reihenfolge: Zwischen Stufe eins und Stufe drei liegt ein Vielfaches. Eine Zahl vorab würde mehr verschleiern als zeigen, weil sie für den einen zu hoch und für den anderen zu niedrig wäre.
Die Hardware kaufen Sie direkt beim Händler Ihrer Wahl. Wir stellen nur Arbeitszeit in Rechnung und verdienen an der Hardware nichts.
Ob sich der eigene Betrieb gegen zugekaufte Abos rechnet, hängt an der Zahl der Nutzer und an der Laufzeit. Eine Beispielrechnung für zwanzig Mitarbeiter steht oben auf dieser Seite, die ausführliche Fassung an anderer Stelle.
Wann wir abraten
Wenn weder vertrauliche Daten noch eine Anlage ohne Netz dahinterstehen und nur wenige Leute damit arbeiten, ist ein zugekauftes Modell in einem europäischen Rechenzentrum meist der günstigere Weg. Er ist schneller verfügbar, und es steht keine Hardware bei Ihnen. Was er gegen den eigenen Betrieb kostet, steht unter was der Betrieb im eigenen Unternehmen kostet.
Auch dann raten wir ab, wenn niemand in der Firma einen Server verantworten will und der Betrieb nicht dauerhaft eingekauft werden soll. Ein System, für das sich niemand zuständig fühlt, veraltet still.
Und die Grenze nach oben: Wer mit den jeweils neuesten Modellen der großen Anbieter arbeiten will oder muss, etwa weil das Team täglich mit ihnen entwickelt, kann mit einem lokalen Modell nicht Schritt halten. Ob ein Modell klug genug ist, ist dagegen keine Frage mehr. Offene Modelle von Qwen, DeepSeek, GLM, Gemma, Kimi und Nvidia lesen Text, Bilder und Scans und liefern bei den Aufgaben oben Ergebnisse, die sich mit den zugekauften messen lassen (Stand September 2026). Ob das für Ihre Fälle gilt, zeigt die Abnahme an Ihren eigenen Fragen, nicht eine Rangliste. Es bleibt eine Kosten-Nutzen-Frage. Welche Modelle infrage kommen, steht unter welche lokalen KI-Modelle für Firmen taugen. Aufgabe für Aufgabe steht das unter ob ein lokales Sprachmodell so gut ist wie ChatGPT.
Alle Preise verstehen sich netto zuzüglich Umsatzsteuer. Der Festpreis für den Aufbau gilt für den Umfang, den die Planung festlegt; eine spätere Erweiterung ist ein eigenes Angebot. Der Hinweis auf § 87 Abs. 1 Nr. 6 BetrVG beschreibt die Rechtslage in Stichworten und ersetzt keine Rechtsberatung.
Der Ort ist eine Entscheidung, keine Vertrauensfrage
Ob Ihre Unterlagen das Unternehmen verlassen, sollte nicht davon abhängen, was in den Nutzungsbedingungen eines Anbieters steht und wie oft er sie ändert. Wenn das Modell auf Ihrer Hardware läuft, ist die Frage technisch beantwortet und bleibt beantwortet.
Das ist der erste Grund. Der zweite ist die Rechnung: Hardware kaufen Sie einmal, Abos zahlen Sie je Nutzer und Monat, Jahr für Jahr. Ab einer bestimmten Zahl von Nutzern kippt das, und die Tabelle oben zeigt, wo.
- Ort
- Ihr Serverraum, Ihr Rechenzentrum oder ein deutsches Rechenzentrum Ihrer Wahl
- Verbindung
- Im eigenen Netz, im Fachwort on premise. Auf Wunsch ohne jeden Weg ins Internet
- Modelle
- Offene Modelle wie Qwen, DeepSeek, GLM, Gemma, Kimi oder Nemotron von Nvidia, für Text, Bild und Sprache, austauschbar (Stand September 2026)
- Anmeldung
- Mit dem Konto, das Ihre Leute ohnehin haben (Ihr Verzeichnis, etwa Microsoft Entra ID, per OAuth und OIDC)
- Hardware
- Welche Grafikkarte und wie viel Speicher, rechnen wir vor dem Kauf an Ihren Fällen aus
- Was Sie stellen
- Die Fälle, die nicht nach außen dürfen, eine Ansprechperson im Fachbereich und einen Termin mit Ihrer IT
- Wann nicht
- Wenn ein zugekauftes Modell in einem europäischen Rechenzentrum reicht, sagen wir das
- Übergabe
- Dokumentation, Zugänge und eine Einweisung für Ihre IT
- Belegter Fall
- Bei einem Armaturenhersteller läuft ein System seit Dezember 2025 im eigenen Netz