KI lokal betreiben: was wirklich dazugehört
Die Software ist an einem Nachmittag installiert. Danach fängt die Arbeit an: ein Modell wählen, das Sie einsetzen dürfen, die Anmeldung an Ihr Verzeichnis hängen, die Rechte so setzen, dass jeder nur seine Unterlagen sieht, und das Ganze am Laufen halten. Dieser Text zeigt den Aufbau Schritt für Schritt und sagt, wann Sie es besser lassen.
- Kurzform
- Erst die Lizenz prüfen, dann die Hardware kaufen. Der Aufbau dauert Tage, der Betrieb bleibt
- Bausteine
- Server, Inferenzserver, Oberfläche mit Anmeldung, Index für eigene Unterlagen, Überwachung
- Werkzeuge
- Ollama zum Ausprobieren, vLLM für mehrere Nutzer, Open WebUI oder LibreChat als Oberfläche
- Lizenz
- Apache 2.0 und MIT erlauben beide die kommerzielle Nutzung. Llama 4 schließt EU-Unternehmen aus
- Belegter Fall
- Armaturenhersteller, Plattform im eigenen Netz, in Betrieb seit Dezember 2025
- Stand
- September 2026
Wann sich der eigene Betrieb lohnt und wann nicht
Der häufigste Irrtum ist, dass man einen Server kauft und dann fertig ist. Die Hardware läuft im Dauerbetrieb und wird irgendwann ersetzt. Wer klug plant, verschiebt diesen Punkt weit nach hinten, aber er kommt.
Der zweite Irrtum betrifft die eigene IT. Es stimmt, dass jemand den Betrieb übernehmen muss. Dieser Jemand muss aber nicht im Unternehmen sitzen. Wer Aufbau und Betrieb an einen Partner vergibt, braucht intern niemanden mit KI-Erfahrung. Das ist unser Geschäft, und wir sagen Ihnen vorher, was davon bei Ihnen bleibt.
| Tun Sie es, wenn | Lassen Sie es, wenn |
|---|---|
| Sie mit Daten arbeiten, die das Unternehmen nicht verlassen dürfen: Konstruktionsdaten, Kundendaten, Gesundheitsdaten | Ihre Unterlagen unkritisch sind. Dann lohnt der Aufwand nicht |
| Sie sich nicht an einen Anbieter binden wollen, dessen Preise und Verfügbarkeit Sie nicht steuern | Sie den Betrieb weder selbst übernehmen noch abgeben wollen |
| Sie Modelle frei und schnell wechseln wollen, ohne dass Ihre Daten dabei das Unternehmen verlassen | niemand sich mit den Grundlagen befassen will. Wer mit KI arbeitet, muss lernen, wie man sie führt |
| Sie dieselben Fragen dauerhaft in großer Zahl beantworten, etwa im Innendienst oder im Service | Sie nicht bereit sind, in der Ablage aufzuräumen. Ein System antwortet nur so gut wie Ihre Daten |
| Sie eigene Abläufe abbilden wollen und nicht nur einen Chat brauchen | niemand seine Arbeitsweise ändern will. Ein System, das keiner benutzt, ist verschwendetes Geld |
| Sie einen Prozess über Jahre planen und ihn nicht jedes Jahr neu verhandeln wollen | Sie in zwei Wochen fertig sein müssen. Ein zugekaufter Dienst läuft am selben Tag |
Zwei Dinge lassen sich nicht auslagern. Ihre Leute müssen mit dem System arbeiten wollen, und Ihre Abläufe müssen klar genug sein, dass sich ein Schritt daraus abbilden lässt. Fehlt eines von beiden, scheitert der Aufbau unabhängig von der Technik. Ab wann sich der eigene Betrieb gegenüber einem zugekauften Dienst rechnet, steht in was der Betrieb im eigenen Unternehmen kostet.
Achten Sie zuerst auf die Lizenz, dann auf die Hardware
Nur weil ein Modell offene Gewichte hat, darf es nicht jeder einsetzen. Die Lizenz von Llama 4 gilt für Unternehmen mit Sitz in der EU nicht, und zwar für alle Varianten, weil alle multimodal sind. Diese Einschränkung steht nicht im Lizenztext selbst, sondern in der Nutzungsrichtlinie, auf die der Vertrag verweist.
Apache 2.0 und MIT kennen solche Grenzen nicht. Beide erlauben die kommerzielle Nutzung ausdrücklich, bis hin zum Verkauf. Der Unterschied zwischen ihnen liegt woanders: Apache 2.0 gibt Ihnen zusätzlich eine Patentlizenz und verlangt dafür, dass Sie Änderungen kennzeichnen und die Hinweisdatei mitgeben. MIT verlangt nur, dass der Urhebervermerk erhalten bleibt, und sagt zu Patenten nichts.
Prüfen Sie das, bevor Sie Hardware kaufen. Sonst steht im schlechtesten Fall eine Karte im Serverraum, auf der das gewünschte Modell nicht laufen darf, und Sie rüsten für ein anderes nach.
| Lizenz | Dürfen Sie es einsetzen? | Was Sie beachten müssen |
|---|---|---|
| Apache 2.0 | Ja, ohne Grenze | Änderungen kennzeichnen, Hinweise und NOTICE-Datei weitergeben. Dafür eine ausdrückliche Patentlizenz |
| MIT | Ja, ohne Grenze | nur den Urhebervermerk erhalten. Zu Patenten schweigt der Text |
| Llama 4 Community License | Nein, nicht mit Sitz in der EU | Damit ist das Thema für Sie erledigt. Die Nutzungsrichtlinie nimmt Unternehmen mit Hauptsitz in der EU von den Rechten aus, und das gilt für alle Llama-4-Modelle |
| Gemma, Kimi K3, GLM | Ja | Verträge mit Umsatz- oder Nutzerschwellen, die ein Mittelständler nie erreicht. Kein Open Source, aber im Alltag ohne Folgen |
| AGPL, etwa bei YOLO | Nur mit Auflage | wer die Modelle einsetzt, muss den eigenen Quelltext offenlegen oder eine Lizenz kaufen |
Was passiert, wenn man sich nicht daran hält? Ehrliche Antwort: Kein Hersteller hat bisher öffentlich jemanden verklagt, der eine Modelllizenz verletzt hat. Auffallen kann es trotzdem. Bei zugangsbeschränkten Modellen gehen Name und Adresse beim Herunterladen an den Anbieter. Zertifizierungen wie ISO 27001 verlangen eine Lizenzübersicht. Und wenn Sie ein System an einen Kunden liefern, prüft dessen Einkauf, was darin steckt. Ohne gültige Lizenz haben Sie kein Nutzungsrecht, ob es jemand merkt oder nicht.
So sieht der Aufbau aus
Sechs Schritte, von der Karte bis zum laufenden Betrieb. Klicken Sie sich durch, oder lassen Sie sie laufen.
Ein Wort zu OpenRouter, das in vielen Anleitungen als Einstieg auftaucht: Der Dienst leitet Anfragen an fremde Rechenzentren weiter. Das ist das Gegenteil von lokalem Betrieb und für den Notfall brauchbar, nicht als Grundlage.
Ein Linux-Server mit einer Grafikkarte, entweder bei Ihnen im Schrank oder gemietet in einem Rechenzentrum. Die Karte richtet sich nach dem Modell, nicht umgekehrt.
NVIDIA nennt in seinem eigenen Leitfaden für zehn bis fünfzig gleichzeitige Sitzungen 24 Gigabyte Speicher bei einem Modell mit sieben bis acht Milliarden Parametern und 48 Gigabyte bei größeren. Eine Formel „so viele Nutzer gleich diese Karte“ gibt es bei keinem Hersteller. Was Ihre Fälle brauchen, rechnen wir vorher aus. Die Rechnung dazu steht in welche Hardware lokale KI braucht, die Frage nach Kauf oder Miete in was ein KI-Server kostet.
Hier entscheidet sich, ob zwei Leute gleichzeitig arbeiten können. Ollama ist zum Ausprobieren gebaut und beantwortet laut eigener Dokumentation eine Anfrage je Modell nacheinander. Kommen mehrere zugleich, stellen sie sich an, und ab einer bestimmten Länge der Schlange nimmt Ollama gar nichts mehr an.
Für den Betrieb mit mehreren Menschen nimmt man vLLM oder SGLang. Die bündeln Anfragen und rechnen sie zusammen, statt sie der Reihe nach abzuarbeiten. Text Generation Inference von Hugging Face steht inzwischen im Wartungsmodus und verweist selbst auf diese beiden.
Es geht nicht um ein Modell, sondern um mehrere. Ein Sprachmodell formuliert die Antwort. Ein Embedding-Modell macht Ihre Unterlagen durchsuchbar. Ein Dokumentmodell liest Scans. Kommen Telefonate, Fotos oder Videos dazu, kommt je eine weitere Art dazu. Welche Art welchen Arbeitsschritt übernimmt, steht in welche lokalen KI-Modelle für Unternehmen relevant sind.
Jede Art wird einzeln ausgewählt. Wir setzen je Aufgabe zwei oder drei Kandidaten auf Ihren Server und lassen sie an Ihren eigenen Fragen gegeneinander laufen. Erst danach fällt die Entscheidung. Ein Modell, das anderswo gewonnen hat, gewinnt bei Ihnen nicht automatisch.
Vorsicht bei kleinen Modellen. Ein Modell lässt sich verkleinert speichern und passt dann auf eine kleinere Karte. Das spart Geld und kostet Tiefe: Komplexe Aufgaben brauchen langes Nachdenken, und genau das können verkleinerte Modelle schlechter. In einer Untersuchung verloren schwere Aufgaben viermal so viel wie leichte. Wo geprüft und ausgewertet wird, nehmen Sie deshalb die volle Fassung.
Open WebUI oder LibreChat geben dem System ein Gesicht und verwalten Rollen, Rechte und Gruppen. Beide holen die Gruppen aus Ihrem vorhandenen Verzeichnis, meist Microsoft Entra ID.
Das ist wichtiger, als es klingt. Niemand soll eine zweite Benutzerverwaltung pflegen, und wer das Unternehmen verlässt, soll damit auch aus dem KI-System verschwinden. AnythingLLM kann das laut eigener Dokumentation nicht und kennt nur drei feste Rollen. Was eine solche Oberfläche im Alltag leistet, steht in Open WebUI als ChatGPT-Alternative.
Aus den Gruppen folgt, wer welche Unterlagen sieht. Mit Handbüchern und Preislisten arbeitet jeder. Lohnabrechnungen sehen nur die Verwaltung und die Geschäftsführung. Ohne diese Trennung kommt ein Mitarbeiter über eine harmlose Frage an das Gehalt seines Kollegen, und niemand merkt es.
Sollen Antworten aus Ihren eigenen Unterlagen kommen, kommt eine Suche dazu: Dokumente einlesen, in Stücke zerlegen, in eine Vektordatenbank schreiben. Wie das im Einzelnen läuft, steht in wie eine RAG-Pipeline aufgebaut wird.
Einmal einlesen reicht nicht. Wird die Preisliste am Montag geändert und der Bestand erst am Freitag erneuert, antwortet das System vier Tage lang mit alten Zahlen. Deshalb hängt die Suche an den Quellen, aus denen Ihre Abteilungen ohnehin arbeiten: Dateiablage, Dokumentenverwaltung, ERP. Was dort geändert wird, steht kurz darauf auch in der Antwort. Erst damit arbeiten Vertrieb, Service und Verwaltung wirklich mit demselben Stand.
Hier entscheidet sich, wer später was sieht. Mehr dazu im nächsten Abschnitt.
Ab hier ist es ein Fachsystem wie Ihr ERP. Aktualisierungen einzeln einspielen, Auslastung und Antwortzeiten im Blick behalten, sichern, und alle paar Monate prüfen, ob ein neueres Modell den Wechsel lohnt.
Die Werkzeuge dafür sind Standard: NVIDIAs DCGM-Exporter liest Temperatur und Fehler direkt aus der Karte, vLLM meldet Warteschlangen und Antwortzeiten, beides landet in Prometheus und wird in Grafana sichtbar.
Wer welche Unterlagen sehen darf
Die Gruppen aus dem Verzeichnis sind die eine Hälfte. Die andere entscheidet sich im Bestand. Eine Vektordatenbank legt Ihre Dokumente nämlich nicht in getrennte Schubladen, sondern in einen gemeinsamen Topf, jedes Stück mit einer Markierung, wem es gehört. Ob die Lohnabrechnung nur in der Verwaltung auftaucht, hängt daran, wann diese Markierung geprüft wird.
Die Regel ist einfach: vor der Suche, nicht danach. Wird erst nachträglich gefiltert, hat das System die fremden Stellen bereits geholt, und ein präparierter Satz in einem Dokument kann es dazu bringen, sie trotzdem auszugeben. Das nennt sich Prompt Injection und steht in der OWASP-Liste für KI-Anwendungen auf Platz eins. Bei Microsoft 365 Copilot wurde 2025 ein solcher Weg gefunden und geschlossen.
Wer die Rechte nur in der Oberfläche prüft, hat sie nicht geprüft. Und niemand kann Ihnen versprechen, dass sich Prompt Injection vollständig ausschließen lässt. Man kann das Risiko senken: getrennte Bereiche je Vertraulichkeitsstufe, Filter vor der Ähnlichkeitssuche, Protokoll darüber, wer was gefragt hat.
Was ein Ausfall bedeutet
Grafikkarten fallen aus. Meta hat beim Training eines großen Modells auf 16.384 Karten in 54 Tagen 466 Unterbrechungen gezählt, also im Schnitt alle drei Stunden eine, und über 47 Prozent davon gingen auf die Karten oder ihren Speicher zurück. Trotzdem lief das System über 90 Prozent der Zeit, weil Zwischenstände und automatische Neustarts die einzelnen Ausfälle abgefangen haben.
Im Unternehmen sind die häufigen Fälle harmloser: eine defekte Karte, ein Softwarefehler nach einer Aktualisierung, eine volle Festplatte. Alle drei sind behebbar, wenn jemand sie bemerkt. Deshalb gehören Überwachung und Sicherungen von Anfang an dazu und nicht ins zweite Jahr.
Legen Sie vorher zwei Zahlen fest: wie lange das System stehen darf und wie viel Arbeit verloren gehen darf. Daraus ergibt sich, was Sie sichern und wie oft. Für den Fall, dass die Karte länger ausfällt, lässt sich ein Zugang bei einem europäischen Anbieter hinterlegen. OVHcloud, IONOS, Scaleway und STACKIT betreiben offene Modelle auf Hardware in der EU.
Kurz beantwortet
Vier Fragen, die immer wieder kommen.
- Was brauche ich, um KI lokal zu betreiben?
- Einen Linux-Server mit Grafikkarte, ein Modell, dessen Lizenz Sie einsetzen dürfen, ein Programm, das die Antworten rechnet, und eine Oberfläche mit Anmeldung an Ihr Verzeichnis. Sollen Antworten aus eigenen Unterlagen kommen, kommt eine Suche dazu. Der Aufbau dauert wenige Tage, der Betrieb bleibt.
- Reicht Ollama für ein Unternehmen?
- Zum Ausprobieren ja, für den Betrieb nicht. Ollama beantwortet laut eigener Dokumentation eine Anfrage je Modell nacheinander und lehnt weitere nach einer Warteschlange ab. Sobald mehrere Menschen gleichzeitig fragen, brauchen Sie vLLM oder SGLang.
- Darf ich jedes offene Modell im Unternehmen einsetzen?
- Nein. Apache 2.0 und MIT erlauben es ohne Einschränkung, die Llama-4-Lizenz gewährt Unternehmen mit Sitz in der EU keine Rechte, und YOLO steht unter AGPL, die eine Offenlegung des eigenen Quelltexts verlangt. Die Lizenz gehört zum einzelnen Modell, nicht zur Familie, und wird vor dem Hardwarekauf geprüft.
- Kann jeder alles sehen, was im System liegt?
- Nur wenn Sie es falsch bauen. Die Rechte gehören in den Bestand und werden vor der Suche geprüft, nicht erst beim Anzeigen der Antwort. Getrennte Bereiche je Vertraulichkeitsstufe sind der zweite Baustein. Eine Garantie gegen Prompt Injection gibt es nicht, aber ein deutlich niedrigeres Risiko.
Im Einzelnen
Die Anmeldung an Entra ID im Detail
Für Open WebUI braucht die IT vier Werte aus der Anwendungsregistrierung und eine Rückleitadresse, die dort identisch hinterlegt sein muss. Zwei Einstellungen entscheiden darüber, ob der Betrieb ruhig läuft.
Ohne den Bereich offline_access schlägt die Erneuerung des Zugangstokens fehl, und die Belegschaft muss sich nach etwa einer Stunde neu anmelden. Setzen Sie ihn, verlängert das zugleich das Zeitfenster, in dem ein entzogenes Recht noch wirkt. Denn Rollen- und Gruppenänderungen aus dem Verzeichnis greifen erst bei der nächsten Anmeldung.
Für die Austrittsliste der IT heißt das: Wer ausscheidet, verliert nicht nur die Rolle, sondern es werden zusätzlich die Zugangstoken im Verzeichnis widerrufen. Sonst kann jemand noch eine Weile arbeiten, dessen Konto längst gesperrt sein sollte.
Eine Grenze steht in derselben Dokumentation: Es lässt sich nur ein einziger OIDC-Anbieter führen. Wer zwei Anmeldewege braucht, etwa für Externe aus einem fremden Konto, landet bei einem Umweg über das eingebaute Google-Modul. Die Dokumentation kennzeichnet das als Beitrag aus der Gemeinschaft, nicht als Zusage des Herstellers, und warnt beim Zusammenführen über die E-Mail-Adresse ausdrücklich vor Kontoübernahmen.
Woher die Angaben stammen und was offen bleibt
Die Lizenzangaben stammen aus den Lizenztexten selbst: Apache 2.0, MIT, Llama 4 Nutzungsrichtlinie und Ultralytics YOLO. Die Aussagen zu den Werkzeugen stehen in deren eigener Dokumentation: Ollama, vLLM, Open WebUI. Die Hardwaregrößen nennt NVIDIAs Sizing-Leitfaden. Abgerufen am 14. September 2026.
Vier Punkte, die dieser Text nicht klärt
- Was Ihr Aufbau kostet. Das folgt aus Modellgröße, Nutzerzahl und Betriebsort. Eine Zahl ohne diese drei Angaben wäre geraten.
- Wie schnell Ihr Modell antwortet. Kein Hersteller nennt Wörter je Sekunde für Ihre Karte. Das misst man im eigenen Aufbau.
- Wie viel Qualität eine verkleinerte Fassung genau kostet. Die Messungen unterscheiden sich je Modell und Aufgabe. Eine allgemeine Prozentzahl gibt es nicht.
- Ob Sie die Mitbestimmung brauchen. Ist das System zur Leistungs- oder Verhaltenskontrolle geeignet, ist der Betriebsrat vorher zu beteiligen. Das klärt was bei KI mitbestimmt wird.
Installieren dauert einen Nachmittag, betreiben dauert Jahre
Die Software ist schnell aufgesetzt. Was bleibt, ist der Betrieb: aktualisieren, überwachen, sichern, Rechte pflegen, alle paar Monate das Modell prüfen.
Wer das einplant, bekommt ein System, das in drei Jahren noch läuft. Wer es überspringt, bekommt einen Bastelstand, den nach dem ersten längeren Urlaub niemand mehr anfasst.
Wir bauen es auf und übernehmen den Betrieb
Planung, Aufbau und Betrieb aus einer Hand. Sie brauchen intern niemanden mit KI-Erfahrung, nur einen Ansprechpartner in der IT. Planung individuell, Aufbau zum Festpreis danach, Betrieb nach Vereinbarung.
Weiterlesen
- Welche lokalen KI-Modelle für Unternehmen relevant sind Welche Modellart welchen Arbeitsschritt übernimmt, und welche Modelle dafür in Frage kommen.
- Welche Hardware lokale KI braucht Wie aus Modellgröße, Kontextlänge und Nutzerzahl die Karte wird, die im Serverraum steht.
- Technische Dokumentation durchsuchbar machen Der Bericht zum Fall: was gebaut wurde, womit, seit wann es läuft und was offen geblieben ist.