Welche lokalen KI-Modelle für Unternehmen relevant sind
Ein lokales KI-System besteht selten aus einem Modell. Wer die eigene Dokumentation durchsuchbar machen will, braucht eines, das Scans liest, eines, das Textstücke vergleichbar macht, und eines, das antwortet. Dieser Text ordnet die Modellarten den betrieblichen Aufgaben zu und nennt je Aufgabe konkrete Kandidaten mit Lizenz, Größe und der Maschine, die der Hersteller dafür angibt.
- Kurzform
- Erst der Arbeitsschritt, dann die Modellart, dann das Modell. Die Maschine folgt daraus, nicht umgekehrt
- Modellarten
- Sprache, Embedding und Reranking, OCR, Audio, Bild und Video, Medienerzeugung, klassische Lernverfahren
- Betriebsklassen
- Eine Karte, ein Server, ein Verbund. Alle drei sind mit offenen Gewichten besetzt
- Angaben
- Modellkarten, Konfigurationsdateien und Dateigrößen der Hersteller, abgerufen am 14. September 2026
- Belegter Fall
- Armaturenhersteller, Plattform im eigenen Netz, in Betrieb seit Dezember 2025
- Stand
- September 2026
Welche Modellarten in einem lokalen System zusammenarbeiten
Die Frage nach dem richtigen lokalen KI-Modell hat selten eine einzige Antwort. Eine Auskunft aus der technischen Dokumentation durchläuft drei Modelle: eines liest den Scan, eines macht aus Textstücken Zahlenreihen, damit sich die passende Stelle finden lässt, und eines formuliert die Antwort. Kommt ein Telefonprotokoll dazu, kommt ein viertes dazu.
Drei Begriffe gehen dabei durcheinander. Alibaba ist der Anbieter, Qwen die Familie, Qwen3.8-27B das Modell, das auf der Maschine liegt. Open WebUI ist noch einmal etwas anderes, nämlich die Oberfläche, und rechnet selbst nichts. Lizenz, Größe und Fähigkeiten gehören zum einzelnen Modell.
Ein multimodales Modell deckt mehrere Zeilen der Tabelle ab, Qwen3.8-27B etwa nimmt Text, Bild und Video entgegen. Umgekehrt braucht kein Prozess alle Zeilen.
| Aufgabe | Hinein und heraus | Modellart | Kandidaten mit offenen Gewichten |
|---|---|---|---|
| Fragen beantworten, zusammenfassen, prüfen | Text hinein, Text heraus | Sprachmodell | gpt-oss, Qwen3.8, Gemma 4, Mistral, Nemotron, GLM, DeepSeek |
| In den eigenen Unterlagen suchen | Textstück hinein, Zahlenreihe heraus; Treffer hinein, Rangfolge heraus | Embedding und Reranking | Nemotron-3-Embed, Qwen3-Embedding, bge-m3 |
| Scans und PDF lesbar machen | Seitenbild hinein, Text mit Struktur heraus | OCR und Dokumentparser | granite-docling, PaddleOCR-VL, Nemotron Parse |
| Telefonate mitschreiben | Tonspur hinein, Text mit Sprechern heraus | Spracherkennung und Sprecherzuordnung | Whisper, Parakeet, Canary, Voxtral, pyannote |
| Fotos und Videos auswerten | Bild hinein, Beschreibung oder Markierung heraus | Vision-Language und Objekterkennung | Qwen3.5, Gemma 4, Molmo2, RF-DETR, SAM 3 |
| Bilder und kurze Filme erzeugen | Beschreibung hinein, Bild oder Film heraus | Bild- und Videomodell | FLUX.2 klein, Qwen-Image-Edit, Wan2.2 |
| Messwerte bewerten | Zahlenreihe hinein, Klasse oder Ausreißer heraus | klassische Lernverfahren | kein Sprachmodell, sondern etwa Support Vector Machines |
Welches Sprachmodell auf welche Maschine passt
Entscheidend ist bei Sprachmodellen nicht die Parameterzahl, sondern die Maschine, die ein Unternehmen dafür hinstellen muss. Drei Klassen lassen sich aus den Herstellerangaben ablesen, und alle drei sind mit offenen Gewichten besetzt. Auf eine einzelne Karte passt dabei mehr, als viele erwarten: Für Auskunft, Zusammenfassung und Prüfung an vorgelegten Unterlagen ist die erste Klasse der Regelfall.
Die offenen Spitzenmodelle sind Rechenzentrumsklasse. Ihre Modellkarten stellen Benchmarktabellen direkt neben Claude, GPT und Gemini; je nach Aufgabe liegen die Werte darüber oder darunter, und Moonshot schreibt selbst, die Gesamtleistung bleibe hinter den stärksten zugekauften Modellen zurück. Wer die Infrastruktur hat oder mietet, erledigt mit dieser Klasse Aufgaben im eigenen Netz, für die sonst ein Dienst eingekauft wird.
| Modell | Lizenz laut Modellkarte | Parameter gesamt und aktiv | Betrieb laut Hersteller |
|---|---|---|---|
| gpt-oss-120b (OpenAI) | Apache 2.0 | 117 Mrd., davon 5,1 aktiv | eine 80-GB-Karte, 65 GB in MXFP4 |
| Nemotron 3.5 Lightning (NVIDIA) | OpenMDW 1.1 | 31 Mrd., davon 3 aktiv | eine H100 oder A100 mit 80 GB |
| Muse Glimmer 30B (Meta) | Apache 2.0 | 30 Mrd., dicht | eine Karte mit 24 GB, Gewichte in 4 Bit |
| Qwen3.8-27B (Alibaba) | Apache 2.0 | 27 Mrd., dicht | eine Karte, 31 GB in FP8 |
| Gemma 4 31B (Google) | Apache 2.0 | 31 Mrd., dicht | Arbeitsplatzrechner oder Karte, 63 GB |
| Mistral Small 4 | Apache 2.0 | 119 Mrd., davon 6,5 aktiv | vier H100 oder zwei H200 |
| DeepSeek V4 Flash | MIT | 284 Mrd., davon 13 aktiv | ein Knoten mit vier GB300, 167 GB |
| Mistral Large 3 | Apache 2.0 | 675 Mrd., davon 41 aktiv | ein Knoten mit B200 oder H200 |
| GLM-5.3 (Z.ai) | eigene Herstellerlizenz | 744 Mrd., davon 40 aktiv | acht H200, 756 GB in FP8 |
| Kimi K3 (Moonshot AI) | eigene Herstellerlizenz | 2,8 Bio., davon 104 aktiv | 64 Beschleuniger, 1.561 GB |
Die Modelle, die neben dem Sprachmodell laufen
Die übrigen Modellarten sind kleiner und fallen in der Planung deshalb oft hinten herunter. Für das Ergebnis sind sie ebenso entscheidend: Ohne brauchbares OCR steht im Bestand Unsinn, und ohne Reranking landen die falschen Textstücke in der Antwort.
Was neben dem Sprachmodell gebraucht wird
- Suche. Ein Embedding-Modell macht aus Textstücken Zahlenreihen, ein Reranker sortiert die Treffer nach. NVIDIA nennt für Nemotron-3-Embed Deutsch ausdrücklich in der Sprachliste, Qwen3-Embedding und bge-m3 sprechen allgemein von über hundert Sprachen. Ein Wechsel des Embedding-Modells macht eine Neuindexierung nötig, ein Wechsel des Sprachmodells nicht.
- Dokumente. granite-docling von IBM ist mit 258 Millionen Parametern klein genug für den Prozessor und liefert Tabellenstruktur mit. PaddleOCR-VL und Nemotron Parse können mehr, brauchen aber eine Karte. Docling selbst ist kein Modell, sondern der Rahmen darum.
- Sprache. Whisper ist die Referenz, Parakeet und Canary von NVIDIA nennen für Deutsch eine gemessene Wortfehlerrate, und Voxtral Mini Realtime von Mistral ist unter den geprüften Modellen das einzige mit Herstellerangabe zur Echtzeit. Wer wann spricht, ordnet pyannote zu.
- Bild und Video. Für Beschreiben und Prüfen reichen Qwen3.5-9B oder Gemma 4. Fürs Zählen, Markieren und die Sichtprüfung sind RF-DETR und SAM 3 gebaut, beide klein genug für ältere Karten.
- Messwerte. Einen Ausreißer in Sensordaten findet ein Sprachmodell nicht besser als eine Support Vector Machine. Diese Aufgabe gehört nicht in ein LLM.
Die Lizenz gehört zum einzelnen Modell, nicht zur Familie. Vier Fälle aus dieser Prüfung schließen den Einsatz hier aus oder verteuern ihn: Metas Nutzungsrichtlinie gewährt die Rechte an den multimodalen Llama-4-Modellen Unternehmen mit Sitz in der EU nicht. YOLO26 steht unter AGPL und verlangt für geschlossene Nutzung eine gesonderte Lizenz. jina-embeddings-v5 und Voxtral TTS stehen unter CC BY-NC. Und beim Videomodell HunyuanVideo von Tencent nimmt das Lizenzgebiet die EU ausdrücklich aus. Was Offenheit im Einzelnen bedeutet, steht in was quelloffen bei einem Modell heißt.
Wie die Modelle in einem Ablauf zusammenspielen
Eine Preisauskunft aus der technischen Dokumentation läuft so: Der Scan geht durch den Dokumentparser, die Textstücke gehen durch das Embedding-Modell in den Bestand, die Frage holt die passenden Stellen heraus, das Sprachmodell formuliert daraus die Antwort. Bei einem Armaturenhersteller läuft seit Dezember 2025 eine solche Plattform im eigenen Netz, gebaut aus Open WebUI, Qdrant und Docling, mit Anmeldung über den vorhandenen Microsoft-Entra-ID-Tenant: Technische Dokumentation durchsuchbar machen.
Ein Serviceprotokoll aus einem Telefonat wäre anders zugeschnitten. Spracherkennung und Sprecherzuordnung liefern zuerst den Text, erst danach macht ein Sprachmodell daraus einen Eintrag mit Kunde, Anliegen und Zusage. Dieses Beispiel dient der Veranschaulichung und ist kein Deep5-Projekt.
Der dritte Ablauf braucht gar kein Sprachmodell. Wer Messkurven gegen ein Sollband prüft, kommt mit klassischen Verfahren weiter, und die laufen auf dem Prozessor. Die Dokumentenstrecke im Einzelnen steht in wie eine RAG-Pipeline aufgebaut wird.
Was Größe und Genauigkeit an Speicher kosten
Die Gewichte müssen vollständig in den Speicher, auch bei Modellen mit Fachabteilungen. Kimi K3 aktiviert je Token 104 von 2.800 Milliarden Parametern, liegen müssen trotzdem alle. Die kleine Zahl bestimmt das Tempo, die große die Maschine.
Quantisierung senkt nicht die Zahl der Parameter, sondern die Genauigkeit, mit der jeder einzelne gespeichert wird. Das spart Platz und kostet Qualität, und wie viel genau, sagt keine Modellkarte. Manche Hersteller liefern die Gewichte gleich in niedriger Genauigkeit aus: Kimi K3 in MXFP4, DeepSeek und GLM in FP8. Wie Größenklasse, Kontextlänge und Karte zusammenhängen, steht in welche Hardware lokale KI braucht.
Eigene Inferenz bedeutet keine Tokenrechnung, aber nicht keine Kosten. Systeme lassen sich zu Arbeitszeiten betreiben und aufwendige Läufe bündeln. Bei gemieteter Infrastruktur hängt die Ersparnis am Vertrag, und eigene Hardware kostet auch ausgeschaltet, was sie gekostet hat.
Wann ein kleineres Modell ausreicht
Die Güte einer Antwort hängt nicht allein am Modell. Ein kleineres Modell mit gut aufbereiteten Unterlagen, sauber zugeschnittenem Kontext und passenden Werkzeugen beantwortet eine feste betriebliche Frage oft zuverlässiger als ein großes Modell, das raten muss. Anders liegt es bei langen Ketten aus Werkzeugaufrufen, bei Code über mehrere Dateien hinweg und bei Aufgaben, deren Antwort aus dem Modell selbst kommen muss und nicht aus dem Bestand.
Die Benchmarks in den Modellkarten sind Herstellerangaben aus unterschiedlichen Testumgebungen. Sie taugen zur Vorauswahl von zwei oder drei Kandidaten, nicht zur Entscheidung. Wie ein Betrieb an den eigenen Aufgaben vergleicht, steht in worauf ein Betrieb beim Modellvergleich achtet.
Was Sie als Nächstes entscheiden
Aus der Zuordnung von Aufgabe und Modellart folgen vier Angaben, die den Zuschnitt bestimmen. Sie lassen sich ohne Testaufbau beantworten.
Vier Angaben, aus denen der Zuschnitt folgt
- Welche Modellarten Ihr Prozess braucht. Aus der Tabelle oben abgelesen, meist zwei bis vier.
- Wie viele Menschen gleichzeitig arbeiten. Der Kontext kostet Speicher je gleichzeitigem Nutzer, nicht einmalig.
- Wo die Maschine steht. Im eigenen Serverraum, in gemieteter Hardware oder gemischt. Was daran hängt, steht in was zum Betrieb im eigenen Netz gehört.
- Was Sie mit dem Modell tun dürfen. Die Lizenz je Modell prüfen, nicht je Familie, und vor dem Einsatz lesen lassen.
- Welche lokalen KI-Modelle braucht ein Unternehmen?
- Meist mehrere. Für Auskunft aus eigenen Unterlagen sind es drei: ein Dokumentparser für Scans, ein Embedding-Modell für die Suche und ein Sprachmodell für die Antwort. Kommen Telefonate, Fotos oder Messwerte dazu, kommt je eine Modellart dazu. Ein multimodales Modell kann mehrere davon abdecken.
- Sind offene Modelle so gut wie ChatGPT oder Claude?
- Die offenen Spitzenmodelle stellen in ihren Modellkarten Benchmarks direkt neben die zugekauften Modelle, und je nach Aufgabe liegen sie darüber oder darunter. Sie verlangen dafür Rechenzentrumsklasse. Für viele betriebliche Aufgaben ist die Frage zweitrangig, weil die Antwort ohnehin aus den vorgelegten Unterlagen kommt und nicht aus dem Gedächtnis des Modells.
- Was ist der Unterschied zwischen Anbieter, Familie und Modell?
- Alibaba ist der Anbieter, Qwen die Familie, Qwen3.8-27B das Modell mit eigener Lizenz, Größe und Kontextlänge. Innerhalb einer Familie können die Lizenzen abweichen: Qwen3.8-27B steht unter Apache 2.0, das größte Modell derselben Generation unter einer eigenen Lizenz des Herstellers.
Im Einzelnen
Woher die Angaben in diesem Text stammen
Alle Zahlen stammen aus den Modellkarten der Hersteller, den Konfigurationsdateien der Modelle und den Dateigrößen in den jeweiligen Repositorien, abgerufen am 14. September 2026. Es sind Herstellerangaben und keine Messungen von uns. Modelle erscheinen laufend neu; vor einer Entscheidung gehört die Karte des einzelnen Modells noch einmal gelesen.
Die Modellkarten der genannten Kandidaten
- Sprachmodelle: gpt-oss-120b, Qwen3.8-27B, Gemma 4 31B, Muse Glimmer 30B, Nemotron 3.5 Lightning
- Größere Sprachmodelle: Mistral Small 4, Mistral Large 3, DeepSeek V4 Flash, GLM-5.3, Kimi K3
- Suche: Nemotron-3-Embed, Qwen3-Embedding, bge-m3, llama-nemotron-rerank
- Dokumente: granite-docling, PaddleOCR-VL, Nemotron Parse
- Sprache und Bild: Whisper large-v3, Parakeet, Voxtral Mini, Qwen3.5-9B, RF-DETR
Was dieser Text nicht klärt
Vier Punkte bleiben offen, und sie entscheiden sich erst am konkreten Fall.
Vier offene Punkte
- Deutsch. Nur ein Teil der Modellkarten nennt Deutsch ausdrücklich, darunter Mistral, NVIDIA Nemotron und die Audiomodelle Parakeet, Canary und Voxtral. Kimi K3, GLM und DeepSeek machen zur Sprachabdeckung keine Angabe.
- Durchsatz. Keine Modellkarte nennt Wörter je Sekunde auf Ihrer Maschine. Das misst man selbst, auf der Karte, die zur Wahl steht.
- Verlust durch Quantisierung. Wie viel Genauigkeit ein Modell in 8 oder 4 Bit verliert, steht in keiner der geprüften Karten.
- Preis. Was ein Aufbau kostet, folgt aus Modellklasse, Nutzerzahl und Betriebsort. Eine Zahl ohne diese drei Angaben wäre geraten.
Die Aufgabe bestimmt das Modell, nicht der Name
Wer mit der Frage anfängt, welches Modell gerade vorn liegt, hat die Reihenfolge umgedreht. Zuerst steht der Arbeitsschritt, daraus folgt die Modellart, daraus die Größenklasse und daraus die Maschine.
Das gilt auch andersherum. Das Modell ist in dieser Kette das Teil, das sich am schnellsten austauschen lässt. Bestand, Suche, Rechte und Prüfung bleiben, wenn in vier Wochen ein neues Modell erscheint.
Ein System im eigenen Netz, mit den Modellen, die Ihre Aufgaben brauchen
Wir sehen uns Ihre Abläufe an, ordnen ihnen die nötigen Modellarten zu, rechnen daraus Größenklasse und Maschine aus und bauen so, dass sich einzelne Modelle später wechseln lassen. Planung individuell, Aufbau zum Festpreis danach, Betrieb nach Vereinbarung.
Weiterlesen
- Technische Dokumentation durchsuchbar machen Der Bericht zum Fall: was gebaut wurde, womit, seit wann es läuft und was offen geblieben ist.
- Modelle an den eigenen Aufgaben vergleichen Fünf Kriterien und eine Methodik, mit der zwei oder drei Kandidaten in einer Woche gegeneinander laufen.
- Welche Hardware lokale KI braucht Wie aus Modellgröße, Kontextlänge und Nutzerzahl die Karte wird, die im Serverraum steht.