Termin buchen

Lokale KI8. September 202610 Minuten

Welche lokalen KI-Modelle für Unternehmen relevant sind

Ein lokales KI-System besteht selten aus einem Modell. Wer die eigene Dokumentation durchsuchbar machen will, braucht eines, das Scans liest, eines, das Textstücke vergleichbar macht, und eines, das antwortet. Dieser Text ordnet die Modellarten den betrieblichen Aufgaben zu und nennt je Aufgabe konkrete Kandidaten mit Lizenz, Größe und der Maschine, die der Hersteller dafür angibt.

Eckdaten
Kurzform
Erst der Arbeitsschritt, dann die Modellart, dann das Modell. Die Maschine folgt daraus, nicht umgekehrt
Modellarten
Sprache, Embedding und Reranking, OCR, Audio, Bild und Video, Medienerzeugung, klassische Lernverfahren
Betriebsklassen
Eine Karte, ein Server, ein Verbund. Alle drei sind mit offenen Gewichten besetzt
Angaben
Modellkarten, Konfigurationsdateien und Dateigrößen der Hersteller, abgerufen am 14. September 2026
Belegter Fall
Armaturenhersteller, Plattform im eigenen Netz, in Betrieb seit Dezember 2025
Stand
September 2026

Welche Modellarten in einem lokalen System zusammenarbeiten

Die Frage nach dem richtigen lokalen KI-Modell hat selten eine einzige Antwort. Eine Auskunft aus der technischen Dokumentation durchläuft drei Modelle: eines liest den Scan, eines macht aus Textstücken Zahlenreihen, damit sich die passende Stelle finden lässt, und eines formuliert die Antwort. Kommt ein Telefonprotokoll dazu, kommt ein viertes dazu.

Drei Begriffe gehen dabei durcheinander. Alibaba ist der Anbieter, Qwen die Familie, Qwen3.8-27B das Modell, das auf der Maschine liegt. Open WebUI ist noch einmal etwas anderes, nämlich die Oberfläche, und rechnet selbst nichts. Lizenz, Größe und Fähigkeiten gehören zum einzelnen Modell.

Ein multimodales Modell deckt mehrere Zeilen der Tabelle ab, Qwen3.8-27B etwa nimmt Text, Bild und Video entgegen. Umgekehrt braucht kein Prozess alle Zeilen.

Ein multimodales Modell kann mehrere Zeilen abdecken. Welche gebraucht werden, entscheidet der Prozess
AufgabeHinein und herausModellartKandidaten mit offenen Gewichten
Fragen beantworten, zusammenfassen, prüfenText hinein, Text herausSprachmodellgpt-oss, Qwen3.8, Gemma 4, Mistral, Nemotron, GLM, DeepSeek
In den eigenen Unterlagen suchenTextstück hinein, Zahlenreihe heraus; Treffer hinein, Rangfolge herausEmbedding und RerankingNemotron-3-Embed, Qwen3-Embedding, bge-m3
Scans und PDF lesbar machenSeitenbild hinein, Text mit Struktur herausOCR und Dokumentparsergranite-docling, PaddleOCR-VL, Nemotron Parse
Telefonate mitschreibenTonspur hinein, Text mit Sprechern herausSpracherkennung und SprecherzuordnungWhisper, Parakeet, Canary, Voxtral, pyannote
Fotos und Videos auswertenBild hinein, Beschreibung oder Markierung herausVision-Language und ObjekterkennungQwen3.5, Gemma 4, Molmo2, RF-DETR, SAM 3
Bilder und kurze Filme erzeugenBeschreibung hinein, Bild oder Film herausBild- und VideomodellFLUX.2 klein, Qwen-Image-Edit, Wan2.2
Messwerte bewertenZahlenreihe hinein, Klasse oder Ausreißer herausklassische Lernverfahrenkein Sprachmodell, sondern etwa Support Vector Machines

Welches Sprachmodell auf welche Maschine passt

Entscheidend ist bei Sprachmodellen nicht die Parameterzahl, sondern die Maschine, die ein Unternehmen dafür hinstellen muss. Drei Klassen lassen sich aus den Herstellerangaben ablesen, und alle drei sind mit offenen Gewichten besetzt. Auf eine einzelne Karte passt dabei mehr, als viele erwarten: Für Auskunft, Zusammenfassung und Prüfung an vorgelegten Unterlagen ist die erste Klasse der Regelfall.

Die offenen Spitzenmodelle sind Rechenzentrumsklasse. Ihre Modellkarten stellen Benchmarktabellen direkt neben Claude, GPT und Gemini; je nach Aufgabe liegen die Werte darüber oder darunter, und Moonshot schreibt selbst, die Gesamtleistung bleibe hinter den stärksten zugekauften Modellen zurück. Wer die Infrastruktur hat oder mietet, erledigt mit dieser Klasse Aufgaben im eigenen Netz, für die sonst ein Dienst eingekauft wird.

Angaben aus den Modellkarten und den vom Hersteller verlinkten Betriebsrezepten, abgerufen am 14. September 2026
ModellLizenz laut ModellkarteParameter gesamt und aktivBetrieb laut Hersteller
gpt-oss-120b (OpenAI)Apache 2.0117 Mrd., davon 5,1 aktiveine 80-GB-Karte, 65 GB in MXFP4
Nemotron 3.5 Lightning (NVIDIA)OpenMDW 1.131 Mrd., davon 3 aktiveine H100 oder A100 mit 80 GB
Muse Glimmer 30B (Meta)Apache 2.030 Mrd., dichteine Karte mit 24 GB, Gewichte in 4 Bit
Qwen3.8-27B (Alibaba)Apache 2.027 Mrd., dichteine Karte, 31 GB in FP8
Gemma 4 31B (Google)Apache 2.031 Mrd., dichtArbeitsplatzrechner oder Karte, 63 GB
Mistral Small 4Apache 2.0119 Mrd., davon 6,5 aktivvier H100 oder zwei H200
DeepSeek V4 FlashMIT284 Mrd., davon 13 aktivein Knoten mit vier GB300, 167 GB
Mistral Large 3Apache 2.0675 Mrd., davon 41 aktivein Knoten mit B200 oder H200
GLM-5.3 (Z.ai)eigene Herstellerlizenz744 Mrd., davon 40 aktivacht H200, 756 GB in FP8
Kimi K3 (Moonshot AI)eigene Herstellerlizenz2,8 Bio., davon 104 aktiv64 Beschleuniger, 1.561 GB

Die Modelle, die neben dem Sprachmodell laufen

Die übrigen Modellarten sind kleiner und fallen in der Planung deshalb oft hinten herunter. Für das Ergebnis sind sie ebenso entscheidend: Ohne brauchbares OCR steht im Bestand Unsinn, und ohne Reranking landen die falschen Textstücke in der Antwort.

Was neben dem Sprachmodell gebraucht wird

  • Suche. Ein Embedding-Modell macht aus Textstücken Zahlenreihen, ein Reranker sortiert die Treffer nach. NVIDIA nennt für Nemotron-3-Embed Deutsch ausdrücklich in der Sprachliste, Qwen3-Embedding und bge-m3 sprechen allgemein von über hundert Sprachen. Ein Wechsel des Embedding-Modells macht eine Neuindexierung nötig, ein Wechsel des Sprachmodells nicht.
  • Dokumente. granite-docling von IBM ist mit 258 Millionen Parametern klein genug für den Prozessor und liefert Tabellenstruktur mit. PaddleOCR-VL und Nemotron Parse können mehr, brauchen aber eine Karte. Docling selbst ist kein Modell, sondern der Rahmen darum.
  • Sprache. Whisper ist die Referenz, Parakeet und Canary von NVIDIA nennen für Deutsch eine gemessene Wortfehlerrate, und Voxtral Mini Realtime von Mistral ist unter den geprüften Modellen das einzige mit Herstellerangabe zur Echtzeit. Wer wann spricht, ordnet pyannote zu.
  • Bild und Video. Für Beschreiben und Prüfen reichen Qwen3.5-9B oder Gemma 4. Fürs Zählen, Markieren und die Sichtprüfung sind RF-DETR und SAM 3 gebaut, beide klein genug für ältere Karten.
  • Messwerte. Einen Ausreißer in Sensordaten findet ein Sprachmodell nicht besser als eine Support Vector Machine. Diese Aufgabe gehört nicht in ein LLM.

Die Lizenz gehört zum einzelnen Modell, nicht zur Familie. Vier Fälle aus dieser Prüfung schließen den Einsatz hier aus oder verteuern ihn: Metas Nutzungsrichtlinie gewährt die Rechte an den multimodalen Llama-4-Modellen Unternehmen mit Sitz in der EU nicht. YOLO26 steht unter AGPL und verlangt für geschlossene Nutzung eine gesonderte Lizenz. jina-embeddings-v5 und Voxtral TTS stehen unter CC BY-NC. Und beim Videomodell HunyuanVideo von Tencent nimmt das Lizenzgebiet die EU ausdrücklich aus. Was Offenheit im Einzelnen bedeutet, steht in was quelloffen bei einem Modell heißt.

Wie die Modelle in einem Ablauf zusammenspielen

Eine Preisauskunft aus der technischen Dokumentation läuft so: Der Scan geht durch den Dokumentparser, die Textstücke gehen durch das Embedding-Modell in den Bestand, die Frage holt die passenden Stellen heraus, das Sprachmodell formuliert daraus die Antwort. Bei einem Armaturenhersteller läuft seit Dezember 2025 eine solche Plattform im eigenen Netz, gebaut aus Open WebUI, Qdrant und Docling, mit Anmeldung über den vorhandenen Microsoft-Entra-ID-Tenant: Technische Dokumentation durchsuchbar machen.

Ein Serviceprotokoll aus einem Telefonat wäre anders zugeschnitten. Spracherkennung und Sprecherzuordnung liefern zuerst den Text, erst danach macht ein Sprachmodell daraus einen Eintrag mit Kunde, Anliegen und Zusage. Dieses Beispiel dient der Veranschaulichung und ist kein Deep5-Projekt.

Der dritte Ablauf braucht gar kein Sprachmodell. Wer Messkurven gegen ein Sollband prüft, kommt mit klassischen Verfahren weiter, und die laufen auf dem Prozessor. Die Dokumentenstrecke im Einzelnen steht in wie eine RAG-Pipeline aufgebaut wird.

OCR EMBEDDING SPRACHERKENNUNG SPRACHMODELL KLASSISCHE ML
Scan und Anruf laufen durch je ein eigenes Modell, bevor das Sprachmodell antwortet. Die Messkurve kommt ohne es aus.

Was Größe und Genauigkeit an Speicher kosten

Die Gewichte müssen vollständig in den Speicher, auch bei Modellen mit Fachabteilungen. Kimi K3 aktiviert je Token 104 von 2.800 Milliarden Parametern, liegen müssen trotzdem alle. Die kleine Zahl bestimmt das Tempo, die große die Maschine.

Quantisierung senkt nicht die Zahl der Parameter, sondern die Genauigkeit, mit der jeder einzelne gespeichert wird. Das spart Platz und kostet Qualität, und wie viel genau, sagt keine Modellkarte. Manche Hersteller liefern die Gewichte gleich in niedriger Genauigkeit aus: Kimi K3 in MXFP4, DeepSeek und GLM in FP8. Wie Größenklasse, Kontextlänge und Karte zusammenhängen, steht in welche Hardware lokale KI braucht.

Eigene Inferenz bedeutet keine Tokenrechnung, aber nicht keine Kosten. Systeme lassen sich zu Arbeitszeiten betreiben und aufwendige Läufe bündeln. Bei gemieteter Infrastruktur hängt die Ersparnis am Vertrag, und eigene Hardware kostet auch ausgeschaltet, was sie gekostet hat.

Wann ein kleineres Modell ausreicht

Die Güte einer Antwort hängt nicht allein am Modell. Ein kleineres Modell mit gut aufbereiteten Unterlagen, sauber zugeschnittenem Kontext und passenden Werkzeugen beantwortet eine feste betriebliche Frage oft zuverlässiger als ein großes Modell, das raten muss. Anders liegt es bei langen Ketten aus Werkzeugaufrufen, bei Code über mehrere Dateien hinweg und bei Aufgaben, deren Antwort aus dem Modell selbst kommen muss und nicht aus dem Bestand.

Die Benchmarks in den Modellkarten sind Herstellerangaben aus unterschiedlichen Testumgebungen. Sie taugen zur Vorauswahl von zwei oder drei Kandidaten, nicht zur Entscheidung. Wie ein Betrieb an den eigenen Aufgaben vergleicht, steht in worauf ein Betrieb beim Modellvergleich achtet.

Was Sie als Nächstes entscheiden

Aus der Zuordnung von Aufgabe und Modellart folgen vier Angaben, die den Zuschnitt bestimmen. Sie lassen sich ohne Testaufbau beantworten.

Vier Angaben, aus denen der Zuschnitt folgt

  • Welche Modellarten Ihr Prozess braucht. Aus der Tabelle oben abgelesen, meist zwei bis vier.
  • Wie viele Menschen gleichzeitig arbeiten. Der Kontext kostet Speicher je gleichzeitigem Nutzer, nicht einmalig.
  • Wo die Maschine steht. Im eigenen Serverraum, in gemieteter Hardware oder gemischt. Was daran hängt, steht in was zum Betrieb im eigenen Netz gehört.
  • Was Sie mit dem Modell tun dürfen. Die Lizenz je Modell prüfen, nicht je Familie, und vor dem Einsatz lesen lassen.
Welche lokalen KI-Modelle braucht ein Unternehmen?
Meist mehrere. Für Auskunft aus eigenen Unterlagen sind es drei: ein Dokumentparser für Scans, ein Embedding-Modell für die Suche und ein Sprachmodell für die Antwort. Kommen Telefonate, Fotos oder Messwerte dazu, kommt je eine Modellart dazu. Ein multimodales Modell kann mehrere davon abdecken.
Sind offene Modelle so gut wie ChatGPT oder Claude?
Die offenen Spitzenmodelle stellen in ihren Modellkarten Benchmarks direkt neben die zugekauften Modelle, und je nach Aufgabe liegen sie darüber oder darunter. Sie verlangen dafür Rechenzentrumsklasse. Für viele betriebliche Aufgaben ist die Frage zweitrangig, weil die Antwort ohnehin aus den vorgelegten Unterlagen kommt und nicht aus dem Gedächtnis des Modells.
Was ist der Unterschied zwischen Anbieter, Familie und Modell?
Alibaba ist der Anbieter, Qwen die Familie, Qwen3.8-27B das Modell mit eigener Lizenz, Größe und Kontextlänge. Innerhalb einer Familie können die Lizenzen abweichen: Qwen3.8-27B steht unter Apache 2.0, das größte Modell derselben Generation unter einer eigenen Lizenz des Herstellers.

Ihren Ablauf einmal gemeinsam durchgehen

Im Einzelnen

Woher die Angaben in diesem Text stammen

Alle Zahlen stammen aus den Modellkarten der Hersteller, den Konfigurationsdateien der Modelle und den Dateigrößen in den jeweiligen Repositorien, abgerufen am 14. September 2026. Es sind Herstellerangaben und keine Messungen von uns. Modelle erscheinen laufend neu; vor einer Entscheidung gehört die Karte des einzelnen Modells noch einmal gelesen.

Die Modellkarten der genannten Kandidaten

Was dieser Text nicht klärt

Vier Punkte bleiben offen, und sie entscheiden sich erst am konkreten Fall.

Vier offene Punkte

  • Deutsch. Nur ein Teil der Modellkarten nennt Deutsch ausdrücklich, darunter Mistral, NVIDIA Nemotron und die Audiomodelle Parakeet, Canary und Voxtral. Kimi K3, GLM und DeepSeek machen zur Sprachabdeckung keine Angabe.
  • Durchsatz. Keine Modellkarte nennt Wörter je Sekunde auf Ihrer Maschine. Das misst man selbst, auf der Karte, die zur Wahl steht.
  • Verlust durch Quantisierung. Wie viel Genauigkeit ein Modell in 8 oder 4 Bit verliert, steht in keiner der geprüften Karten.
  • Preis. Was ein Aufbau kostet, folgt aus Modellklasse, Nutzerzahl und Betriebsort. Eine Zahl ohne diese drei Angaben wäre geraten.
Der Punkt

Die Aufgabe bestimmt das Modell, nicht der Name

Wer mit der Frage anfängt, welches Modell gerade vorn liegt, hat die Reihenfolge umgedreht. Zuerst steht der Arbeitsschritt, daraus folgt die Modellart, daraus die Größenklasse und daraus die Maschine.

Das gilt auch andersherum. Das Modell ist in dieser Kette das Teil, das sich am schnellsten austauschen lässt. Bestand, Suche, Rechte und Prüfung bleiben, wenn in vier Wochen ein neues Modell erscheint.

Alles vor dem Modell ist verschraubt, das Modell selbst steckt nur und lässt sich herausziehen.
Passend dazu

Ein System im eigenen Netz, mit den Modellen, die Ihre Aufgaben brauchen

Wir sehen uns Ihre Abläufe an, ordnen ihnen die nötigen Modellarten zu, rechnen daraus Größenklasse und Maschine aus und bauen so, dass sich einzelne Modelle später wechseln lassen. Planung individuell, Aufbau zum Festpreis danach, Betrieb nach Vereinbarung.

Zur Leistung

Welchen Arbeitsschritt wollen Sie zuerst abbilden?

Eine halbe Stunde. Sie beschreiben einen Vorgang, der bei Ihnen oft anfällt, und sagen uns, wo die Unterlagen dazu liegen. Wir sagen Ihnen, welche Modellarten dafür nötig sind, in welcher Größenordnung sich das bewegt und was der erste Schritt wäre.

Lieber ohne Kalender? info@deep5.io oder +49 176 57703783.