Lokale Modelle · Stand 29.09.2026
Offene KI-Modelle für Ihre eigene Hardware.
Vor einem Jahr brauchte man für gute KI-Ergebnisse die Cloud. Heute laufen Modelle mit vergleichbarer Leistung auf einer einzelnen Grafikkarte, frei lizenziert, ohne Token-Kosten und auf Wunsch komplett ohne Internetverbindung. Hier die Modelle, die wir aktuell einsetzen, und warum sie für Unternehmen immer wichtiger werden.
Lokale Modelle waren nie so relevant wie heute
01Klein, aber alltagstauglich
Die meisten Aufgaben im Büro sind keine Forschungsprojekte: E-Mails einordnen, Rechnungen auslesen, Akten zusammenfassen, Entwürfe schreiben, Daten zwischen Systemen übertragen. Dafür reichen heute Modelle mit rund 30 Milliarden Parametern, oft sogar solche, die pro Wort nur 3 Milliarden davon aktivieren und entsprechend schnell antworten.
02So stark wie die Cloud-Spitze vor einem Jahr
Qwen3.6-27B löst auf einer einzigen Grafikkarte mehr echte Programmieraufgaben (SWE-bench Verified) als GPT-5 und Claude Opus 4.1 zu ihrem Start im August 2025. Bei Wissenschaftsfragen (GPQA Diamond) liegen Qwen3.8-27B, Qwen3.6-35B-A3B und Gemma 4 31B vor Claude Opus 4.1. Der Abstand zur Spitze wird mit jeder Generation kleiner.
03Keine Preis- und Modellwechsel von außen
Cloud-Anbieter ändern Preise und Modelle, wann sie wollen: OpenAI hat den Preis seines Top-Modells mit GPT-5.5 verdoppelt, Anthropic hat Claude Opus 4.1 aus der eigenen API genommen. Ein lokales Modell bleibt genau so, wie es eingerichtet wurde: gleiche Gewichte, gleiche Antworten, gleiche Kosten, so lange Sie wollen. Gewechselt wird nur, wenn Sie es entscheiden.
04Funktioniert komplett ohne Internet
Ein lokales Modell braucht keine Verbindung nach außen. Der Server lässt sich vollständig vom Internet trennen, und die KI arbeitet weiter: bei Internetausfall, bei Störungen eines Anbieters, in abgeschotteten Netzen von Praxen, Kanzleien oder KRITIS-Betrieben. Daten können das Haus nicht verlassen, weil es schlicht keinen Weg nach draußen gibt.
05Günstigere Hardware verstärkt den Effekt
Grafikkarten sind 2026 wegen knapper Speicherchips teuer. Sinken die Preise wieder, wird derselbe Server günstiger, während die Modelle darauf jedes Quartal besser werden. Die Hardware kaufen Sie einmal; neue offene Modelle lassen sich ohne Lizenzkosten auf dieselbe Maschine aufspielen.
Lokal auf dem Niveau der Cloud-Spitze von 2025
Im August 2025 waren GPT-5 und Claude Opus 4.1 die besten Modelle am Markt, nur in der Cloud verfügbar. Heute erreichen offene Modelle, die auf einer Grafikkarte mit 24–32 GB laufen, dieselben Werte in denselben Tests.
SWE-bench Verified
Echte Programmieraufgaben aus GitHub-Projekten, in %
- GPT-5Cloud · Aug 202574,9
- Claude Opus 4.1Cloud · Aug 202574,5
- Qwen3.6-27Blokal · 1 GPU77,2
- Qwen3.6-35B-A3Blokal · 3B aktiv73,4
GPQA Diamond
Wissenschaftsfragen auf Doktoranden-Niveau, in %
- Claude Opus 4.1Cloud · Aug 202580,9
- Qwen3.8-27Blokal · 1 GPU89,2
- Qwen3.6-35B-A3Blokal · 3B aktiv86,0
- Gemma 4 31Blokal · 1 GPU84,3
Ehrlich eingeordnet: Benchmarks sind nicht alles, und die heutigen Spitzenmodelle wie Claude Fable 5.1 oder GPT-6 Astra liegen bei langen, selbstständigen Aufgaben weiter vorn. Für die typischen Aufgaben im Büro ist der Unterschied aber kaum noch spürbar. Wir testen die Modelle vor jeder Entscheidung mit Ihren eigenen Dokumenten.
Sechs Modelle, die wir aktuell einsetzen
Alle laufen auf einer einzelnen Grafikkarte mit 24–32 GB (z. B. RTX 5090) oder einem Mac mit ausreichend Arbeitsspeicher, alle sind kommerziell nutzbar. Drei davon sind Mixture-of-Experts-Modelle (MoE): Sie aktivieren pro Wort nur einen kleinen Teil ihrer Parameter und antworten dadurch besonders schnell.
Qwen3.8-27B
Aug 2026Alibaba
Der aktuell stärkste Allrounder in dieser Größe. Versteht Text, Bilder und Video und kann Programme am Bildschirm bedienen (OSWorld).
- Aufbau
- 27 Mrd. Parameter, dicht
- Hardware
- 1× GPU mit 24–32 GB
- Kontext
- 262K (bis 1M) Tokens
- Lizenz
- Apache 2.0
Setzen wir ein für
- Dokumente und Wissensdatenbanken
- Agenten, die Software bedienen
- Programmieren
Muse Glimmer 30B
Aug 2026Meta
Gebaut für Agenten, die dauerhaft lokal laufen: zuverlässige Werkzeugaufrufe, mehrstufige Aufgaben und Fehlerbehandlung. Meta liefert eine offizielle 4-Bit-Version unter 20 GB mit.
- Aufbau
- 29,6 Mrd. Parameter, dicht
- Hardware
- 1× GPU mit 24–32 GB
- Kontext
- 131K Tokens
- Lizenz
- Apache 2.0
Setzen wir ein für
- Agenten mit Werkzeugen (MCP, APIs)
- Postfach- und Kalender-Automatisierung
- Bilder und Dokumente auswerten
GLM-4.7-Flash
Jan 2026Z.ai
Der Älteste in dieser Liste, aber sehr effizient: Nur 3 Milliarden aktive Parameter pro Wort machen ihn schnell und sparsam, stark bei Kundenservice-Dialogen (τ²-Bench).
- Aufbau
- 30 Mrd., davon 3 Mrd. aktiv (MoE)
- Hardware
- 1× GPU mit 24 GB
- Lizenz
- MIT
Setzen wir ein für
- Kundenservice und Standardanfragen
- Coding-Assistent im Alltag
- Günstige Dauerlast
Nemotron 3.5 Lightning
Aug 2026NVIDIA
Aus NVIDIAs großem Nemotron 3 Ultra destilliert und auf Tempo getrimmt. Gedacht als „Arbeitsschicht“ von Agenten: Werkzeugaufrufe, Klassifizieren, Prüfen, Zusammenfassen, in großer Stückzahl. Auch Trainingsdaten und Rezepte sind offen.
- Aufbau
- 30 Mrd., davon 3 Mrd. aktiv (MoE)
- Hardware
- 1× GPU mit 24 GB
- Kontext
- 1M Tokens
- Lizenz
- OpenMDW-1.1
Setzen wir ein für
- Klassifizieren und Extrahieren in Masse
- Schritte innerhalb langer Agenten-Workflows
- Nachtraining auf eigene Aufgaben
Qwen3.6-35B-A3B
Frühjahr 2026Alibaba
Fast so stark wie GPT-5 zum Start beim Programmieren, rechnet pro Wort aber nur mit 3 Milliarden Parametern. Entsprechend schnell, auch bei mehreren Nutzern gleichzeitig. Versteht Text, Bilder und Video.
- Aufbau
- 35 Mrd., davon 3 Mrd. aktiv (MoE)
- Hardware
- 1× GPU mit 24 GB
- Kontext
- 262K (bis 1M) Tokens
- Lizenz
- Apache 2.0
Setzen wir ein für
- Schneller Allrounder für viele Nutzer
- RAG und Zusammenfassungen
- Programmieren
Gemma 4 31B
Apr 2026Die beste Wahl, wenn Texte gut klingen müssen: über 140 Sprachen, sehr natürliches Deutsch, dazu Bildverständnis. Auf der Arena-Rangliste eines der am besten bewerteten offenen Modelle.
- Aufbau
- 31 Mrd. Parameter, dicht
- Hardware
- 1× GPU mit 24–32 GB
- Kontext
- 256K Tokens
- Lizenz
- Apache 2.0
Setzen wir ein für
- Kundenkommunikation auf Deutsch
- Briefe, Angebote, Zusammenfassungen
- Mehrsprachige Dokumente
Welches Modell für welche Aufgabe?
Welche Grafikkarte Sie für welches Modell brauchen, zeigt unser Hardware-Rechner.
Wenn eine Grafikkarte nicht reicht: Frontier-nahe Modelle auf eigenen Servern
Neben den kompakten Modellen gibt es offene Modelle mit Hunderten Milliarden bis mehreren Billionen Parametern. Sie sprengen jede Consumer-Hardware, kommen in Benchmarks aber nah an die kommerzielle Cloud-Spitze heran, und ihre Gewichte sind trotzdem frei verfügbar.
| Modell | Parameter | Hardware (ca.) | Besonderheit |
|---|---|---|---|
Kimi K3 Moonshot AI · Jul 2026 | 2,8 Bio. (104 Mrd. aktiv) | GPU-Cluster über mehrere Server | Größtes offenes Modell, stark bei agentischem Coding, 1M Kontext |
Qwen3.8-Max Alibaba · Aug 2026 | 2,4 Bio. (95 Mrd. aktiv) | GPU-Cluster über mehrere Server | Erstes Max-Modell von Qwen mit offenen Gewichten |
GLM-5.3 Z.ai · 2026 | ~750 Mrd. (MoE) | 8× RTX PRO 6000 oder H200-Server | Im September 2026 Spitzenreiter der offenen Modelle im Artificial Analysis Index |
DeepSeek V4 Flash DeepSeek · 2026 | 284 Mrd. (13 Mrd. aktiv) | 2× RTX PRO 6000 (ab ~110 GB) | Einstieg in die große Klasse, MIT-Lizenz, 1M Kontext |
Eigener Server statt US-Cloud
Diese Modelle laufen auf Multi-GPU-Servern in Ihrem Serverraum oder gemietet in einem deutschen Rechenzentrum. Die Datenhoheit bleibt dieselbe wie bei den kleinen Modellen: Kein US-Anbieter sieht Ihre Anfragen.
Die Lehrer der kleinen Modelle
Viele kompakte Modelle werden aus den großen destilliert, Nemotron 3.5 Lightning etwa aus Nemotron 3 Ultra. Was heute ein Server-Cluster braucht, läuft oft ein Jahr später in verdichteter Form auf einer einzelnen Grafikkarte.
Für wen sich das lohnt
Für Großkanzleien, Klinikverbünde und Industrie mit vielen Nutzern oder komplexen Agenten. Mit sinkenden Hardware-Preisen rückt diese Klasse auch für den Mittelstand näher; DeepSeek V4 Flash läuft schon heute auf zwei Workstation-Karten.
Welches Modell zu Ihren Aufgaben passt, testen wir mit Ihren Daten.
Im kostenlosen Erstgespräch schauen wir auf Ihre Abläufe, schlagen passende Modelle und Hardware vor und rechnen die Kosten im Vergleich zur Cloud durch.
Quellen: Modellkarten der Hersteller auf Hugging Face (Qwen, Meta, Z.ai, NVIDIA, Google), OpenAI und Anthropic (Launch-Werte GPT-5 und Claude Opus 4.1, August 2025), Artificial Analysis. Benchmark-Werte sind Herstellerangaben. Stand 29.09.2026.