Lokale KI-Lösungen

Lokale Modelle · Stand 29.09.2026

Offene KI-Modelle für Ihre eigene Hardware.

Vor einem Jahr brauchte man für gute KI-Ergebnisse die Cloud. Heute laufen Modelle mit vergleichbarer Leistung auf einer einzelnen Grafikkarte, frei lizenziert, ohne Token-Kosten und auf Wunsch komplett ohne Internetverbindung. Hier die Modelle, die wir aktuell einsetzen, und warum sie für Unternehmen immer wichtiger werden.

01Warum jetzt

Lokale Modelle waren nie so relevant wie heute

01Klein, aber alltagstauglich

Die meisten Aufgaben im Büro sind keine Forschungsprojekte: E-Mails einordnen, Rechnungen auslesen, Akten zusammenfassen, Entwürfe schreiben, Daten zwischen Systemen übertragen. Dafür reichen heute Modelle mit rund 30 Milliarden Parametern, oft sogar solche, die pro Wort nur 3 Milliarden davon aktivieren und entsprechend schnell antworten.

02So stark wie die Cloud-Spitze vor einem Jahr

Qwen3.6-27B löst auf einer einzigen Grafikkarte mehr echte Programmieraufgaben (SWE-bench Verified) als GPT-5 und Claude Opus 4.1 zu ihrem Start im August 2025. Bei Wissenschaftsfragen (GPQA Diamond) liegen Qwen3.8-27B, Qwen3.6-35B-A3B und Gemma 4 31B vor Claude Opus 4.1. Der Abstand zur Spitze wird mit jeder Generation kleiner.

03Keine Preis- und Modellwechsel von außen

Cloud-Anbieter ändern Preise und Modelle, wann sie wollen: OpenAI hat den Preis seines Top-Modells mit GPT-5.5 verdoppelt, Anthropic hat Claude Opus 4.1 aus der eigenen API genommen. Ein lokales Modell bleibt genau so, wie es eingerichtet wurde: gleiche Gewichte, gleiche Antworten, gleiche Kosten, so lange Sie wollen. Gewechselt wird nur, wenn Sie es entscheiden.

04Funktioniert komplett ohne Internet

Ein lokales Modell braucht keine Verbindung nach außen. Der Server lässt sich vollständig vom Internet trennen, und die KI arbeitet weiter: bei Internetausfall, bei Störungen eines Anbieters, in abgeschotteten Netzen von Praxen, Kanzleien oder KRITIS-Betrieben. Daten können das Haus nicht verlassen, weil es schlicht keinen Weg nach draußen gibt.

05Günstigere Hardware verstärkt den Effekt

Grafikkarten sind 2026 wegen knapper Speicherchips teuer. Sinken die Preise wieder, wird derselbe Server günstiger, während die Modelle darauf jedes Quartal besser werden. Die Hardware kaufen Sie einmal; neue offene Modelle lassen sich ohne Lizenzkosten auf dieselbe Maschine aufspielen.

02Vergleich

Lokal auf dem Niveau der Cloud-Spitze von 2025

Im August 2025 waren GPT-5 und Claude Opus 4.1 die besten Modelle am Markt, nur in der Cloud verfügbar. Heute erreichen offene Modelle, die auf einer Grafikkarte mit 24–32 GB laufen, dieselben Werte in denselben Tests.

SWE-bench Verified

Echte Programmieraufgaben aus GitHub-Projekten, in %

  • GPT-5
    Cloud · Aug 2025
    74,9
  • Claude Opus 4.1
    Cloud · Aug 2025
    74,5
  • Qwen3.6-27B
    lokal · 1 GPU
    77,2
  • Qwen3.6-35B-A3B
    lokal · 3B aktiv
    73,4

GPQA Diamond

Wissenschaftsfragen auf Doktoranden-Niveau, in %

  • Claude Opus 4.1
    Cloud · Aug 2025
    80,9
  • Qwen3.8-27B
    lokal · 1 GPU
    89,2
  • Qwen3.6-35B-A3B
    lokal · 3B aktiv
    86,0
  • Gemma 4 31B
    lokal · 1 GPU
    84,3
offenes Modell, läuft lokalCloud-Spitzenmodell zum Start (Aug 2025)Herstellerangaben, Skala 0–100

Ehrlich eingeordnet: Benchmarks sind nicht alles, und die heutigen Spitzenmodelle wie Claude Fable 5.1 oder GPT-6 Astra liegen bei langen, selbstständigen Aufgaben weiter vorn. Für die typischen Aufgaben im Büro ist der Unterschied aber kaum noch spürbar. Wir testen die Modelle vor jeder Entscheidung mit Ihren eigenen Dokumenten.

03Modelle für eigene Hardware

Sechs Modelle, die wir aktuell einsetzen

Alle laufen auf einer einzelnen Grafikkarte mit 24–32 GB (z. B. RTX 5090) oder einem Mac mit ausreichend Arbeitsspeicher, alle sind kommerziell nutzbar. Drei davon sind Mixture-of-Experts-Modelle (MoE): Sie aktivieren pro Wort nur einen kleinen Teil ihrer Parameter und antworten dadurch besonders schnell.

Qwen3.8-27B

Aug 2026

Alibaba

Der aktuell stärkste Allrounder in dieser Größe. Versteht Text, Bilder und Video und kann Programme am Bildschirm bedienen (OSWorld).

89,2
GPQA Diamond
90,3
LiveCodeBench v6
84,3
OSWorld-Verified
Aufbau
27 Mrd. Parameter, dicht
Hardware
1× GPU mit 24–32 GB
Kontext
262K (bis 1M) Tokens
Lizenz
Apache 2.0

Setzen wir ein für

  • Dokumente und Wissensdatenbanken
  • Agenten, die Software bedienen
  • Programmieren

Muse Glimmer 30B

Aug 2026

Meta

Gebaut für Agenten, die dauerhaft lokal laufen: zuverlässige Werkzeugaufrufe, mehrstufige Aufgaben und Fehlerbehandlung. Meta liefert eine offizielle 4-Bit-Version unter 20 GB mit.

75,5
MCP Atlas
51,2
SWE-bench Pro
94,7
AIME 2026
Aufbau
29,6 Mrd. Parameter, dicht
Hardware
1× GPU mit 24–32 GB
Kontext
131K Tokens
Lizenz
Apache 2.0

Setzen wir ein für

  • Agenten mit Werkzeugen (MCP, APIs)
  • Postfach- und Kalender-Automatisierung
  • Bilder und Dokumente auswerten

GLM-4.7-Flash

Jan 2026

Z.ai

Der Älteste in dieser Liste, aber sehr effizient: Nur 3 Milliarden aktive Parameter pro Wort machen ihn schnell und sparsam, stark bei Kundenservice-Dialogen (τ²-Bench).

59,2
SWE-bench Verified
79,5
τ²-Bench
91,6
AIME 2025
Aufbau
30 Mrd., davon 3 Mrd. aktiv (MoE)
Hardware
1× GPU mit 24 GB
Lizenz
MIT

Setzen wir ein für

  • Kundenservice und Standardanfragen
  • Coding-Assistent im Alltag
  • Günstige Dauerlast

Nemotron 3.5 Lightning

Aug 2026

NVIDIA

Aus NVIDIAs großem Nemotron 3 Ultra destilliert und auf Tempo getrimmt. Gedacht als „Arbeitsschicht“ von Agenten: Werkzeugaufrufe, Klassifizieren, Prüfen, Zusammenfassen, in großer Stückzahl. Auch Trainingsdaten und Rezepte sind offen.

86 %
PinchBench
+35 %
Tempo ggü. Qwen3.6-35B
Aufbau
30 Mrd., davon 3 Mrd. aktiv (MoE)
Hardware
1× GPU mit 24 GB
Kontext
1M Tokens
Lizenz
OpenMDW-1.1

Setzen wir ein für

  • Klassifizieren und Extrahieren in Masse
  • Schritte innerhalb langer Agenten-Workflows
  • Nachtraining auf eigene Aufgaben

Qwen3.6-35B-A3B

Frühjahr 2026

Alibaba

Fast so stark wie GPT-5 zum Start beim Programmieren, rechnet pro Wort aber nur mit 3 Milliarden Parametern. Entsprechend schnell, auch bei mehreren Nutzern gleichzeitig. Versteht Text, Bilder und Video.

73,4
SWE-bench Verified
86,0
GPQA Diamond
51,5
Terminal-Bench 2.0
Aufbau
35 Mrd., davon 3 Mrd. aktiv (MoE)
Hardware
1× GPU mit 24 GB
Kontext
262K (bis 1M) Tokens
Lizenz
Apache 2.0

Setzen wir ein für

  • Schneller Allrounder für viele Nutzer
  • RAG und Zusammenfassungen
  • Programmieren

Gemma 4 31B

Apr 2026

Google

Die beste Wahl, wenn Texte gut klingen müssen: über 140 Sprachen, sehr natürliches Deutsch, dazu Bildverständnis. Auf der Arena-Rangliste eines der am besten bewerteten offenen Modelle.

84,3
GPQA Diamond
80,0
LiveCodeBench v6
1452
Arena (Text)
Aufbau
31 Mrd. Parameter, dicht
Hardware
1× GPU mit 24–32 GB
Kontext
256K Tokens
Lizenz
Apache 2.0

Setzen wir ein für

  • Kundenkommunikation auf Deutsch
  • Briefe, Angebote, Zusammenfassungen
  • Mehrsprachige Dokumente

Welches Modell für welche Aufgabe?

Dokumente, Wissen, KundenkommunikationGemma 4 31B · Qwen3.8-27B
Agenten mit Werkzeugen (E-Mail, Kalender, ERP, APIs)Muse Glimmer 30B · Qwen3.8-27B
Große Mengen schneller RoutineaufgabenNemotron 3.5 Lightning · Qwen3.6-35B-A3B · GLM-4.7-Flash
Programmieren und technische DokumentationQwen3.8-27B · Qwen3.6-35B-A3B

Welche Grafikkarte Sie für welches Modell brauchen, zeigt unser Hardware-Rechner.

04Große offene Modelle

Wenn eine Grafikkarte nicht reicht: Frontier-nahe Modelle auf eigenen Servern

Neben den kompakten Modellen gibt es offene Modelle mit Hunderten Milliarden bis mehreren Billionen Parametern. Sie sprengen jede Consumer-Hardware, kommen in Benchmarks aber nah an die kommerzielle Cloud-Spitze heran, und ihre Gewichte sind trotzdem frei verfügbar.

ModellParameterHardware (ca.)Besonderheit
Kimi K3
Moonshot AI · Jul 2026
2,8 Bio. (104 Mrd. aktiv)GPU-Cluster über mehrere ServerGrößtes offenes Modell, stark bei agentischem Coding, 1M Kontext
Qwen3.8-Max
Alibaba · Aug 2026
2,4 Bio. (95 Mrd. aktiv)GPU-Cluster über mehrere ServerErstes Max-Modell von Qwen mit offenen Gewichten
GLM-5.3
Z.ai · 2026
~750 Mrd. (MoE)8× RTX PRO 6000 oder H200-ServerIm September 2026 Spitzenreiter der offenen Modelle im Artificial Analysis Index
DeepSeek V4 Flash
DeepSeek · 2026
284 Mrd. (13 Mrd. aktiv)2× RTX PRO 6000 (ab ~110 GB)Einstieg in die große Klasse, MIT-Lizenz, 1M Kontext

Eigener Server statt US-Cloud

Diese Modelle laufen auf Multi-GPU-Servern in Ihrem Serverraum oder gemietet in einem deutschen Rechenzentrum. Die Datenhoheit bleibt dieselbe wie bei den kleinen Modellen: Kein US-Anbieter sieht Ihre Anfragen.

Die Lehrer der kleinen Modelle

Viele kompakte Modelle werden aus den großen destilliert, Nemotron 3.5 Lightning etwa aus Nemotron 3 Ultra. Was heute ein Server-Cluster braucht, läuft oft ein Jahr später in verdichteter Form auf einer einzelnen Grafikkarte.

Für wen sich das lohnt

Für Großkanzleien, Klinikverbünde und Industrie mit vielen Nutzern oder komplexen Agenten. Mit sinkenden Hardware-Preisen rückt diese Klasse auch für den Mittelstand näher; DeepSeek V4 Flash läuft schon heute auf zwei Workstation-Karten.

Welches Modell zu Ihren Aufgaben passt, testen wir mit Ihren Daten.

Im kostenlosen Erstgespräch schauen wir auf Ihre Abläufe, schlagen passende Modelle und Hardware vor und rechnen die Kosten im Vergleich zur Cloud durch.

Quellen: Modellkarten der Hersteller auf Hugging Face (Qwen, Meta, Z.ai, NVIDIA, Google), OpenAI und Anthropic (Launch-Werte GPT-5 und Claude Opus 4.1, August 2025), Artificial Analysis. Benchmark-Werte sind Herstellerangaben. Stand 29.09.2026.