Kostenloser Kompatibilitätscheck für lokale LLMs

Kann mein PC lokale KI und LLMs lokal ausführen?

Finde ohne Rätselraten heraus, welche lokale KI auf deiner Hardware läuft. Vergleiche beliebte LLMs nach VRAM, Speicherbedarf, Quantisierung, Kontextlänge und geschätzten Tokens pro Sekunde, bevor du ein Modell herunterlädst.

Kostenlos und ohne Software-Installation. Die Hardware-Erkennung läuft in deinem Browser; rohe GPU-Daten werden nicht hochgeladen.

Deine Hardware

Hardware wird erkannt…

Gemeinsamer Speicher48 GBArbeitsspeicher48 GBSpeicherbandbreite273 GB/s
Quantisierung / Präzision
Kontext
31Läuft flüssig
0Knapp passend
3Mit Auslagerung
5Passt nicht

39 Modelle geprüft

Welche lokalen KI-Modelle laufen auf dieser Hardware?

Durchsuche lokale KI-Modelle für Chat, Programmieren, Schlussfolgern und Bildverarbeitung. Vergleiche Kompatibilität, geschätzten Speicherbedarf, Tempo, Laufzeitumgebung und die Belege für jedes Ergebnis.

Aufgabe
Kompatibilität
Anbieter
Sortierung

Der Arena-Rang wird für 20 exakt zuordenbare Modelle angezeigt. Nicht zuordenbare Modelle bleiben ohne Rang, statt geschätzt zu werden.

Arena · CC BY 4.0 · 2026-07-10
Läuft flüssigAlibaba

Qwen3.5 9B

Chat · Schlussfolgern · Programmieren · Bildverarbeitung · Apache-2.0

Parameter 9B
Geschätzter Speicherbedarf 6,9 GBQ4_K_M
Geschätztes Tempo 24–36 tok/sMLX
Open-Source-Rang in Arena Keine genaue Übereinstimmung in Arena
Läuft flüssigAlibabaMoE

Qwen3 30B-A3B

Chat · Schlussfolgern · Programmieren · Apache-2.0

Parameter 31B3,3B aktiv
Geschätzter Speicherbedarf 20 GBQ4_K_M
Geschätztes Tempo 65–98 tok/sMLX
Open-Source-Rang in Arena #821317 · 26.474 Stimmen
Läuft flüssigAlibabaMoE

Qwen3.5 35B-A3B

Chat · Schlussfolgern · Programmieren · Bildverarbeitung · Apache-2.0

Parameter 35B3B aktiv
Geschätzter Speicherbedarf 23 GBQ4_K_M
Geschätztes Tempo 72–108 tok/sMLX
Open-Source-Rang in Arena #451396 · 29.184 Stimmen
Läuft flüssigMeta

Llama 3.1 8B Instruct

Chat · Programmieren · Llama 3.1 Community

Parameter 8B
Geschätzter Speicherbedarf 6,3 GBQ4_K_M
Geschätztes Tempo 27–40 tok/sMLX
Open-Source-Rang in Arena #1301187 · 49.605 Stimmen
Läuft flüssigOpenAIMoE

GPT-OSS 20B

Chat · Programmieren · Schlussfolgern · Apache-2.0

Parameter 21B3,6B aktiv
Geschätzter Speicherbedarf 14 GBQ4_K_M
Geschätztes Tempo 60–90 tok/sMLX
Open-Source-Rang in Arena #931288 · 10.621 Stimmen
Läuft flüssigAlibaba

Qwen2.5 Coder 7B Instruct

Programmieren · Chat · Apache-2.0

Parameter 7,6B
Geschätzter Speicherbedarf 6 GBQ4_K_M
Geschätztes Tempo 28–43 tok/sMLX
Open-Source-Rang in Arena Keine genaue Übereinstimmung in Arena
Läuft flüssigDeepSeek

DeepSeek R1 Distill Qwen 14B

Schlussfolgern · Chat · MIT

Parameter 15B
Geschätzter Speicherbedarf 11 GBQ4_K_M
Geschätztes Tempo 15–22 tok/sMLX
Open-Source-Rang in Arena Keine genaue Übereinstimmung in Arena
Läuft flüssigAlibaba

Qwen3 8B

Chat · Schlussfolgern · Programmieren · Apache-2.0

Parameter 8,2B
Geschätzter Speicherbedarf 6,4 GBQ4_K_M
Geschätztes Tempo 26–39 tok/sMLX
Open-Source-Rang in Arena Keine genaue Übereinstimmung in Arena
Läuft flüssigAlibaba

Qwen2.5 7B Instruct

Chat · Schlussfolgern · Apache-2.0

Parameter 7,6B
Geschätzter Speicherbedarf 6 GBQ4_K_M
Geschätztes Tempo 28–43 tok/sMLX
Open-Source-Rang in Arena Keine genaue Übereinstimmung in Arena
Läuft flüssigDeepSeek

DeepSeek R1 Distill Qwen 7B

Schlussfolgern · Chat · MIT

Parameter 7,6B
Geschätzter Speicherbedarf 6 GBQ4_K_M
Geschätztes Tempo 28–43 tok/sMLX
Open-Source-Rang in Arena Keine genaue Übereinstimmung in Arena
Läuft flüssigDeepSeek

DeepSeek R1 Distill Qwen 32B

Schlussfolgern · Chat · MIT

Parameter 33B
Geschätzter Speicherbedarf 23 GBQ4_K_M
Geschätztes Tempo 6,6–9,9 tok/sMLX
Open-Source-Rang in Arena Keine genaue Übereinstimmung in Arena
Läuft flüssigGoogle

Gemma 3 12B IT

Chat · Schlussfolgern · Bildverarbeitung · Gemma Terms

Parameter 12B
Geschätzter Speicherbedarf 8,8 GBQ4_K_M
Geschätztes Tempo 18–27 tok/sMLX
Open-Source-Rang in Arena #751334 · 3.829 Stimmen
Läuft flüssigAlibaba

Qwen2.5 Coder 14B Instruct

Programmieren · Chat · Apache-2.0

Parameter 15B
Geschätzter Speicherbedarf 11 GBQ4_K_M
Geschätztes Tempo 15–22 tok/sMLX
Open-Source-Rang in Arena Keine genaue Übereinstimmung in Arena
Läuft flüssigAlibaba

Qwen3 14B

Chat · Schlussfolgern · Programmieren · Apache-2.0

Parameter 15B
Geschätzter Speicherbedarf 11 GBQ4_K_M
Geschätztes Tempo 15–22 tok/sMLX
Open-Source-Rang in Arena Keine genaue Übereinstimmung in Arena
Läuft flüssigGoogle

Gemma 3 27B IT

Chat · Schlussfolgern · Bildverarbeitung · Gemma Terms

Parameter 27B
Geschätzter Speicherbedarf 19 GBQ4_K_M
Geschätztes Tempo 8–12 tok/sMLX
Open-Source-Rang in Arena #621358 · 47.514 Stimmen
Läuft flüssigMicrosoft

Phi-4 14B

Chat · Programmieren · Schlussfolgern · MIT

Parameter 14B
Geschätzter Speicherbedarf 10 GBQ4_K_M
Geschätztes Tempo 15–23 tok/sMLX
Open-Source-Rang in Arena #1211217 · 24.126 Stimmen
Läuft flüssigAlibaba

Qwen2.5 Coder 32B Instruct

Programmieren · Chat · Apache-2.0

Parameter 33B
Geschätzter Speicherbedarf 22 GBQ4_K_M
Geschätztes Tempo 6,6–10 tok/sMLX
Open-Source-Rang in Arena #1131230 · 5.432 Stimmen
Läuft flüssigMistral AI

Mistral Small 3.1 24B

Chat · Programmieren · Bildverarbeitung · Apache-2.0

Parameter 24B
Geschätzter Speicherbedarf 17 GBQ4_K_M
Geschätztes Tempo 9–14 tok/sMLX
Open-Source-Rang in Arena #991278 · 33.199 Stimmen
Läuft flüssigAlibaba

Qwen2.5 14B Instruct

Chat · Schlussfolgern · Apache-2.0

Parameter 15B
Geschätzter Speicherbedarf 11 GBQ4_K_M
Geschätztes Tempo 15–22 tok/sMLX
Open-Source-Rang in Arena Keine genaue Übereinstimmung in Arena
Läuft flüssigAlibaba

Qwen3 32B

Chat · Schlussfolgern · Programmieren · Apache-2.0

Parameter 33B
Geschätzter Speicherbedarf 23 GBQ4_K_M
Geschätztes Tempo 6,6–9,9 tok/sMLX
Open-Source-Rang in Arena #711340 · 3.926 Stimmen
Läuft flüssigGoogle

Gemma 3 4B IT

Chat · Bildverarbeitung · Gemma Terms

Parameter 4B
Geschätzter Speicherbedarf 3,7 GBQ4_K_M
Geschätztes Tempo 54–81 tok/sMLX
Open-Source-Rang in Arena #911291 · 4.171 Stimmen
Läuft flüssigAlibaba

Qwen2.5 32B Instruct

Chat · Schlussfolgern · Apache-2.0

Parameter 33B
Geschätzter Speicherbedarf 22 GBQ4_K_M
Geschätztes Tempo 6,6–10 tok/sMLX
Open-Source-Rang in Arena Keine genaue Übereinstimmung in Arena
Läuft flüssigMicrosoft

Phi-4 Mini Instruct

Chat · Programmieren · Schlussfolgern · MIT

Parameter 3,8B
Geschätzter Speicherbedarf 3,6 GBQ4_K_M
Geschätztes Tempo 57–85 tok/sMLX
Open-Source-Rang in Arena Keine genaue Übereinstimmung in Arena
Läuft flüssigMeta

Llama 3.2 3B Instruct

Chat · Llama 3.2 Community

Parameter 3B
Geschätzter Speicherbedarf 3 GBQ4_K_M
Geschätztes Tempo 72–108 tok/sMLX
Open-Source-Rang in Arena #1561110 · 7.936 Stimmen
Läuft flüssigMistral AI

Mistral 7B Instruct v0.3

Chat · Programmieren · Apache-2.0

Parameter 7,3B
Geschätzter Speicherbedarf 5,8 GBQ4_K_M
Geschätztes Tempo 30–44 tok/sMLX
Open-Source-Rang in Arena Keine genaue Übereinstimmung in Arena
Läuft flüssigGoogle

Gemma 2 9B IT

Chat · Gemma Terms

Parameter 9,2B
Geschätzter Speicherbedarf 7 GBQ4_K_M
Geschätztes Tempo 24–35 tok/sMLX
Open-Source-Rang in Arena #1221208 · 54.611 Stimmen
Läuft flüssigMicrosoft

Phi-3.5 Mini Instruct

Chat · Programmieren · MIT

Parameter 3,8B
Geschätzter Speicherbedarf 3,6 GBQ4_K_M
Geschätztes Tempo 57–85 tok/sMLX
Open-Source-Rang in Arena Keine genaue Übereinstimmung in Arena
Läuft flüssigMistral AI

Mistral NeMo 12B Instruct

Chat · Programmieren · Apache-2.0

Parameter 12B
Geschätzter Speicherbedarf 8,9 GBQ4_K_M
Geschätztes Tempo 18–27 tok/sMLX
Open-Source-Rang in Arena Keine genaue Übereinstimmung in Arena
Läuft flüssigGoogle

Gemma 2 27B IT

Chat · Schlussfolgern · Gemma Terms

Parameter 27B
Geschätzter Speicherbedarf 19 GBQ4_K_M
Geschätztes Tempo 8–12 tok/sMLX
Open-Source-Rang in Arena #1121232 · 75.754 Stimmen
Läuft flüssigMeta

Llama 3.2 1B Instruct

Chat · Llama 3.2 Community

Parameter 1B
Geschätzter Speicherbedarf 1,7 GBQ4_K_M
Geschätztes Tempo 200–300 tok/sMLX
Open-Source-Rang in Arena #1831055 · 8.045 Stimmen
Läuft flüssigZhipu AI

GLM-4 9B Chat

Chat · Programmieren · GLM-4 License

Parameter 9,4B
Geschätzter Speicherbedarf 7,2 GBQ4_K_M
Geschätztes Tempo 23–34 tok/sMLX
Open-Source-Rang in Arena Keine genaue Übereinstimmung in Arena
Läuft mit AuslagerungMeta

Llama 3.1 70B Instruct

Chat · Schlussfolgern · Llama 3.1 Community

Parameter 70B
Geschätzter Speicherbedarf 47 GBQ4_K_M
Geschätztes Tempo 0,5–0,7 tok/sMLX
Open-Source-Rang in Arena #1071261 · 55.240 Stimmen
Läuft mit AuslagerungMeta

Llama 3.3 70B Instruct

Chat · Schlussfolgern · Llama 3.3 Community

Parameter 70B
Geschätzter Speicherbedarf 47 GBQ4_K_M
Geschätztes Tempo 0,5–0,7 tok/sMLX
Open-Source-Rang in Arena #1001275 · 54.726 Stimmen
Läuft mit AuslagerungDeepSeek

DeepSeek R1 Distill Llama 70B

Schlussfolgern · Chat · MIT + Llama

Parameter 70B
Geschätzter Speicherbedarf 47 GBQ4_K_M
Geschätztes Tempo 0,5–0,7 tok/sMLX
Open-Source-Rang in Arena Keine genaue Übereinstimmung in Arena
Passt nichtOpenAIMoE

GPT-OSS 120B

Chat · Programmieren · Schlussfolgern · Apache-2.0

Parameter 117B5,1B aktiv
Geschätzter Speicherbedarf 75 GBQ4_K_M
Geschätztes Tempo 1,7–2,5 tok/sMLX
Open-Source-Rang in Arena #591366 · 30.628 Stimmen
Passt nichtMoonshot AIMoE

Kimi K2 Instruct

Chat · Programmieren · Schlussfolgern · Modified MIT

Parameter 1.000B32B aktiv
Geschätzter Speicherbedarf 633 GBQ4_K_M
Geschätztes Tempo 0,3–0,4 tok/sMLX
Open-Source-Rang in Arena Keine genaue Übereinstimmung in Arena
Passt nichtMetaMoE

Llama 4 Scout 17B-16E

Chat · Schlussfolgern · Bildverarbeitung · Llama 4 Community

Parameter 109B17B aktiv
Geschätzter Speicherbedarf 70 GBQ4_K_M
Geschätztes Tempo 0,5–0,8 tok/sMLX
Open-Source-Rang in Arena #981281 · 30.280 Stimmen
Passt nichtMiniMaxMoE

MiniMax M2.1

Chat · Programmieren · Schlussfolgern · MiniMax Open License

Parameter 230B10B aktiv
Geschätzter Speicherbedarf 146 GBQ4_K_M
Geschätztes Tempo 0,9–1,3 tok/sMLX
Open-Source-Rang in Arena Keine genaue Übereinstimmung in Arena
Passt nichtMetaMoE

Llama 4 Maverick 17B-128E

Chat · Schlussfolgern · Bildverarbeitung · Llama 4 Community

Parameter 400B17B aktiv
Geschätzter Speicherbedarf 254 GBQ4_K_M
Geschätztes Tempo 0,5–0,8 tok/sMLX
Open-Source-Rang in Arena #921288 · 39.963 Stimmen
Katalog 2026.07.17-mvp.2Aktualisiert am 2026-07-17Engine 1.1.0

Die Leistung wird anhand öffentlicher Spezifikationen geschätzt. Treiber, Laufzeitversionen, Kühlung, Kontextlänge und Hintergrundlast können die tatsächlichen Ergebnisse verändern.

Mehr als passend oder unpassend

Lokale KI mit verständlichen Angaben zu VRAM, Speicher und Tempo

Nutze den kostenlosen Kompatibilitätscheck als VRAM-Rechner und Entscheidungshilfe für lokale LLMs, nicht nur als Hardwareliste. Eingaben und Grenzen jeder Schätzung bleiben sichtbar.

Kompatibilität mit PC, GPU und Mac

Beginne mit der Browser-Erkennung, wähle ein bekanntes GPU- oder Mac-Profil oder bearbeite VRAM, gemeinsamen Speicher, Arbeitsspeicher und Bandbreite selbst.

VRAM- und Speicherrechner für lokale LLMs

Schätze Modellgewichte, Kontext-KV-Cache und Laufzeit-Overhead, statt nur die Dateigröße eines Modells mit dem beworbenen VRAM zu vergleichen.

Quantisierung passend zu deiner Hardware

Vergleiche Q4, Q5, Q8, BF16, FP8 und NVFP4. Der Check erklärt die Unterschiede beim Speicherbedarf und welche Präzision deine Hardware unterstützt.

Geschätztes Tempo lokaler LLMs

Sieh dir die geschätzte Ausgabegeschwindigkeit in Tokens pro Sekunde an. Sie dient zur Planung und ist kein Benchmark-Versprechen für deinen exakten Computer.

Begründungen und Quellen statt Blackbox

Öffne ein Ergebnis und prüfe Speicheraufteilung, Kompatibilitätsgrund, Laufzeitumgebung, Quelle, Katalogdatum und Version der Bewertungs-Engine.

Hardware-Erkennung direkt im Browser

Die automatische Erkennung läuft in deinem Browser. Rohe GPU-Adapterdaten werden nicht hochgeladen, und du kannst ein ungenaues Ergebnis jederzeit selbst ersetzen.

Vor dem Download

LLM lokal ausführen: Checkliste für Hardware und Speicher

Wer ein LLM lokal ausführen möchte, sollte nicht nur Parameterzahl und beworbenen VRAM vergleichen. Prüfe nutzbaren Speicher, Modellformat, Quantisierung, Kontext und Laufzeit-Overhead, bevor du ein Modell herunterlädst.

Meine lokale LLM-Konfiguration prüfen

Mit nutzbarem VRAM oder gemeinsamem Speicher beginnen

Plane Platz für Betriebssystem, Anzeige, Inferenz-Laufzeitumgebung, Modellkontext und temporäre Puffer ein, statt jedes beworbene Gigabyte als verfügbar zu behandeln.

Lokales KI-Modell und Quantisierung wählen

Stimme Modellarchitektur und Parameterzahl auf eine praxistaugliche Q4-, Q5-, Q8-, BF16-, FP8- oder NVFP4-Version ab, die von Hardware und Laufzeitumgebung unterstützt wird.

LLM-Rechner vor dem Download verwenden

Vergleiche geschätzte Modellgewichte, KV-Cache, Laufzeit-Overhead, Kompatibilitätsstatus und Tokens pro Sekunde, bevor du Speicherplatz und Einrichtungszeit investierst.

So lässt sich ein LLM lokal ausführen

Hardware-Anforderungen lokaler LLMs in drei Schritten prüfen

Beginne mit deinem PC, deiner GPU oder deinem Mac, passe Modellpräzision und Kontext an und entscheide anhand von Kompatibilität, Speicherbedarf und Tempo, welches Modell du herunterladen solltest.

Meine Hardware jetzt prüfen

1. PC, GPU oder Mac bestätigen

Der Check versucht, WebGPU und WebGL lokal zu erkennen. Datenschutzbeschränkungen des Browsers können das Ergebnis ungenau machen; deshalb kannst du ein Profil wählen oder die Hardwarewerte bearbeiten.

2. Quantisierung und Kontext festlegen

Q4, Q5 und Q8 sind breit einsetzbar; BF16 benötigt mehr Speicher; FP8 und NVFP4 setzen bestimmte NVIDIA-Architekturen voraus. Ein längerer Kontext vergrößert den KV-Cache.

3. Lokales KI-Modell auswählen

Bewerte Kompatibilitätsstatus, Speicheraufteilung, geschätztes Tempo, Laufzeitumgebung, Quelle, Katalog- und Engine-Version gemeinsam statt nur einer einzelnen VRAM-Zahl.

FAQ zu lokalen LLMs

Lokale KI und LLMs auf dem eigenen PC: Häufige Fragen

Praktische Antworten zu Hardware-Anforderungen lokaler LLMs, VRAM, gemeinsamem Speicher auf dem Mac, Quantisierung, Geschwindigkeitsschätzungen und Browser-Erkennung.

Finde die lokale KI, die auf deiner Hardware wirklich läuft

Nutze den kostenlosen Kompatibilitätscheck für lokale LLMs, bevor du Modelldateien herunterlädst. Vergleiche Kompatibilität, VRAM, Speicher, Quantisierung, Kontext und geschätztes Tempo an einem Ort.