Qwen3.5 9B
Chat · Schlussfolgern · Programmieren · Bildverarbeitung · Apache-2.0
Finde ohne Rätselraten heraus, welche lokale KI auf deiner Hardware läuft. Vergleiche beliebte LLMs nach VRAM, Speicherbedarf, Quantisierung, Kontextlänge und geschätzten Tokens pro Sekunde, bevor du ein Modell herunterlädst.
Kostenlos und ohne Software-Installation. Die Hardware-Erkennung läuft in deinem Browser; rohe GPU-Daten werden nicht hochgeladen.
39 Modelle geprüft
Durchsuche lokale KI-Modelle für Chat, Programmieren, Schlussfolgern und Bildverarbeitung. Vergleiche Kompatibilität, geschätzten Speicherbedarf, Tempo, Laufzeitumgebung und die Belege für jedes Ergebnis.
Der Arena-Rang wird für 20 exakt zuordenbare Modelle angezeigt. Nicht zuordenbare Modelle bleiben ohne Rang, statt geschätzt zu werden.
Arena · CC BY 4.0 · 2026-07-10Chat · Schlussfolgern · Programmieren · Bildverarbeitung · Apache-2.0
Chat · Schlussfolgern · Programmieren · Apache-2.0
Chat · Schlussfolgern · Programmieren · Bildverarbeitung · Apache-2.0
Chat · Programmieren · Llama 3.1 Community
Chat · Programmieren · Schlussfolgern · Apache-2.0
Programmieren · Chat · Apache-2.0
Schlussfolgern · Chat · MIT
Chat · Schlussfolgern · Programmieren · Apache-2.0
Chat · Schlussfolgern · Apache-2.0
Schlussfolgern · Chat · MIT
Schlussfolgern · Chat · MIT
Chat · Schlussfolgern · Bildverarbeitung · Gemma Terms
Programmieren · Chat · Apache-2.0
Chat · Schlussfolgern · Programmieren · Apache-2.0
Chat · Schlussfolgern · Bildverarbeitung · Gemma Terms
Chat · Programmieren · Schlussfolgern · MIT
Programmieren · Chat · Apache-2.0
Chat · Programmieren · Bildverarbeitung · Apache-2.0
Chat · Schlussfolgern · Apache-2.0
Chat · Schlussfolgern · Programmieren · Apache-2.0
Chat · Bildverarbeitung · Gemma Terms
Chat · Schlussfolgern · Apache-2.0
Chat · Programmieren · Schlussfolgern · MIT
Chat · Llama 3.2 Community
Chat · Programmieren · Apache-2.0
Chat · Gemma Terms
Chat · Programmieren · MIT
Chat · Programmieren · Apache-2.0
Chat · Schlussfolgern · Gemma Terms
Chat · Llama 3.2 Community
Chat · Programmieren · GLM-4 License
Chat · Schlussfolgern · Llama 3.1 Community
Chat · Schlussfolgern · Llama 3.3 Community
Schlussfolgern · Chat · MIT + Llama
Chat · Programmieren · Schlussfolgern · Apache-2.0
Chat · Programmieren · Schlussfolgern · Modified MIT
Chat · Schlussfolgern · Bildverarbeitung · Llama 4 Community
Chat · Programmieren · Schlussfolgern · MiniMax Open License
Chat · Schlussfolgern · Bildverarbeitung · Llama 4 Community
Die Leistung wird anhand öffentlicher Spezifikationen geschätzt. Treiber, Laufzeitversionen, Kühlung, Kontextlänge und Hintergrundlast können die tatsächlichen Ergebnisse verändern.
Mehr als passend oder unpassend
Nutze den kostenlosen Kompatibilitätscheck als VRAM-Rechner und Entscheidungshilfe für lokale LLMs, nicht nur als Hardwareliste. Eingaben und Grenzen jeder Schätzung bleiben sichtbar.
Beginne mit der Browser-Erkennung, wähle ein bekanntes GPU- oder Mac-Profil oder bearbeite VRAM, gemeinsamen Speicher, Arbeitsspeicher und Bandbreite selbst.
Schätze Modellgewichte, Kontext-KV-Cache und Laufzeit-Overhead, statt nur die Dateigröße eines Modells mit dem beworbenen VRAM zu vergleichen.
Vergleiche Q4, Q5, Q8, BF16, FP8 und NVFP4. Der Check erklärt die Unterschiede beim Speicherbedarf und welche Präzision deine Hardware unterstützt.
Sieh dir die geschätzte Ausgabegeschwindigkeit in Tokens pro Sekunde an. Sie dient zur Planung und ist kein Benchmark-Versprechen für deinen exakten Computer.
Öffne ein Ergebnis und prüfe Speicheraufteilung, Kompatibilitätsgrund, Laufzeitumgebung, Quelle, Katalogdatum und Version der Bewertungs-Engine.
Die automatische Erkennung läuft in deinem Browser. Rohe GPU-Adapterdaten werden nicht hochgeladen, und du kannst ein ungenaues Ergebnis jederzeit selbst ersetzen.
Vor dem Download
Wer ein LLM lokal ausführen möchte, sollte nicht nur Parameterzahl und beworbenen VRAM vergleichen. Prüfe nutzbaren Speicher, Modellformat, Quantisierung, Kontext und Laufzeit-Overhead, bevor du ein Modell herunterlädst.
Meine lokale LLM-Konfiguration prüfenPlane Platz für Betriebssystem, Anzeige, Inferenz-Laufzeitumgebung, Modellkontext und temporäre Puffer ein, statt jedes beworbene Gigabyte als verfügbar zu behandeln.
Stimme Modellarchitektur und Parameterzahl auf eine praxistaugliche Q4-, Q5-, Q8-, BF16-, FP8- oder NVFP4-Version ab, die von Hardware und Laufzeitumgebung unterstützt wird.
Vergleiche geschätzte Modellgewichte, KV-Cache, Laufzeit-Overhead, Kompatibilitätsstatus und Tokens pro Sekunde, bevor du Speicherplatz und Einrichtungszeit investierst.
So lässt sich ein LLM lokal ausführen
Beginne mit deinem PC, deiner GPU oder deinem Mac, passe Modellpräzision und Kontext an und entscheide anhand von Kompatibilität, Speicherbedarf und Tempo, welches Modell du herunterladen solltest.
Meine Hardware jetzt prüfenDer Check versucht, WebGPU und WebGL lokal zu erkennen. Datenschutzbeschränkungen des Browsers können das Ergebnis ungenau machen; deshalb kannst du ein Profil wählen oder die Hardwarewerte bearbeiten.
Q4, Q5 und Q8 sind breit einsetzbar; BF16 benötigt mehr Speicher; FP8 und NVFP4 setzen bestimmte NVIDIA-Architekturen voraus. Ein längerer Kontext vergrößert den KV-Cache.
Bewerte Kompatibilitätsstatus, Speicheraufteilung, geschätztes Tempo, Laufzeitumgebung, Quelle, Katalog- und Engine-Version gemeinsam statt nur einer einzelnen VRAM-Zahl.
FAQ zu lokalen LLMs
Praktische Antworten zu Hardware-Anforderungen lokaler LLMs, VRAM, gemeinsamem Speicher auf dem Mac, Quantisierung, Geschwindigkeitsschätzungen und Browser-Erkennung.
Nutze den kostenlosen Kompatibilitätscheck für lokale LLMs, bevor du Modelldateien herunterlädst. Vergleiche Kompatibilität, VRAM, Speicher, Quantisierung, Kontext und geschätztes Tempo an einem Ort.