Qwen3.5 9B
Chat · Raisonnement · Code · Vision · Apache-2.0
Faites tourner un LLM en local sans avancer à l’aveugle. Comparez les modèles d’IA locale populaires à votre matériel, puis vérifiez la VRAM, la mémoire, la quantification, la taille du contexte et la vitesse estimée avant tout téléchargement.
Utilisation gratuite, sans logiciel à installer. La détection du matériel s’effectue dans votre navigateur et les données brutes de votre GPU ne sont pas envoyées.
39 modèles évalués
Recherchez des modèles d’IA locale pour le chat, le code, le raisonnement ou la vision. Comparez leur compatibilité, leur mémoire et leur vitesse estimées, leur moteur d’exécution et les sources de chaque résultat.
Le classement Arena s’affiche pour 20 modèles associés avec certitude ; les autres restent non classés plutôt que d’être rapprochés au hasard.
Arena · CC BY 4.0 · 2026-07-10Chat · Raisonnement · Code · Vision · Apache-2.0
Chat · Raisonnement · Code · Apache-2.0
Chat · Raisonnement · Code · Vision · Apache-2.0
Chat · Code · Llama 3.1 Community
Chat · Code · Raisonnement · Apache-2.0
Code · Chat · Apache-2.0
Raisonnement · Chat · MIT
Chat · Raisonnement · Code · Apache-2.0
Chat · Raisonnement · Apache-2.0
Raisonnement · Chat · MIT
Raisonnement · Chat · MIT
Chat · Raisonnement · Vision · Gemma Terms
Code · Chat · Apache-2.0
Chat · Raisonnement · Code · Apache-2.0
Chat · Raisonnement · Vision · Gemma Terms
Chat · Code · Raisonnement · MIT
Code · Chat · Apache-2.0
Chat · Code · Vision · Apache-2.0
Chat · Raisonnement · Apache-2.0
Chat · Raisonnement · Code · Apache-2.0
Chat · Vision · Gemma Terms
Chat · Raisonnement · Apache-2.0
Chat · Code · Raisonnement · MIT
Chat · Llama 3.2 Community
Chat · Code · Apache-2.0
Chat · Gemma Terms
Chat · Code · MIT
Chat · Code · Apache-2.0
Chat · Raisonnement · Gemma Terms
Chat · Llama 3.2 Community
Chat · Code · GLM-4 License
Chat · Raisonnement · Llama 3.1 Community
Chat · Raisonnement · Llama 3.3 Community
Raisonnement · Chat · MIT + Llama
Chat · Code · Raisonnement · Apache-2.0
Chat · Code · Raisonnement · Modified MIT
Chat · Raisonnement · Vision · Llama 4 Community
Chat · Code · Raisonnement · MiniMax Open License
Chat · Raisonnement · Vision · Llama 4 Community
Les performances sont estimées à partir de spécifications publiques. Les pilotes, les versions du moteur, le refroidissement, la longueur du contexte et la charge en arrière-plan peuvent modifier les résultats réels.
Bien plus qu’un simple oui ou non
Utilisez ce test gratuit comme calculateur de VRAM pour LLM local et comme guide de décision, pas comme une simple liste de matériel. Les données et limites de chaque estimation restent visibles.
Commencez par la détection dans le navigateur, choisissez un profil GPU ou Mac connu, ou modifiez vous-même la VRAM, la mémoire unifiée, la RAM système et la bande passante.
Estimez les poids du modèle, le cache KV du contexte et le surcoût du moteur au lieu de comparer uniquement la taille du fichier à la VRAM annoncée.
Comparez Q4, Q5, Q8, BF16, FP8 et NVFP4 ; le test explique les compromis de mémoire et la prise en charge de chaque précision par votre matériel.
Consultez une plage de vitesse de sortie estimée en tokens par seconde. C’est une aide à la décision, pas un résultat de benchmark garanti sur votre machine.
Ouvrez un résultat pour examiner la répartition de la mémoire, la raison de la compatibilité, le moteur, la source, la date du catalogue et la version du moteur d’évaluation.
La détection automatique s’effectue dans votre navigateur. Les données brutes de l’adaptateur GPU ne sont pas envoyées et vous pouvez toujours corriger manuellement un résultat approximatif.
Avant de télécharger
Pour faire tourner un LLM en local, il ne suffit pas de comparer le nombre de paramètres à la VRAM annoncée. Vérifiez la mémoire réellement disponible, le format, la quantification, le contexte et le surcoût du moteur avant de télécharger.
Vérifier ma configuration LLM localeGardez de la place pour le système d’exploitation, l’affichage, le moteur d’inférence, le contexte du modèle et les tampons temporaires, au lieu de considérer chaque gigaoctet annoncé comme disponible.
Associez l’architecture et le nombre de paramètres du modèle à une version Q4, Q5, Q8, BF16, FP8 ou NVFP4 réellement prise en charge par votre matériel et votre moteur.
Comparez le poids estimé, le cache KV, le surcoût du moteur, l’état de compatibilité et les tokens par seconde avant de consacrer du stockage et du temps à l’installation.
Comment exécuter un LLM en local
Commencez par votre PC, GPU ou Mac, réglez la précision et le contexte du modèle, puis utilisez les estimations de compatibilité, de mémoire et de vitesse pour choisir le bon téléchargement.
Tester mon matériel maintenantLe test essaie WebGPU et WebGL localement. Les restrictions de confidentialité du navigateur peuvent rendre la détection approximative ; vous pouvez donc choisir un profil ou modifier les valeurs matérielles.
Q4, Q5 et Q8 sont largement compatibles ; BF16 demande plus de mémoire ; FP8 et NVFP4 nécessitent certaines architectures NVIDIA. Un contexte plus long augmente la mémoire du cache KV.
Tenez compte ensemble de la compatibilité, de la répartition de la mémoire, de la vitesse estimée, du moteur, de la source, de la version du catalogue et de celle du moteur d’évaluation, pas d’un seul chiffre de VRAM.
FAQ sur les LLM locaux
Des réponses concrètes sur le matériel nécessaire pour un LLM local, la VRAM, la mémoire unifiée des Mac, la quantification, la vitesse estimée et la détection par navigateur.
Utilisez gratuitement le test de compatibilité avant de télécharger un modèle d’IA locale. Comparez au même endroit la compatibilité, la VRAM, la mémoire, la quantification, le contexte et la vitesse estimée.