Qwen3.5 9B
Chat · Razonamiento · Programación · Visión · Apache-2.0
Ejecuta un LLM en local sin ir a ciegas. Compara modelos de IA local populares con tu hardware y revisa la VRAM, la memoria, la cuantización, la longitud del contexto y los tokens por segundo estimados antes de descargar nada.
Gratis y sin instalar software. La detección del hardware se realiza en tu navegador y no se envían los datos sin procesar de la GPU.
39 modelos evaluados
Busca modelos de IA locales para chat, programación, razonamiento o visión. Compara la compatibilidad, la memoria y la velocidad estimadas, el motor de ejecución y las fuentes que justifican cada resultado.
La clasificación de Arena se muestra para 20 modelos que coinciden exactamente; los demás quedan sin clasificar en lugar de asignarles una coincidencia dudosa.
Arena · CC BY 4.0 · 2026-07-10Chat · Razonamiento · Programación · Visión · Apache-2.0
Chat · Razonamiento · Programación · Apache-2.0
Chat · Razonamiento · Programación · Visión · Apache-2.0
Chat · Programación · Llama 3.1 Community
Chat · Programación · Razonamiento · Apache-2.0
Programación · Chat · Apache-2.0
Razonamiento · Chat · MIT
Chat · Razonamiento · Programación · Apache-2.0
Chat · Razonamiento · Apache-2.0
Razonamiento · Chat · MIT
Razonamiento · Chat · MIT
Chat · Razonamiento · Visión · Gemma Terms
Programación · Chat · Apache-2.0
Chat · Razonamiento · Programación · Apache-2.0
Chat · Razonamiento · Visión · Gemma Terms
Chat · Programación · Razonamiento · MIT
Programación · Chat · Apache-2.0
Chat · Programación · Visión · Apache-2.0
Chat · Razonamiento · Apache-2.0
Chat · Razonamiento · Programación · Apache-2.0
Chat · Visión · Gemma Terms
Chat · Razonamiento · Apache-2.0
Chat · Programación · Razonamiento · MIT
Chat · Llama 3.2 Community
Chat · Programación · Apache-2.0
Chat · Gemma Terms
Chat · Programación · MIT
Chat · Programación · Apache-2.0
Chat · Razonamiento · Gemma Terms
Chat · Llama 3.2 Community
Chat · Programación · GLM-4 License
Chat · Razonamiento · Llama 3.1 Community
Chat · Razonamiento · Llama 3.3 Community
Razonamiento · Chat · MIT + Llama
Chat · Programación · Razonamiento · Apache-2.0
Chat · Programación · Razonamiento · Modified MIT
Chat · Razonamiento · Visión · Llama 4 Community
Chat · Programación · Razonamiento · MiniMax Open License
Chat · Razonamiento · Visión · Llama 4 Community
El rendimiento es una estimación basada en especificaciones públicas. Los controladores, las versiones del motor, la refrigeración, la longitud del contexto y la carga en segundo plano pueden cambiar los resultados reales.
Mucho más que cabe o no cabe
Usa este test gratuito como calculadora de VRAM para LLM local y como guía de decisión, no solo como una lista de hardware. Los datos y límites de cada estimación permanecen visibles.
Empieza con la detección del navegador, elige un perfil conocido de GPU o Mac, o edita la VRAM, la memoria unificada, la RAM del sistema y el ancho de banda.
Estima los pesos del modelo, la caché KV del contexto y la sobrecarga del motor en vez de comparar solo el tamaño del archivo con la VRAM anunciada.
Compara Q4, Q5, Q8, BF16, FP8 y NVFP4 mientras el test explica el uso de memoria y qué precisiones admite tu hardware.
Consulta un intervalo estimado de tokens de salida por segundo. Es una ayuda para planificar, no el resultado de un benchmark garantizado en tu equipo.
Abre un resultado para consultar el desglose de memoria, el motivo de compatibilidad, el motor, la fuente, la fecha del catálogo y la versión del motor de evaluación.
La detección automática se ejecuta en tu navegador. No se envían los datos sin procesar del adaptador GPU y siempre puedes corregir manualmente un resultado aproximado.
Antes de descargar
Para ejecutar IA localmente no basta con comparar el número de parámetros con la VRAM anunciada. Comprueba la memoria útil, el formato del modelo, la cuantización, el contexto y la sobrecarga del motor antes de elegir una descarga.
Comprobar mi configuración de LLM localReserva espacio para el sistema operativo, la pantalla, el motor de inferencia, el contexto del modelo y los búferes temporales, en vez de considerar disponible cada gigabyte anunciado.
Combina la arquitectura y el número de parámetros del modelo con una versión Q4, Q5, Q8, BF16, FP8 o NVFP4 que tu hardware y tu motor admitan de verdad.
Compara los pesos estimados, la caché KV, la sobrecarga del motor, el estado de compatibilidad y los tokens por segundo antes de dedicar almacenamiento y tiempo a la instalación.
Cómo ejecutar un LLM en local
Empieza por tu PC, GPU o Mac, ajusta la precisión y el contexto del modelo y usa las estimaciones de compatibilidad, memoria y velocidad para decidir qué descargar.
Comprobar mi hardware ahoraEl test prueba WebGPU y WebGL de forma local. Las restricciones de privacidad del navegador pueden hacer que la detección sea aproximada, por lo que puedes elegir un perfil o editar los valores del hardware.
Q4, Q5 y Q8 ofrecen una amplia compatibilidad; BF16 necesita más memoria; FP8 y NVFP4 requieren determinadas arquitecturas NVIDIA. Un contexto mayor aumenta la memoria de la caché KV.
Valora a la vez la compatibilidad, el desglose de memoria, la velocidad estimada, el motor, la fuente, la versión del catálogo y la del motor de evaluación, no una sola cifra de VRAM.
Preguntas sobre LLM locales
Respuestas prácticas sobre el hardware para un LLM local, la VRAM, la memoria unificada de los Mac, la cuantización, la velocidad estimada y la detección desde el navegador.
Usa gratis el test de compatibilidad antes de descargar modelos de IA locales. Compara en un solo lugar compatibilidad, VRAM, memoria, cuantización, contexto y velocidad estimada.