Qwen3.5 9B
聊天 · 推理 · 编程 · 视觉 · Apache-2.0
下载模型之前,先检查你的硬件能运行哪些热门本地大模型,并对比显存、内存、量化、上下文长度和预计每秒生成速度。
免费使用,无需安装软件。硬件检测在浏览器本地完成,原始 GPU 信息不会被上传。
已评估 39 个模型
搜索聊天、编程、推理和视觉模型,对比兼容性、预计内存、生成速度、运行时,以及每个结论背后的依据。
仅对能精确对应版本的 20 个模型展示 Arena 排名;无法确认的模型保持未排名,不做猜测。
Arena · CC BY 4.0 · 2026-07-10聊天 · 推理 · 编程 · 视觉 · Apache-2.0
聊天 · 推理 · 编程 · Apache-2.0
聊天 · 推理 · 编程 · 视觉 · Apache-2.0
聊天 · 编程 · Llama 3.1 Community
聊天 · 编程 · 推理 · Apache-2.0
编程 · 聊天 · Apache-2.0
推理 · 聊天 · MIT
聊天 · 推理 · 编程 · Apache-2.0
聊天 · 推理 · Apache-2.0
推理 · 聊天 · MIT
推理 · 聊天 · MIT
聊天 · 推理 · 视觉 · Gemma Terms
编程 · 聊天 · Apache-2.0
聊天 · 推理 · 编程 · Apache-2.0
聊天 · 推理 · 视觉 · Gemma Terms
聊天 · 编程 · 推理 · MIT
编程 · 聊天 · Apache-2.0
聊天 · 编程 · 视觉 · Apache-2.0
聊天 · 推理 · Apache-2.0
聊天 · 推理 · 编程 · Apache-2.0
聊天 · 视觉 · Gemma Terms
聊天 · 推理 · Apache-2.0
聊天 · 编程 · 推理 · MIT
聊天 · Llama 3.2 Community
聊天 · 编程 · Apache-2.0
聊天 · Gemma Terms
聊天 · 编程 · MIT
聊天 · 编程 · Apache-2.0
聊天 · 推理 · Gemma Terms
聊天 · Llama 3.2 Community
聊天 · 编程 · GLM-4 License
聊天 · 推理 · Llama 3.1 Community
聊天 · 推理 · Llama 3.3 Community
推理 · 聊天 · MIT + Llama
聊天 · 编程 · 推理 · Apache-2.0
聊天 · 编程 · 推理 · Modified MIT
聊天 · 推理 · 视觉 · Llama 4 Community
聊天 · 编程 · 推理 · MiniMax Open License
聊天 · 推理 · 视觉 · Llama 4 Community
性能结果来自公开规格和估算。驱动、运行时版本、散热、上下文长度及后台负载都会影响实际表现。
不只是能或不能
它既是本地大模型兼容性检测器,也是 LLM 显存计算器和选择指南;每项估算都会展示输入条件与局限。
使用浏览器检测结果,选择已有显卡或 Mac 配置,也可以手动编辑显存、统一内存、系统内存和带宽。
同时估算模型权重、上下文 KV Cache 和运行时开销,而不是只拿模型文件大小与标称显存比较。
对比 Q4、Q5、Q8、BF16、FP8 和 NVFP4,并了解内存差异与特定硬件的精度支持。
查看预计每秒输出 token 范围。它用于下载前的规划参考,并不是对你这台设备的实机跑分承诺。
打开结果即可查看内存构成、适配原因、运行时、数据来源、目录日期和评估引擎版本。
自动检测在浏览器中运行,原始 GPU 适配器信息不会上传;检测不准时可以随时手动替换。
系统、显示输出、推理运行时、模型上下文和临时缓冲区都会占用内存,不能把每一 GB 标称容量都算给模型。
结合模型架构和参数量,选择硬件及运行时真正支持的 Q4、Q5、Q8、BF16、FP8 或 NVFP4 文件。
投入存储空间和安装时间之前,先比较预计权重、KV Cache、运行时开销、适配状态和每秒 token 数。
如何在本地运行大模型
检测器会在本地尝试 WebGPU 和 WebGL。浏览器隐私限制可能导致结果近似,因此也可以选择配置或手动修改参数。
Q4、Q5、Q8 更通用,BF16 占用更多内存,FP8 和 NVFP4 需要特定 NVIDIA 架构;上下文越长,KV Cache 越大。
综合适配状态、内存构成、预计速度、运行时、来源、目录版本和引擎版本,而不是只看一个显存数字。