免费的本地大模型兼容性检测器

我的 PC、显卡或 Mac 能在本地运行 AI 吗?

下载模型之前,先检查你的硬件能运行哪些热门本地大模型,并对比显存、内存、量化、上下文长度和预计每秒生成速度。

免费使用,无需安装软件。硬件检测在浏览器本地完成,原始 GPU 信息不会被上传。

你的硬件

正在检测硬件…

统一内存48 GB系统内存48 GB内存带宽273 GB/s
量化 / 精度
上下文
31宽松运行
0勉强适配
3内存卸载
5无法运行

已评估 39 个模型

这台设备能运行哪些本地大模型?

搜索聊天、编程、推理和视觉模型,对比兼容性、预计内存、生成速度、运行时,以及每个结论背后的依据。

任务
兼容性
厂商
排序

仅对能精确对应版本的 20 个模型展示 Arena 排名;无法确认的模型保持未排名,不做猜测。

Arena · CC BY 4.0 · 2026-07-10
运行宽松Alibaba

Qwen3.5 9B

聊天 · 推理 · 编程 · 视觉 · Apache-2.0

参数量 9B
预计内存 6.9 GBQ4_K_M
预计速度 24–36 tok/sMLX
Arena 开源排名 Arena 无精确对应版本
运行宽松AlibabaMoE

Qwen3 30B-A3B

聊天 · 推理 · 编程 · Apache-2.0

参数量 31B3.3B 激活参数
预计内存 20 GBQ4_K_M
预计速度 65–98 tok/sMLX
Arena 开源排名 #821317 · 26,474 票
运行宽松AlibabaMoE

Qwen3.5 35B-A3B

聊天 · 推理 · 编程 · 视觉 · Apache-2.0

参数量 35B3B 激活参数
预计内存 23 GBQ4_K_M
预计速度 72–108 tok/sMLX
Arena 开源排名 #451396 · 29,184 票
运行宽松Meta

Llama 3.1 8B Instruct

聊天 · 编程 · Llama 3.1 Community

参数量 8B
预计内存 6.3 GBQ4_K_M
预计速度 27–40 tok/sMLX
Arena 开源排名 #1301187 · 49,605 票
运行宽松OpenAIMoE

GPT-OSS 20B

聊天 · 编程 · 推理 · Apache-2.0

参数量 21B3.6B 激活参数
预计内存 14 GBQ4_K_M
预计速度 60–90 tok/sMLX
Arena 开源排名 #931288 · 10,621 票
运行宽松Alibaba

Qwen2.5 Coder 7B Instruct

编程 · 聊天 · Apache-2.0

参数量 7.6B
预计内存 6 GBQ4_K_M
预计速度 28–43 tok/sMLX
Arena 开源排名 Arena 无精确对应版本
运行宽松DeepSeek

DeepSeek R1 Distill Qwen 14B

推理 · 聊天 · MIT

参数量 15B
预计内存 11 GBQ4_K_M
预计速度 15–22 tok/sMLX
Arena 开源排名 Arena 无精确对应版本
运行宽松Alibaba

Qwen3 8B

聊天 · 推理 · 编程 · Apache-2.0

参数量 8.2B
预计内存 6.4 GBQ4_K_M
预计速度 26–39 tok/sMLX
Arena 开源排名 Arena 无精确对应版本
运行宽松Alibaba

Qwen2.5 7B Instruct

聊天 · 推理 · Apache-2.0

参数量 7.6B
预计内存 6 GBQ4_K_M
预计速度 28–43 tok/sMLX
Arena 开源排名 Arena 无精确对应版本
运行宽松DeepSeek

DeepSeek R1 Distill Qwen 7B

推理 · 聊天 · MIT

参数量 7.6B
预计内存 6 GBQ4_K_M
预计速度 28–43 tok/sMLX
Arena 开源排名 Arena 无精确对应版本
运行宽松DeepSeek

DeepSeek R1 Distill Qwen 32B

推理 · 聊天 · MIT

参数量 33B
预计内存 23 GBQ4_K_M
预计速度 6.6–9.9 tok/sMLX
Arena 开源排名 Arena 无精确对应版本
运行宽松Google

Gemma 3 12B IT

聊天 · 推理 · 视觉 · Gemma Terms

参数量 12B
预计内存 8.8 GBQ4_K_M
预计速度 18–27 tok/sMLX
Arena 开源排名 #751334 · 3,829 票
运行宽松Alibaba

Qwen2.5 Coder 14B Instruct

编程 · 聊天 · Apache-2.0

参数量 15B
预计内存 11 GBQ4_K_M
预计速度 15–22 tok/sMLX
Arena 开源排名 Arena 无精确对应版本
运行宽松Alibaba

Qwen3 14B

聊天 · 推理 · 编程 · Apache-2.0

参数量 15B
预计内存 11 GBQ4_K_M
预计速度 15–22 tok/sMLX
Arena 开源排名 Arena 无精确对应版本
运行宽松Google

Gemma 3 27B IT

聊天 · 推理 · 视觉 · Gemma Terms

参数量 27B
预计内存 19 GBQ4_K_M
预计速度 8–12 tok/sMLX
Arena 开源排名 #621358 · 47,514 票
运行宽松Microsoft

Phi-4 14B

聊天 · 编程 · 推理 · MIT

参数量 14B
预计内存 10 GBQ4_K_M
预计速度 15–23 tok/sMLX
Arena 开源排名 #1211217 · 24,126 票
运行宽松Alibaba

Qwen2.5 Coder 32B Instruct

编程 · 聊天 · Apache-2.0

参数量 33B
预计内存 22 GBQ4_K_M
预计速度 6.6–10 tok/sMLX
Arena 开源排名 #1131230 · 5,432 票
运行宽松Mistral AI

Mistral Small 3.1 24B

聊天 · 编程 · 视觉 · Apache-2.0

参数量 24B
预计内存 17 GBQ4_K_M
预计速度 9–14 tok/sMLX
Arena 开源排名 #991278 · 33,199 票
运行宽松Alibaba

Qwen2.5 14B Instruct

聊天 · 推理 · Apache-2.0

参数量 15B
预计内存 11 GBQ4_K_M
预计速度 15–22 tok/sMLX
Arena 开源排名 Arena 无精确对应版本
运行宽松Alibaba

Qwen3 32B

聊天 · 推理 · 编程 · Apache-2.0

参数量 33B
预计内存 23 GBQ4_K_M
预计速度 6.6–9.9 tok/sMLX
Arena 开源排名 #711340 · 3,926 票
运行宽松Google

Gemma 3 4B IT

聊天 · 视觉 · Gemma Terms

参数量 4B
预计内存 3.7 GBQ4_K_M
预计速度 54–81 tok/sMLX
Arena 开源排名 #911291 · 4,171 票
运行宽松Alibaba

Qwen2.5 32B Instruct

聊天 · 推理 · Apache-2.0

参数量 33B
预计内存 22 GBQ4_K_M
预计速度 6.6–10 tok/sMLX
Arena 开源排名 Arena 无精确对应版本
运行宽松Microsoft

Phi-4 Mini Instruct

聊天 · 编程 · 推理 · MIT

参数量 3.8B
预计内存 3.6 GBQ4_K_M
预计速度 57–85 tok/sMLX
Arena 开源排名 Arena 无精确对应版本
运行宽松Meta

Llama 3.2 3B Instruct

聊天 · Llama 3.2 Community

参数量 3B
预计内存 3 GBQ4_K_M
预计速度 72–108 tok/sMLX
Arena 开源排名 #1561110 · 7,936 票
运行宽松Mistral AI

Mistral 7B Instruct v0.3

聊天 · 编程 · Apache-2.0

参数量 7.3B
预计内存 5.8 GBQ4_K_M
预计速度 30–44 tok/sMLX
Arena 开源排名 Arena 无精确对应版本
运行宽松Google

Gemma 2 9B IT

聊天 · Gemma Terms

参数量 9.2B
预计内存 7 GBQ4_K_M
预计速度 24–35 tok/sMLX
Arena 开源排名 #1221208 · 54,611 票
运行宽松Microsoft

Phi-3.5 Mini Instruct

聊天 · 编程 · MIT

参数量 3.8B
预计内存 3.6 GBQ4_K_M
预计速度 57–85 tok/sMLX
Arena 开源排名 Arena 无精确对应版本
运行宽松Mistral AI

Mistral NeMo 12B Instruct

聊天 · 编程 · Apache-2.0

参数量 12B
预计内存 8.9 GBQ4_K_M
预计速度 18–27 tok/sMLX
Arena 开源排名 Arena 无精确对应版本
运行宽松Google

Gemma 2 27B IT

聊天 · 推理 · Gemma Terms

参数量 27B
预计内存 19 GBQ4_K_M
预计速度 8–12 tok/sMLX
Arena 开源排名 #1121232 · 75,754 票
运行宽松Meta

Llama 3.2 1B Instruct

聊天 · Llama 3.2 Community

参数量 1B
预计内存 1.7 GBQ4_K_M
预计速度 200–300 tok/sMLX
Arena 开源排名 #1831055 · 8,045 票
运行宽松Zhipu AI

GLM-4 9B Chat

聊天 · 编程 · GLM-4 License

参数量 9.4B
预计内存 7.2 GBQ4_K_M
预计速度 23–34 tok/sMLX
Arena 开源排名 Arena 无精确对应版本
可通过内存卸载运行Meta

Llama 3.1 70B Instruct

聊天 · 推理 · Llama 3.1 Community

参数量 70B
预计内存 47 GBQ4_K_M
预计速度 0.5–0.7 tok/sMLX
Arena 开源排名 #1071261 · 55,240 票
可通过内存卸载运行Meta

Llama 3.3 70B Instruct

聊天 · 推理 · Llama 3.3 Community

参数量 70B
预计内存 47 GBQ4_K_M
预计速度 0.5–0.7 tok/sMLX
Arena 开源排名 #1001275 · 54,726 票
可通过内存卸载运行DeepSeek

DeepSeek R1 Distill Llama 70B

推理 · 聊天 · MIT + Llama

参数量 70B
预计内存 47 GBQ4_K_M
预计速度 0.5–0.7 tok/sMLX
Arena 开源排名 Arena 无精确对应版本
无法运行OpenAIMoE

GPT-OSS 120B

聊天 · 编程 · 推理 · Apache-2.0

参数量 117B5.1B 激活参数
预计内存 75 GBQ4_K_M
预计速度 1.7–2.5 tok/sMLX
Arena 开源排名 #591366 · 30,628 票
无法运行Moonshot AIMoE

Kimi K2 Instruct

聊天 · 编程 · 推理 · Modified MIT

参数量 1,000B32B 激活参数
预计内存 633 GBQ4_K_M
预计速度 0.3–0.4 tok/sMLX
Arena 开源排名 Arena 无精确对应版本
无法运行MetaMoE

Llama 4 Scout 17B-16E

聊天 · 推理 · 视觉 · Llama 4 Community

参数量 109B17B 激活参数
预计内存 70 GBQ4_K_M
预计速度 0.5–0.8 tok/sMLX
Arena 开源排名 #981281 · 30,280 票
无法运行MiniMaxMoE

MiniMax M2.1

聊天 · 编程 · 推理 · MiniMax Open License

参数量 230B10B 激活参数
预计内存 146 GBQ4_K_M
预计速度 0.9–1.3 tok/sMLX
Arena 开源排名 Arena 无精确对应版本
无法运行MetaMoE

Llama 4 Maverick 17B-128E

聊天 · 推理 · 视觉 · Llama 4 Community

参数量 400B17B 激活参数
预计内存 254 GBQ4_K_M
预计速度 0.5–0.8 tok/sMLX
Arena 开源排名 #921288 · 39,963 票
数据版本 2026.07.17-mvp.2更新于 2026-07-17Engine 1.1.0

性能结果来自公开规格和估算。驱动、运行时版本、散热、上下文长度及后台负载都会影响实际表现。

不只是能或不能

解释本地大模型的显存、内存与运行速度

它既是本地大模型兼容性检测器,也是 LLM 显存计算器和选择指南;每项估算都会展示输入条件与局限。

支持 PC、显卡与 Mac 配置

使用浏览器检测结果,选择已有显卡或 Mac 配置,也可以手动编辑显存、统一内存、系统内存和带宽。

LLM 显存与内存计算器

同时估算模型权重、上下文 KV Cache 和运行时开销,而不是只拿模型文件大小与标称显存比较。

匹配硬件的量化与精度

对比 Q4、Q5、Q8、BF16、FP8 和 NVFP4,并了解内存差异与特定硬件的精度支持。

本地 LLM 速度估算

查看预计每秒输出 token 范围。它用于下载前的规划参考,并不是对你这台设备的实机跑分承诺。

展示原因与来源

打开结果即可查看内存构成、适配原因、运行时、数据来源、目录日期和评估引擎版本。

浏览器本地硬件检测

自动检测在浏览器中运行,原始 GPU 适配器信息不会上传;检测不准时可以随时手动替换。

下载模型之前

在本地运行 LLM:实用硬件与内存检查清单

在本地运行 LLM 不能只比较参数量和标称显存。下载前还要检查实际可用内存、模型格式、量化、上下文与运行时开销。

检查我的本地 LLM 配置

从实际可用显存或统一内存开始

系统、显示输出、推理运行时、模型上下文和临时缓冲区都会占用内存,不能把每一 GB 标称容量都算给模型。

选择本地 LLM 模型与量化版本

结合模型架构和参数量,选择硬件及运行时真正支持的 Q4、Q5、Q8、BF16、FP8 或 NVFP4 文件。

下载前使用 LLM 计算器

投入存储空间和安装时间之前,先比较预计权重、KV Cache、运行时开销、适配状态和每秒 token 数。

如何在本地运行大模型

三步检查本地 LLM 硬件要求

先确认 PC、显卡或 Mac,再调整模型精度与上下文,最后根据适配、内存和速度估算决定下载哪个模型。

立即检查我的硬件

1. 确认 PC、显卡或 Mac

检测器会在本地尝试 WebGPU 和 WebGL。浏览器隐私限制可能导致结果近似,因此也可以选择配置或手动修改参数。

2. 设置量化和上下文

Q4、Q5、Q8 更通用,BF16 占用更多内存,FP8 和 NVFP4 需要特定 NVIDIA 架构;上下文越长,KV Cache 越大。

3. 选择本地 AI 模型

综合适配状态、内存构成、预计速度、运行时、来源、目录版本和引擎版本,而不是只看一个显存数字。

本地大模型常见问题

我能在本机运行 AI 吗?常见问题

了解本地 LLM 硬件要求、显存、Mac 统一内存、量化、速度估算和浏览器硬件检测。

找到你的硬件真正能运行的本地大模型

下载模型文件之前,先免费检查兼容性,并在一个页面中对比适配状态、显存、内存、量化、上下文与预计速度。