GPU检测与本地模型推荐
检测显卡与可用内存,告诉你能流畅运行哪些本地大模型和量化版本
通过 WebGPU / WebGL 读取本机 GPU 信息,识别显卡型号并推算可用显存或统一内存,再按「模型权重 + KV Cache + 运行时开销」的显存账单,给出 Qwen、Llama、DeepSeek 等热门开源模型在不同量化等级(Q3/Q4/Q6/Q8)下的运行建议。全部检测在浏览器本地完成,不上传任何信息。
硬件检测结果
参数修正
浏览器无法直接读取显存容量,已按型号预填常见配置。苹果芯片请填写统一内存大小,与显存同等参与计算。
— GB
显存总量
0
模型可用(含预留)
0
可流畅运行
0
可勉强运行
流畅运行 权重 + 上下文占用不超过可用内存的 72%
当前配置下没有可流畅运行的大模型,可查看下方「勉强运行」或选择更小的模型。
勉强运行 需缩短上下文、关闭其他占用内存的程序
无。你的配置可以直接跳过这一档。
当前跑不动 升级配置或使用云端 API
Qwen3-0.6B
最低 Q3 量化也需约 1.3 GB
Qwen3-1.7B
最低 Q3 量化也需约 1.9 GB
Llama-3.2-1B
最低 Q3 量化也需约 1.7 GB
Qwen3-4B
最低 Q3 量化也需约 3.2 GB
Llama-3.2-3B
最低 Q3 量化也需约 2.8 GB
Qwen3-8B
最低 Q3 量化也需约 5.4 GB
DeepSeek-R1-Distill-7B
最低 Q3 量化也需约 4.9 GB
Mistral-7B
最低 Q3 量化也需约 4.9 GB
GLM-4-9B
最低 Q3 量化也需约 6 GB
Llama-3.1-8B
最低 Q3 量化也需约 5.4 GB
Qwen3-14B
最低 Q3 量化也需约 8.7 GB
DeepSeek-R1-Distill-14B
最低 Q3 量化也需约 8.7 GB
Phi-4-14B
最低 Q3 量化也需约 8.7 GB
Gemma-3-12B
最低 Q3 量化也需约 7.6 GB
Qwen3-30B-A3B
最低 Q3 量化也需约 17.5 GB
Qwen3-32B
最低 Q3 量化也需约 18.6 GB
DeepSeek-R1-Distill-32B
最低 Q3 量化也需约 18.6 GB
Llama-3.3-70B
最低 Q3 量化也需约 39.5 GB
DeepSeek-R1-Distill-70B
最低 Q3 量化也需约 39.5 GB
bge-m3(向量化/检索)
最低 Q3 量化也需约 1.5 GB
Whisper-large-v3(语音转文字)
最低 Q3 量化也需约 3.5 GB
Stable Diffusion XL(文生图)
最低 Q3 量化也需约 8 GB
Flux.1-schnell(文生图 FP8)
最低 Q3 量化也需约 13 GB
量化等级速查(GGUF)
| 量化格式 | 每 1B 参数占用 | 7B 模型体积 | 质量与建议 |
|---|---|---|---|
| Q2_K | ≈ 0.36 GB | ≈ 2.6 GB GB | 质量下降明显,仅极限压体积时使用 |
| Q3_K_M | ≈ 0.46 GB | ≈ 3.3 GB GB | 显存紧张时的可接受下限 |
| Q4_K_M | ≈ 0.6 GB | ≈ 4.4 GB GB | 主流选择,质量/体积最佳平衡(Ollama 默认) |
| Q5_K_M | ≈ 0.7 GB | ≈ 5.1 GB GB | 比 Q4 略好,性价比一般 |
| Q6_K | ≈ 0.81 GB | ≈ 5.9 GB GB | 接近无损,显存富余时的优选 |
| Q8_0 | ≈ 1.06 GB | ≈ 7.7 GB GB | 几乎无损 |
| FP16 | ≈ 2 GB | ≈ 14.5 GB GB | 原始精度,一般仅微调/训练场景使用 |
通行经验:Q4_K_M 是质量与体积的最佳平衡点,也是 Ollama、LM Studio 等工具的默认档位;显存富余选 Q6_K(接近无损),追求极限压体积再考虑 Q3/IQ 系列。AWQ/GPTQ 4-bit(vLLM/ExLlama 生态)体积与 GGUF Q4 接近。
#关于GPU检测与本地模型推荐
想在自己电脑上跑 Ollama、LM Studio、llama.cpp 本地大模型,第一个问题就是"我的显卡能跑多大的模型"。本工具通过浏览器的 WebGPU 与 WebGL 接口读取显卡型号与能力,识别出具体芯片后结合内置的显存规格库推算可用内存,再按大语言模型的真实显存占用公式(模型权重 + KV Cache + 运行时开销)逐个评估热门开源模型在不同量化等级下的可运行性。
支持识别的显卡
- Apple M1 / M2 / M3 / M4 系列(Base / Pro / Max / Ultra,按统一内存计算)
- NVIDIA GeForce RTX 20 / 30 / 40 / 50 系及专业卡(T4 / A100 / H100 / V100)
- AMD Radeon RX 6000 / 7000 / 9000 系
- Intel Arc 独显与集成显卡
量化版本怎么选
量化是把模型权重从 16-bit 浮点压缩到更低精度的技术,体积与显存占用成倍下降。GGUF 格式的 Q4_K_M(约 4-bit)是最常用的平衡档位,质量损失在多数场景下难以察觉;Q6_K 接近原始质量;Q8_0 几乎无损;FP16 为原始精度。显存紧张时可选择 Q3_K_M 或 IQ4_XS 进一步压缩,但低于 Q3 后质量下降会明显起来。
常见问题
- 检测结果与我的实际显存不符?浏览器出于隐私考虑不暴露显存容量,本工具按显卡型号预填了常见配置,请在"参数修正"中改成实际显存;苹果芯片请填写统一内存。
- 苹果 Mac 为什么按统一内存的 70% 计算?macOS 默认限制 GPU 可使用的有线内存比例(约 65%-75%),剩余部分留给系统。高级用户可通过 sysctl 调整 iogpu.wired_limit,但一般建议按默认值评估。
- MoE 模型(如 Qwen3-30B-A3B)怎么算?混合专家模型虽然每次只激活少量参数(推理速度快),但全部权重仍需完整载入内存,所以按总参数量 30B 计算占用。
- 检测信息会上传吗?不会。所有检测与计算都在浏览器本地完成。
相关工具推荐
Spine动画编辑器
专业的Spine动画预览和编辑工具,支持多引擎导出
SQL查询优化器
分析SQL查询并提供优化建议
JVM启动参数配置
可视化配置Java虚拟机启动参数,支持内存、GC、性能等选项
代码片段转换
不同编程语言间代码片段转换(如Python↔JavaScript)
IP地址查询
查询IP地址的地理位置、运营商、ASN等信息,支持IPv4和IPv6
JSON转TypeScript接口
根据JSON数据自动生成TypeScript类型定义