GPU检测与本地模型推荐

检测显卡与可用内存,告诉你能流畅运行哪些本地大模型和量化版本

通过 WebGPU / WebGL 读取本机 GPU 信息,识别显卡型号并推算可用显存或统一内存,再按「模型权重 + KV Cache + 运行时开销」的显存账单,给出 Qwen、Llama、DeepSeek 等热门开源模型在不同量化等级(Q3/Q4/Q6/Q8)下的运行建议。全部检测在浏览器本地完成,不上传任何信息。

硬件检测结果

参数修正

浏览器无法直接读取显存容量,已按型号预填常见配置。苹果芯片请填写统一内存大小,与显存同等参与计算。

— GB

显存总量

0

模型可用(含预留)

0

可流畅运行

0

可勉强运行

流畅运行 权重 + 上下文占用不超过可用内存的 72%

当前配置下没有可流畅运行的大模型,可查看下方「勉强运行」或选择更小的模型。

勉强运行 需缩短上下文、关闭其他占用内存的程序

无。你的配置可以直接跳过这一档。

当前跑不动 升级配置或使用云端 API

Qwen3-0.6B

最低 Q3 量化也需约 1.3 GB

建议 ≥ 4 GB

Qwen3-1.7B

最低 Q3 量化也需约 1.9 GB

建议 ≥ 4 GB

Llama-3.2-1B

最低 Q3 量化也需约 1.7 GB

建议 ≥ 4 GB

Qwen3-4B

最低 Q3 量化也需约 3.2 GB

建议 ≥ 8 GB

Llama-3.2-3B

最低 Q3 量化也需约 2.8 GB

建议 ≥ 8 GB

Qwen3-8B

最低 Q3 量化也需约 5.4 GB

建议 ≥ 12 GB

DeepSeek-R1-Distill-7B

最低 Q3 量化也需约 4.9 GB

建议 ≥ 12 GB

Mistral-7B

最低 Q3 量化也需约 4.9 GB

建议 ≥ 12 GB

GLM-4-9B

最低 Q3 量化也需约 6 GB

建议 ≥ 12 GB

Llama-3.1-8B

最低 Q3 量化也需约 5.4 GB

建议 ≥ 12 GB

Qwen3-14B

最低 Q3 量化也需约 8.7 GB

建议 ≥ 16 GB

DeepSeek-R1-Distill-14B

最低 Q3 量化也需约 8.7 GB

建议 ≥ 16 GB

Phi-4-14B

最低 Q3 量化也需约 8.7 GB

建议 ≥ 16 GB

Gemma-3-12B

最低 Q3 量化也需约 7.6 GB

建议 ≥ 16 GB

Qwen3-30B-A3B

最低 Q3 量化也需约 17.5 GB

建议 ≥ 32 GB

Qwen3-32B

最低 Q3 量化也需约 18.6 GB

建议 ≥ 36 GB

DeepSeek-R1-Distill-32B

最低 Q3 量化也需约 18.6 GB

建议 ≥ 36 GB

Llama-3.3-70B

最低 Q3 量化也需约 39.5 GB

建议 ≥ 72 GB

DeepSeek-R1-Distill-70B

最低 Q3 量化也需约 39.5 GB

建议 ≥ 72 GB

bge-m3(向量化/检索)

最低 Q3 量化也需约 1.5 GB

建议 ≥ 4 GB

Whisper-large-v3(语音转文字)

最低 Q3 量化也需约 3.5 GB

建议 ≥ 8 GB

Stable Diffusion XL(文生图)

最低 Q3 量化也需约 8 GB

建议 ≥ 12 GB

Flux.1-schnell(文生图 FP8)

最低 Q3 量化也需约 13 GB

建议 ≥ 20 GB

量化等级速查(GGUF)

量化格式每 1B 参数占用7B 模型体积质量与建议
Q2_K≈ 0.36 GB≈ 2.6 GB GB质量下降明显,仅极限压体积时使用
Q3_K_M≈ 0.46 GB≈ 3.3 GB GB显存紧张时的可接受下限
Q4_K_M≈ 0.6 GB≈ 4.4 GB GB主流选择,质量/体积最佳平衡(Ollama 默认)
Q5_K_M≈ 0.7 GB≈ 5.1 GB GB比 Q4 略好,性价比一般
Q6_K≈ 0.81 GB≈ 5.9 GB GB接近无损,显存富余时的优选
Q8_0≈ 1.06 GB≈ 7.7 GB GB几乎无损
FP16≈ 2 GB≈ 14.5 GB GB原始精度,一般仅微调/训练场景使用

通行经验:Q4_K_M 是质量与体积的最佳平衡点,也是 Ollama、LM Studio 等工具的默认档位;显存富余选 Q6_K(接近无损),追求极限压体积再考虑 Q3/IQ 系列。AWQ/GPTQ 4-bit(vLLM/ExLlama 生态)体积与 GGUF Q4 接近。

#关于GPU检测与本地模型推荐

想在自己电脑上跑 Ollama、LM Studio、llama.cpp 本地大模型,第一个问题就是"我的显卡能跑多大的模型"。本工具通过浏览器的 WebGPU 与 WebGL 接口读取显卡型号与能力,识别出具体芯片后结合内置的显存规格库推算可用内存,再按大语言模型的真实显存占用公式(模型权重 + KV Cache + 运行时开销)逐个评估热门开源模型在不同量化等级下的可运行性。

支持识别的显卡

  • Apple M1 / M2 / M3 / M4 系列(Base / Pro / Max / Ultra,按统一内存计算)
  • NVIDIA GeForce RTX 20 / 30 / 40 / 50 系及专业卡(T4 / A100 / H100 / V100)
  • AMD Radeon RX 6000 / 7000 / 9000 系
  • Intel Arc 独显与集成显卡

量化版本怎么选

量化是把模型权重从 16-bit 浮点压缩到更低精度的技术,体积与显存占用成倍下降。GGUF 格式的 Q4_K_M(约 4-bit)是最常用的平衡档位,质量损失在多数场景下难以察觉;Q6_K 接近原始质量;Q8_0 几乎无损;FP16 为原始精度。显存紧张时可选择 Q3_K_M 或 IQ4_XS 进一步压缩,但低于 Q3 后质量下降会明显起来。

常见问题

  • 检测结果与我的实际显存不符?浏览器出于隐私考虑不暴露显存容量,本工具按显卡型号预填了常见配置,请在"参数修正"中改成实际显存;苹果芯片请填写统一内存。
  • 苹果 Mac 为什么按统一内存的 70% 计算?macOS 默认限制 GPU 可使用的有线内存比例(约 65%-75%),剩余部分留给系统。高级用户可通过 sysctl 调整 iogpu.wired_limit,但一般建议按默认值评估。
  • MoE 模型(如 Qwen3-30B-A3B)怎么算?混合专家模型虽然每次只激活少量参数(推理速度快),但全部权重仍需完整载入内存,所以按总参数量 30B 计算占用。
  • 检测信息会上传吗?不会。所有检测与计算都在浏览器本地完成。

相关工具推荐

Spine动画编辑器

专业的Spine动画预览和编辑工具,支持多引擎导出

热门 新品 本地

SQL查询优化器

分析SQL查询并提供优化建议

热门 新品 本地

JVM启动参数配置

可视化配置Java虚拟机启动参数,支持内存、GC、性能等选项

热门 新品 本地

代码片段转换

不同编程语言间代码片段转换(如Python↔JavaScript)

热门 新品 本地

IP地址查询

查询IP地址的地理位置、运营商、ASN等信息,支持IPv4和IPv6

热门 新品 本地

JSON转TypeScript接口

根据JSON数据自动生成TypeScript类型定义

热门 新品 本地