“本地不是免费的吗”

常有人拿"本地免费"当结论,也常有人被 API 账单吓到后盲目购入显卡。两种方案的成本结构完全不同:API 是按量付费,零固定成本;本地是一次性重投入,边际成本近零。哪种更划算,取决于调用量落在哪一档——这笔账不难算,本文用一套可复算的模型把它算清。

两种成本结构

API 的成本公式很简单:账单 = 输入单价 × 输入 Token 量 + 输出单价 × 输出 Token 量。Token 是大模型的计费单位(见 Token 词条),输出单价通常是输入的数倍。主流模型输出价大约在 1-16 元/百万 Token 区间,本文统一按 8 元/百万 Token 估算。为简化口径,下文算例只计输出 Token;多轮对话里输入量通常与输出在同一量级,把输入也计入时,API 账单大致再乘 1.5-2 倍——结论只会更偏向本地。

本地的成本由两部分构成:硬件折旧(购机价 ÷ 使用月数)和电费(整机功率 × 运行时长 × 电价)。电费里的运行时长由推理速度决定——同样的 Token 量,速度越慢烧电越久,这层关系在推理速度词条里有展开。至于硬件折旧,正是大多数"免费党"漏掉的部分。

算账前的三个变量

  • 调用量:每月输出多少 Token,这是最敏感的变量
  • 硬件功耗与速度:决定电费。先用 GPU 检测与模型推荐工具确认手里的机器能跑哪档模型,别为跑不动的配置算账
  • 质量需求:能否接受小模型与旗舰 API 的输出差距。能接受,本地才有性价比可言

两边的数字都能用 Token 计数与 API 成本计算器一次算出:输入调用量与模型,它会同时给出 API 账单和本地电费两条结果。

三档算例

假设电价 0.55 元/度,硬件按 4 年折旧:

档位月输出 TokenAPI 账单/月本地方案本地成本/月结论
轻度(每天几十次)50 万约 4 元为此新购 Mac mini折旧约 92 元API 完胜
中度(每天几千次)2000 万约 160 元沿用已有 Mac mini电费约 8 元本地胜
重度(批量任务)1 亿约 800 元4090 工作站折旧约 333 元 + 电费约 115 元本地明显胜

三档的口径说明:

  • 轻度:4 元/月的账单不值一提,为此新购任何硬件都永远回不了本——本地每月约 92 元的折旧是账单的 23 倍,这条路从第一个月就注定追不平。但如果机器本来就有,本地确实近乎零成本,只是别指望它"回本"。
  • 中度:2000 万 Token 按 15 Token/s 要跑约 370 小时,40W 的 Mac mini 电费约 8 元;就算把 4400 元机器的折旧摊进来(约 92 元/月),合计约 100 元,仍低于 160 元的 API 账单。这档的正确姿势是用已有设备本地兜底,而不是为省几十元专门买设备。
  • 重度:1 亿 Token 在 4090 上(8B 模型,80 Token/s)约 347 小时,600W 整机电费约 115 元。API 要 800 元,本地合计约 450 元,还能离线跑批量、不限调用次数——代价是任务要排队,且只能接受 8B 级质量。批量任务多在夜间跑,若能利用峰谷电价,电费还有下探空间。

数字都可复算:中度 2000 万 ÷ 15 Token/s ≈ 370 小时 × 0.04kW ≈ 14.8 度 × 0.55 元 ≈ 8 元;重度 1 亿 ÷ 80 Token/s ≈ 347 小时 × 0.6kW ≈ 208 度 × 0.55 元 ≈ 115 元。

混合策略:本地兜底 + 云端攻坚

三档算例指向同一个实践方案:日常 80% 的任务交给本地小模型(边际成本近零,随便造),难题、长文和需要旗舰质量的任务调 API。隐私敏感的数据强制走本地,一个 Token 都不出门。

分工的判断标准可以很简单:结果错了也无所谓、只求快——本地;结果质量直接影响交付——API。跑一段时间后你会形成自己的任务清单,哪类任务走哪条路一目了然,账单和电费也都收敛在预期之内。

还有一条进阶路:如果 API 账单长期高企,可以微调一个 8B 小模型把特定任务的质量顶上去,从而整体降低对旗舰 API 的依赖。训练门槛先用 LoRA 微调显存计算器确认,训练电费照本文口径计入总账。

常见问题

为什么说"本地免费"是错觉

因为只看到了电费这个边际成本。折旧、折腾配置的时间、模型下载与维护,都是真实支出。把 1.6 万的工作站按 4 年摊销,哪怕一个 Token 都不生成,每月也有约 333 元的沉默成本。本地真正的优势是边际成本近零,适合已经拥有硬件且用得满的人——把折旧摊进单价就能看出:重度档下本地每百万 Token 的综合成本可以压到 4-5 元,这正是重度结论的由来。

API 一直在降价,本地会不会失去意义

降价同时利好两边。但本地的价值从来不只是钱:隐私、离线可用、无速率限制。价格战只会把轻度用户进一步推向 API,而重度用户与隐私敏感用户的本地化理由不变。

输入 Token 也计费吗

计费,而且长对话里输入占比会越来越高——多轮对话每一轮都要把历史重新发一遍。控成本的两招:精简系统提示词,及时开新会话而不是无限续聊。

小结

结论一句话:轻度直接 API,已有设备的中度用户本地兜底,重度批量任务才值得为本地购置硬件。文中所有数字都可以用 Token 计数与 API 成本计算器代入自己的参数复算。相关工具都收录在本地跑大模型场景专题里;硬件够不够跑,先看显存速查表,完整部署流程见16G Mac 部署实录。