← 返回个人博文

算了一笔 AI 账单,我决定把主力编码模型换成 Flash

为什么突然想算这笔账

上周末我做了个决定:把这两周的 AI 用量导出来好好算一笔账。

起因很简单——我的阿里百炼 Token Plan(Lite 版,39 元/月,每周 2500 Credits)几乎每周都准时用光,而 DeepSeek 那边又一直开着按量付费在跑。两边都在花钱,但花得清不清楚?老实说,我心里一直没底。

我的使用模式很固定:qwen3.8-max 跑高价值的重活(长周期任务、复杂分析,都在 Token Plan 里),DeepSeek 跑日常海量的编码 Agent 流量(pro 和 flash 两个模型都在用)。导出官方用量 CSV 一统计,账目比我预想的更有意思。

我对现在价格的一些看法

先说结论:现在是个人开发者用 AI 最幸福的时期,但前提是得会选计费方式。

qwen3.8-max 按量价很贵,但 Token Plan 把价格打到了 1.1 折

qwen3.8-max 按量价是 1.5 / 12 / 36 元每百万 token(缓存命中输入 / 未命中输入 / 输出)。我每周 22.10M token 的用量(缓存命中 18.28M、未命中 3.62M、输出 0.20M),按这个价格算一周要 78 元,一个月约 338 元

而我的 Token Plan 只要 39 元/月——相当于按量价的 1.1 折。说实话,这是我见过折扣力度最大的订阅方案。39 块钱每周换 2500 Credits,等效约 8.84K token 每 Credit,这个账怎么算都划算。

DeepSeek 的 98% 缓存折扣,才是真正的"地板价"

DeepSeek 这边更夸张。V4 Flash 的按量价是 0.02 / 1 / 2 元,Pro 是 0.025 / 3 / 6 元——缓存命中的输入 token 几乎不要钱(98% 折扣,比行业通行的 90% 还狠)。

我这两周 5833 次请求,两个模型的缓存命中率分别是 97.4%(Pro)和 96.1%(Flash)。这组数字说明一件事:Agent 编码任务天然是"上下文反复复用"的,而 DeepSeek 的定价恰好吃准了这个特性。仓库级上下文循环在这种计费下接近免费,这在一年前是不可想象的。

价格和性能有点"倒挂"了

最让我意外的是 DeepSeek V4 Flash 0731 正式版(7 月 31 日上线):它在九项 Agent 与代码基准上全面反超自家的 V4 Pro 预览版(DeepSWE 从 7.3 涨到 54.4,Terminal-Bench 从 61.8 升到 82.7),但价格只有 Pro 的 1/3

性能更强的版本卖得更便宜——这种"倒挂"以前只出现在换代产品上,现在一个月就能见到一次。对我这种按量用户来说,这既是好消息(更便宜的模型更好用),也是提醒(别惯性用 Pro,价格体系早就变了)。

我实际采用的省钱方法

账单算完,我发现自己已经在无意中做对了几件事,也踩过一些坑,整理出来:

1. 混合计费:订阅跑高价值任务,按量跑海量流量

我的 DeepSeek 两周用量约 488M token,月均约 888M;而 Token Plan 额度一个月只有约 96M——量级差了约 9 倍。这种海量流量根本不适合订阅制承载(升级套餐要么不够用要么严重过剩),所以分工必须明确:订阅制买的是"旗舰能力 + 确定性成本",按量制买的是"地板价 + 弹性"。

2. 尽量保持上下文复用

同样一个任务、同一段代码库上下文,能续着用就续着用。我的缓存命中率已经到 97% 左右,意味着 97% 的输入 token 都按近乎免费的折扣价计费。这是 Agent 场景下最容易被忽视的省钱点。

3. 用数据说话,定期导出用量 CSV

DeepSeek 控制台能导出 amountcost 两个 CSV,一段简单的 Python 脚本就能按模型统计缓存命中/未命中输入和输出。不看数据之前,我以为花费大头在 Flash 上,实际 90% 的钱都花在 Pro 的未命中输入和输出上——不统计根本发现不了。

4. 克制升级冲动

算过账之后我更确定一件事:不要为了装下 DeepSeek 的流量去升级 Token Plan。Standard(139 元)额度不到我月需求的一半,Pro(499 元)严重过剩,都比混合方案贵得多。省钱的第一原则是别被"更大的套餐"收割。

我下一步的计划

1. 主力编码流量从 Pro 迁到 Flash 0731(最大的动作)

把 Pro 的流量按 Flash 价格重算:两周约 22.9 元,月化约 42 元,加上现有 Flash 流量月化约 11 元,DeepSeek 部分月支出能从 110 元降到约 52 元,整体月支出从 149 元降到约 91 元,每月省约 58 元(39%)。Flash 0731 的能力已经反超 Pro 预览版,这个迁移几乎没有性能代价。唯一的风险是 Flash 生成 token 偏"啰嗦"(第三方评测说约为行业中位数的 3 倍),我当前输出占比只有 0.6%,影响有限,但迁移后要盯一个月输出量。

2. 每月初花十分钟核对一次账单

脚本已经写好了,导出 CSV、跑一遍统计、对比上个月——控制在十分钟内。AI 支出应该是"看得见的成本",而不是月底才惊讶的数字。

3. 关注两个开源权重

qwen3.8-max 下周在 Hugging Face 和 ModelScope 开源权重(2.4T 参数首次开源),DeepSeek V4 Flash 0731 也早已发布 MIT 协议开源权重(284B 总量、13B 激活,部署门槛不高)。如果本地部署的成本能打下来,我的"高价值任务"部分也有机会脱离订阅,这是下半年最值得关注的事。

4. 留意价格变动

Flash 的峰谷定价还没有生效,qwen3.8-max 这类新模型的价格也常有调整。价格战还在继续,每个月都值得重新审视一次"用哪个模型、走哪条计费通道"。

最后

算完这笔账,我的感受是:AI 不是越来越贵,而是越来越考验选择能力。 同样是我这两周的用法,贵的方案(全按量)要 338 元/月,便宜的方案(混合 + Flash 迁移)只要 91 元/月——差了三倍多,但用的模型几乎一样强。

下一期账单,我再来汇报迁移 Flash 之后到底省了多少。

数据来源:DeepSeek 官方用量导出(2026-07-20 ~ 08-05)、阿里百炼 Token Plan 账单、各平台公开定价。价格行情变化快,以官网最新报价为准。