数据时效:2026-08 DeepSeek-V4 Flash 的缓存命中输入,标价每百万 token 两分钱。这个数字从四月开始挂在各种「AI 成本崩了」的标题里。同一张价目表上还有另外两行,缓存未命中输入一元,输出两元。两分钱和一元之间,隔着五十倍。

深度求索官网首页,DeepSeek-V4 Pro 正式发布的主视觉

我特意把这套价目表和几篇实测都翻了一遍,才敢说下面这些。这行两分钱,指的只是输入请求里恰好撞上缓存的那部分 token。你要是对 token 没概念,把它理解成大模型读写文字的字数就行。一个模型的输入分两种。一种以前被你问过、结果被它记下来,再问就按缓存价收;一种要从头算一遍,按未命中价收。两分钱是前者,后面那两行是后者。一个自己写代码的人,绝大多数请求都落在未命中和输出这边,真正按两分钱付的,其实是少数。

这张价目表上周刚被改过。

8 月 17 日,DeepSeek 把 V4 系列改成峰谷计费。工作日 9 点到 12 点、14 点到 18 点是高峰,价翻倍;其余时间算平峰。V4-Flash 的缓存命中价从两分钱改成平峰五分、高峰一毛,输出价从两元改成平峰四块五、高峰九块。《财经》用六组相同任务实测,涨价后 V4-Pro 的实际花费变成 2.9 到 5.8 倍,V4-Flash 变成 2.0 到 4.0 倍。

我讲这个,是想说单看单价去判断「便不便宜」,本身就接不住现实。单价会变,口径会变,最便宜的那一行,经常是让你先往里看的那一行。真要把账算对,得从「让一个 agent 连续跑多久、跑多深」倒推。

这笔账该倒过来算

真正该算的,是让一个 agent 连续跑一个月,你实际掏多少。这个数不取决于标价,取决于你喂进去多少、让它写多少、什么时候跑。

先拆一个普通例子。一个独立开发者让 agent 整天读自己的代码库、改 bug、补测试,一个月下来大约五千万输入 token、一千万输出 token。数字是估的,结构是真的。agent 这类工作流里,九成六以上的输入是缓存命中,因为它反复读同一份代码,命中率出乎意料地高。把钱烧掉的大头,是输出。

按 V4-Flash 现在的平峰价,五千万输入里,四千八百万命中,按五分钱算两块四;两百万未命中,按一块五算三块;输入加到一起五块四。一千万输出,按四块五算,四十五块。加起来一个月五十块出头。用 V4-Pro 算,同一套活约一百五十一块。

DeepSeek V4 官方定价表,缓存命中、未命中与输出三档价格并列

看到没有。被你当成标题的「两分钱」,在这笔账里只占两块零头,九成去了输出。输出没有缓存这道闸,每生成一个 token 都按全价收,而且输出单价本来就比命中输入高几十倍。一个总在「写」的 agent,和一个总在「读」的 agent,同样跑一个月,账单能差出一个数量级。

还有三个变量,会让账单更不像标题。上下文长度这一条,V4 支持一百万 token,一次调用就可能塞进一万个请求,只要没命中缓存、缓存失效,每多问一次都按未命中价重算。调用频次也是,一个 agent 一天调几百次很常见,把一百万上下文反复喂进去,单价再低也架不住总量。更别提峰谷,9 点到 12 点、14 点到 18 点翻倍,那些白天跑、夜里歇的 agent,恰好卡在最贵的时候。

便宜是真的便宜,只是便宜发生在「读得多、写得少、夜里跑」那个角落。你想要的「让 agent 替一个人干一整周」的工作流,成本结构和标题里的两分钱,已经不是一个东西。涨价之后也能佐证这一点,次日 OpenCode 上 V4-Flash 的调用量少了近六成,V4-Pro 少了五成六,最先砍量的,正是那种大批量自动化的用户。

国产芯片适配,是真算力,还是好看的故事

到这一步,很多人会问那句老话,便宜是不是因为算力自主可控了。DeepSeek V4 四月底发布,八家国产芯片同时适配,华为昇腾、寒武纪都在。昇腾 950 上,V4-Pro 单卡解码每秒能出四千七百个 token,V4-Flash 十毫秒吐首 token(TPS 就是每秒生成的 token 数);寒武纪在 vLLM 框架上做了 Day 0 适配,代码开在 GitHub 上。这些是看得见的数字,不是口号。

但要说清楚,适配的收益落在供给端,不在你端上。它有两层实际作用。一层,是让更多算力能跑这个模型,供给了、排队少了,以后价格才有往下压的空间。另一层,是把「用国产模型跑起来」的底层能力攒出来,哪天进口卡紧张、价格抬头,你还有别的池子可以切。

这两层,都改变不了刚才那笔账的结构。算力变便宜,压的是「每百万 token 多少钱」,压不掉「你这个月要写多少」「你有没有那么多需求可喂」。对一个人公司,顶到天花板的是需求、交付、信任这三样。能持续定义清楚的需求,要有人肯付钱;交付出去,要陌生客户真敢用;信任,得靠一次做对、再一次做对攒下来。这几样,哪一样都不靠算力便宜就自己长出来。

卡住一人公司的,不是那点算力钱

账算到这份上,结论已经露出来了。对一个人公司,一个月几十块算力,就算用最贵的 V4-Pro 一百五十一块,也只是「一顿饭钱」的量级,跟雇个人一个月几千上万比,差了两三个数量级。真正决定「能不能成立」的,从来不在算力成本这一栏。

有一个挺直白的佐证。8 月中旬,DeepSeek 开源了 Harness,一个对标 Claude Code 的开源 agent 工具,MIT 协议。同一周它涨价、又推自家 agent 工具。这一套动作的指向很清楚。模型厂把最便宜的算力当引流,真正想收钱的,是你在 agent 里干活的那一层。连最会打价格战的厂商,都不再拿「最便宜」当护城河了。

这对一个人公司是个提醒。把「算力便宜」当成能成立公司的理由,跟把「水电便宜」当成能开餐厅是一回事。水电确实便宜,但开餐厅要的是菜单、手艺和回头客,水电打折救不了营生。算力也一样。它让你敢把一件事跑深、敢试错、敢接那些以前因为人力成本接不起的零散活。这就是「一个人能接多少活」那扇门移动的地方。但门开了,走进来靠的还是你拿得出什么,别人敢不敢信。

至于这套 agent 工作流到底能替掉多少人工,我现在也拿不准。它在跑,只是还没跑到能下结论。我能确认的是另一个方向。那些重复、有标准、能校验的活,改一遍接口、写合规文案、清一段杂数据,是最先被 agent 化的;而「这事该怎么定义、做成什么样算好」,始终得靠人。

最后把这笔账收住

算力成本降下来,确实把一个「可负担的尝试」交给了个人。两分钱那行价是真事,几个月里它让不少人真的开始跑 agent。但它撑不起一家公司。它做的是把「要不要试」的门槛压低。「能不能立住」的边界,在需求定义、交付质量、信任积累这些算力管不到的地方。

DeepSeek 涨价、上线自家 agent 工具,只是把这事又点破了一层。单价是动的,今天最便宜的那一行,未必是你三个月后还能买到的价。所以别按「每百万 token 多少钱」去判断一人公司能不能成立,按「我这个月要跑多少、写多少、能不能夜里便宜跑」去算,算出的是你真要掏的钱。这笔账能算过来,说明条件够了;够不够开公司,还得看那三样算力买不来的东西。