大家好,我是鹿远。
过去 48 小时,AI 圈出了件挺有意思的事。
Anthropic 和 OpenAI,前后脚发新模型,中间只隔了不到两小时。
换平时,主角应该是"谁更聪明"。
这次不是。
这次所有人都在谈同一个词:降价。
我的判断先放这儿,不绕弯子:
价格战打到这个份上,还在按旧价格做 AI 选型的人,是在替去年的自己付账单。
为什么敢这么说?
先看我核实过的三组数字。
第一组,OpenAI 发布 GPT-6 Sol 和 Luna,API 价格较上一代直接砍半:Sol 输入每百万 token 2 美元、输出 10 美元,Luna 低到 0.1 和 0.5 美元(OpenAI 官方,9 月 22 日)。

第二组,Anthropic 同日发布 Claude Opus 5.5,官方口径是典型任务的运行成本比 Opus 5 降 40%,输出速度还快了 30% 以上(Anthropic 官方,9 月 22 日)。
注意一个细节:它的 token 单价其实只降了 20%,剩下那 20%,是模型干活更省量省出来的。

第三组最狠。Epoch AI 发了一份报告,结论一句话:达到同样的 AI 能力,成本每季度下降约 47%(epoch.ai,9 月 22 日)。
注意,是每季度。
折成年,就是一年便宜十几倍。
报告里有个对比我印象很深:这个降价速度,约是锂电池的 18 倍。
锂电池跑了二十年的路,AI 一年就走完了。
报告自己也留了话:厂商可能针对跑分做优化,账面降幅会比真实工作快。
但就算打个折,方向不会变。

AI 与电力、锂电池、DNA 测序、算力的历史成本下降曲线(Source: Epoch AI,CC-BY)
光说价格,你可能无感:便宜是便宜了,东西还行吗?
这才是这次最值得说的地方。
搁以前,降价通常意味着减配。
这次邪门就邪门在:价格往下走,跑分往上走。
先看 Opus 5.5。
第三方评测机构 Artificial Analysis 的智能指数,它拿了 58 分,直接登顶,把 GPT-6 Astra 和上代旗舰都甩在身后。
官方公布的 9 项测试,7 项领先,三项编程测试全是第一。
最能说明问题的是长任务。官方内测里,它用 9.5 小时把负载均衡软件 HAProxy 从 C 语言整体改写成 Rust,几乎全数通过回归测试,成本比上代旗舰低 51%。
还有个早期测试案例:有人用它不到一天,完成了 68 万行代码的迁移。
再看 GPT-6 Sol。
价格砍半的同时,Artificial Analysis 的 max 档评测里,幻觉率从上一代的 92% 压到了 60%(压力测试口径,不是日常聊天的出错率)。OpenAI 自己的内部事实性评估,错误数量也只有上一代的一半。
最夸张的是 Luna。
每百万 token 一毛钱的轻量模型,在软件工程测试 DeepSWE 上拿了 66.6 分。官方口径,这已经能跟上一代旗舰的中档水平掰手腕。

当然,冷水也得泼一盆。
Artificial Analysis 发现,Opus 5.5 在最高档位特别"能吃 token",单任务用量比上代高出六成,算下来单任务成本反而没降。
所以官方那句"成本降 40%",说的是默认档位的典型任务。
你看,连"降价"这件事本身,都得算账才能看明白。
但总体结论没变:
这轮降价不是减配清仓,是加量还降价。
空说没意思,我来算一笔。
举个最常见的场景:一个用 AI 比较狠的小团队,客服问答、内容初稿、代码辅助全上,一个月大概跑 10 万个"任务"。
这笔账怎么估?
OpenAI 自己公布了一组对比:在一个覆盖销售、客服、运营等场景的智能体测试里,GPT-6 Sol 单任务成本约 0.27 美元,而上一代旗舰按同口径约是它的 11 倍。
咱就按官方口径粗算:
一个月 10 万个任务,用上一代旗舰,账单约 3 万美元。
换成 GPT-6 Sol,约 2700 美元。
一个月省两万七千美元,一年省出一辆保时捷。
得说明白:这是按厂商公布的单任务成本做的等比估算,不是我自己跑出来的实测,方向可信,数字别当真金白银。
再叠上 Epoch 那个 47%。
同样这笔预算,三个季度之后,能买到的能力大约是今天的四到五倍。
翻译成人话:
你今天花 100 块干的事,明年开春大概 20 块就能干。
想想你上个月刚签的那单,后背凉不凉?

同任务成本对比(按 OpenAI 官方 AutomationBench 口径,外推值为估算)
那大厂凭什么敢这么降?
有人会说,抢市场呗。
这话只说对了一半。
前面那些跑分已经说明问题了:现在的旗舰模型,互相之间的差距,已经小到用户开始用价格投票。
能力一旦同质化,定价权就没了,我不砍,隔壁明天也会砍。
还有个细节:OpenAI 这次把缓存命中的输入 token 折扣拉到了 90%,GitHub 用这个机制,让 Copilot 需要重新算的内容直接少了一半。
什么行业才会在这种成本细节上做文章?
电费、带宽、云服务器。
模型正在从高科技产品变成大宗商品,像电,像带宽,像云主机。
大宗商品时代什么玩法?
没人会为了用电便宜,提前囤一年的电。
但过去一年,囤 AI 额度、签 AI 长约的人,一抓一大把。

同性能成本指数(Epoch AI 数据,-47%/季度)与锂电池降价曲线对比
那现在到底该干什么?
不说虚的,三条。
第一,别签长约,别囤额度。
每季度 47% 的降幅摆在那儿,任何超过三个月的价格承诺,都可能把你钉死在一个注定过时的价位上。
合同里没有降价同步条款的,一律谈月付。
不用 API、只买会员的,这条对你一样成立。
Anthropic 这次顺手把付费套餐的五小时额度提了,还送一次自主重置;Luna 干脆向免费用户开放。
红利正在往订阅端渗,所以会员也别急着续年付。
第二,按任务路由,别全家桶。
不是所有任务都配得上旗舰模型。
前面说了,Luna 这种一毛钱的轻量模型,已经能跟上一代旗舰掰手腕。
分类、打标签、格式转换、初稿生成,交给中低价位模型,成本能差出一个数量级。
旗舰模型留给真正烧脑的那 20% 任务,比如几十万行代码的迁移、几个小时的长任务,那才是 Opus 5.5 们的主场。
这一条做好了,账单砍半真不夸张。
直接给一份可照抄的配置单:
任务类型 | 用哪档 | 参考价(每百万 token) | 为什么 |
|---|---|---|---|
分类、打标签、格式转换 | 轻量档(Luna 这类) | 0.5 | 便宜 20 倍,能力够 |
初稿、摘要、客服问答 | 中阶档(Sol 这类) | 10 | 性价比甜点位 |
代码迁移、长任务、复杂 Agent | 旗舰档(Opus 5.5 这类) | 20 起 | 该花的别省 |
第三,每月重算一次账。
选型这事,以前一年想一次,现在一个月得想一次。
花一个下午,把上个月的 token 用量按任务拆开,看看多少贵模型在干便宜活。
尤其检查一件事:是不是开着最高档位跑日常任务。Opus 5.5 那个"最高档多吃六成 token"的坑,就是专门给不看档位的人准备的。
这个动作值多少钱?
月账单 1000 美元的团队,筛掉三成浪费,一年省下的钱,够给每个人换台新电脑。
写到这,想起一个老比喻。
早年间带宽贵,大家传张图压缩再压缩,抠抠搜搜。
后来带宽白菜价了,谁还抠那个?
AI 正在走带宽的老路:今天你觉得贵的,明年都是白菜价。
你们团队现在一个月烧多少 token?有没有被长约坑过?评论区聊聊。
以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标~
我是鹿远,谢谢你看我的文章。我们,下次再见。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。