首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >Opus 5.5、GPT-6 Sol、Luna 一夜齐发!价格腰斩

Opus 5.5、GPT-6 Sol、Luna 一夜齐发!价格腰斩

原创
作者头像
鹿远笔记
发布于 2026-09-23 13:35:03
发布于 2026-09-23 13:35:03
1580
举报

大家好,我是鹿远。

过去 48 小时,AI 圈出了件挺有意思的事。

Anthropic 和 OpenAI,前后脚发新模型,中间只隔了不到两小时。

换平时,主角应该是"谁更聪明"。

这次不是。

这次所有人都在谈同一个词:降价。

我的判断先放这儿,不绕弯子:

价格战打到这个份上,还在按旧价格做 AI 选型的人,是在替去年的自己付账单。

为什么敢这么说?

先看我核实过的三组数字。

第一组,OpenAI 发布 GPT-6 Sol 和 Luna,API 价格较上一代直接砍半:Sol 输入每百万 token 2 美元、输出 10 美元,Luna 低到 0.1 和 0.5 美元(OpenAI 官方,9 月 22 日)。

第二组,Anthropic 同日发布 Claude Opus 5.5,官方口径是典型任务的运行成本比 Opus 5 降 40%,输出速度还快了 30% 以上(Anthropic 官方,9 月 22 日)。

注意一个细节:它的 token 单价其实只降了 20%,剩下那 20%,是模型干活更省量省出来的。

第三组最狠。Epoch AI 发了一份报告,结论一句话:达到同样的 AI 能力,成本每季度下降约 47%(epoch.ai,9 月 22 日)。

注意,是每季度。

折成年,就是一年便宜十几倍。

报告里有个对比我印象很深:这个降价速度,约是锂电池的 18 倍。

锂电池跑了二十年的路,AI 一年就走完了。

报告自己也留了话:厂商可能针对跑分做优化,账面降幅会比真实工作快。

但就算打个折,方向不会变。

AI 与电力、锂电池、DNA 测序、算力的历史成本下降曲线(Source: Epoch AI,CC-BY)

光说价格,你可能无感:便宜是便宜了,东西还行吗?

这才是这次最值得说的地方。

一、不降反升

搁以前,降价通常意味着减配。

这次邪门就邪门在:价格往下走,跑分往上走。

先看 Opus 5.5。

第三方评测机构 Artificial Analysis 的智能指数,它拿了 58 分,直接登顶,把 GPT-6 Astra 和上代旗舰都甩在身后。

官方公布的 9 项测试,7 项领先,三项编程测试全是第一。

最能说明问题的是长任务。官方内测里,它用 9.5 小时把负载均衡软件 HAProxy 从 C 语言整体改写成 Rust,几乎全数通过回归测试,成本比上代旗舰低 51%。

还有个早期测试案例:有人用它不到一天,完成了 68 万行代码的迁移。

再看 GPT-6 Sol。

价格砍半的同时,Artificial Analysis 的 max 档评测里,幻觉率从上一代的 92% 压到了 60%(压力测试口径,不是日常聊天的出错率)。OpenAI 自己的内部事实性评估,错误数量也只有上一代的一半。

最夸张的是 Luna。

每百万 token 一毛钱的轻量模型,在软件工程测试 DeepSWE 上拿了 66.6 分。官方口径,这已经能跟上一代旗舰的中档水平掰手腕。

当然,冷水也得泼一盆。

Artificial Analysis 发现,Opus 5.5 在最高档位特别"能吃 token",单任务用量比上代高出六成,算下来单任务成本反而没降。

所以官方那句"成本降 40%",说的是默认档位的典型任务。

你看,连"降价"这件事本身,都得算账才能看明白。

但总体结论没变:

这轮降价不是减配清仓,是加量还降价。

二、一笔账

空说没意思,我来算一笔。

举个最常见的场景:一个用 AI 比较狠的小团队,客服问答、内容初稿、代码辅助全上,一个月大概跑 10 万个"任务"。

这笔账怎么估?

OpenAI 自己公布了一组对比:在一个覆盖销售、客服、运营等场景的智能体测试里,GPT-6 Sol 单任务成本约 0.27 美元,而上一代旗舰按同口径约是它的 11 倍。

咱就按官方口径粗算:

一个月 10 万个任务,用上一代旗舰,账单约 3 万美元。

换成 GPT-6 Sol,约 2700 美元。

一个月省两万七千美元,一年省出一辆保时捷。

得说明白:这是按厂商公布的单任务成本做的等比估算,不是我自己跑出来的实测,方向可信,数字别当真金白银。

再叠上 Epoch 那个 47%。

同样这笔预算,三个季度之后,能买到的能力大约是今天的四到五倍。

翻译成人话:

你今天花 100 块干的事,明年开春大概 20 块就能干。

想想你上个月刚签的那单,后背凉不凉?

同任务成本对比(按 OpenAI 官方 AutomationBench 口径,外推值为估算)

那大厂凭什么敢这么降?

有人会说,抢市场呗。

这话只说对了一半。

前面那些跑分已经说明问题了:现在的旗舰模型,互相之间的差距,已经小到用户开始用价格投票。

能力一旦同质化,定价权就没了,我不砍,隔壁明天也会砍。

还有个细节:OpenAI 这次把缓存命中的输入 token 折扣拉到了 90%,GitHub 用这个机制,让 Copilot 需要重新算的内容直接少了一半。

什么行业才会在这种成本细节上做文章?

电费、带宽、云服务器。

模型正在从高科技产品变成大宗商品,像电,像带宽,像云主机。

大宗商品时代什么玩法?

没人会为了用电便宜,提前囤一年的电。

但过去一年,囤 AI 额度、签 AI 长约的人,一抓一大把。

同性能成本指数(Epoch AI 数据,-47%/季度)与锂电池降价曲线对比

三、三条动作

那现在到底该干什么?

不说虚的,三条。

第一,别签长约,别囤额度。

每季度 47% 的降幅摆在那儿,任何超过三个月的价格承诺,都可能把你钉死在一个注定过时的价位上。

合同里没有降价同步条款的,一律谈月付。

不用 API、只买会员的,这条对你一样成立。

Anthropic 这次顺手把付费套餐的五小时额度提了,还送一次自主重置;Luna 干脆向免费用户开放。

红利正在往订阅端渗,所以会员也别急着续年付。

第二,按任务路由,别全家桶。

不是所有任务都配得上旗舰模型。

前面说了,Luna 这种一毛钱的轻量模型,已经能跟上一代旗舰掰手腕。

分类、打标签、格式转换、初稿生成,交给中低价位模型,成本能差出一个数量级。

旗舰模型留给真正烧脑的那 20% 任务,比如几十万行代码的迁移、几个小时的长任务,那才是 Opus 5.5 们的主场。

这一条做好了,账单砍半真不夸张。

直接给一份可照抄的配置单:

任务类型

用哪档

参考价(每百万 token)

为什么

分类、打标签、格式转换

轻量档(Luna 这类)

0.5

便宜 20 倍,能力够

初稿、摘要、客服问答

中阶档(Sol 这类)

10

性价比甜点位

代码迁移、长任务、复杂 Agent

旗舰档(Opus 5.5 这类)

20 起

该花的别省

第三,每月重算一次账。

选型这事,以前一年想一次,现在一个月得想一次。

花一个下午,把上个月的 token 用量按任务拆开,看看多少贵模型在干便宜活。

尤其检查一件事:是不是开着最高档位跑日常任务。Opus 5.5 那个"最高档多吃六成 token"的坑,就是专门给不看档位的人准备的。

这个动作值多少钱?

月账单 1000 美元的团队,筛掉三成浪费,一年省下的钱,够给每个人换台新电脑。

写到这,想起一个老比喻。

早年间带宽贵,大家传张图压缩再压缩,抠抠搜搜。

后来带宽白菜价了,谁还抠那个?

AI 正在走带宽的老路:今天你觉得贵的,明年都是白菜价。

你们团队现在一个月烧多少 token?有没有被长约坑过?评论区聊聊。

以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标~

我是鹿远,谢谢你看我的文章。我们,下次再见。

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

目录
  • 一、不降反升
  • 二、一笔账
  • 三、三条动作
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档