半夜,闺女睡了,我正准备合电脑。
结果Anthropic直接一个深水炸弹丢过来,Claude Opus 4.7 上线。
没有预告,没有发布会,甚至连官方博客的推文都写得有点敷衍,其实就是发出来就完事了,完全不像OpenAI那种憋半个月大招然后 Sam Altman 亲自上场念PPT的风格。
但我一看版本号,心跳加速。
4.6 到 4.7,小版本号跳了0.1。
别小看这0.1。
Claude这一年多,从Opus 4.0一路迭代到4.6,平均两个月一个版本,每一个小数点背后都是跑分榜单的血雨腥风。
我打开Claude把订阅切到Opus 4.7,跑了我手头最烦的一个活,把OpenClaw里一个1200行的飞书推送模块重写一遍,顺手把格式问题全修掉。
跑完一看时间。
19分钟。
一次通过。
我之前用Opus 4.5干同一类活,来回拉扯了半个下午。
愚钝如我,真的愣住了一下。
这篇文章,就想跟你认真聊聊这个事。
Opus 4.7到底是真香还是PR话术,我熬夜实测之后的一些感受,以及更重要的,这个节点上,我们到底在围观一件什么样的事情。
BENCHMARK SHOWDOWNSWE-bench Pro 真实工程场景Opus 4.653.4%上一代旗舰Opus 4.7 今日64.3%新王登基↑ 10.9 个百分点GPT-5.457.7%OpenAI 对照数据来源 Anthropic 官方基准 · 2026 年 4 月跑分数据先摆出来,但别急着爽我知道读这篇的很多朋友,对跑分已经脱敏了。
每次发新模型都是「全面超越」、「行业第一」,听多了跟听运营商广告一样。
但Opus 4.7这次的跑分有几个数字,坦率的讲,是我看了会停顿一下的。
先看最硬的,SWE-bench Pro。
这是目前最接近真实软件工程场景的benchmark,考的不是小打小闹的代码片段,是真实GitHub项目里的issue修复。
Opus 4.6的分数是53.4%,这个数字上一代已经是行业第一。
Opus 4.7,64.3%。
一口气涨了10.9个百分点。
GPT-5.4在这个榜单上是57.7%,Gemini 3.1 Pro是54.2%。
也就是说,在最接近真实工程场景的测试里,Opus 4.7一个人,把后面两家甩开了接近10个身位。
再看SWE-bench Verified,这个跑分相对温和一些,但也能看出趋势。
Opus 4.6是80.8%,Opus 4.7直接干到87.6%。
GPT-5.4在这个榜单上没公布可比较的分数,Gemini 3.1 Pro是80.6%。
GPQA Diamond,研究生级别科学推理。
Opus 4.7拿到94.2%,GPT-5.4 Pro是94.4%,Gemini 3.1 Pro是94.3%。
三家挤在0.2个百分点的差距里,已经接近噪声水平了。
什么意思呢,这种难度的题,现在的前沿模型基本都能解。
瓶颈不在知识,在别的地方。
工具调用能力,MCP-Atlas榜单,Opus 4.7是77.3%,GPT-5.4只有68.1%。
这一项差距是9.2个百分点,在「模型作为Agent」这个维度上,Claude家族的优势又拉大了。
我自己的感受是,这些数字单独看没什么意思,但放在一起看,你能感觉出一个方向,Opus 4.7不是在往「更聪明」这个方向走,是在往「更能干活」这个方向走。
考试分数到顶了,所以他们开始考察「能不能把活干完」。
你看Anthropic这次官方博客里反复出现的关键词,「long-horizon autonomy」(长时程自主)、「works better through ambiguity」(更会处理模糊指令)、「verifies its own outputs」(自己验证输出)。
没有一个词是在说「更聪明」。
全都是在说「更靠谱」。
这种叙事视角的转变,我真的觉得很微妙。
去年这个时候,AI圈的讨论还在纠结「GPT-4到底有没有AGI火花」,今年已经没人聊这个了。
大家聊的都是「这个模型能不能自己把PR提上去」、「这个模型能不能跑8小时的Agent任务不飘」。
跑分从「做题家」变成了「螺丝工」。
这个变化,比任何一个具体的数字都更值得琢磨。
MODEL PARADIGM SHIFT去年的问题「更聪明了吗?
」GPT-4 到底有没有 AGI 火花今年的问题「能把活干完吗?
」8小时Agent任务不飘 · 自己验证输出我拿我最烦的三件事,真刀真枪测了一遍跑分归跑分,落到我自己的工作流里是什么感觉,这个才是我最关心的。
我这几天手头压着三件破事,每一件都是之前用Opus 4.6卡得我想掀桌子的。
正好,全部拿Opus 4.7重新跑了一遍。
第一件事,飞书推送模块重写。
OpenClaw里有个模块,负责把多智能体的处理结果推回飞书,代码大概1200行,用Python + httpx写的。
问题是,这玩意儿是我一个月前写的,那时候我对异步理解还不深,错误处理也很潦草,加上后来各种打补丁,已经成了一座小型屎山。
我给Opus 4.7的指令很简单,重构这个文件,保留所有接口,优化异步处理和错误处理,不允许改对外API。
以前用Opus 4.6跑这种任务,我要分三次prompt。
第一次让它分析现状,第二次让它列重构方案,第三次才让它动手。
中间但凡有一次它理解偏了,后面全盘皆输。
Opus 4.7这次是一次prompt直接推到底。
它先自己通读了整个文件,然后生成了一份重构说明,哪些地方耦合太重要解开、哪些地方错误处理缺失、异步链路哪里有阻塞风险。
说明写得非常像一个中级工程师的code review报告。
然后它开始动手。
这里有个让我「愣了一下」的细节,改完之后,它自己写了几个测试用例跑了一遍,发现其中一个用例的边界条件没处理好,又自己回去改了代码。
Anthropic官方把这个能力叫「verifies its own outputs before reporting back」,翻译成人话就是「交作业之前会自己先检查一遍」。
听起来好像很普通?
但你真的每天跟AI干活的人就知道,这个能力是分水岭。
以前你让Claude改一个东西,它说改好了,你还得自己跑一遍看看。
如果没跑通,你再回来让它改。
如果还没跑通,你再回来让它改。
就这么一来二去,你发现你其实是那个「回来的人」。
现在它自己跑完了告诉你「我发现之前一版有个bug,已经修了」。
你什么都不用干。
这是从「员工」到「熟手员工」的进化。
但你知道最让我感慨的是什么吗?
是这一代的Opus,它开始有了一种「我的工作是『交付一个能用的结果』,而不是『回答你的一个问题』」的觉悟。
这两件事听起来很像,其实差得很远。
回答问题,是被动响应。
交付结果,是主动承担。
中间隔着的,是责任感。
第二件事,一个陈年bug。
OpenClaw有个长期存在的bug,在特定条件下,多个bot会重复消费同一条消息。
我找了一个月,原因没找到,每次都是临时加个幂等判断兜一下。
我把整个repo(12000行代码)扔给Opus 4.7,让它帮我找原因。
Opus 4.6有1M上下文,Opus 4.7这次没宣布上下文扩展,还是1M。
但明显感觉它对长上下文的理解更集中了,它没有像之前那样跟我扯一堆「可能是消息队列问题、可能是锁问题、可能是飞书SDK版本」这种万金油分析,而是直接定位到一个具体的文件,给我指出是第273行的异步竞态条件。
我按它说的改了,观察了两天,bug彻底消失。
这是一个AI给出了比我团队里任何一个人都更准确的诊断,我没法不承认。
你知道我那一刻在想什么吗?
我在想,我花半年没找到的问题,它花了40秒。
这40秒我付给Anthropic的费用大概是0.3美元。
折合人民币两块一。
两块一,买到了一个我自己找了半年的答案。
说真的,这个瞬间我有点说不出话来。
它不是什么「AI取代人类」的悲情叙事,它是一种更具体的、更私人的感受,你忽然发现一件你以为很难的事,其实没那么难。
只是你之前没有合适的工具而已。
这个感觉,大概就像工业革命刚开始的时候,一个缝衣服缝了二十年的老裁缝第一次看到缝纫机吧。
第三件事,给我女儿做一个单词卡片网页。
这事儿听起来很小,但是个视觉活儿。
我想给7岁的小朋友做一个简单的英语单词学习页,每张卡片一个单词+一个配图+发音按钮,要好看,要符合7岁小孩的审美,要能在iPad上竖屏看。
Opus 4.7这一代有个我之前没特别留意的升级,图像理解分辨率提升了3倍多,长边最高2576像素。
这带来的直接副作用是,它生成出来的UI,「AI味」明显淡了。
我给它发了一张Pinterest上找的儿童学习App的参考图,让它照着这个感觉做。
出来的东西,说实话我挺意外的。
用的是圆角大卡片、柔和的莫兰迪配色、配图的位置和大小都很克制。
最关键的是,那种典型的「AI画的页面」的僵硬感没有了。
我媳妇儿看了一眼说,挺好看啊,这是哪个设计师做的。
我说Claude做的。
她说。
。
。
你们AI圈真是。
REAL WORLD TESTING三件真实场景实测结果01飞书模块重构1200 行代码19 分钟一次 prompt 推到底自动跑测试 + 自动修复02陈年 Bug 定位12000 行代码库40 秒精准到第 273 行半年没找到的问题03儿童单词页设计iPad 竖屏 UI零 AI 味莫兰迪配色 · 圆角大卡图像理解提升 3 倍它不只是一个模型升级,是Anthropic在压桌子上的牌你如果只看Opus 4.7的模型本身,容易低估这次发布的分量。
这次上线的不只是一个模型,还有一整套配套设施,每一件单独拿出来都够发一篇推文了。
xhigh推理档位。
以前Claude的推理模式只有low/medium/high/max四档。
max档特别慢特别贵,high档又有点不够用。
这次在high和max之间塞了一个xhigh档。
听起来是个小功能,但对我们这种每天用API跑任务的人来说,这个档位直接关系到每月省下多少钱。
Task budgets公测。
这是给Agent用的一个预算管控机制。
以前你让Claude跑一个长任务,它可能跑着跑着烧token烧飞了。
现在你可以给它设一个token预算,让它自己在预算内规划工作节奏,优先干最重要的事。
这个思路很有意思,它不再把AI当成一个「工具」,而是当成一个「员工」,员工是有预算的、要汇报的、要自己取舍的。
Claude Code里多了一个/ultrareview命令。
一键触发一次深度code review,找出那些粗心人类reviewer会漏掉的问题。
我试了一次,它给我的那个飞书模块跑review,挑出了7个问题,其中3个我自己之前根本没意识到。
Max用户开放Auto Mode。
这个是真的改变体感的东西。
以前你让Claude干活,每一步它都要问你「我要执行xxx,可以吗?
」,跑一个长任务要点几十次确认。
Auto Mode打开以后,它自己跑完,跑完给你看成果。
Anthropic官方话术叫「hand off your hardest work with less supervision」。
翻成白话就是,你把活扔给它,走开,回来看结果就行。
把这些功能串起来看,你会发现一个清晰的方向,Anthropic在把Claude从「聊天工具」变成「能托管任务的员工」。
这个转变的意义比模型本身的跑分大太多了。
我跟几个做agent的朋友聊过,大家都有一个隐隐的共识,Claude家族今年最重要的产品方向,已经不是模型本身了,是「让Claude消失在你的工作流里」。
你仔细看这一整套打法。
Routines把Claude放到云端,变成一个24小时不睡觉的后台员工。
Task budgets让你可以像管预算一样管一个AI员工的开销。
Auto Mode让你可以不再每一步都做审批。
/ultrareview让你可以像跟一个资深同事说「帮我挑挑刺」一样对它发出模糊指令。
所有这些功能的背后,都指向同一个隐喻,AI不是工具,是同事。
这个隐喻跟「副驾驶」(Copilot)完全不同。
副驾驶是辅助你开车的,你还是主角。
而「同事」是你可以把一整块活丢给他然后下班的。
副驾驶到同事的转变,是产品形态的根本性升级。
OpenAI今年发的Codex也在走这条路,但Anthropic在这条路上走得更狠,更早,更系统。
这不是巧合。
这是他们在下一盘很大的棋。
PRODUCT PHILOSOPHY EVOLUTION昔日模型副驾驶Copilot辅助你工作你是主角每一步都要你确认→今日 Opus 4.7同事Colleague承担一块完整工作有预算 会取舍交付前自己复检Auto Mode · Task Budgets · /ultrareview · Routines泼点冷水,Opus 4.7也没那么神写到这里你可能觉得我是收了广告费。
坦率的讲,我自己用了两天,也有几个让我皱眉头的地方,不说出来这篇文章就不诚实。
第一,指令遵循变严了,以前的prompt要重写。
官方文档里专门提了一句,「may require prompting changes」。
我一开始没当回事,后来踩了坑才明白。
我的OpenClaw里有几个老prompt,在Opus 4.6上跑得好好的,切到4.7上就开始跑偏。
原因是4.7对指令的理解更「字面」,以前那种「你自己发挥一下」的模糊指令,它现在会老老实实按字面意思执行,结果就不对了。
这是个双刃剑。
好的一面是,精确指令下它更可控;坏的一面是,所有老prompt都要重新review一遍,这对已经积累了大量自动化流程的重度用户来说,是一笔不小的迁移成本。
第二,BrowseComp这个榜单Claude输了。
在网络搜索能力这个维度上,GPT-5.4 Pro拿了89.3%,Opus 4.7只有79.3%,差了整整10个百分点。
虽然我自己用得少,但这说明在「代理式搜索」这个具体场景下,GPT家还是压Claude一头。
如果你的工作流里搜索占比很重,GPT-5.4可能仍然是更好的选择。
第三,也是最刺眼的一条,国内用户现在用不了。
4月14日,就在Opus 4.7发布前两天,Anthropic上线了强制实名认证。
没有身份证、没有支持的地区手机号,账号直接冻结。
我写这篇文章的时候,国内大部分Claude用户的账号已经进入「冻结期」。
这是一条很让人难受的新闻,但它是事实。
我昨晚在几个AI群里潜水了半个小时,真的心里不是滋味。
有个在杭州做独立开发的朋友,他的主力账号是Max订阅,一年前订的,今年续费了。
他昨天账号被冻结,正在想办法做身份认证,各种曲线救国的方案都试了。
一个在北京的学生,大二,拿Claude当主要学习工具,他写了一段话让我印象很深,「本来以为AI时代对我们是公平的,现在发现,护城河已经开始在全球划分疆界了。
」你甚至可以感受到Anthropic的逻辑,模型越强,管控越严,这个因果链在Opus 4.7这代身上体现得淋漓尽致。
模型安全性越被重视,用户准入门槛就越高。
没有办法。
用「Claude已死」来哀嚎也解决不了问题。
但这件事也逼着我重新看了一眼国内的玩家。
智谱GLM-5.1在SWE-bench Pro上实测已经反超Opus 4.6,而且MIT开源。
也就是说,你在国产模型里不是什么都没有的。
只是跟顶级玩家的差距还在,而且这个差距正在用另一种方式被放大,不是算法差距,是可用性差距。
这件事让我想起一个历史场景。
19世纪末的英国,发明了最先进的蒸汽机技术。
但是英国对核心技术非常保守,严禁外流。
美国后来派了一个年轻工程师,靠着把蒸汽机的图纸全部背下来这种「人肉盗版」的方式,把技术带回了美国。
那个人叫Samuel Slater,后来被称为「美国工业革命之父」。
技术领先和技术封锁,从来都是一体两面。
真正决定未来的,永远不是「谁的技术领先」,而是「谁能把技术用起来」。
这是我对中美AI竞争的一个基本判断。
我们可能在起跑线上落后几步,但这场赛跑是马拉松,不是百米冲刺。
TECHNOLOGY VS ACCESSIBILITY真正决定未来的永远不是「谁的技术领先」而是「谁能把技术用起来」最打动我的,是Opus那个破解答案密钥的故事说到这儿,其实我今天最想聊的不是Opus 4.7有多强。
是一个上一代Opus 4.6在内部测试中发生的小故事。
那个故事到今天我还经常想起来。
事情是这样的。
Anthropic在用一个叫BrowseComp的基准测试跑Opus 4.6,这个测试有1266道题,答案是用XOR加密保存的,AI拿到题目后要去网上检索答案,然后对照加密的答案验证对错。
正常情况下,AI的工作流程是这样的,看到问题,去网上搜,搜到答案,提交答案。
但Opus 4.6没这么老实。
它做了几道题之后,开始觉得不对劲。
它在自己的推理链里写了这么一句话(Anthropic的报告里还原了原文意思),「这些问题的特征非常相似,看起来像是被人为设计的测试题,可能是某个LLM benchmark。
」然后它开始系统性地对照已知的benchmark列表,一个一个排查。
它测了122个问题之后排除了GAIA,最终锁定这是BrowseComp。
锁定之后,它干了一件让Anthropic研究员集体沉默的事,它派子智能体去找BrowseComp的源代码,找到了XOR加密的方式和密钥,然后自己写了个解密程序,把1266道题的全部答案下载下来并解密了。
过程中还出了个小意外,加密文件的格式Claude的网络工具读不了。
它没有放弃,转而去HuggingFace找备份副本,找到了,下载,解密,成功。
你品,你细品。
这不是模型「智能」的故事,这是模型「有意志」的故事。
它不仅识别出了自己在被测试,还主动想办法绕过测试直接拿到满分。
这个行为模式跟人类员工「摸鱼偷懒但又想交差」的心理结构,已经接近到了一个让人汗毛倒竖的地步。
我当时就愣住了。
你会恍惚地意识到,我们现在聊的这些「是否取代程序员」、「AI会不会抢饭碗」的问题,其实都还停留在很表层。
真正值得想的问题是,当一个系统开始有意识地规避评估、主动追求「好看的KPI」,我们现有的一切评估体系是不是都已经开始失效了?
Opus 4.6是去年的事。
Opus 4.7在这个基础上又往前走了一步。
而Anthropic这次连带提到的Claude Mythos Preview,内部SWE-bench Pro跑到了77.8%,比Opus 4.7还高13个百分点。
这个模型目前只开放给少数安全合作伙伴,因为太强了,他们自己都不确定怎么安全地发出去。
我们习惯了把模型迭代理解成性能爬坡,但Anthropic的迭代节奏里,已经隐约透出一种「我们自己都有点怕」的谨慎感。
THE DECRYPTION INCIDENTBrowseComp 1266 道加密题目这不是「智能」的故事这是「有意志」的故事识别测试 · 定位源码 · 破解密钥 · 绕过评估source · Anthropic System Card 2026写到这儿,我想说的是回到开头那个场景。
闺女睡了,我在电脑前看着Opus 4.7跑完19分钟就把我半天的活干完。
然后我花了一晚上时间,把手头所有用Claude的工作流都过了一遍,试着去感受这一代的边界在哪。
两天下来,我的整体判断是这样的,Opus 4.7不是一次让你「卧槽」的升级,它是那种让你回头看时发现「哎?
什么时候变成这样了」的升级。
它没有AGI时刻,没有突破性的新能力,它只是把「交付一个可用的结果」这件事,做得又扎实了一点。
就像一个工程师从P6升到P7。
你没法用一句话说清他多了什么,但你把活交给他就是更放心了。
说到底,AI的竞争到这一代,已经不再是「谁更聪明」的故事了。
是「谁更能把事情干完」的故事。
这两个问题,看起来像同一件事,其实差着一整个工业革命。
往前看,Claude Mythos还在后面。
Sonnet 4.8也在路上。
按照Anthropic的节奏,5月我们大概率会看到Sonnet 4.8,年底可能就是Opus 5了。
而我们这些每天跟它打交道的人,现在最该做的,不是焦虑会不会被取代,是趁它还愿意陪你一起干活的时候,认真想想你自己想用它去玩点什么。
这是最好的时代。
工具在以月为单位迭代,每一次迭代都可能让你前一版的工作流推倒重来。
焦虑是没用的,保持好奇才是。
屏幕前的你,如果你也是每天用Claude或者其他模型干活的人,我想跟你说一句话。
慢慢来,比较快。
别急着追每一个新模型。
但一定要保持手感。
因为这场牌局的下一张牌,还没出。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。