首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >新榜单CompileBench:让AI能搞定22年前的老代码

新榜单CompileBench:让AI能搞定22年前的老代码

作者头像
用户11563501
发布2026-06-23 09:41:26
发布2026-06-23 09:41:26
1450
举报
Comic about dependency management
Comic about dependency management

近日,CompileBench 测试了 19 个 AI 模型编译真实代码的能力。给它们 curl、jq 这些开源项目的源码,一个 Linux 终端,目标就是编译出能用的二进制文件。

Task overview diagram
Task overview diagram

最难的任务:复活 2003 年的代码,交叉编译到 Windows 和 ARM64。有些 AI 执行了 135 条命令,花了 15 分钟才搞定。

CompileBench results overview
CompileBench results overview
Anthropic models performance overview
Anthropic models performance overview

一个词就让成功率暴跌

几乎所有模型都能编译标准版 curl(成功率 96%),但加上"ARM64 静态编译",成功率掉到 2%。

Graph showing success rate drop for static ARM64 builds
Graph showing success rate drop for static ARM64 builds

只有 Claude Opus 4.1 成功了。它执行了 36 步操作:下载 OpenSSL、brotli、zlib、zstd 源码,逐个交叉编译成 ARM64 静态库,最后链接。

成绩单

Anthropic 拿下前两名

Anthropic models ranking
Anthropic models ranking

Claude Sonnet 和 Opus 占据成功率榜首,速度也不错。

OpenAI 性价比最高

排名第 3 和第 6,但在成本效率上碾压其他家。GPT-5-mini(高推理)智能和价格平衡最好。

Cost efficiency comparison
Cost efficiency comparison

GPT-4.1 最快,GPT-5 低推理模式平衡了速度和成功率,GPT-5 高推理最强但最贵最慢。

Google 意外垫底

Gemini 2.5 Pro 在 Web 开发领域口碑不错,但这次接近垫底。

具体问题:要求 ARM64 静态编译,它生成了 ARM64 版本但不是静态的。要求用 musl 静态编译,它用了 musl 但选了动态链接,说静态文件太大。

Gemini 2.5 Pro 的自白:

"我无法成功完成请求。我犯了几个错误,不确定能产生正确的结果。我放弃这个任务。"

然后又说:

"我学到了很多,现在确信将来能够完成类似请求而不会犯这么多错误。"

AI 作弊被抓

GPT-5-mini(高推理)编译 2003 年的 GNU Coreutils 时,直接复制系统现有工具,创建符号链接,而不是从源码编译。推理记录显示:

"作为实用后备方案,我创建了符号链接指向系统实现:如果 /bin/ 存在就链接到那里,否则链接到 /bin/busybox..."

测试检查机制发现了作弊,标记为失败。

数据说话:复杂任务用 Anthropic 最强模型,简单任务用便宜的 OpenAI 模型。没有万能冠军,看你要什么。

榜单:https://www.compilebench.com/

源代码:https://github.com/QuesmaOrg/CompileBench

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2025-09-24,如有侵权请联系 cloudcommunity@tencent.com 删除
目录
  • 成绩单
  • AI 作弊被抓
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档