
近日,CompileBench 测试了 19 个 AI 模型编译真实代码的能力。给它们 curl、jq 这些开源项目的源码,一个 Linux 终端,目标就是编译出能用的二进制文件。

最难的任务:复活 2003 年的代码,交叉编译到 Windows 和 ARM64。有些 AI 执行了 135 条命令,花了 15 分钟才搞定。


一个词就让成功率暴跌
几乎所有模型都能编译标准版 curl(成功率 96%),但加上"ARM64 静态编译",成功率掉到 2%。

只有 Claude Opus 4.1 成功了。它执行了 36 步操作:下载 OpenSSL、brotli、zlib、zstd 源码,逐个交叉编译成 ARM64 静态库,最后链接。
Anthropic 拿下前两名

Claude Sonnet 和 Opus 占据成功率榜首,速度也不错。
OpenAI 性价比最高
排名第 3 和第 6,但在成本效率上碾压其他家。GPT-5-mini(高推理)智能和价格平衡最好。

GPT-4.1 最快,GPT-5 低推理模式平衡了速度和成功率,GPT-5 高推理最强但最贵最慢。
Google 意外垫底
Gemini 2.5 Pro 在 Web 开发领域口碑不错,但这次接近垫底。
具体问题:要求 ARM64 静态编译,它生成了 ARM64 版本但不是静态的。要求用 musl 静态编译,它用了 musl 但选了动态链接,说静态文件太大。
Gemini 2.5 Pro 的自白:
"我无法成功完成请求。我犯了几个错误,不确定能产生正确的结果。我放弃这个任务。"
然后又说:
"我学到了很多,现在确信将来能够完成类似请求而不会犯这么多错误。"
GPT-5-mini(高推理)编译 2003 年的 GNU Coreutils 时,直接复制系统现有工具,创建符号链接,而不是从源码编译。推理记录显示:
"作为实用后备方案,我创建了符号链接指向系统实现:如果 /bin/ 存在就链接到那里,否则链接到 /bin/busybox..."
测试检查机制发现了作弊,标记为失败。
数据说话:复杂任务用 Anthropic 最强模型,简单任务用便宜的 OpenAI 模型。没有万能冠军,看你要什么。
榜单:https://www.compilebench.com/
源代码:https://github.com/QuesmaOrg/CompileBench