Anthropic Claude 系列的 16 个 AI 代理自给自足地创建了一个 C 编译器。
在实验中,Anthropic公司聚集了16个自主AI代理,它们从零开始共同创建了一个用Rust编写的C语言编译器。结果是“纯净”的实现,能够构建Linux 6.19内核,并编译PostgreSQL、SQLite、Redis、FFmpeg和QEMU等项目,但在质量和效率上仍显著落后于GCC。
如何完成
阶段 发生了什么 准备 16个Claude Opus 4.6实例在独立的Docker容器中运行,没有互联网访问权限。每个实例克隆公共Git仓库,并通过锁文件获取任务。 自主规划 没有中央协调者:每个代理自行决定接下来执行哪一“显而易见”的工作块。在冲突时,代码会自动合并。 开发 代理被指派从零开始编写C编译器。工作持续了2周,需要近2000次Claude Code会话。 测试 为避免用长请求“堵塞”模型上下文,测试以摘要模式运行(仅几行输出)。为加速,还添加了快速处理1–10%的测试。
最终产品
* 体积——约100,000行Rust代码。
* 功能——可在x86、ARM和RISC‑V上构建Linux 6.19内核;编译PostgreSQL、SQLite、Redis、FFmpeg、QEMU;通过约99%的GCC测试。
* 限制——不生成16位机器码(运行Linux需要GCC);汇编器和链接器存在错误,代码性能低于GCC。与经验丰富的程序员相比,生成的Rust源代码质量令人失望。
实验成本
指标 成本 代币 Claude API≈$20,000 额外费用(模型训练、项目组织、测试集)未包含在上述金额中
教训和结论
1. 自主性极限——当代码量达到约100,000行时,代理开始无法完全理解项目;这似乎是独立AI的上限。
2. 需要支持——尝试扩展功能往往会破坏已工作的代码部分。
3. 开发环境的重要性——与互联网隔离和正确配置测试对代理稳定运行至关重要。
结论
实验表明,现代AI模型能够在最小控制下生成复杂的软件系统。然而,它们尚无法完全替代经验丰富的开发者:代码质量、性能和可靠性仍低于传统编译器,项目规模受限于数十万行。这是一个重要进展,但离完整自主软件开发还有很长路要走。
评论 (0)
分享你的想法——请保持礼貌并围绕主题。
登录后发表评论