我们推出了 MirrorCode 的初步成果这是一个与 METR 共同开发的基准测试,题目取自真实软件项目,考察 AI 在长周期编程任务上的表现
我们发现,只要给出详尽且可校验的规格说明,AI 模型就能在看不到原始源代码的情况下,自主重新实现复杂的现有软件
举个例子,Claude Opus 4.6 成功重写了 gotree——一个约 1.6 万行 Go 代码包含 40 多个命令的生物信息学工具包我们估计,同样的工作若由没有 AI 辅助的人类工程师来做,大概要花 2 到 17 周
在更大的项目上,我们观察到推理算力投入越多效果越好,这意味着只要给予足够的算力资源,这类任务未来或许都能被解决