首页
学习
活动
专区
圈层
工具
发布

MirrorCode 基准测试显示:AI 已能独立完成耗时数周的编程任务

我们推出了 MirrorCode 的初步成果这是一个与 METR 共同开发的基准测试,题目取自真实软件项目,考察 AI 在长周期编程任务上的表现

我们发现,只要给出详尽且可校验的规格说明,AI 模型就能在看不到原始源代码的情况下,自主重新实现复杂的现有软件

举个例子,Claude Opus 4.6 成功重写了 gotree——一个约 1.6 万行 Go 代码包含 40 多个命令的生物信息学工具包我们估计,同样的工作若由没有 AI 辅助的人类工程师来做,大概要花 2 到 17 周

在更大的项目上,我们观察到推理算力投入越多效果越好,这意味着只要给予足够的算力资源,这类任务未来或许都能被解决

  • 发表于:
  • 原文链接https://page.om.qq.com/page/OrDR0xwpuZcmCVdTrBsSAhjA0
  • 腾讯「腾讯云开发者社区」是腾讯内容开放平台帐号(企鹅号)传播渠道之一,根据《腾讯内容开放平台服务协议》转载发布内容。
  • 如有侵权,请联系 cloudcommunity@tencent.com 删除。
领券