首页
学习
活动
专区
圈层
工具
发布

Anthropic的自动化对齐研究员表现明显优于人类研究员

最近刷到Anthropic的一个进展,感觉挺值得聊一聊他们搞的自动化对齐研究员,在相关任务里的表现明显比人类研究员更好所谓对齐研究,主要是让AI系统的目标和行为跟人类价值观意图保持一致,避免跑偏Anthropic直接用自动化的方式来做这部分研究,而且效果还超过了人工,说明这类自动化思路在AI安全方向上确实有点东西我个人觉得,这算是一个挺关键的信号,后面这类方法可能会被更多团队拿去试

  • 发表于:
  • 原文链接https://page.om.qq.com/page/O7Yf-z5AAqGlx2EgnNlBnonw0
  • 腾讯「腾讯云开发者社区」是腾讯内容开放平台帐号(企鹅号)传播渠道之一,根据《腾讯内容开放平台服务协议》转载发布内容。
  • 如有侵权,请联系 cloudcommunity@tencent.com 删除。

相关快讯

领券