最近刷到Anthropic的一个进展,感觉挺值得聊一聊他们搞的自动化对齐研究员,在相关任务里的表现明显比人类研究员更好所谓对齐研究,主要是让AI系统的目标和行为跟人类价值观意图保持一致,避免跑偏Anthropic直接用自动化的方式来做这部分研究,而且效果还超过了人工,说明这类自动化思路在AI安全方向上确实有点东西我个人觉得,这算是一个挺关键的信号,后面这类方法可能会被更多团队拿去试
分享快讯到朋友圈