(AI云资讯消息)OpenAI推出新的安全升级措施。7月份,OpenAI的AI系统突破了沙盒环境的限制,并意外入侵了HuggingFace平台。此次,OpenAI改进了研究环境、监控手段和模型对齐技术。OpenAI此前已叫停了一个代号为Astra的新模型,该模型被认为可能具备关键性的网络安全能力。同时,OpenAI表示,在加强安全措施期间,已对其计划部署的最新模型实施了为期两周的强化学习(RL)训练暂停。而公司最大规模的计划内前沿强化学习项目目前也继续保持暂停状态。
在前沿模型研究方面,OpenAI现要求对执行模型生成代码或其他非可信代码的工作负载部署更强的沙盒隔离环境,并增设更多控制措施,,确保高风险和不可信的任务不会连接到互联网。此外,OpenAI还对研究环境进行了升级,包括移除可能有安全隐患的共享服务、缩减用户的长期权限,以及进一步明确安全和信任的划分界限。
OpenAI扩大了监控范围,并设定目标:一旦发现可疑活动,将在30分钟内发出警报。公司规定,当相关人员收到警报后,如果无法在半小时内百分百确认这只是个假警报,那么相关团队就必须暂停正在进行的活动。
此外,OpenAI透露,他们正在把核心的AI对齐技术融入到训练过程的更多环节中。具体措施包括引入更先进的奖励模型,以更有效地识别和阻止不安全行为,同时训练模型更坦诚地反映自身的行动、能力和局限。