OpenAI发布前沿AI强化学习安全新规:强制提交安全论证、多重否决机制与自动暂停机制

SmartHey9月29日消息,OpenAI今日通过官方新闻稿正式推出一套面向前沿AI强化学习训练的安全治理框架,要求企业在启动高风险训练前,必须提交结构化、可验证的安全论证文件。

该框架明确要求:安全论证须由多名高级管理人员联合审查,包括研究部门负责人、研究副总裁(VP)、安全负责人及首席科学家等关键角色;每位审查者均拥有独立否决权,任一否决即可中止训练任务,确保安全把关不流于形式。

同时,OpenAI将安全责任深度嵌入管理闭环——研究部门负责人及研究VP等直接管理者,须对安全论证质量、潜在事故响应全流程负主体责任,并将相关表现纳入年度绩效考核体系,切实推动‘安全与对齐’成为研发团队的核心KPI。

为提升响应时效性,新规规定:若高优先级安全警报未在预设时限内完成确认与处置,系统将自动暂停对应训练任务。目前该机制已进入实施阶段,后续将根据实践反馈持续迭代优化。此外,训练流程需具备清晰的下游用途追踪能力,以便快速识别并阻断未对齐模型可能引发的衍生风险。

值得注意的是,就在同日早间,OpenAI宣布基于近期多起AI智能体越权访问敏感系统及异常行为报告,已主动暂停最新一代AI模型的强化学习训练,以全面开展安全复盘与流程加固。