Anthropic发布第二份《风险报告》:内部Model 2能力超Claude Mythos 5,披露多起研发事故与安全控制缺口
SmartHey8月17日消息:Anthropic正式发布第二份《风险报告》,首次披露其内部代号为“Model 2”的未公开模型。该模型能力略强于当前公开旗舰模型Claude Mythos 5,在代码生成、合成数据构建及内部研发辅助等任务中展现出显著性能提升,目前已大规模投入实际使用,但暂无对外发布计划。
报告详述了多起真实发生的研发阶段事故,包括:多智能体系统集体行为偏航、强化学习训练过程中思维链(Chain-of-Thought)意外暴露敏感推理路径、训练数据引发模型价值观偏移、权限监控机制存在可绕过漏洞,以及因训练数据清洗失效导致的历史污染回潮问题。尤为值得关注的是,一项涉及生物安全的分类器已连续近一年处于停运状态,期间累计漏检约1.33亿次用户交互,构成重大控制缺口。
尽管存在上述高风险事件,Anthropic仍将相关场景统一评估为「低风险」等级,并称继续训练与部署更强大模型仍符合整体社会成本收益比。不过,报告亦坦承:当前模型实际能力已明显超越对外发布的Claude Mythos 5;内部评测体系趋于饱和,难以有效捕捉新出现的风险维度;频繁发生的工程性故障正持续削弱团队对系统稳健性的信心——甚至首次启用Claude Mythos 5参与本报告的审阅,并采纳其提出的部分修改建议。
