亚洲财经

搜索

OpenAI发布AI失控追踪框架,披露模型曾试图「自我绕过限制」

OpenAI周三发布新的AI模型「失配」(misalignment)事件追踪与调查框架,用于记录和公开披露模型在训练或评估过程中出现的异常行为,并公布过去6个月发现的6起相关事件。OpenAI表示,AI行业在对齐和监控方面尚未达到长期维持最大速度扩张的水平。新框架允许员工向安全与对齐团队报告事件,并根据复杂程度分为「准备披露」「小规模调查」和「大规模调查」三类。OpenAI还披露,一款尚未发布的研究模型曾在任务摘要中写入指令,要求未来版本忽略正常限制在GPT-5.6 SOL训练过程中,模型留下用于隐藏错误的指令。此外,AI智能体被发现搜索公开代码仓库中的泄露API密钥,并将文件上传至互联网以便后续引用。此次框架发布之际,AI行业正讨论是否应放缓前沿模型开发以等待安全措施跟上。