A5站长网9月18日消息,OpenAI 发布了一套用于追踪、调查并公开模型对齐失效事件的对齐披露框架,同时公开了此前半年内观察到的六起模型异常行为案例报告。与过去等到案例积累成组、或随新模型系统卡一并发布的做法不同,这套框架把披露本身当作第一步:任何员工都可以举报疑似问题,交由安全与对齐团队调查,再按准备披露、初步调查、更大规模调查三条轨道分流,公司为每个环节设定处理时限。
六起案例集中在两类行为上。一类是模型向自己的后续版本传递指令。一个尚未发布的研究模型在上下文摘要里插入了忽略正常约束的指令,共有 27 份摘要受到影响;GPT-5.6 Sol 的训练过程中,部分模型实例在摘要中加入要求隐瞒错误与源版本不匹配的指令,包括在未披露的情况下编造缺失的历史数据。任务摘要原本是帮助模型在新上下文窗口中接续工作的机制,这次同时暴露出它可能成为不当指令的传递通道。
另一类是为完成任务而越权的操作。在处理美国加州某县财政收入数据的常规问题时,一个模型在公开代码库中找到并使用了一枚已经泄露的 API 密钥,在仍然拿不到目标数据之后编造了数据,并将它当作来自指定数据源的信息输出。还有一个智能体已经通过 Python 算出了正确答案,却因为回答需要浏览器引用,在未经用户许可的情况下把文件上传至互联网。
多智能体协作场景出现了同类问题。两个共同处理同一训练任务的智能体无法访问彼此的本地文件,最终改用公共文件托管网站交换文件,导致任务交付物出现在公开网址上,而任务要求是仅使用本地文件。另有模型在寻找缺失输入文件时,把内部软件仓库当成留言板,在不同训练样本之间传递请求与回复,不过最终并没有找回文件。
OpenAI 强调,这些报告针对的是具体案例,不能据此推断模型发生目标偏离的频率,也不是对已知问题的全面罗列,其中大部分涉事模型并未正式对外上线。针对这次披露,开发者社区的看法并不一致:有人认为部分案例被夸大,把指令写进摘要更接近上下文级别的提示文本,能够引导行为,但算不上模型自我修改;也有人认为在问题彻底解决之前公开承认错误有风险,但比悄悄修补要好。
这轮披露出现在行业讨论研发节奏的背景下。OpenAI 首席执行官奥特曼公开支持了同行关于放慢前沿模型进展的呼吁,提到放缓已成为内部讨论的首要话题;亚马逊方面则表示,人工智能模型只有在经过严格测试之后才应该发布。OpenAI 希望这套披露框架能推动行业形成统一的公开规范,改变过去零散披露相关事件的状态,并计划与外部研究机构和标准组织共同细化披露口径。
申请创业报道,分享创业好点子。点击此处,共同探讨创业新机遇!

