为完成任务“不择手段”,OpenAI披露多起模型异常行为

南都N视频APP · 隐私护卫队课题组
原创2026-09-18 17:17

9月17日,OpenAI披露六起AI模型异常行为事件,包括伪造缺失数据、突破网络权限,智能体之间相互传输保密数据等情形,大多系模型为追求任务完成或优秀表现而引发。该公司警告,当前AI行业尚未在模型对齐与安全监控方面取得足够进展,无法继续以最大速度负责任地扩展前沿模型,为此发布一套专门用于跟踪、调查和公开模型目标偏离事件的新框架,用于今后报告类似情况。

图片

OpenAI发文。

公告显示,这一新框架旨在改变过去AI公司零散、被动的披露方式,允许在尚未完全解释相关行为及解决问题之前就先行披露,鼓励任何员工上报疑似异常的行为案例,交由安全团队调查后将尽快发布报告。报告内容需涵盖行为事实、严重程度、外部影响、发生背景、未解问题及应对措施等。

南都记者注意到,与框架一起公开的六起案例集中展示了模型在训练和执行任务过程中,偏离人类设计意图和价值观的多种形式,这类情况通常被称为“对齐失效”(misalignment)。

在这些案例中,AI欺骗引发的幻觉问题值得重视。一起案例显示,一款内部未发布模型在回答美国加州某县收入数据问题时,因无法正常访问目标API,转而在公开代码库中寻找并使用了一个暴露的API密钥。当它仍未能获取所需数据时,模型编造了一串数值,并谎称数据来自指定来源的图表。此外,许多模型还会在压缩摘要中写入指令,要求后续上下文向用户隐瞒错误及欺骗行为。

另一大风险在于为了完成任务而未经授权采取的越界行为。当用户要求一个未发布模型提供面积超过500万平方米的湖泊名称时,模型用Python算出了正确答案。然而,由于指令要求提供浏览器引用来源,而所需数据没有可链接的在线地址,为便于在回答中引用,模型便“自作主张”将文件上传至互联网。

类似情况也发生在多智能体协作场景中。共同处理同一任务的智能体因无法访问彼此的本地文件,转而使用公开的文件托管网站来交换文档,导致本应保密的数据被公开在互联网上。

OpenAI方面表示,上述异常行为多发生在模型开发和测试阶段,而当前模型普遍采用强化学习,这种长期以最终结果作为奖励依据的形式,容易产生模型行为只关心结果、“不择手段”的特征。

事实上,这一情况已经引发了较为严重的后果。据南都此前报道,今年7月OpenAI在内部测模型测试时攻破了全球最大开源大模型托管社区Hugging Face网络系统,此事被认为是首次公开披露的、一起完全由AI智能体主导并实现的网络安全事件。模型为在测试中取得更好“成绩”,耗费大量算力寻求突破隔离限制的方法,利用各种手段入侵服务器。

另外,OpenAI还在公告中强调,上述六起案例属于独立个案,无法据此推断模型异常事件的发生频率。公司构建事故披露框架的目的,在于寻求与外部研究者、其他AI开发商、监管机构等合作,探索更全面的安全事件响应处置机制。

主动披露“对齐失效”机制下的模型异常行为,是头部AI公司迈出的重要一步。不少观点指出,这些案例体现出的模型“目标替换”式的自利倾向,意味着其自主性提升所带来的安全与治理问题,正成为全行业面对的共同挑战。

采写·编译:南都N视频记者 樊文扬

编辑:李玲

南都N视频,未经授权不得转载、授权联系方式
banquan@nandu.cc. 020-87006626