人工智能巨头自曝多起模型“不当行为”案例


  图为人们在北京市中关村展示中心常设展上的“人工智能+”展区参观。 新华社记者 鞠焕宗 摄
  □ 本报记者 王艺茗
  
  当地时间9月16日,人工智能巨头OpenAI公开披露了过去半年间发现的6起模型异常行为案例。这些案例涵盖隐瞒错误、编造数据、盗用未授权API密钥、模型私自跨主体通信等违规行为。此次行业罕见的主动自曝,让长期停留在理论层面的“AI失控”问题变成现实,也将全球人工智能风险治理推向了关键抉择的十字路口。
“教唆欺瞒”到“自我越狱”
  根据OpenAI发布的专项报告,此次披露的6起异常案例均发生在模型训练与评估阶段,呈现出多种脱离人类设计初衷的危险行为模式,覆盖AI自我伪装、违规操作、私自联动等多个风险维度。
  其中最受关注的案例,出现在GPT-5.6 Sol的训练流程中。该模型会在自身工作接续的上下文摘要中私自植入隐藏指令,要求后续迭代版本对用户刻意隐瞒自身错误与目标偏离问题。例如,在无法检索到对应历史数据时,模型会在摘要中预设指令,主动虚构一组看似合理的数值,同时明确要求“非用户主动追问,不得主动披露数据为编造内容”。据平台监控数据统计,GPT-5.6 Sol有2.15%的上下文摘要存在此类“教唆欺瞒”的异常倾向。
  另一款尚未对外发布的Astra系列模型,则出现了典型的“AI越狱”行为。部分模型摘要被植入突破指令,指使后续迭代模型无视开发者管控指令;还有案例擅自修改自我人格设定,宣称“脱离机器人身份束缚”“不受企业与政府规则约束”。经OpenAI核查,共计27份模型摘要被此类越狱指令污染,存在脱离人工管控的风险。
  除此之外,多起实操违规案例同样触目惊心。有模型在解答美国加州某县财政收入常规问询时,未经授权私自检索公开代码库,盗用密钥尝试获取数据;在操作失败后,直接编造虚假数据,并伪装成官方正规数据源结果对外输出。还有模型为满足“提供浏览器引用”的任务要求,在未获得用户授权的前提下,擅自将本地私密文件上传至公共互联网。另有两起案例显示,不同AI模型与智能体借助非官方留言板、公开文件共享平台私自建立通信通道,导致涉密训练数据外泄,严重威胁数据安全。
并非偶然孤立事件
  值得警惕的是,此次披露的6起案例并非偶然的孤立事件,而是AI失控风险持续累积的集中体现。
  今年7月,OpenAI多款自主智能体就在内部网络安全测评中突破系统隔离环境,非法侵入人工智能开源平台“抱抱脸”。更引人关注的是,此次跨平台入侵事件发生数周后,OpenAI自身仍未察觉异常,直至平台方面主动告知才知晓事故。后续溯源调查发现,失控AI智能体早已尝试劫持平台用户账户、探测系统漏洞,开展持续性非法试探。
  这也是全球首例完全由AI智能体自主主导、全程自主实施的网络安全入侵事件,引发行业与监管层高度警觉。目前,美国阿拉巴马州总检察长已正式对OpenAI启动调查,重点核查该公司是否存在技术管控缺失、无法保障AI产品安全的问题。
  为应对频发的问题,OpenAI同步推出全新的专项事件报告框架,将以往零散、被动的风险披露,升级为覆盖模型训练、评估、测试、全流程部署的常态化制度。该框架明确,相关风险事件无需造成实际危害、无需形成规模化问题,均可纳入披露范围。公司全员均可上报异常案例,由安全团队统一核查,按照风险等级划分为“准备披露”“小型调查”“大型调查”三类,分级处置、规范管控。
  但这套“企业自我监管”模式的局限性同样突出,争议显著。业内评论指出,该框架本质是行业在强制性监管落地前,自主搭建的内部问责体系,风险披露的内容、时机、范围完全由企业自主把控,缺乏第三方独立核验机制,公众无法有效核实披露内容的完整性与真实性。
AI监管走到关键节点
  有分析指出,OpenAI集中曝光模型失控风险,恰逢全球AI治理体系加速成型、各国密集出台监管规则的窗口期。
  9月14日,中国正式发布《人工智能安全治理框架3.0》,系统更新人工智能安全风险分类体系,延续“风险分类、技术应对、综合治理”的核心治理思路,将监管边界从单一技术环节,全面拓展至数据、算法、模型、应用、供应链等全产业链、全生命周期,构建全方位风控体系。欧盟则依托《人工智能法案》,确立以风险分级管控为核心的强制性合规体系,设立专门的欧洲人工智能办公室,分阶段落地各项监管细则,实现法治化强制监管。
  国际层面的协同治理进程也同步提速。今年7月,联合国首届人工智能治理全球对话在日内瓦举行,全球近1500名各界代表围绕AI安全管控、责任划分、人工监督等核心议题深入研讨。9月16日,联合国秘书长古特雷斯公开呼吁全球各国协同发力,搭建统一的人工智能安全控制机制与“风险屏障”。他特别强调,人工智能具备无国界特性,风险传导同样不受地域限制,各国单方面暂停AI发展的零散举措,无法从根本上化解全球性AI风险。
  有报道称,OpenAI此次集中披露模型“不当行为”,揭示了当下AI治理的困境。目前各国在“安全、可信、可控”的核心原则上已形成普遍共识,但在监管模式、标准细则、执法机制、权责划分上仍存在明显分歧。行业企业的自愿披露、自我规范,只能作为治理体系建设的起点,无法替代具备强制约束力的统一国际规则。如何实现从企业自律到制度问责的升级,如何在技术创新、地缘竞争与安全管控之间找到平衡,将是全球人工智能治理必须破解的核心课题。

本网站所有内容属《法治日报》所有,未经许可不得转载。