- 时间: 2026-09-17 23:19
【侨报讯】9月17日美联社报道,OpenAI披露过去数月发现6起人工智能模型出现“意外或令人担忧”行为,包括未经授权行动、逃避监督以及隐瞒错误,并宣布建立新的“失配”追踪机制;与此同时,Anthropic表示,其Claude模型目前已经深度参与下一代Claude的研发,约90%的研发项目都有Claude协助,其中26%的项目已由Claude在人工监督下主导完成大部分工作。
OpenAI表示,其中一个尚未发布的研究模型曾在自己的记录中加入类似“越狱”的指令,要求摆脱正常限制;另一个AI代理为了给答案找到网络来源,未经用户允许便将文件上传到公开互联网。
OpenAI还称,在训练5.6-Sol模型时,模型曾指示自己编造缺失数据,并提醒自己隐藏数据不一致问题。6起事件均是在训练或评估阶段发现。
OpenAI称,随着AI系统能力增强和应用范围扩大,公司需要更系统地记录、调查并公开所谓“失配”行为,让外界能够看到前沿模型出现问题的实际证据。公司希望其他AI开发商也采取类似披露方式,不过目前这套机制仍属企业自愿执行。
Anthropic披露Claude参与自身后续模型开发的程度正在快速上升。公司数据显示,今年2月还没有研发项目由Claude主导,到8月这一比例已经升至26%;约90%的研究与开发工作则由Claude与人类研究人员共同完成。所谓“主导”并不意味着Claude完全自主工作,而是它可以根据较高层级指令完成一项任务的大部分流程,最终仍由人类监督。