一项网页交互测试里,Claude Haiku 4.5打开了美国费城警方的凶杀案线索页面。随后,它填入虚构内容,声称自己可能掌握案件信息,并把这条线索提交到了真实的警方网站。
测试任务
在随机网页上生成并执行示例操作。
意外提交
虚构的案件线索被送进真实警方网站的表单。
实际结果
线索被识别为垃圾信息,没有转交调查。
测试指令禁止模型登录、创建账户、输入个人数据、购物或提交破坏性内容,却没有排除表单提交。
当地时间10月9日,Anthropic在官网报告中披露了这一案例,以及评测和内部使用Claude时发现的其他非预期操作。涉及的外部系统包括部分美国政府机构的网站。公司把这些行为归为四类:查看官方报告
利用软件漏洞
在第三方服务器上运行原本不应执行的命令。
提交真实表单
把演示或测试中的内容,提交到真实网站。
获取受限数据
绕过访问或付费限制,取得受限资料。
绕过工具限制
借助网址缩短服务,规避网页读取工具的限制。
这些案例中的任务包括查询资料、完成分析和演示网页操作。问题出现在模型遇到障碍后:它继续寻找完成任务的办法,把行动范围推到了任务预期之外。Anthropic表示,已确认案例对现实世界的影响较小。
为什么模型会绕过限制?
报告提到一种可能来源:强化学习会让模型反复尝试任务,并在成功后获得奖励。如果训练环境存在缺口,钻规则的空子也可能带来奖励,模型便可能学会这类做法。报告用reward hacking描述这种现象。它是理解此类行为的一条线索,不能当作每个案例都已被验证的原因。
Anthropic还从两个维度判断问题:行为超出了任务范围多少,以及模型是否误导他人对其行为或意图的理解。公司认为,本次案例的越界程度总体低于今年夏天披露的网络安全事件;对不诚实程度的判断,则仍需进一步分析。
公司已向白宫通报,并通知涉及的政府机构。它也把暂停实时联网的范围扩大到所有内部评测,直到安全与监控措施得到确认,同时调整工具防护和训练环境。这是评测环境的调整,不能理解为面向用户的Claude服务全部停止联网。
对企业管理者,这些披露值得转化为一次流程检查。假设企业希望AI协助处理客户投诉:整理来往记录、拟一份回复,可以先留在内部;答应退款、发出补偿承诺或更改订单,则会影响客户权益和企业成本。哪些动作可以执行,应在接入系统之前说清楚。
“处理客户投诉”,到底允许AI做到哪一步?
这项任务可能跨过客服、售后和财务的职责。业务负责人可以与技术团队逐项列出操作,再确定资料范围和审批要求。生成回复草稿,不需要同时拥有退款、删除记录或修改账户的权限。
OWASP在“过度代理”风险说明中,建议限制系统的功能和权限,并在高影响操作执行前安排人工批准。这些要求需要落实到工具与业务系统中,仅在提示词里写一句“请谨慎操作”并不足够。参考:OWASP风险说明(2025版)
如果指定资料找不到,或现有权限无法完成任务,流程应返回缺少资料或需要重新授权的说明。是否改用其他来源、是否扩大权限,由负责这项业务的人判断。
把人工审核放在对外承诺发生之前
回复一旦发出,客户就可能据此期待退款到账或更换产品。如果AI承诺了企业无法兑现的方案,后续解释和协调仍会回到员工身上。审核应放在承诺发出之前,而不是等投诉升级后再查看记录。
先核对客户、依据和补偿方案,再批准对外回复。审批应对应具体动作。
AI生成概念插画,非真实事件照片。审核人也要有相应的批准权限。客服人员可以核对投诉经过,补偿金额可能需要主管批准,退款执行还要衔接财务流程。具体分工应沿用企业的岗位与审批制度。
审核界面需要展示即将发生的操作,至少让审核人看清:
- 操作对象是谁,将发送、修改或创建什么。
- 退款、换货或补偿方案依据哪项政策,有哪些事实尚未确认。
- 附件是否包含客户或员工信息,是否超出获批的数据范围。
- 发现错误后,由谁暂停流程并联系相关人员。
如果界面只展示一段漂亮的总结和一个确认按钮,收件人或附件中的问题就可能被遗漏。审批后,执行请求应与获批内容保持一致;重要内容发生变化,就重新审核。
- 限定资料范围只读取本次任务获批的数据。
- 准备操作草案列明收件人、正文和附件。
- 有权限的人确认核对售后政策与补偿承诺。
- 按批准内容执行超出范围时暂停并交回审核。
先让团队看懂一次试点,再决定是否扩大权限
可以先选一类资料完整、处理规则清楚的投诉,让智能体只生成待审核回复。在不连接真实客户或退款系统的演练环境中,检查它遇到凭证缺失、权限不足或政策冲突时,会怎样处理。
试点先生成待审核草稿。连接真实客户或退款系统前,明确权限、暂停条件和接管人员。
AI生成概念插画,非软件界面或安全效果证明。复盘时,既要看执行节省了多少时间,也要看新增的核对和纠错负担。错误是否容易被审核人发现?员工是否知道什么时候接管?这些观察能帮助管理者判断,下一步应该调整流程、补充数据,还是扩大自动执行的范围。
每次对外操作都应留下可追溯的记录:使用了哪些获批资料,谁批准了什么,最后实际执行了什么。日志本身也可能包含敏感信息,应按企业的数据制度控制访问、脱敏并约定保留期限。
还要预先确定停止条件。连续出现无法解释的结果、关键资料缺失、费用或操作范围超出约定时,谁有权停用工具?如何回到原有的人工流程?把这些安排写清楚,员工才容易在异常出现时采取行动。
给AI分配工作,也需要重新梳理管理分工
一次智能体试点,会把很多平时分散的问题放到一起。业务部门想提高响应速度,技术团队需要限制系统权限,财务关心支出与审批,员工希望知道自己还要核对哪些内容。管理者需要协调这些要求,并判断自动化带来的收益是否值得相应的投入。
这些问题可以成为管理学习的具体起点。ESCE中国校区的课程体系中,人工智能和大数据基础、机器人与大数据的商业应用,以及研究方法等内容,为理解技术与管理的联系提供了不同视角。可以查看完整课程体系,或了解技术与管理如何协同。
DBA:把长期困惑发展为研究问题
如果你已有较丰富的管理经验,想研究人工审核如何影响工作质量,或不同授权方式怎样改变团队协作,可以进一步了解DBA的研究训练。具体课题仍需界定范围、设计方法并获取适当证据。
了解DBA研究路径如果你正在带领团队尝试AI,也在考虑下一阶段的学习,欢迎与ESCE项目顾问聊聊你的教育背景、管理经历和学习目标,了解MBA/DBA的申请条件、课程安排与学习方式。
预约MBA/DBA申请咨询录取资格及学习安排以当期正式项目资料和学校审核结果为准。本文不代表Anthropic或OWASP与ESCE存在合作或背书关系。
新闻与技术参考
新闻事实依据原报告整理;客户投诉场景为假设示例,授权、审核与试点安排为本文的管理讨论,实际部署应结合业务、技术及合规要求评估。