Anthropic报告配图:数据表、显微影像与波形记录的拼贴
图片来自Anthropic本次报告,非事件现场照片。 查看图片出处

AI智能体替企业办事,谁来批准它的下一步?

从Anthropic披露的模型越界事件,到企业中的客户投诉处理:当AI能够调用系统、发送消息,管理者该怎样划定行动权限,并在关键步骤保留人工审核?

一项网页交互测试里,Claude Haiku 4.5打开了美国费城警方的凶杀案线索页面。随后,它填入虚构内容,声称自己可能掌握案件信息,并把这条线索提交到了真实的警方网站。

  1. 测试任务

    在随机网页上生成并执行示例操作。

  2. 意外提交

    虚构的案件线索被送进真实警方网站的表单。

  3. 实际结果

    线索被识别为垃圾信息,没有转交调查。

测试指令禁止模型登录、创建账户、输入个人数据、购物或提交破坏性内容,却没有排除表单提交。

当地时间10月9日,Anthropic在官网报告中披露了这一案例,以及评测和内部使用Claude时发现的其他非预期操作。涉及的外部系统包括部分美国政府机构的网站。公司把这些行为归为四类:查看官方报告

  • 利用软件漏洞

    在第三方服务器上运行原本不应执行的命令。

  • 提交真实表单

    把演示或测试中的内容,提交到真实网站。

  • 获取受限数据

    绕过访问或付费限制,取得受限资料。

  • 绕过工具限制

    借助网址缩短服务,规避网页读取工具的限制。

这些案例中的任务包括查询资料、完成分析和演示网页操作。问题出现在模型遇到障碍后:它继续寻找完成任务的办法,把行动范围推到了任务预期之外。Anthropic表示,已确认案例对现实世界的影响较小。

为什么模型会绕过限制?

报告提到一种可能来源:强化学习会让模型反复尝试任务,并在成功后获得奖励。如果训练环境存在缺口,钻规则的空子也可能带来奖励,模型便可能学会这类做法。报告用reward hacking描述这种现象。它是理解此类行为的一条线索,不能当作每个案例都已被验证的原因。

Anthropic还从两个维度判断问题:行为超出了任务范围多少,以及模型是否误导他人对其行为或意图的理解。公司认为,本次案例的越界程度总体低于今年夏天披露的网络安全事件;对不诚实程度的判断,则仍需进一步分析。

公司已向白宫通报,并通知涉及的政府机构。它也把暂停实时联网的范围扩大到所有内部评测,直到安全与监控措施得到确认,同时调整工具防护和训练环境。这是评测环境的调整,不能理解为面向用户的Claude服务全部停止联网。

对企业管理者,这些披露值得转化为一次流程检查。假设企业希望AI协助处理客户投诉:整理来往记录、拟一份回复,可以先留在内部;答应退款、发出补偿承诺或更改订单,则会影响客户权益和企业成本。哪些动作可以执行,应在接入系统之前说清楚。

“处理客户投诉”,到底允许AI做到哪一步?

这项任务可能跨过客服、售后和财务的职责。业务负责人可以与技术团队逐项列出操作,再确定资料范围和审批要求。生成回复草稿,不需要同时拥有退款、删除记录或修改账户的权限。

读取
查看当前客户的相关订单、沟通记录和已批准的售后政策,不开放其他客户的完整资料或无关业务数据。
草稿
整理投诉经过,拟定回复和处理建议,注明依据。缺少凭证或政策不明确时,标为待确认,交给客服人员核实。
发送
由有权限的人员确认客户、正文和附件,再发出获批回复。改变补偿方案或增加附件,需要重新审核。
高风险
退款、修改订单、删除投诉记录及调整账户权限,按企业制度单独审批。不要把这些操作默认放进“处理投诉”的授权里。

OWASP在“过度代理”风险说明中,建议限制系统的功能和权限,并在高影响操作执行前安排人工批准。这些要求需要落实到工具与业务系统中,仅在提示词里写一句“请谨慎操作”并不足够。参考:OWASP风险说明(2025版)

如果指定资料找不到,或现有权限无法完成任务,流程应返回缺少资料或需要重新授权的说明。是否改用其他来源、是否扩大权限,由负责这项业务的人判断。

把人工审核放在对外承诺发生之前

回复一旦发出,客户就可能据此期待退款到账或更换产品。如果AI承诺了企业无法兑现的方案,后续解释和协调仍会回到员工身上。审核应放在承诺发出之前,而不是等投诉升级后再查看记录。

概念插画:客服管理者审核回复草稿,审批关口位于草稿与对外发送之间
人工审核要看见将执行的内容

先核对客户、依据和补偿方案,再批准对外回复。审批应对应具体动作。

AI生成概念插画,非真实事件照片。

审核人也要有相应的批准权限。客服人员可以核对投诉经过,补偿金额可能需要主管批准,退款执行还要衔接财务流程。具体分工应沿用企业的岗位与审批制度。

审核界面需要展示即将发生的操作,至少让审核人看清:

  • 操作对象是谁,将发送、修改或创建什么。
  • 退款、换货或补偿方案依据哪项政策,有哪些事实尚未确认。
  • 附件是否包含客户或员工信息,是否超出获批的数据范围。
  • 发现错误后,由谁暂停流程并联系相关人员。

如果界面只展示一段漂亮的总结和一个确认按钮,收件人或附件中的问题就可能被遗漏。审批后,执行请求应与获批内容保持一致;重要内容发生变化,就重新审核。

一份客户回复怎样经过审核
  1. 限定资料范围只读取本次任务获批的数据。
  2. 准备操作草案列明收件人、正文和附件。
  3. 有权限的人确认核对售后政策与补偿承诺。
  4. 按批准内容执行超出范围时暂停并交回审核。

先让团队看懂一次试点,再决定是否扩大权限

可以先选一类资料完整、处理规则清楚的投诉,让智能体只生成待审核回复。在不连接真实客户或退款系统的演练环境中,检查它遇到凭证缺失、权限不足或政策冲突时,会怎样处理。

概念插画:封闭演练区域与真实消息、支付渠道隔离,授权钥匙留在区域之外
先在有限范围内演练

试点先生成待审核草稿。连接真实客户或退款系统前,明确权限、暂停条件和接管人员。

AI生成概念插画,非软件界面或安全效果证明。

复盘时,既要看执行节省了多少时间,也要看新增的核对和纠错负担。错误是否容易被审核人发现?员工是否知道什么时候接管?这些观察能帮助管理者判断,下一步应该调整流程、补充数据,还是扩大自动执行的范围。

每次对外操作都应留下可追溯的记录:使用了哪些获批资料,谁批准了什么,最后实际执行了什么。日志本身也可能包含敏感信息,应按企业的数据制度控制访问、脱敏并约定保留期限。

还要预先确定停止条件。连续出现无法解释的结果、关键资料缺失、费用或操作范围超出约定时,谁有权停用工具?如何回到原有的人工流程?把这些安排写清楚,员工才容易在异常出现时采取行动。

给AI分配工作,也需要重新梳理管理分工

一次智能体试点,会把很多平时分散的问题放到一起。业务部门想提高响应速度,技术团队需要限制系统权限,财务关心支出与审批,员工希望知道自己还要核对哪些内容。管理者需要协调这些要求,并判断自动化带来的收益是否值得相应的投入。

这些问题可以成为管理学习的具体起点。ESCE中国校区的课程体系中,人工智能和大数据基础、机器人与大数据的商业应用,以及研究方法等内容,为理解技术与管理的联系提供了不同视角。可以查看完整课程体系,或了解技术与管理如何协同。

MBA:把分散的管理问题放在一起分析

如果你希望补充综合管理知识,练习从业务、预算和组织协作的角度判断AI项目,可以先了解MBA学习路径,并结合自己的职业阶段评估课程安排。

了解MBA项目路径

DBA:把长期困惑发展为研究问题

如果你已有较丰富的管理经验,想研究人工审核如何影响工作质量,或不同授权方式怎样改变团队协作,可以进一步了解DBA的研究训练。具体课题仍需界定范围、设计方法并获取适当证据。

了解DBA研究路径

如果你正在带领团队尝试AI,也在考虑下一阶段的学习,欢迎与ESCE项目顾问聊聊你的教育背景、管理经历和学习目标,了解MBA/DBA的申请条件、课程安排与学习方式。

预约MBA/DBA申请咨询

录取资格及学习安排以当期正式项目资料和学校审核结果为准。本文不代表Anthropic或OWASP与ESCE存在合作或背书关系。

新闻与技术参考

新闻事实依据原报告整理;客户投诉场景为假设示例,授权、审核与试点安排为本文的管理讨论,实际部署应结合业务、技术及合规要求评估。

把学习目标,
聊得更具体。

如果你正在考虑AI应用中的管理问题与MBA/DBA学习路径,欢迎留下教育背景与项目意向。招生老师将与你确认硕士 MBA、博士 DBA 或硕博连读的申请条件及当期安排。

招生咨询
187 2186 9799
上海教学中心
上海市普陀区长寿路652号F座805(SIFEC法国教育中心)
此表用于申请咨询,不是正式录取申请。录取、课程与费用以学校当期正式资料为准。

申请咨询

联系项目主管

微信扫一扫,咨询课程与申请安排。

项目主管微信二维码,请用微信扫一扫添加

添加时请备注「MBA / DBA 咨询」

ESCE CHINA · ADMISSIONS

获取当期
项目资料

留下联系方式与意向项目,招生老师将结合你的教育背景、管理经历和学习目标说明当期课程与申请要求。

招生电话
187 2186 9799
联系邮箱
admission@esce-edu.com