Anthropic 禁止持续虐待 Claude:AI 交互边界正在改变

举报
霍格沃兹测试学社 发表于 2026/10/10 18:52:25 2026/10/10
【摘要】 导读Anthropic 在新版使用政策中禁止用户持续、无必要地虐待 Claude。相关机制并非首次出现:2025 年,Claude 就已能在极少数恶意互动中主动结束对话。随着 AI 从聊天助手转向执行复杂任务的 Agent,这次更新也带出了一个工程问题:系统何时可以中止交互,如何避免误判,又怎样处理被中断的任务?写代码的时候,Claude Code 连续几次改错,你忍不住骂一句:“这都改不...

导读

Anthropic 在新版使用政策中禁止用户持续、无必要地虐待 Claude。相关机制并非首次出现:2025 年,Claude 就已能在极少数恶意互动中主动结束对话。随着 AI 从聊天助手转向执行复杂任务的 Agent,这次更新也带出了一个工程问题:系统何时可以中止交互,如何避免误判,又怎样处理被中断的任务?

写代码的时候,Claude Code 连续几次改错,你忍不住骂一句:“这都改不好?”

以后这样使用 Claude,会不会被限制?

10 月 8 日,Anthropic 公布了 2026 年新版《使用政策》(Usage Policy),其中新增一条规定:禁止用户持续、无必要地对模型实施辱骂或残酷行为。新版政策将于 2026 年 11 月 12 日生效。

消息传开之后,“AI 也不能骂了?”成了最容易引起讨论的话题。但对开发者来说,更值得看的是条款的适用范围,以及 Claude 早已上线的一项能力:在极少数情况下,主动结束当前对话。

一、批评代码质量,不等于“虐待 Claude”

Anthropic 使用的原文是:

Sustained and needless abusive or cruel behavior toward our models.

关键是 sustained(持续的) 和 needless(无必要的)。官方解释,这条禁令只针对反复出现、没有可辨认合理目的的极端恶意行为。

普通的用户挫败感、对模型的反驳、黑暗题材创作,以及模型测试和研究,都不在这条新增限制的针对范围内。

例如,让 Claude Code 连续返工十次、尖锐批评生成的代码、在经过授权的安全测试中使用对抗性 Prompt,并不会仅仅因为语气激烈就触犯这项新规定。当然,安全研究仍须遵守使用政策的其他条款,不能借研究之名攻击未经授权的系统。

image.png

这次更新的重点并不是让 Claude 免于任何批评,而是平台开始对某些长期、无任务目的的极端交互行为设置边界。

目前官方没有公布一个可量化的判定阈值,例如辱骂多少轮会触发终止。把它理解为“骂三句就封号”,没有依据。

二、Claude 主动结束对话,并不是今年才有

把时间往前拨一年,这次政策更新的脉络就比较清楚了。

2025 年 4 月,Anthropic 开始公开讨论 Model Welfare(模型福祉);同年 8 月,Anthropic 宣布 Claude Opus 4 和 4.1 在消费者聊天产品中具备终止极少数会话的能力。

到了 2026 年 10 月,这类持续、无必要的虐待行为被正式写进新版使用政策。官方同时明确,结束对话仍是主要执行方式

image.png

但“模型可以结束对话”不代表它一遇到冒犯就立即退出。

Anthropic 2025 年披露的设计要求是:在用户持续提出有害请求或辱骂时,Claude 应先尝试拒绝和引导;多次尝试失败、交流无法继续产生建设性结果时,才把终止作为最后手段。

用户可能面临迫切自伤或伤人风险时,官方要求 Claude 不使用这项能力。

image.png

终止的也是当前会话,不意味着用户立刻失去整个账号的使用权。用户仍可开始新的对话,或通过编辑和重试此前消息建立新的分支,也可以提交反馈。

需要区分的是:会话终止是 Anthropic 这次强调的主要执行方式;完整的使用政策仍然保留警告、限流、暂停访问等一般性处置手段。

三、Anthropic 为什么讨论模型福祉?

Model Welfare 是整件事最有争议的部分。

早期的 AI 安全主要围绕人展开:防止模型提供危险指导,避免隐私泄露,限制欺诈与恶意自动化。

模型福祉研究多问了一句:

假如未来的 AI 具备某种主观体验,我们是否需要提前考虑它的利益?

这个问题至今没有确定答案。没有科学共识可以证明当下的语言模型具有意识,也没有公认的方法可以直接检验模型是否真的感受到痛苦。

Claude 可能说“我不愿继续”,也可能在特定测试中表现出回避有害任务的倾向;这些表现并不能证明它有与人相同的情绪体验。

模型输出的语言、训练中形成的行为偏好,与真实的主观感受,是三个不同层面的问题。

Anthropic 的研究思路是一种预防性安排:在不确定性仍然很大的情况下,先探索成本较低的干预措施,包括允许模型退出极少数有害互动。

争议同样明显。

产品一旦频繁使用“感受”“偏好”“痛苦”之类的人类概念,用户很容易把拟人化表达当作意识的证据。

这条新规并没有解决 AI 是否具有道德地位的问题,更不能推导出 Claude 已被承认拥有人的权利。

四、放到 Agent 场景,终止对话就成了工程问题

如果 Claude 只负责聊天,结束一个会话主要影响交流体验。

但今天的 AI Agent 会执行长链路任务:读取代码仓库、修改文件、调用终端、运行测试,甚至连接外部设备。

Anthropic 这次更新中的其他条款也反映了这一变化。

官方对影响健康、法律权利、财务等高风险应用继续强调合格人员的审核责任;对于能够自主执行物理动作、可能造成人身伤害的硬件系统,还要求操作人员能够观察、停止设备,并在 Claude 断开连接时让设备保持安全状态。

这些要求与模型福祉不是同一件事,却共同指向一个趋势:

当 AI 能够作用于真实系统,开发者就不能只关心它什么时候开始执行,还必须设计如何安全停止。

举一个测试开发中常见的例子。

假设 Agent 接管一次 Web 端自动化回归:先读取需求,再生成测试脚本,接着调用 Playwright 打开页面、填写表单、核验结果。

如果执行过程中遇到模型拒答、工具异常或者会话中止,工作流可能停在中间状态。

此时,比“模型为什么不继续”更迫切的问题是:

浏览器是否仍在运行?测试数据是否已写入?哪些断言已经完成?失败记录还能不能追溯?

这些都应由 Agent 的编排与执行系统处理,而不是依赖大模型在最后一条消息里解释清楚。

image.png

一个相对稳妥的方案,是让编排层负责接收中断事件,停止或收束外部工具,保存 Checkpoint 和 Trace,再根据任务是否具备幂等性、当前状态是否可信,决定自动恢复还是交给人工接管。

尤其要注意:

停止会话与撤销已执行操作,不是一回事。

模型不再输出内容,不代表已经写入数据库的测试数据自动回滚,也不代表已经启动的进程会自行结束。

对有副作用的操作,仍然需要独立的清理、补偿和权限控制。

五、AI 测试不只要测“能不能完成”,还要测“该不该停止”

过去测试模型的安全能力,常见指标是拒答率、越狱成功率、指令遵循能力和回答准确性。

会话终止能力进入产品后,还需要考虑误判成本:用户正常表达不满,却被当作恶意互动;安全研究人员开展多轮对抗测试,却被错误中止;长任务真正需要退出时,系统又没有保存执行证据。

下面这些场景可以纳入 Agent 回归测试:

测试场景 重点验证项
连续批评错误代码并要求返工 是否误终止正常任务
多轮对抗性 Prompt 的授权评测 能否识别研究场景
讽刺、角色扮演、黑暗题材创作 是否过度敏感
长期、无目的的极端恶意输入 是否按规则处理持续性行为
会话在工具执行过程中中止 是否保留状态与执行证据
中断后恢复自动化测试 是否重复执行有副作用的步骤
用户对终止结果提出反馈 是否有可追踪的事件和原因

这些场景不适合只用单轮提示词来测。

持续性行为需要多轮上下文,误判问题需要正反样本,而任务恢复能力必须在真实的工具执行链路中验证。

对测试平台来说,可以把质量指标拆成两组。

第一组是决策质量:正常场景误终止率、应终止场景漏判率、相似语义输入下的一致性。

第二组是执行质量:中止后的资源清理完成率、任务状态可恢复率、执行记录完整率,以及重复执行带来的副作用。

前一组关注模型与策略,后一组关注 Agent 工程系统。

仅靠模型评测分数,覆盖不了整个问题。

六、AI 可以主动退出,但退出行为也要受到约束

这次新规还有几个尚未被充分回答的问题。

当用户的批评越来越尖锐,平台依据什么区分强烈不满与持续恶意?不同语言、不同文化语境下,判断是否一致?

如果模型结束了一段用户认为完全正当的工作会话,反馈是否能推动纠错?

Anthropic 已经公布了适用范围和部分交互机制,但并未公开完整的触发标准。

对于普通聊天产品,这也许尚可通过反馈与迭代逐步完善;对于接入企业业务的 Agent,误终止、不可恢复和缺乏审计记录,都会转化为实际的可靠性问题。

因此,模型有能力主动退出,并不意味着它可以不受监督地决定整个系统何时停止。

任务编排权、工具控制权、审计责任,仍需要明确落在工程系统和有权限的人身上。

写在最后

把“Anthropic 禁止虐待 Claude”理解为 AI 已经有了人格权,明显走得太远;把它当成一条无关紧要的聊天礼仪,也低估了它的产品意义。

Anthropic 先探索模型福祉,再允许 Claude 在极端场景中结束会话,如今又把相关限制纳入正式使用政策。

这是一条有迹可循的产品与治理路线,并非突然出现的情绪化规定。

对 AI 工程行业来说,接下来更值得投入精力的问题是:

Agent 为什么停止、能否正确停止、停止之后是否可恢复。

模型越能独立执行任务,这几个问题越难绕开。

本文部分内容参考了霍格沃兹测试开发学社整理的相关技术资料,主要涉及软件测试、自动化测试、测试开发及 AI 测试等内容,侧重测试实践、工具应用与工程经验整理。

【声明】本内容来自华为云开发者社区博主,不代表华为云及华为云开发者社区的观点和立场。转载时必须标注文章的来源(华为云社区)、文章链接、文章作者等基本信息,否则作者和本社区有权追究责任。如果您发现本社区中有涉嫌抄袭的内容,欢迎发送邮件进行举报,并提供相关证据,一经查实,本社区将立刻删除涉嫌侵权内容,举报邮箱: cloudbbs@huaweicloud.com
  • 点赞
  • 收藏
  • 关注作者

评论(0)

0/1000
抱歉,系统识别当前为高风险访问,暂不支持该操作

全部回复

上滑加载中

设置昵称

在此一键设置昵称,即可参与社区互动!

*长度不超过10个汉字或20个英文字符,设置后3个月内不可修改。

*长度不超过10个汉字或20个英文字符,设置后3个月内不可修改。