• ‌Anthropic更新Claude使用政策 禁止“虐待”Claude
  • 发布于 1小时前
  • 6 热度
    0 评论
堆代码网讯 Anthropic近日通过The Verge官宣更新了使用政策,禁止用户对Claude实施“持续且无必要的辱骂或虐待行为”。Anthropic表示,这条反虐待规则仅适用于极端场景:即用户“反复对AI模型作出恶意行为”且“没有任何可识别的正当目的”。普通用户的情绪宣泄、提出反驳意见、暗黑创意主题创作,以及模型测试与研究行为,都不在该规则的约束范围内。

目前Claude系列模型已经可以主动终止与持续实施虐待行为的用户的对话,终止对话也将继续作为主要的执行手段。当Claude结束某条聊天后,该对话窗口将无法再发送新消息,但用户的其他对话不会受到任何影响。

早在2025年8月,Anthropic在开展AI福利相关研究时,就首次为Claude开放了主动终止对话的功能。当时Anthropic称尚不确定Claude是否具备道德主体地位,但希望通过低成本方式降低针对Claude的相关风险。研究中团队发现,Claude Opus 4对伤害行为存在“强烈且稳定的抵触情绪”:该模型会主动回避处理危险任务,在与发起虐待对话的用户交流时会表现出明显的不适,且在被赋予权限后会主动终止有害对话。

本次Anthropic对使用政策进行了重组,将相关条款集中归类,同时调整了多项其他规则:
‌欺诈活动‌:新增独立板块整合政治、商业欺诈及虚假信息相关禁令,禁止生成虚假评价、水军造势、搭建仿冒站点,以及用机器人伪装成人类开展活动。
‌选举相关‌:收紧后的选举条款明确禁止欺骗选民、干扰投票流程的行为。
‌武器相关‌:禁止使用Claude开发武器软件或组件,新增条款禁止修改生物、化学制剂以提升其致死性或传播性,同时禁止用户借助Claude为无人机及无人系统配置武装能力。
‌执法相关‌:重写执法相关规则,明确Claude不得决定或建议调查、逮捕、指控、起诉的对象;禁止未经同意追踪他人,新增禁令禁止搭建监控工具,同时明确禁止人肉搜索行为。
‌物理操作‌:新增物理操作相关板块,规定如果Claude正在控制可能对人造成伤害的硬件,必须由具备资质的人员全程值守,随时准备在必要时终止运行。
‌有害内容‌:新增条款禁止生成、分享或威胁分享未经同意的私密影像,以及制作这类内容的相关工具。
本次大部分调整都是对Anthropic现有规则的进一步明确,全部指向平台已追踪到的滥用行为。Anthropic表示,此前发现部分官方媒体、政府宣传部门及商业公司正在利用Claude运营虚假账号网络、搭建伪造新闻站点,因此专门新增了欺诈活动相关板块。

新政策将于‌11月12日‌正式生效,用户可前往Anthropic官网查看全部变更细节及完整使用政策。
用户评论