NEWS / ARCHIVE · 其他 AI 动态

AIHOT ARCHIVE

Anthropic 自曝安全漏洞:生物武器过滤器曾失效近一年,涉及 1.33 亿次对话。

AIHOT 于 2026-08-16 收录了“Anthropic 自曝安全漏洞:生物武器过滤器曾失效近一年,涉及 1.33 亿次对话”这一公开动态。以下先呈现从来源页面抓取的正文,再给出 AIHOT 摘要与 TopoReduce 编辑解读。

PUBLIC SOURCE CONTENT

公开原文内容

已抓取公开正文

Anthropic 自曝安全漏洞:生物武器过滤器曾失效近一年,涉及 1.33 亿次对话 - IT之家

IT之家 8 月 16 日消息,Anthropic 于当地时间 8 月 14 日发布的最新安全报告显示,该公司用于拦截化学、生物武器相关危险请求的部分安全分类器曾出现长期失效。
这直接导致 2025 年 5 月至 2026 年 4 月期间,外部承包商提供人工反馈时产生的大量请求未经过滤。Anthropic 表示,内部调查目前没有发现相关请求被实际用于滥用的证据。

根据 Anthropic 公开的安全机制说明,其实时提示词和输出分类器会分析用户输入以及模型生成内容,并在识别到相关风险时阻止模型提供可能用于实施危险行为的信息。据IT之家所知,该机制属于 Anthropic 针对化学、生物、放射性及核武器(CBRN)风险所设置的多层安全措施之一。
此次暴露的问题涉及 Anthropic 外部承包商。报告显示,大约 5 万名承包商在相关时间段内产生了约 1.33 亿次与模型的对话,而这些流量在近一年时间里没有经过相关生物安全分类器的拦截。
Anthropic 称,这些承包商主要由外部供应商负责审核,其筛查流程存在不足。公司随后展开内部调查,并表示没有发现这些请求被用于实际滥用的证据。因此,Anthropic 已经提高了对外部承包商的相关要求。
Anthropic 此前已经将生物安全防护纳入其 AI 安全体系。2025 年 5 月,公司在 Claude Opus 4 发布时启用 AI 安全等级 3(ASL-3)防护措施,其中包括针对化学、生物、放射性及核武器开发或获取风险的部署限制。
按照 Anthropic 现行的负责任扩展政策,实时提示词和输出分类器会持续监测模型输入与输出,并根据不断发现的有害模式、越狱方法和混淆技术进行更新。公司还将红队测试、漏洞赏金计划以及离线监测等机制作为补充安全措施。
2026 年 7 月,Anthropic 公布 Claude Fable 5 相关安全措施时也再次强调了生物和化学领域的风险。公司表示,Fable 5 的底层能力达到一定水平后,可能为恶意行为者提供额外帮助,因此需要使用分类器限制相关请求。
Anthropic 同时承认,过于严格的安全分类器可能误伤正常科研活动。对于 Fable 5,目前涉及生物和化学领域的大量请求会被转交给 Claude Opus 4.8 处理,公司计划随着安全机制改进逐步缩小限制范围。
目前,Anthropic 表示已经根据调查结果加强外部承包商的筛查和管理要求。公司公开的负责任扩展政策也显示,其正在持续调整针对化学、生物武器等高风险领域的安全防护标准。
相关阅读:

- 《Anthropic 发布 AI 风险报告:旗下智能体会攻击同类并隐藏自身违规痕迹》

- 《Anthropic:第三方评估环境配置失误,导致三起真实网络安全事件》

AIHOT 摘要

Anthropic 最新安全报告显示,其用于拦截化学、生物武器相关危险请求的部分安全分类器在 2025 年 5 月至 2026 年 4 月期间长期失效,约 5 万名外部承包商产生的 1.33 亿次对话未经过滤。内部调查未发现相关请求被实际用于滥用的证据,公司已加强外部承包商筛查要求。

为什么值得关注

安全报告披露分类器失效近一年,涉及1.33亿次承包商对话,将安全机制过度依赖人工筛查的隐患转化为具体管理缺口。

工程化解读

从 TopoReduce 的工程视角看,这条信息属于“其他 AI 动态”主题。它的价值不只在于一个新产品或新观点本身,还在于说明 AI 系统正在如何影响模型接入、智能体协作、研发流程、基础设施和团队决策。实际采用前,应结合原文确认版本、适用范围、价格和运行条件。

  • 发布时间:2026-08-16;AIHOT 分类:其他 AI 动态。
  • AIHOT 标签:Anthropic安全/对齐
  • AIHOT 判断:安全报告披露分类器失效近一年,涉及1.33亿次承包商对话,将安全机制过度依赖人工筛查的隐患转化为具体管理缺口。
  • AIHOT 评分:59;评分用于站内排序,不等同于独立评测结论。

TopoReduce 编辑观察

当 AI 动态进入真实生产环境,团队需要同时关注能力边界、数据来源、调用成本、权限控制和可回滚性。把单条新闻放回完整工程链路中阅读,比只看标题更有助于判断它是否适合自己的产品和工作流。

来源链路AIHOT 条目:Anthropic 自曝安全漏洞:生物武器过滤器曾失效近一年,涉及 1.33 亿次对话公开原文:Anthropic 自曝安全漏洞:生物武器过滤器曾失效近一年,涉及 1.33 亿次对话 - IT之家
← 返回全部文章News 首页 →

把 AI 动态放回工程现场。

了解 TopoReduce 的模型路由、工具集成和研发自动化能力。

建立合作连接