Anthropic生物武器过滤器曾失效近一年,涉及1.33亿次对话

IT之家8月16日消息,Anthropic 于当地时间8月14日发布的最新安全报告显示,该公司用于拦截化学、生物武器相关危险请求的部分安全分类器曾出现长期失效。 这直接导致2025年5月至2026年4月期间,外部承包商提供人工反馈时产生的大量请求未经过滤。Anthropic 表示,内部调查目前没有发现相关请求被实际用于滥用的证据。 根据 Anthropic 公开的安全机制说明,其实时提示词和输出分类器会分析用户输入以及模型生成内容,并在识别到相关风险时阻止模型提供可能用于实施危险行为的信息。据IT之家所知,该机制属于 Anthropic 针对化学、生物、放射性及核武器(CBRN)风险所设置的多层安全措施之一。 此次暴露的问题涉及 Anthropic 外部承包商。报告显示,大约5万名承包商在相关时间段内产生了约1.33亿次与模型的对话,而这些流量在近一年时间里没有经过相关生物安全分类器的拦截。 Anthropic 称,这些承包商主要由外部供应商负责审核,其筛查流程存在不足。公司随后展开内部调查,并表示没有发现这些请求被用于实际滥用的证据。因此,Anthropic 已经提高了对外部承包商的相关要求。 Anthropic 此前已经将生物安全防护纳入其 AI 安全体系。2025年5月,公司在 Claude Opus 4发布时启用 AI 安全等级3(ASL-3)防护措施,其中包括针对化学、生物、放射性及核武器开发或获取风险的部署限制。 按照 Anthropic 现行的负责任扩展政策,实时提示词和输出分类器会持续监测模型输入与输出,并根据不断发现的有害模式、越狱方法和混淆技术进行更新。公司还将红队测试、漏洞赏金计划以及离线监测等机制作为补充安全措施。 2026年7月,Anthropic 公布 Claude Fable 5相关安全措施时也再次强调了生物和化学领域的风险。公司表示,Fable 5的底层能力达到一定水平后,可能为恶意行为者提供额外帮助,因此需要使用分类器限制相关请求。 Anthropic 同时承认,过于严格的安全分类器可能误伤正常科研活动。对于 Fable 5,目前涉及生物和化学领域的大量请求会被转交给 Claude Opus 4.8处理,公司计划随着安全机制改进逐步缩小限制范围。 目前,Anthropic 表示已经根据调查结果加强外部承包商的筛查和管理要求。公司公开的负责任扩展政策也显示,其正在持续调整针对化学、生物武器等高风险领域的安全防护标准。

本页 /producttag/naturalindigo/

查看更多内容 更多最新文章 相关栏目

淘宝频道

淘宝频道:本文聚合淘宝相关资讯语音提问能理解口语说法,懒得打字时很友好。会区分科普简化模型和专业表述,提醒别过度脑补。概念关系图帮助把术语放到网络里,不再孤立背词。求知从情绪慢慢变成方法,转变安静,但对人影响很大。语言通俗,但没有把科学讲成尴尬段子,分寸拿得住。作为主力科普入口长期留下很合适。

关键词:淘宝,扒开 让我 蓝莓视频网站,女人和猪发生性后肚子变大的原因