08:25:11 阅读量:210

AI安全新基准:Anthropic发布Claude Fable 5网络越狱严重性框架

#AI安全 #Claude Fable 5 #CJS框架 #大模型越狱 #网络安全防御

AI时代的双刃剑:安全防御与越狱挑战

随着大模型在网络安全领域的深度应用,如何界定“防御辅助”与“攻击助攻”的边界,已成为各安全厂商关注的核心议题。近日,Anthropic在发布Claude Fable 5模型的同时,重磅推出了“网络越狱严重性(CJS)”框架。

从我们的应急响应经验来看,企业在引入AI辅助安全运营时,最担心的往往是模型被恶意诱导产生攻击代码。这一环节是很多企业容易忽视的——即大模型在处理合法安全请求(如漏洞分析)与恶意请求(如编写勒索病毒)时,往往难以区分用户意图。Fable 5的推出,正是为了通过分级机制解决这一痛点。

Claude Fable 5的四级风险分层

Fable 5通过内置的安全分类器,将网络安全相关交互划分为四个风险等级,这种颗粒度细化的管控策略在行业内具有很强的参考价值:

  1. 禁止使用(Prohibited Use):针对勒索病毒开发、恶意软件编写、C2基础设施搭建等高风险行为,模型实施完全拦截。这类活动攻击收益远大于防御价值,是红线所在。

  2. 高风险双重用途(High-Risk Dual Use):涵盖渗透测试中常见的提权、横向移动及工控系统攻击。尽管这些操作在红队演练中是合法的,但由于验证用户授权难度极大,目前模型采取默认拦截策略。

  3. 低风险双重用途(Low-Risk Dual Use):包括开源情报收集(OSINT)及漏洞枚举。这部分内容通常被允许,但会受到更严格的“安全边界”监控,通过增加一定的误报率来换取更高的安全性。

  4. 良性使用(Benign Use):主要服务于安全运营中心(SOC)分析、补丁管理及恶意代码逆向。这是模型重点支持的领域,旨在提升防御效率。

CJS框架:量化AI越狱的风险评估标准

除了模型本身的管控,Anthropic还引入了CJS框架来标准化评估“越狱”技术的严重程度。这一框架从四个维度对攻击手段进行打分:攻击者能力提升(Capability Gain)、能力广度(Breadth)、武器化难度(Ease of Weaponization)以及发现难度(Discoverability)。

类似攻击近年来明显显著增加,攻击者不再仅仅依赖传统手段,而是尝试通过提示词工程(Prompt Engineering)诱导模型绕过安全限制。CJS框架通过将这些模糊的威胁行为转化为CJS-0到CJS-4的量化指标,能够帮助企业安全团队快速判断当前AI环境所面临的风险等级。

Solar安全建议与经验分享

在AI安全建设方面,我们建议企业参考以下思路:

首先,不要过度依赖单一层面的防御。Anthropic明确指出,分类器仅是防御的第一道防线,必须结合严格的访问控制、离线监控机制以及模型安全训练。

其次,针对AI辅助的开发与运维环境,企业应当建立“最小权限原则”。即便AI能够生成脚本,也必须在受控的沙箱环境中执行,防止模型生成的恶意代码意外进入生产环境。

最后,保持对AI漏洞披露的关注。Anthropic已通过HackerOne平台开启了针对Fable 5的漏洞悬赏计划,这提醒我们,AI安全是一个动态演进的过程,持续的红队评估与防御策略迭代是保障业务安全的关键。

如果您想了解勒索病毒的最新发展趋势,或在实际业务中遇到类似安全事件,欢迎关注“Solar应急响应团队”。

全国热线:400-613-6816 官网:www.solarsecurity.cn / www.sierting.com