Anthropic 推出 Fable 5.1,设反蒸馏机制封堵 API 漏洞
42 分钟前

9月2日,Anthropic发布了Claude Fable 5.1,并引入了史上最严格的反蒸馏机制。该机制通过上下文一致性验证来锁定“思考块”,若客户端返回的思考块与生成时的系统提示、工具和历史消息不一致,API将直接报错。合法开发者若需修改上下文,可选择“非严格模式”,但系统会删除思考块。非法蒸馏已形成工业级规模,黑客利用虚假账户、自动化脚本和上下文注入等手段,窃取顶尖模型的推理逻辑,训练出无安全护栏的小模型,导致AI能力与安全脱钩的风险增加,这是Anthropic出台新规的主要原因。新规将分阶段执行,首先针对2026年8月31日12:00:00 AM UTC后创建的新API账户,现有API账户和消费端普通用户不受影响。受影响的开发者需保持上下文绝对一致或启用非严格模式调整代码逻辑,未来该机制将覆盖所有账户。此外,新规通过强制上下文一致性,提高了提示词缓存命中率,降低了合法开发者的API调用成本,并提升了响应速度。此次新规被视为AI行业的分水岭,将大幅压缩非法蒸馏小模型的生存空间。

简体中文 English