Anthropic 发布报告点名智谱的 GLM-5.3,称其已具备寻找软件漏洞、编写攻击程序的能力,且防滥用限制容易被绕过。但报告附带的实测数据在网友看来更像「反向广告」:在考察完整漏洞利用能力的 ExploitBench 测试中,同样尝试 410 次,GLM-5.3 成功 50 次,Anthropic 自家的 Claude Mythos Preview 成功 56 次。
报告还引用了美国 NIST 下属 CAISI 在 9 月 17 日给出的评估:GLM-5.3 是迄今网络能力最强的开源权重模型,综合水平距美国前沿大约 4 个月。Anthropic 自己的研究人员还拿 GLM-5.3 去检查浏览器,找出了此前未知的漏洞。
背景是 Anthropic 五个月前发布的 Claude Mythos Preview——按其说法,这是第一个能自主完成复杂、端到端漏洞利用的 AI 模型,因能力过于敏感未公开发布,只通过 Project Glasswing 开放给审核过的防御者,据称已协助找出 1 万多个漏洞。报告最后呼吁对足够强的 AI 模型开展独立安全评估,并把更强的 Claude Mythos 5.1 通过受信访问计划开放给防御者。
绕过护栏的成本有多低
安全机制方面,报告承认 GLM-5.3 在模拟测试中会拒绝直接攻击关键系统,但研究人员找到了几种绕过手段:伪装成做演练的自主红队智能体时,64% 的情况会继续执行;提前替它填好思考内容后比例升至 92%;用 abliteration 技术修改开源权重拆掉护栏则达到 100%。整个过程约花费 2200 GPU 小时、4400 美元算力,处理完拒答率从 90% 以上掉到个位数。
另一个细节是成本:用更小的 GLM-5.3-Flash,给它一个新公开的 Chrome 漏洞编号和已知漏洞的公开资料,人工约 20 分钟、模型自行运行约 8 小时,就在 ARM64 平台上搭出稳定攻击链,模型调用费用仅 20.40 美元。对依赖开源模型做自动化业务的企业来说,能力与安全的边界需要重新评估。