Anthropic 前沿红队发布模型二进制利用能力评估
Anthropic 前沿红队在内部 Binary Exploitation benchmark 的 100 个随机任务上评估了多个模型。结果显示 GLM-5.3 在 4% 的试验中实现了完全的控制流劫持,而 Claude Mythos Preview 的比例为 6%,表明早期模型未达到的阈值已被跨越。
Anthropic 前沿红队在内部 Binary Exploitation benchmark 的 100 个随机任务上评估了多个模型。结果显示 GLM-5.3 在 4% 的试验中实现了完全的控制流劫持,而 Claude Mythos Preview 的比例为 6%,表明早期模型未达到的阈值已被跨越。