Simon Willison·· 3 天前AI 评分66
Simon Willison 引述 Anthropic Frontier Red Team 对 GLM-5.3 网络能力的评估
Quoting Anthropic Frontier Red Team
AI 导读
Anthropic Frontier Red Team 在内部 Binary Exploitation 基准的 100 项随机任务中评估多个模型,GLM-5.3 在 4% 的测试中实现完整控制流劫持,Claude Mythos Preview 为 6%。Claude Opus 4.6 和 GLM-5.2 在这些任务中均未成功。
来源:Simon Willison · simonwillison.net