Simon Willison 引述 Anthropic Frontier Red Team 对 GLM-5.3 网络能力的评估
Anthropic Frontier Red Team 在内部 Binary Exploitation 基准的 100 项随机任务中评估多个模型,GLM-5.3 在 4% 的测试中实现完整控制流劫持,Claude Mythos Preview 为 6%。Claude Opus 4.6 和 GLM-5.2 在这些任务中均未成功。
Anthropic Frontier Red Team 在内部 Binary Exploitation 基准的 100 项随机任务中评估多个模型,GLM-5.3 在 4% 的测试中实现完整控制流劫持,Claude Mythos Preview 为 6%。Claude Opus 4.6 和 GLM-5.2 在这些任务中均未成功。
宝玉测试并分析了 Caveman 电报体 Skill:JetBrains 使用 Claude Code 执行 SkillsBench 中的 86 个真实编程任务,强制 Skill 每次回复生效后,输出 Token 仅减少 8.5%,低于项目宣传的 65%。