Mercor 研究显示 AI 记账任务表现超越会计师,但仍需监督
Mercor 的研究发现,AI 模型在简化的结构化记账任务上速度更快、准确率更高且成本更低,但仍无法在无需监督的情况下完成结账。研究中,12 名持证注册会计师完成 APEX Accounting Benchmark 的简化任务;完整基准包含 10 家模拟公司、160 项任务。
Mercor 的研究发现,AI 模型在简化的结构化记账任务上速度更快、准确率更高且成本更低,但仍无法在无需监督的情况下完成结账。研究中,12 名持证注册会计师完成 APEX Accounting Benchmark 的简化任务;完整基准包含 10 家模拟公司、160 项任务。
Anthropic Frontier Red Team 在内部 Binary Exploitation 基准的 100 项随机任务中评估多个模型,GLM-5.3 在 4% 的测试中实现完整控制流劫持,Claude Mythos Preview 为 6%。Claude Opus 4.6 和 GLM-5.2 在这些任务中均未成功。
Basis 使用 GPT-6 Astra 完成一份 50 个标签页的税务工作簿,速度比 GPT-5.6 Sol 快 2 倍。GPT-6 Astra 对用户意图的理解更强,让 Basis 对其在真实场景中的使用更有信心。
宝玉测试并分析了 Caveman 电报体 Skill:JetBrains 使用 Claude Code 执行 SkillsBench 中的 86 个真实编程任务,强制 Skill 每次回复生效后,输出 Token 仅减少 8.5%,低于项目宣传的 65%。