AI 周报 · 2026 年第 40 周 · 09.28 — 10.04
千机新闻
智能体评测与搜索强化学习
本期覆盖 2026-09-28 至 2026-10-04。入选动态聚焦智能体能力评估、科学计算与搜索优化:Microsoft 与 Hugging Face 推出 ThinkingBox 及其基准,评估重点从回复或工具调用转向任务完成后的数据库终态和副作用;开源工具 BootLoops 面向精确科学计算,资料称其已用于跨领域研究及积分计算;AWS 则以多轮强化学习微调搜索智能体,并在留出测试集上报告检索质量与可靠性指标改善。这些动态分别呈现了评测方式、计算工具和搜索训练上的进展。
智能体任务评测
本版导读Microsoft 与 Hugging Face 推出 ThinkingBox 环境及 ThinkingBox-Bench,评估智能体是否真正完成业务工作流。其方法检查任务执行后的数据库终态和副作用,而不只依据回复内容或工具调用记录,为衡量任务结果提供了不同于过程观察的评测视角。
Microsoft与Hugging Face推出ThinkingBox智能体评测环境与基准
Microsoft与Hugging Face推出ThinkingBox及ThinkingBox-Bench,通过检查智能体执行任务后的数据库终态和副作用,而非只看回复或工具调用,评估其完成业务工作流的情况。
科学计算工具
本版导读开源工具 BootLoops 是面向精确科学计算的 harness,源代码已在 GitHub 提供。Matthew Schwartz 称,团队在三个月内跨 18 个领域产出 36 篇手稿;其中 Claude 借助该工具计算了 30 个积分,15 个复现了已知结果。
开源 BootLoops harness 支持 AI 模型进行精确科学计算
开源工具 BootLoops 是用于精确科学计算的 harness,源代码已在 GitHub 提供。Matthew Schwartz 称,团队在三个月内跨 18 个领域产出 36 篇手稿;其中 Claude 借助 BootLoops 计算了 30 个积分,15 个复现已知结果,另 15 个此前首次计算。
搜索智能体强化学习
本版导读AWS 使用 Amazon SageMaker AI 进行多轮强化学习,将 Qwen3.6-27B 微调为搜索智能体,并在四个留出测试集上评估检索质量与可靠性。资料报告,微调后 BrowseComp-Plus 的 nDCG@10 提升 23.7%,失败率从 22.89% 降至 0.68%。
AWS 使用 Amazon SageMaker AI 多轮强化学习微调搜索智能体
AWS 使用 Amazon SageMaker AI 多轮强化学习,将 Qwen3.6-27B 微调为搜索智能体,并在四个留出测试集上评估检索质量与可靠性。微调后,BrowseComp-Plus 的 nDCG@10 提升 23.7%,失败率从 22.89% 降至 0.68%;WixQA 和 Wands 的 nDCG@10 也有所提升,FreshStack 则略有下降。