跳到正文
千机 API
2026 年第 40 周 · 09.28 — 10.04每周一出刊

AI 周报 · 2026 年第 40 周 · 09.28 — 10.04

千机新闻

第 2 期402026 年第 40 周09.28 — 10.04
3件大事3条精选4期日报约 2 分钟读完
本期导读

智能体评测与搜索强化学习

本期覆盖 2026-09-28 至 2026-10-04。入选动态聚焦智能体能力评估、科学计算与搜索优化:Microsoft 与 Hugging Face 推出 ThinkingBox 及其基准,评估重点从回复或工具调用转向任务完成后的数据库终态和副作用;开源工具 BootLoops 面向精确科学计算,资料称其已用于跨领域研究及积分计算;AWS 则以多轮强化学习微调搜索智能体,并在留出测试集上报告检索质量与可靠性指标改善。这些动态分别呈现了评测方式、计算工具和搜索训练上的进展。

01

智能体任务评测

本版导读Microsoft 与 Hugging Face 推出 ThinkingBox 环境及 ThinkingBox-Bench,评估智能体是否真正完成业务工作流。其方法检查任务执行后的数据库终态和副作用,而不只依据回复内容或工具调用记录,为衡量任务结果提供了不同于过程观察的评测视角。

02

科学计算工具

本版导读开源工具 BootLoops 是面向精确科学计算的 harness,源代码已在 GitHub 提供。Matthew Schwartz 称,团队在三个月内跨 18 个领域产出 36 篇手稿;其中 Claude 借助该工具计算了 30 个积分,15 个复现了已知结果。

The Decoder10.03

开源 BootLoops harness 支持 AI 模型进行精确科学计算

开源工具 BootLoops 是用于精确科学计算的 harness,源代码已在 GitHub 提供。Matthew Schwartz 称,团队在三个月内跨 18 个领域产出 36 篇手稿;其中 Claude 借助 BootLoops 计算了 30 个积分,15 个复现已知结果,另 15 个此前首次计算。

03

搜索智能体强化学习

本版导读AWS 使用 Amazon SageMaker AI 进行多轮强化学习,将 Qwen3.6-27B 微调为搜索智能体,并在四个留出测试集上评估检索质量与可靠性。资料报告,微调后 BrowseComp-Plus 的 nDCG@10 提升 23.7%,失败率从 22.89% 降至 0.68%。

AWS Machine Learning Blog一手10.02

AWS 使用 Amazon SageMaker AI 多轮强化学习微调搜索智能体

AWS 使用 Amazon SageMaker AI 多轮强化学习,将 Qwen3.6-27B 微调为搜索智能体,并在四个留出测试集上评估检索质量与可靠性。微调后,BrowseComp-Plus 的 nDCG@10 提升 23.7%,失败率从 22.89% 降至 0.68%;WixQA 和 Wands 的 nDCG@10 也有所提升,FreshStack 则略有下降。

往期 AI 周报
(本期完)

千机新闻 周报由编辑系统根据公开来源自动综合,每条均附原文 · 往期周报