AI 日报 · 2026 年 10 月 8 日 · 星期四
千机新闻
OpenAI发布372项AI生成数学结果
OpenAI将内部AI模型生成的372项数学结果发布到GitHub,称其涉及开放问题或实质进展,许多证明附有可由Lean机器检查的形式化版本。Mistral推出Mistral Large 4公测预览版,Reflection则发布从头训练的501B-A23B开源模型;GitHub推出评估AI代码审查智能体的开放基准ReviewBench。
模型发布/更新
Mistral 发布 Mistral Large 4 公测预览版
Mistral 推出 Mistral Large 4 公测预览版,这是一款 1 trillion-parameter 原生多模态模型,拥有 49 billion active parameters。用户可通过 Mistral Studio 试用预览 API,模型权重计划于本月底发布。文章列出其在编码、智能体工作流、多模态理解和网络安全等方面的评测结果,并介绍模型在欧洲数据中心训练及部署。
Reflection 发布 Beam:501B-A23B 美国开源模型
Reflection 发布 Beam,这是一款面向编码、智能体和科学工作的纯文本 MoE 模型,总参数量为 501B、激活参数量为 23B,并从头训练。Reflection 称其预训练使用了 23.8T tokens,报告 SWE-bench Verified 得分为 80.9;完整权重预计本月以 Apache 2.0 发布。
论文研究
OpenAI在GitHub发布372项AI生成的数学结果
OpenAI将内部AI模型生成的372项数学结果发布到GitHub,每项据称解决了一个开放问题或取得实质进展。平均每项结果消耗约3小时ChatGPT Pro Thinking算力,许多证明附有可由Lean机器检查的形式化版本。Lean可核验逻辑正确性,但不能判断结果的数学相关性或原创性,数学界对这批结果的意义看法不一。
Google Research介绍Earth AI地理空间基础模型PDFM在全球公共卫生中的应用
Google Research介绍如何将Earth AI的Population Dynamics Foundation Model(PDFM)地点嵌入接入现有公共卫生与流行病学工作流,并在五类健康挑战中进行评估。
GitHub推出ReviewBench开放基准评测AI代码审查
GitHub推出开放的AI代码审查离线基准ReviewBench,用于评估和比较代码审查智能体。基准包含219个来自187个公开开源许可仓库的PR,覆盖19种语言,其语言和仓库规模分布参照103.9M个GitHub PR;资深工程师复核结果的一致率为96.6%。GitHub称,在一项Copilot代码审查实验中,ReviewBench的离线预测与线上A/B测试变化方向一致。