跳到正文
千机 API
2026 年 10 月 8 日 · 星期四每天 08:00 出刊

AI 日报 · 2026 年 10 月 8 日 · 星期四

千机新闻

第 7 期082026 年 10 月星期四
5件大事5个来源3件一手发布2个新模型约 3 分钟读完
头条

OpenAI发布372项AI生成数学结果

OpenAI将内部AI模型生成的372项数学结果发布到GitHub,称其涉及开放问题或实质进展,许多证明附有可由Lean机器检查的形式化版本。Mistral推出Mistral Large 4公测预览版,Reflection则发布从头训练的501B-A23B开源模型;GitHub推出评估AI代码审查智能体的开放基准ReviewBench。

01

模型发布/更新

Mistral AI一手

Mistral 发布 Mistral Large 4 公测预览版

Mistral 推出 Mistral Large 4 公测预览版,这是一款 1 trillion-parameter 原生多模态模型,拥有 49 billion active parameters。用户可通过 Mistral Studio 试用预览 API,模型权重计划于本月底发布。文章列出其在编码、智能体工作流、多模态理解和网络安全等方面的评测结果,并介绍模型在欧洲数据中心训练及部署。

Latent Space

Reflection 发布 Beam:501B-A23B 美国开源模型

Reflection 发布 Beam,这是一款面向编码、智能体和科学工作的纯文本 MoE 模型,总参数量为 501B、激活参数量为 23B,并从头训练。Reflection 称其预训练使用了 23.8T tokens,报告 SWE-bench Verified 得分为 80.9;完整权重预计本月以 Apache 2.0 发布。

02

论文研究

The Decoder

OpenAI在GitHub发布372项AI生成的数学结果

OpenAI将内部AI模型生成的372项数学结果发布到GitHub,每项据称解决了一个开放问题或取得实质进展。平均每项结果消耗约3小时ChatGPT Pro Thinking算力,许多证明附有可由Lean机器检查的形式化版本。Lean可核验逻辑正确性,但不能判断结果的数学相关性或原创性,数学界对这批结果的意义看法不一。

GitHub Blog · AI & ML一手

GitHub推出ReviewBench开放基准评测AI代码审查

GitHub推出开放的AI代码审查离线基准ReviewBench,用于评估和比较代码审查智能体。基准包含219个来自187个公开开源许可仓库的PR,覆盖19种语言,其语言和仓库规模分布参照103.9M个GitHub PR;资深工程师复核结果的一致率为96.6%。GitHub称,在一项Copilot代码审查实验中,ReviewBench的离线预测与线上A/B测试变化方向一致。

(本期完)

千机新闻 日报由编辑系统根据公开来源自动编辑,每条均附原文 · 日报合订本