OpenAI 发布 GPT-5
OpenAI 发布 GPT-5,称其是迄今最好的 AI 系统,并在智能水平上显著超过此前所有模型。OpenAI 表示,GPT-5 在编码、数学、写作、健康和视觉感知等领域达到最先进表现。
原文概括了 GPT-5 相较此前模型的智能提升,并列出编码、数学、写作、健康和视觉感知等表现领域。
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
OpenAI 发布 GPT-5,称其是迄今最好的 AI 系统,并在智能水平上显著超过此前所有模型。OpenAI 表示,GPT-5 在编码、数学、写作、健康和视觉感知等领域达到最先进表现。
原文概括了 GPT-5 相较此前模型的智能提升,并列出编码、数学、写作、健康和视觉感知等表现领域。
OpenAI 发布 gpt-oss-120b 和 gpt-oss-20b 两款开放权重大语言模型,采用 Apache 2.0 许可。官方称,它们在推理任务上优于规模相近的开放模型,具备较强工具使用能力,并针对消费级硬件上的高效部署进行了优化。
gpt-oss-120b 和 gpt-oss-20b 采用 Apache 2.0 许可,并强调推理、工具使用与消费级硬件部署,可从这些维度了解其定位。
月之暗面发布并开源 Kimi K2,这是一个拥有 32 billion 激活参数、1 trillion 总参数的 MoE 模型,提供 Kimi-K2-Base 和 Kimi-K2-Instruct 两个版本。
Kimi K2 同时公布了模型规模、MuonClip 稳定训练方案和智能体数据构建流程,呈现了从预训练到工具使用能力的技术路径。
Anthropic 发布新一代 Claude 模型 Claude Opus 4 和 Claude Sonnet 4,面向编码、推理和 AI 智能体任务。Opus 4 在 SWE-bench 得分为 72.5%,Sonnet 4 为 72.7%;两款模型支持扩展思考与工具使用,并可通过 Anthropic API、Amazon Bedrock 和 Google Cloud Vertex AI 使用。
Claude 4 同时覆盖长时程编码智能体任务与日常使用场景,并公布基准成绩、价格和接入渠道,可比较 Opus 与 Sonnet 的定位。
OpenAI 在 GPT-4o 中推出原生图像生成,并称其文字渲染和指令遵循能力有所增强。此条记录 2025 年的发布事件,官网后来添加的其他图像模型推荐不属于本次发布。
这次更新将图像生成纳入 GPT‑4o,并突出文字渲染和指令遵循两项变化,呈现了模型能力扩展的方向。
DeepSeek 在此次 API 更新中将 deepseek-reasoner 对应至 DeepSeek-R1 推理模型。这是当时的模型映射记录;当前可用模型及调用名称应以最新 API 文档为准。
这条记录保留 DeepSeek-R1 发布时的 API 模型名称,便于查阅推理模型接入历史;当前接入方式需另查最新文档。
DeepSeek 将 deepseek-chat 模型升级为 DeepSeek-V3,API 保持不变。调用时仍指定 model='deepseek-chat';详情见 https://api-docs.deepseek.com/updates/#deepseek-chat-1。
此次升级沿用原有 API 调用方式,模型版本变化与接口兼容性信息有助于开发者评估迁移成本。
Google DeepMind 发布 Gemini 2.0 模型系列的首个版本 Gemini 2.0 Flash experimental,称其具备低延迟和增强性能,并在关键基准上超过 1.5 Pro,速度为其两倍。该模型支持图像、视频和音频输入,以及原生生成图像、文本转语音和工具调用;Google 还公布 Project Astra、Project Mariner 和 Jules 等研究原型。
Gemini 2.0 Flash 将多模态输出、原生工具调用与低延迟结合,并同步展示多个智能体研究原型,呈现 Google 推进智能体路线的具体做法。
OpenAI 发布 o1。
Anthropic 发布 Claude 3.5 Sonnet,这是 Claude 3.5 模型系列的首个版本,在多项评测中超过 Claude 3 Opus,并以 Claude 3 Sonnet 的速度和成本档位运行。
Claude 3.5 Sonnet 同时给出评测表现、推理速度、定价和可用渠道,便于对照其能力与接入成本。
OpenAI 宣布推出新旗舰模型 GPT-4o,可实时跨音频、视觉和文本进行推理。
GPT-4o 将音频、视觉和文本纳入实时推理能力,展示了这一旗舰模型覆盖的输入模态与交互范围。
Anthropic 发布 Claude 3 模型系列,包含按能力递增排列的 Opus、Sonnet 和 Haiku,提供不同的智能、速度与成本组合。Opus 和 Sonnet 已通过 Claude API 提供,API 面向 159 个国家开放;Haiku 将于稍后推出。三款模型初始上下文窗口为 200K,面向特定用例可提供 1M tokens。
Claude 3 将 Opus、Sonnet、Haiku 按能力梯度区分,并列出速度、价格与适用任务,便于比较不同模型在成本和性能之间的取舍。
Google DeepMind 宣布推出下一代模型 Gemini 1.5,首个供早期测试的模型 Gemini 1.5 Pro 在多项能力上表现提升,并采用 MoE 架构。
Gemini 1.5 Pro 将标准上下文窗口设为 128,000 tokens,并提供最高 1 million tokens 的限量预览,呈现长上下文能力与测试阶段可用方式。
Google DeepMind 发布 Gemini 1.0,这是其面向文本、代码、音频、图像和视频的多模态模型,提供 Ultra、Pro 和 Nano 三种规模。
Gemini 1.0按Ultra、Pro和Nano三种规模推出,覆盖复杂任务、广泛任务及端侧场景,文章也列出基准成绩与产品接入安排。
OpenAI 发布 GPT-4,这是其扩大深度学习规模进程中的一个重要里程碑。GPT-4 是大型多模态模型,可接收图像和文本输入并输出文本;在多项专业和学术基准上达到人类水平表现,但在许多现实场景中仍不如人类。
这则公告概述了 GPT-4 的输入输出形式及其基准表现,为理解模型发布时披露的能力范围提供了直接信息。
OpenAI 训练了名为 ChatGPT 的模型,该模型以对话方式交互。对话格式使 ChatGPT 能回答后续问题、承认错误、质疑不正确的前提,并拒绝不当请求。
材料概述了 ChatGPT 对话格式所支持的几种交互行为,可帮助读者了解该模型区别于单轮问答的使用方式。