Kimi K2 开源,提供 32 billion 激活参数与 1 trillion 总参数的 MoE 模型
月之暗面发布并开源 Kimi K2,这是一个拥有 32 billion 激活参数、1 trillion 总参数的 MoE 模型,提供 Kimi-K2-Base 和 Kimi-K2-Instruct 两个版本。
Kimi K2 同时公布了模型规模、MuonClip 稳定训练方案和智能体数据构建流程,呈现了从预训练到工具使用能力的技术路径。
模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。
月之暗面发布并开源 Kimi K2,这是一个拥有 32 billion 激活参数、1 trillion 总参数的 MoE 模型,提供 Kimi-K2-Base 和 Kimi-K2-Instruct 两个版本。
Kimi K2 同时公布了模型规模、MuonClip 稳定训练方案和智能体数据构建流程,呈现了从预训练到工具使用能力的技术路径。
Anthropic 发布新一代 Claude 模型 Claude Opus 4 和 Claude Sonnet 4,面向编码、推理和 AI 智能体任务。Opus 4 在 SWE-bench 得分为 72.5%,Sonnet 4 为 72.7%;两款模型支持扩展思考与工具使用,并可通过 Anthropic API、Amazon Bedrock 和 Google Cloud Vertex AI 使用。
Claude 4 同时覆盖长时程编码智能体任务与日常使用场景,并公布基准成绩、价格和接入渠道,可比较 Opus 与 Sonnet 的定位。
DeepSeek 在此次 API 更新中将 deepseek-reasoner 对应至 DeepSeek-R1 推理模型。这是当时的模型映射记录;当前可用模型及调用名称应以最新 API 文档为准。
这条记录保留 DeepSeek-R1 发布时的 API 模型名称,便于查阅推理模型接入历史;当前接入方式需另查最新文档。
Google DeepMind 发布 Gemini 2.0 模型系列的首个版本 Gemini 2.0 Flash experimental,称其具备低延迟和增强性能,并在关键基准上超过 1.5 Pro,速度为其两倍。该模型支持图像、视频和音频输入,以及原生生成图像、文本转语音和工具调用;Google 还公布 Project Astra、Project Mariner 和 Jules 等研究原型。
Gemini 2.0 Flash 将多模态输出、原生工具调用与低延迟结合,并同步展示多个智能体研究原型,呈现 Google 推进智能体路线的具体做法。
OpenAI 发布 o1。
Anthropic 发布 Claude 3.5 Sonnet,这是 Claude 3.5 模型系列的首个版本,在多项评测中超过 Claude 3 Opus,并以 Claude 3 Sonnet 的速度和成本档位运行。
Claude 3.5 Sonnet 同时给出评测表现、推理速度、定价和可用渠道,便于对照其能力与接入成本。
Anthropic 发布 Claude 3 模型系列,包含按能力递增排列的 Opus、Sonnet 和 Haiku,提供不同的智能、速度与成本组合。Opus 和 Sonnet 已通过 Claude API 提供,API 面向 159 个国家开放;Haiku 将于稍后推出。三款模型初始上下文窗口为 200K,面向特定用例可提供 1M tokens。
Claude 3 将 Opus、Sonnet、Haiku 按能力梯度区分,并列出速度、价格与适用任务,便于比较不同模型在成本和性能之间的取舍。
Google DeepMind 宣布推出下一代模型 Gemini 1.5,首个供早期测试的模型 Gemini 1.5 Pro 在多项能力上表现提升,并采用 MoE 架构。
Gemini 1.5 Pro 将标准上下文窗口设为 128,000 tokens,并提供最高 1 million tokens 的限量预览,呈现长上下文能力与测试阶段可用方式。
Google DeepMind 发布 Gemini 1.0,这是其面向文本、代码、音频、图像和视频的多模态模型,提供 Ultra、Pro 和 Nano 三种规模。
Gemini 1.0按Ultra、Pro和Nano三种规模推出,覆盖复杂任务、广泛任务及端侧场景,文章也列出基准成绩与产品接入安排。