Qwen3-Coder-Next 发布,面向智能体编程与本地开发
Qwen 团队推出开源权重语言模型 Qwen3-Coder-Next,面向编程智能体与本地开发。该模型基于 Qwen3-Next-80B-A3B-Base 构建,采用混合注意力与 MoE 架构,并通过可执行编程任务、环境交互和强化学习进行智能体训练。
文章将模型的训练配方与基准表现放在一起,呈现小激活参数规模下的编程智能体效率取舍,也交代了其训练侧重点。
让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。
Qwen 团队推出开源权重语言模型 Qwen3-Coder-Next,面向编程智能体与本地开发。该模型基于 Qwen3-Next-80B-A3B-Base 构建,采用混合注意力与 MoE 架构,并通过可执行编程任务、环境交互和强化学习进行智能体训练。
文章将模型的训练配方与基准表现放在一起,呈现小激活参数规模下的编程智能体效率取舍,也交代了其训练侧重点。
OpenAI 推出 macOS 版 Codex app,将其定位为 AI 编码与软件开发的指挥中心。该应用支持多个智能体、并行工作流和长时任务。
Codex app 将多个智能体、并行工作流和长时任务集中到 macOS 的开发环境中,呈现了其面向软件开发的核心使用方式。
Google DeepMind 发布 Gemini 3,并开放 Gemini 3 Pro 预览版;官方称其在推理、多模态理解和智能体编码方面能力提升。Gemini 3 Pro 在 LMArena 获得 1501 Elo,在 Humanity’s Last Exam 上取得 37.5%(不使用工具),并在 GPQA Diamond 上取得 91.9%。
Gemini 3 Pro 与 Deep Think 的基准成绩呈现了不同推理模式下的表现差异,也交代了模型在 Google 产品及开发平台中的发布范围。
月之暗面发布并开源 Kimi K2,这是一个拥有 32 billion 激活参数、1 trillion 总参数的 MoE 模型,提供 Kimi-K2-Base 和 Kimi-K2-Instruct 两个版本。
Kimi K2 同时公布了模型规模、MuonClip 稳定训练方案和智能体数据构建流程,呈现了从预训练到工具使用能力的技术路径。
Anthropic 发布新一代 Claude 模型 Claude Opus 4 和 Claude Sonnet 4,面向编码、推理和 AI 智能体任务。Opus 4 在 SWE-bench 得分为 72.5%,Sonnet 4 为 72.7%;两款模型支持扩展思考与工具使用,并可通过 Anthropic API、Amazon Bedrock 和 Google Cloud Vertex AI 使用。
Claude 4 同时覆盖长时程编码智能体任务与日常使用场景,并公布基准成绩、价格和接入渠道,可比较 Opus 与 Sonnet 的定位。
OpenAI 于2025年5月16日发布 Codex 研究预览,这是一款可并行处理多个任务的云端软件工程智能体,由针对软件工程优化的 o3 版本 codex-1 支持。
Codex 将代码编写、代码库问答、漏洞修复和拉取请求交由云端智能体并行处理,并以独立沙箱隔离各项任务。
OpenAI 于 2025年3月11日发布首套帮助开发者构建智能体的工具,包括 Responses API 和 Agents SDK。Responses API 提供网页搜索、文件搜索和计算机使用等内置工具;Agents SDK 可协调单个或多个智能体,并提供集成追踪与可观察性工具。
Responses API 与 Agents SDK 分别覆盖内置工具调用和智能体协调、追踪,呈现了 OpenAI 将开发与调试环节整合进流程的做法。
Google DeepMind 发布 Gemini 2.0 模型系列的首个版本 Gemini 2.0 Flash experimental,称其具备低延迟和增强性能,并在关键基准上超过 1.5 Pro,速度为其两倍。该模型支持图像、视频和音频输入,以及原生生成图像、文本转语音和工具调用;Google 还公布 Project Astra、Project Mariner 和 Jules 等研究原型。
Gemini 2.0 Flash 将多模态输出、原生工具调用与低延迟结合,并同步展示多个智能体研究原型,呈现 Google 推进智能体路线的具体做法。