跳到正文
千机 API

推理能力

模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。

最新精选

第 21–29 条 · 共 29 条
7月11日周五
5月23日周五
  1. Anthropic News

    Anthropic 发布 Claude Opus 4 和 Claude Sonnet 4

    Anthropic 发布新一代 Claude 模型 Claude Opus 4 和 Claude Sonnet 4,面向编码、推理和 AI 智能体任务。Opus 4 在 SWE-bench 得分为 72.5%,Sonnet 4 为 72.7%;两款模型支持扩展思考与工具使用,并可通过 Anthropic API、Amazon Bedrock 和 Google Cloud Vertex AI 使用。

    Claude 4 同时覆盖长时程编码智能体任务与日常使用场景,并公布基准成绩、价格和接入渠道,可比较 Opus 与 Sonnet 的定位。

1月20日周一
12月11日周三
  1. Google DeepMind

    Google DeepMind 发布 Gemini 2.0,面向智能体时代的新模型

    Google DeepMind 发布 Gemini 2.0 模型系列的首个版本 Gemini 2.0 Flash experimental,称其具备低延迟和增强性能,并在关键基准上超过 1.5 Pro,速度为其两倍。该模型支持图像、视频和音频输入,以及原生生成图像、文本转语音和工具调用;Google 还公布 Project Astra、Project Mariner 和 Jules 等研究原型。

    Gemini 2.0 Flash 将多模态输出、原生工具调用与低延迟结合,并同步展示多个智能体研究原型,呈现 Google 推进智能体路线的具体做法。

9月12日周四
6月21日周五
3月4日周一
  1. Anthropic News

    Anthropic 发布 Claude 3 模型系列

    Anthropic 发布 Claude 3 模型系列,包含按能力递增排列的 Opus、Sonnet 和 Haiku,提供不同的智能、速度与成本组合。Opus 和 Sonnet 已通过 Claude API 提供,API 面向 159 个国家开放;Haiku 将于稍后推出。三款模型初始上下文窗口为 200K,面向特定用例可提供 1M tokens。

    Claude 3 将 Opus、Sonnet、Haiku 按能力梯度区分,并列出速度、价格与适用任务,便于比较不同模型在成本和性能之间的取舍。

2月15日周四
12月6日周三