跳到正文
千机 API
评测来源

DeepSWE v1.1

DataCurve / 编程 · 在统一的编程助手环境里改仓库、修缺陷,比较的是写代码的模型本身。

官方评测
在 千机新闻 中参与排名
证据预算3.6%
上游数据时间09/22 14:27
最近成功同步10/03 10:56

它测什么,怎么测

只取 pass@1;统一 harness 内按预先固定的推理档位优先级选代表配置。

如何使用这份证据

编程与设计预算中的 3.6%;固定受控系统与版本。

评测成绩

按固定规则,每个公开模型采用一套代表配置。匿名测试型号不展示,保留原榜名次,每项最多 30 个。

原榜名次原榜型号原始成绩代表配置
2gemini-3-8-flashgoogle73.8%High 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
3claude-opus-5anthropic73.6%Max 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
4gpt-6-astraopenai73.2%Max 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
9gpt-5-6-solopenai72.7%Max 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
13claude-fable-5anthropic69.7%Max 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
14gpt-5-6-terraopenai69.6%Max 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
16glm-5-3—69.0%Max 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
19kimi-k3—68.5%Max 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
21gpt-5-6-lunaopenai67.2%Max 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
22gpt-5-5openai67.0%xHigh 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
24grok-4-6xai66.7%xHigh 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
27gemini-3-7-flashgoogle65.3%High 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
30glm-5-3-flashzai63.4%Max 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
31deepseek-v4-prodeepseek62.8%Max 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
35claude-opus-4-8anthropic59.0%Max 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
37qwen3-8-maxalibaba57.5%xHigh 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
39muse-spark-1-2meta54.9%xHigh 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
42claude-sonnet-5anthropic53.8%Max 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
43grok-4-5xai53.8%High 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
46deepseek-v4-flashdeepseek53.3%Max 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
46muse-spark-1-1meta53.3%xHigh 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
48gpt-5-4openai51.8%xHigh 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
53gemini-3-6-flashgoogle46.7%High 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
56glm-5-2—43.8%Max 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
61gemini-3-5-flashgoogle36.1%High 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
63kimi-k2-7-codemoonshot30.5%完整系统 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
65claude-sonnet-4-6anthropic29.9%High 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
68gemini-3-1-pro-previewgoogle11.7%High 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
评测局限与数据署名

仍是模型+mini-swe-agent 的系统表现;大版本变化必须隔离快照。

数据许可:官方公开结构化结果;仅管理员私有观察,公开前复核许可

成绩由 DataCurve 发布,原始分数与 千机新闻 共识分使用不同尺度,不能直接相加。