评测来源官方评测
DeepSWE v1.1
DataCurve / 编程 · 在统一的编程助手环境里改仓库、修缺陷,比较的是写代码的模型本身。
在 千机新闻 中参与排名
证据预算3.6%
上游数据时间09/22 14:27
最近成功同步10/03 10:56
它测什么,怎么测
只取 pass@1;统一 harness 内按预先固定的推理档位优先级选代表配置。
如何使用这份证据
编程与设计预算中的 3.6%;固定受控系统与版本。
评测成绩
按固定规则,每个公开模型采用一套代表配置。匿名测试型号不展示,保留原榜名次,每项最多 30 个。
| 原榜名次 | 原榜型号 | 原始成绩 | 代表配置 |
|---|---|---|---|
| 2 | gemini-3-8-flashgoogle | 73.8% | High 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent |
| 3 | claude-opus-5anthropic | 73.6% | Max 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent |
| 4 | gpt-6-astraopenai | 73.2% | Max 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent |
| 9 | gpt-5-6-solopenai | 72.7% | Max 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent |
| 13 | claude-fable-5anthropic | 69.7% | Max 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent |
| 14 | gpt-5-6-terraopenai | 69.6% | Max 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent |
| 16 | glm-5-3— | 69.0% | Max 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent |
| 19 | kimi-k3— | 68.5% | Max 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent |
| 21 | gpt-5-6-lunaopenai | 67.2% | Max 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent |
| 22 | gpt-5-5openai | 67.0% | xHigh 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent |
| 24 | grok-4-6xai | 66.7% | xHigh 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent |
| 27 | gemini-3-7-flashgoogle | 65.3% | High 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent |
| 30 | glm-5-3-flashzai | 63.4% | Max 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent |
| 31 | deepseek-v4-prodeepseek | 62.8% | Max 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent |
| 35 | claude-opus-4-8anthropic | 59.0% | Max 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent |
| 37 | qwen3-8-maxalibaba | 57.5% | xHigh 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent |
| 39 | muse-spark-1-2meta | 54.9% | xHigh 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent |
| 42 | claude-sonnet-5anthropic | 53.8% | Max 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent |
| 43 | grok-4-5xai | 53.8% | High 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent |
| 46 | deepseek-v4-flashdeepseek | 53.3% | Max 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent |
| 46 | muse-spark-1-1meta | 53.3% | xHigh 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent |
| 48 | gpt-5-4openai | 51.8% | xHigh 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent |
| 53 | gemini-3-6-flashgoogle | 46.7% | High 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent |
| 56 | glm-5-2— | 43.8% | Max 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent |
| 61 | gemini-3-5-flashgoogle | 36.1% | High 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent |
| 63 | kimi-k2-7-codemoonshot | 30.5% | 完整系统 · mini-swe-agent · deepswe-v1.1:mini-swe-agent |
| 65 | claude-sonnet-4-6anthropic | 29.9% | High 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent |
| 68 | gemini-3-1-pro-previewgoogle | 11.7% | High 推理 · mini-swe-agent · deepswe-v1.1:mini-swe-agent |
评测局限与数据署名
仍是模型+mini-swe-agent 的系统表现;大版本变化必须隔离快照。
数据许可:官方公开结构化结果;仅管理员私有观察,公开前复核许可
成绩由 DataCurve 发布,原始分数与 千机新闻 共识分使用不同尺度,不能直接相加。