评测来源官方评测
Longform Writing
EQ-Bench · 长篇故事的连贯性与完整性
在 千机新闻 中参与排名
证据预算2.4%
上游数据时间09/24 15:57
最近成功同步10/03 10:55
它测什么,怎么测
采用 overall_score_100;八章长文的情节与表达评分,裁判偏好作为局限披露。
如何使用这份证据
正式计分;两张写作榜合计占 6%,不按题数或模型数增加权重。
评测成绩
按固定规则,每个公开模型采用一套代表配置。匿名测试型号不展示,保留原榜名次,每项最多 30 个。
| 原榜名次 | 原榜型号 | 原始成绩 | 代表配置 |
|---|---|---|---|
| 1 | claude-opus-5anthropic | 86.3 | 来源默认配置 |
| 2 | claude-fable-5-1anthropic | 85.3 | 来源默认配置 |
| 3 | claude-opus-5-5anthropic | 84.6 | 来源默认配置 |
| 4 | grok-4.7xai | 83 | 来源默认配置 |
| 4 | claude-fable-5anthropic | 83 | 来源默认配置 |
| 6 | gpt-6-astraopenai | 82.8 | 来源默认配置 |
| 6 | muse-spark-1.3meta | 82.8 | 来源默认配置 |
| 6 | gpt-6-solopenai | 82.8 | 来源默认配置 |
| 9 | aion-3.5— | 82.1 | 来源默认配置 |
| 10 | GLM-5.3— | 81.8 | 来源默认配置 |
| 10 | claude-opus-4-7anthropic | 81.8 | 来源默认配置 |
| 12 | gpt-5.6-solopenai | 81.7 | 来源默认配置 |
| 13 | muse-spark-1.2meta | 81.5 | 来源默认配置 |
| 14 | claude-opus-4-8anthropic | 80.8 | 来源默认配置 |
| 15 | ox-alpha— | 79.9 | 来源默认配置 |
| 15 | claude-sonnet-4-6anthropic | 79.9 | 来源默认配置 |
| 17 | kimi-k3— | 79.6 | 来源默认配置 |
| 18 | moonshotai/Kimi-K2.6moonshot | 78.5 | 来源默认配置 |
| 19 | gpt-5.4openai | 78.3 | 来源默认配置 |
| 19 | claude-sonnet-5anthropic | 78.3 | 来源默认配置 |
| 21 | gpt-5.5openai | 78.2 | 来源默认配置 |
| 22 | gpt-5.6-terraopenai | 78 | 来源默认配置 |
| 23 | zai-org/GLM-5.2— | 77.9 | 来源默认配置 |
| 24 | claude-opus-4-6anthropic | 77.7 | 来源默认配置 |
| 25 | gemini-3.8-flashgoogle | 76.8 | 来源默认配置 |
| 26 | deepseek-ai/DeepSeek-V4-Prodeepseek | 75.6 | 来源默认配置 |
| 27 | gpt-5.6-lunaopenai | 75.5 | 来源默认配置 |
| 28 | moonshotai/Kimi-K2.5— | 74.9 | 来源默认配置 |
| 29 | Altworld/Hemmingway-1— | 74.2 | 来源默认配置 |
| 30 | deepseek-v4.1-flash— | 74 | 来源默认配置 |
评测局限与数据署名
以英文写作为主,依赖模型裁判;同一裁判和相关任务共用预算,不代表中文文笔。
数据许可:MIT · EQ-bench-site README 元数据声明
成绩由 EQ-Bench 发布,原始分数与 千机新闻 共识分使用不同尺度,不能直接相加。