跳到正文
千机 API
评测来源

Vals Finance Agent

Vals AI / 专业办公 · 金融分析师的日常办公题,看研报、建模这类工作做得怎样。

官方评测
在 千机新闻 中参与排名
证据预算3%
上游数据时间10/01 08:00
最近成功同步10/03 10:56

它测什么,怎么测

只取 Finance Agent v2 官方 Overall 正确率。

如何使用这份证据

行业专业任务预算 3%;目前直接测金融,不宣称已经覆盖全部行业。

评测成绩

按固定规则,每个公开模型采用一套代表配置。匿名测试型号不展示,保留原榜名次,每项最多 30 个。

原榜名次原榜型号原始成绩代表配置
1google/gemini-4-argongoogle65.4%High 推理
2google/gemini-3.8-flashgoogle61.4%High 推理
3meta/muse_spark_1_2meta60.6%xHigh 推理
4meta/muse_spark_1_3_maxMeta60.0%Max 推理
5google/gemini-3.7-flashgoogle59.0%High 推理
6meta/muse_spark_1_3meta58.9%xHigh 推理
7anthropic/claude-fable-5-1anthropic58.9%Max 推理
8anthropic/claude-opus-5anthropic58.6%Max 推理
9anthropic/claude-opus-5-5anthropic58.6%Max 推理
10anthropic/claude-sonnet-5-5anthropic58.1%Max 推理
11google/gemini-3.5-flashgoogle57.9%High 推理
12zai/glm-5.3-flashzai57.9%Max 推理
13xiaomi/mimo-v2.6-proxiaomi57.3%来源默认配置
14meta/muse_spark_1_1meta57.2%xHigh 推理
15anthropic/claude-fable-5anthropic56.3%Max 推理
16google/gemini-3.6-flashgoogle56.3%High 推理
17xiaomi/mimo-v2.6-flashxiaomi56.3%来源默认配置
18zai/glm-5.3—55.8%Max 推理
19tencent/hy4-previewtencent55.1%来源默认配置
20openai/gpt-5.6-lunaopenai55.0%Max 推理
21ant/ling-3.0-flash-af-rc3Ant54.9%来源默认配置
22openai/gpt-5.6-terraopenai54.4%Max 推理
23anthropic/claude-opus-4-8anthropic53.9%Max 推理
24anthropic/claude-sonnet-5anthropic53.9%Max 推理
25openai/gpt-5.6-solopenai53.8%Max 推理
26grok/grok-4.6xai53.7%High 推理
27openai/gpt-6-astraopenai53.5%Max 推理
28deepseek/deepseek-v4.1-flash—53.5%High 推理
29kimi/kimi-k3—53.1%Max 推理
30grok/grok-4.7xai52.3%xHigh 推理
评测局限与数据署名

私有题不能逐题复算;与 APEX 同属办公任务,必须共用一组预算。

数据许可:官方公开结果;公开再展示保留官方署名,完整再分发授权仍以 Vals 条款为准

成绩由 Vals AI 发布,原始分数与 千机新闻 共识分使用不同尺度,不能直接相加。