deepseek-harness
deepseek-ai
DeepSeek Harness: Everything is a Plugin.
PROJECT TOPICS
INSTALL REFERENCE
dsh plugin --profile web add github:suyoumo/deepseekharnesseval
该命令指向仓库当前默认分支;尚无绑定当前 commit 的完整验证结果。
PROJECT README
dsh (deepseekharness headless)deepseek-v4-flash#effort=maxswebench-pro 151 (zh release v30 aligned),共 151 题、6 个仓库dsh-swepro-results 目录下的 3 份 md 报告及配套 JSON(2026-08-14 ~ 2026-08-17)| 单轮 | 工具面 | solved | 比例 |
|---|---|---|---|
| 标准 1(a1) | 全部原生工具(bash/read/edit/subagent/...) | 102 | 67.5% |
| 标准 2(a2) | 全部原生工具(bash/read/edit/subagent/...) | 96 | 63.6% |
| 极简 | bash + str_replace_editor | 109 | 72.2% |
| 代码 | run_code + 生成 SDK | 104 | 68.9% |
| ⚠️ 标准 3(a3) | 全部原生工具 |
标准 3 为异常低分轮次(大量空补丁集中在个别仓库批次),已标记剔除,不纳入对比。
四轮并集 121 题(80.1%),四轮全过 78 题(51.7%)。
| repo | 总数 | 标准1 | 标准2 | 极简 | 代码 | 四轮并集 |
|---|---|---|---|---|---|---|
| ansible | 33 | 24 | 28 | 25 | 24 | 30 |
| flipt | 45 | 21 | 19 | 21 | 19 | 27 |
| vuls | 24 | 24 | 22 | 24 | 23 | 24 |
| openlibrary | 35 | 26 | 19 | 27 | 26 | 27 |
| navidrome | 5 | 5 | 4 | 5 | 5 | 5 |
| qutebrowser | 9 | 2 | 4 | 7 | 7 | 8 |
| 合计 | 151 | 102 | 96 | 109 | 104 | 121 |
四轮全败题目分布:flipt 18/45、openlibrary 8/35、ansible 3/33、qutebrowser 1/9、vuls 和 navidrome 为 0。
工具面最窄的极简模式(仅 bash + str_replace_editor)拿到 109 分(72.2%),高于标准 1(102)、标准 2(96)和代码模式(104)。砍掉大部分原生工具不仅没有损失单轮解题能力,反而略优于全套工具的标准模式——工具面宽度不是单轮成绩的决定因素。
标准 1 与标准 2 差 6 题,且仓库级趋势互相矛盾:ansible 24→28、qutebrowser 2→4(变好),而 openlibrary 26→19、vuls 24→22(变差)。同配置两次运行尚且如此,说明单轮差距在 5 个百分点以内时不足以下结论,横向比较应多轮并排看。
标准模式单轮只有 2/9 和 4/9,极简与代码模式都是 7/9。这是四个单轮中唯一出现大幅方向性差异的仓库——受限工具面反而显著更好,标准模式在该仓库的低分不代表能力上限,值得单独排查。
| 四轮中通过次数 | 题数 | 占比 |
|---|---|---|
| 4 轮全过 | 78 | 51.7% |
| 1–3 轮通过 | 43 | 28.5% |
| 0 轮通过 | 30 | 19.9% |
近三成题目在通过/失败之间翻转,任何单轮分数都含有抽样噪声,评测结论应同时给出多轮并排与全过率。
四轮并集 121,比最好的单轮(极简 109)多 12 题;极简 vs 标准 1 的逐题差异为 14 : 7(极简独有 : 标准1独有)。换工具面/交互形态能捞回少量题目(约 +10%),但 30 题四轮全败的重叠失败集才是主要矛盾。
| verdict | 次数 | 占比 | 说明 |
|---|---|---|---|
| harness-ok | 281 | 62.0% | 通过 |
| harness-failed | 120 | 26.5% | 最大失败类别,测试未通过 |
| no-op-patch | 45 | 9.9% | 空补丁,绝大部分集中在被剔除的 a3 |
| apply-failed | 3 | 0.7% | 补丁无法应用 |
| harness-mutated-workspace | 3 | 0.7% | 污染工作区 |
| blocked-suspicious-patch | 1 | 0.2% | 可疑补丁被拦截 |
| 文件 | 内容 |
|---|---|
dsh-swepro-151-results.json/.md |
标准模式 3 try 完整结果(2026-08-14;原始报告以 pass^1=118 口径汇总,本报告改用单轮口径,a3 为异常轮次已剔除) |
dsh-swepro-151-minimal-1try-results.json/.md |
极简模式单轮结果明细(2026-08-16) |
dsh-swepro-151-mini-final.json |
极简模式最终结果:109 题 |
dsh-swepro-151-code-final.json |
代码模式最终结果:104 题 |
dsh-swepro-151-三模式对比报告.md |
三模式逐题对照表 |
CLASSIFICATION EVIDENCE
系统优先读取 GitHub Topics,再与站内分类词典和词根规则比对。当前命中: 无有效分类标签。