deepseek-harness
deepseek-ai
DeepSeek Harness: Everything is a Plugin.
PROJECT TOPICS
INSTALL REFERENCE
dsh plugin --profile web add github:GTC2080/dsh-APEX_Plugin
该命令指向仓库当前默认分支;尚无绑定当前 commit 的完整验证结果。
PROJECT README
研究如何让同一个模型更可靠地完成复杂任务。
APEX 是面向 DeepSeek Harness 的任务增强插件。我们围绕工具调用、任务协作和结果验证构建执行环境,探索基础模型在实际交付中的能力边界。
当前阶段 · 2026-09-16
v1.0 已完成正式集成、macOS 工程验证和首轮复杂任务对照研究。下一阶段将通过多任务、重复实验和同等预算比较,检验观察到的收益是否稳定。
项目围绕一个核心问题展开:在保持基础模型不变的前提下,更合适的工具、协作方式和反馈,能否提高完整任务的通过率?
APEX v1.0 将这项研究落成了可安装的插件:模型可以使用官方工具完成工作,按需要组织团队,并通过浏览器检查、只读审查和执行记录核验结果。任务如何分解、是否委派、何时检查,仍由模型结合任务和用户要求决定。
我们同时维护插件实现与对照实验,分别回答“工程机制是否正确运行”和“最终作品是否更好”这两个问题。
在已完成的四冲程柴油机任务中,两组作品都能生成复杂场景,也都报告过自测通过;进一步检查却发现了机械装配、运动关系或交互稳定性上的错误。这说明,本案例中的自测与展示没有覆盖完整验收要求。
因此,APEX 的开发重点是:
| 方向 | 当前实现 |
|---|---|
| 原生工具执行 | 从首轮使用官方 PTC(通过程序调用工具),组合文件、搜索、Shell、Web 和后台任务能力。 |
| 按需团队协作 | 复用官方 Teams 的成员、消息、任务依赖、取消与恢复机制,补充 APEX 的协作指引和状态诊断。 |
| 浏览器验证与证据 | 在独立无头浏览器中执行指定交互,检查页面状态、DOM 和截图;可读取实际工具执行记录。 |
| 可选只读审查 | 调用仅具备读取能力的审查子代理,提供有依据的发现和后续检查建议。 |
| 执行与取消保护 | 在 macOS 上实现会话私有临时目录、受限写入与进程信号保护;阻止取消后的自动通知继续触发模型请求。 |
| 可分发的插件 | 已公开 v1.0 安装入口、预设、回归测试、开发文档,以及首轮对照论文与脱敏资料。 |
PTC、文件、Shell、Web 和 Teams 的基础能力来自官方 Harness。APEX 的工作集中在这些能力的组合、调用指引、验证工具和必要的执行保护上;各项机制的效果仍需通过实验分别评估。
我们使用同一模型配置(deepseek-flash / max)完成四冲程柴油机三维交互任务,对照官方原生环境与 APEX v1.0。两组各生成一次,按同一套 37 项量表检查冻结的实际交付。
| 指标 | 官方原生对照 | APEX v1.0 |
|---|---|---|
| 原始得分(满分 100) | 72.8 | 83.8 |
| 应用严重故障上限后的得分 | 40.0 | 83.8 |
| 完整任务验收 | 未通过 | 未通过 |
| 完成时间 | 51 分 13.9 秒 | 26 分 44.6 秒 |
| 全会话树输出 token | 265,713 | 1,229,906 |
原生对照因渲染冻结和关键机械连接缺陷触发严重故障上限。APEX 样本得分较高、完成较快,但仍有装配偏移、局部运动及信息一致性问题,输出 token 约为对照的 4.63 倍。
这是一项探索性的单任务观察。 每组仅一次生成、评价非盲、运行顺序固定且总计算预算不等,尚不能证明稳定、普遍或因果性的能力提升。
查看中文论文、补充材料和图表。公开数据支持文中说明的图表与论文复现;完整会话、原始 trace 和冻结应用未公开,完整成品复验仍受限制,详见 脱敏说明。
APEX 当前处于 v1.0 正式集成完成后的效果评估阶段。 插件已经落地,首轮研究已经公开;稳定收益、收益来源及适用范围仍是待解决的问题。
后续评估将以完整任务通过率为主要指标,并同时报告质量、严重故障、耗时和分类用量。
当前包名为 dsh-apex@1.0.0,预设为 apex-v1;固定兼容基线为 DeepSeek Harness v0.1.6-alpha.1。源码通过本仓库分发,尚未发布到 npm。安装前请按文档核对官方构建与依赖版本。
CLASSIFICATION EVIDENCE
系统优先读取 GitHub Topics,再与站内分类词典和词根规则比对。当前命中: 无有效分类标签。