deepseek-harness
deepseek-ai
DeepSeek Harness: Everything is a Plugin.
PROJECT TOPICS
PROJECT README
DeepSeek Harness(DSH)插件:LLM 模型选型部署分析。
给它模型、GPU/NPU 型号、节点数、精度、上下文长度、并发数与互联带宽,它用一阶解析模型给出可审计的估算:
dsh plugin --profile web add dsh-model-deploy
或从 GitHub 检出安装:
dsh plugin --profile web add github:lhwwxy/dsh-model-deploy
--profile必填。安装后重启会话(或 profile),工具 schema 才会进入 prompt 组装。
model_deploy_analyze主分析工具。示例调用:
{
"model": "deepseek-v3",
"gpu": "ascend910b",
"gpusPerNode": 8,
"nodes": 1,
"precision": "int4",
"ctx": 131072,
"batch": 4
}
字段:model(目录 id,或自定义模型 JSON 字符串)、gpu(目录 id)、gpusPerNode
(1–8)、nodes (1–64)、precision(fp32|bf16|fp16|fp8|int8|int4|fp4)、ctx/batch/
prompt/output(tokens)、intraMode(auto|custom)+ intraGBs、interMode
(none|ib400|ib800|roce100|roce200|custom)+ interGBs。
返回结构化报告(status、issues、strategy、memory、performance、power、
assumptions),渲染输出为简洁中文文本报告。
model_deploy_catalog列出支持的模型(id、参数量、层数、上下文上限)与 GPU/NPU(id、显存、带宽、
FP16/FP8/INT8/FP4、互联、TDP),支持 query/vendor 过滤。先用它查 id,再调分析工具。
模型架构数据来自各模型公开的 config.json(ModelScope/HuggingFace);硬件数据来自
官方规格表与公开规格汇总,每个条目在 dsh/data.js 中带有来源链接。官方未公开的
字段(如含光800 显存带宽、950 灵衢互联)标注 ~估算,报告里会提示。
公式与系数全部公开,结论可复核:
(kv_lora_rank + rope) × 层数 × 字节,滑动窗口层按窗口折算(Qwen3-Next)估算结果用真实部署锚点校验过(70B BF16 在 8×H100 ≈ 150 tok/s;DeepSeek-V3 FP8 放不进 8×80G、INT4 可以;Qwen3-8B INT4 单 4090 ≈ 170 tok/s),并扫描全部 760 个 模型×GPU 组合无异常。
国产 NPU 按规格表理想值估算,工具会提示 CANN/XPU/MUSA 软件栈实际利用率有差异, 正式采购前请用目标框架实测。
开发、测试与发布流程(维护者)见 docs/MAINTAINING.md。
MIT
CLASSIFICATION EVIDENCE
系统优先读取 GitHub Topics,再与站内分类词典和词根规则比对。当前命中: 无有效分类标签。