deepseek-harness
deepseek-ai
DeepSeek Harness: Everything is a Plugin.
DIAG5/dsh-better-input
BetterInput是一套输入增强套件:语音识别、提示词优化、输入更多文件类型,各类文件转Md,交互体验优化等——把每一种喂给智能体的输入都变得更好。BetterInput is an input-enhancement suite — voice recognition, prompt optimization, more file types, everything-to-Markdown conversion, and UX refinements — making every input you feed an agent better.
PROJECT TOPICS
PROJECT README
给 DeepSeek Harness 更好的「输入」体验。
开源输入体验增强插件 · BetterInput for your DeepSeek Harness agent
💡 它解决什么? 与智能体对话,输入不只靠键盘打字。BetterInput 是一套输入增强套件:语音识别、提示词优化、提示词模板随用随插、更多格式的本地文件输入与转 Markdown,再到交互细节都打磨的体验优化——把每一种「喂给智能体的输入」都变得更好。
https://github.com/user-attachments/assets/caae08fc-2d8e-43c6-8bab-ade2d278337f
V0.1.5 版本四大功能演示
| 模块 | 说明 |
|---|---|
| 🎙️ 语音输入 |
点击麦克风,边说边转写,文字实时流式进入输入框。浏览器原生识别,无需 API Key。 |
| 🤖 AI 润色 |
识别后自动清理:去口头禅、修同音错字(根木鹿→根目录、脱肯→Token)、补标点、把口语列举转成编号列表。复用 dsh 已配置的模型,无需额外 Key。 |
| ✨ 提示词优化 |
输入框右上角一个图标,AI 帮你把写好的提示词优化得更精准;点击后弹出原文 / 优化结果对比,确认满意再采用。复用 dsh 模型,无需额外 Key。 |
| 📝 提示词模板 |
常用提示词存成模板,输入框键入 / 搜索并一键插入正文;设置页内新建 / 编辑 / 删除,本地存储不经服务器。 |
| 📎 更多文件格式输入 |
输入框右上角「添加文件」按钮(默认收起)。把本地文件带进输入:纯文本(.txt / .json / .py / .md 等)可直接发送;文档类先转换再以 @ 引用芯片插入输入框。不带转换需求也能引入非工作区文件。 |
| 🔄 文件转 Markdown |
把 PDF / DOCX / XLSX / PPTX / HTML / EPUB / CSV / JSON / XML 等转成结构清晰的 Markdown,发送时自动展开成正文;转换结果可二次编辑。 |
| 🐘 防覆盖保护 |
润色进行中你手动改了草稿,结果不会覆盖你的编辑;失败保留原文。 |
| 🔄 更新检查 |
设置页底部「关于与更新」一键检测 npm 最新版,发现新版会给出一键复制更新命令,让你及时跟进修复与新功能。 |
| ⏱️ 录音自动停止 |
可自定义单次录音上限(1–600 秒),不占麦克风。 |
| ⚙️ 可视化设置页 |
识别语言、录音时长、语音润色开关、以及润色 / 优化的模型、思考强度、自定义提示词,全部可在设置里配置;内置提示词可一键展开查看。默认已开启并自动选中主模型。 |
BetterInput 是一套完整的输入增强套件:不只是某一类输入,而是让喂给智能体的每一种输入都更顺、更省心。语音已经就位,接下来围绕三个方向展开:
📷 图片输入:DSH
rc.8起已原生支持。DeepSeek API 已原生支持图片输入,不再提供图片相关的插件功能。
把文稿、表格、演示文件一键转成结构清晰的 Markdown,让 AI 一看就懂。
/ 搜索并插入常用模板(写代码 / 总结 / 翻译 / 角色扮演…)输入不只是功能,也讲究好用与美观——把交互细节打磨到位。
{{日期}}、{{当前目录}} 等变量自动替换以上按主题规划,会持续迭代。有想法欢迎提 Issue / PR,一起把它做成更好的输入套件。
💭 关于设置里的开关:对于改动 DSH 核心自带插件的功能,在设置界面里再加一个开关其实是多此一举——如果一个功能原则上可以剥离出去作为一个独立插件,那就应该通过安装 / 卸载来开关,而不是在 BetterInput 设置里多一个 toggle。所以本插件不再为核心功能的开关买单:凡是可以剥离出去的功能,BetterInput 都已经剥离出去了,需要时单独安装对应插件,不需要就卸载即可。
前置:DeepSeek Harness(>= 0.1.2-rc.1)+ Node.js ^22.19.0 || >=24.0.0 + Chrome/Edge 浏览器。
💡 两种方式,任选其一。 装过
dshCLI 的用短命令;没装或不想全局安装的,用下方 npx 全称——不需要任何全局环境配置。已发布到 npm。
dsh CLI# 从 npm 安装(推荐)
dsh plugin --profile web add dsh-better-input
# 或从 GitHub 仓库安装
dsh plugin --profile web add github:DIAG5/dsh-better-input
# 卸载
dsh plugin --profile web remove dsh-better-input
dsh,或不想全局安装(npx 全称)下面的命令用 npx 直接运行 dsh CLI,不写入全局环境,临时拉取即可用:
# 从 npm 安装(推荐)
npx -y @deepseek-ai/dsh plugin --profile web add dsh-better-input
# 或从 GitHub 仓库安装
npx -y @deepseek-ai/dsh plugin --profile web add github:DIAG5/dsh-better-input
# 卸载
npx -y @deepseek-ai/dsh plugin --profile web remove dsh-better-input
-y表示自动确认下载;首次运行会拉取 dsh CLI,之后有 npx 缓存。
git clone https://github.com/DIAG5/dsh-better-input.git
cd dsh-better-input
npm install
npm run build
# 有全局 CLI:
dsh plugin --profile web add "$PWD"
# 没有全局 CLI:
npx -y @deepseek-ai/dsh plugin --profile web add "$PWD"
cordis.yml如果你已经在用某个 agent preset,只需要加一行(无需跑安装命令):
- insert:
- id: dsh-better-input
name: dsh-better-input
安装后刷新 Web UI,输入框右侧会出现麦克风图标 🎤。
识别完全在浏览器本地完成(Web Speech API),无需 API Key、无服务器往返。Firefox/Safari 不支持时按钮自动禁用。
设置 → BetterInput → 打开 AI 润色 → 选择一个 dsh 里已配置的模型。
内置提示词会:去口头禅、修 ASR 同音错字、补标点、把口语列举转成编号列表(如「第一…第二…」→ 1. 2.)。留空用内置提示词,点「查看内置提示词」可展开原文;或粘贴自定义提示词(总会追加输出契约保护,保证只返回正文、不答非所问)。
默认关闭思考,追求快速、低成本的直出结果。从设置页可手动提高思考强度以获得更深层的优化。
把常用的提示词(写代码 / 总结 / 翻译 / 角色扮演…)存成模板,随用随插:
/,模板候选即弹出;继续输入按名称 / 描述 / 标签实时过滤模板保存在宿主本地
~/.dsh/better-input/templates.json,不经服务器、不上传;最多 200 个模板,正文上限 8000 字,列表按最近更新排序。
.txt / .md / .json / .py 等)会直接标记 ✓,输入 @ 即可选入发送,无需转换——这是「更多文件格式输入」的能力.pdf / .docx / .xlsx 等)点击「开始转换」——这是「文件转 Markdown」的能力:@,从候选中选择该文件,插入成 @<文件名> 引用芯片× 移除转换在本地通过内置解析完成(PDF / Word / Excel / PPT / EPUB / HTML / CSV / JSON / XML 等),生成的 Markdown 随消息发送给 AI,方便它快速读懂文档内容。
针对没有文本层的文档——如扫描件 PDF、图片型 PDF、只有图片没有文字的 PPT——普通转换只能抽出有限或空的文本。此时可用 OCR 让视觉模型直接「看图识字」:
.pdf / .pptx 文件后点「开始转换」,会询问「是否使用 OCR」未配置 OCR 模型时点「使用 OCR」只会弹出中性提示引导去设置页,不会报红错;若所选模型明确声明不支持图片输入,会提前提示更换,避免无效的空白结果。
当前版本 → 最新版本,并给出更新命令dsh plugin --profile web update dsh-better-input
npx -y @deepseek-ai/dsh plugin --profile web update dsh-better-input
说明:DSH 不会在你进入时自动更新第三方插件,需手动执行上面命令才会拉到新版。这个分节就是帮你及时发现并跟进更新。
| 设置项 | 说明 |
|---|---|
| 界面语言 | 插件界面文案支持中文 / 英文,跟随 DSH 界面语言一键切换,即时生效 |
| 识别语言 | 留空自动跟随浏览器语言(如 zh-CN、en-US) |
| 单次录音上限 | 1–600 秒,默认 120,到点自动停止 |
| AI 润色 | 开/关;开启后每次语音识别结束自动润色进草稿 |
| 润色模型 | 选择 dsh 已配置的模型路由 |
| 润色思考强度 | 默认关闭思考;可选模型支持的更高档位 |
| 自定义润色提示词 | 可选,替换内置提示词 |
| 提示词优化 | 开/关;开启后输入框右侧显示 ✨ 按钮 |
| 优化模型 | 选择 dsh 已配置的模型路由 |
| 优化思考强度 | 默认关闭思考;可选模型支持的更高档位 |
| 自定义优化提示词 | 可选,替换内置优化提示词 |
| OCR 视觉模型 | 选择用于识别扫描页 / 内嵌图片的视觉模型;独立于润色模型,未选择时无法使用 OCR |
| 提示词模板 | 设置页内新建 / 编辑 / 删除模板(名称、描述、正文、标签),数据保存在宿主本地 JSON 文件 |
| 关于与更新 | 显示当前版本 / 许可证 / 仓库,一键「检查更新」获取最新版与更新命令 |
润色与优化的模型、思考强度、提示词相互独立,可各自配置。
>= 0.1.2-rc.1(已在 0.1.5-rc.1 下实测通过)^22.19.0 || >=24.0.0npm install
npm run check # 类型检查
npm run build # 构建 lib/(Host ESM + 浏览器 bundle)
改 Client 端:npm run dev:watch 后刷新 UI;改 Host 端:重启 dsh web。
src/index.ts — Host 插件入口,挂载润色服务src/polish/service.ts — BetterInputPolishService(Typert remote):设置、dsh 模型路由发现、LLM 润色与提示词优化、文件转 Markdown(convertFile,复用 ctx.llm)、提示词模板存取(templatesList / templatesSave / templatesRemove)src/templates/ — 提示词模板的数据模型与宿主端 JSON 存储(原子写入、损坏自愈)src/converter/ — 纯 TypeScript 文件→Markdown 转换层(PDF / DOCX / XLSX / PPT / EPUB / HTML / CSV / JSON / XML / ZIP),仅在 Host 端打包src/about.ts — 插件身份读取与 npm 版本检查(「关于与更新」)src/client/ — 浏览器端:麦克风/优化/选择文件按钮(conversation.input.right)、识别条/文件面板(conversation.input.dock)、设置页与模板管理(settings.section)、@ 引用芯片源(conversion-source)、/ 模板候选源(input trigger)src/typert.ts / src/remote.ts — Client↔Host 类型化通信契约这个插件正在从「语音」走向「完整的输入增强套件」——觉得它值得期待?
感谢你的支持 ❤️
CLASSIFICATION EVIDENCE
系统优先读取 GitHub Topics,再与站内分类词典和词根规则比对。当前命中: 无有效分类标签。