WeKnora
Tencent
Open-source LLM knowledge platform: turn raw documents into a queryable RAG, an autonomous reasoning agent, and a self-maintaining Wiki.
PROJECT TOPICS
INSTALL REFERENCE
dsh plugin --profile web add github:PetCT/dsh-Bio-image-dup-check
该命令指向仓库当前默认分支;尚无绑定当前 commit 的完整验证结果。
PROJECT README
一个运行在 DeepSeek Harness (DSH) 里的生命科学科研图片查重插件:检测图片之间的整图重复 / 翻转 / 旋转 / 缩放重压缩、单图内部的局部复制粘贴(copy-move)、跨图局部区域复用(自动框出并给出裁剪对比),并支持对 PDF 稿件直接抽取图片查重(带页码标注)。输出美观的可视化报告,全程本地离线,不上传任何图片数据。
English — A local, offline image-integrity checker for life-science figures (Western blots, microscopy, gels, FACS…), built as a DeepSeek Harness plugin. It detects whole-image duplicates / flips / rotations / resizing, intra-image copy-move forgery, cross-image region reuse (with auto-cropped side-by-side evidence) and duplicates inside PDF manuscripts — entirely on your machine. Documentation is primarily in Chinese; issues and PRs in any language are welcome.
check_image_duplicates(folder)。| 类别 | 格式 | 解码器 |
|---|---|---|
| 基础 | PNG、JPEG、BMP、GIF、TIFF | jimp(纯 JS) |
| 扩展 | WebP、AVIF、HEIC/HEIF、JPEG2000(.jp2/.j2k)、SVG | sharp(预编译 libvips),jimp 失败时自动后备 |
| PDF 内嵌 | JPEG、Flate(含 PNG/TIFF 预测器)、ASCII85/Hex、RunLength、JPEG2000、Indexed/ICCBased/CMYK/灰度 | 自研对象级解析器 + 上述解码器 |
| 不支持 | PDF 中的 CCITT Fax 黑白压缩图、纯矢量图形(非位图) | — |
未安装 sharp 时仅影响扩展格式(提示“格式不支持”),其余功能不受影响;
npm install会一并下载 sharp 的预编译二进制,无需本地编译。
git clone https://github.com/PetCT/dsh-Bio-image-dup-check.git && cd dsh-Bio-image-dup-check
npm install # 安装 jimp + sharp(平台预编译二进制,无需本地编译)
node hash-worker.mjs --selftest # 自检算法(翻转/旋转/局部复制判定)
node make-demo.mjs && node hash-worker.mjs --dir demo --threshold 8 # 端到端冒烟
然后在任意 DSH 会话里:
host.js,把文件内容整体粘贴到 cordis_define 的 code.host;client.js,把文件内容整体粘贴到 code.client;cordis_run 激活(Client 半部分需在 Run 卡片勾选授权)。⚠️ 唯一需要配置的地方:
host.js顶部有一处WORKER_PATH常量,请改成你本机hash-worker.mjs所在的绝对路径(动态插件沙箱无法探测/引用文件,这是设计如此;路径写错时会给出明确报错提示)。
DSH 设置 → 「科研图片查重」,三种入口:
查看报告:摘要、子文件夹汇总、重复分组、疑似重复/变换对(可按类型/文件夹筛选排序)、疑似局部复用(裁剪对比图)、相似度矩阵、局部重复区域高亮;点「导出 HTML / Markdown / JSON」保存报告。
直接对 DSH 说:「帮我查 G:\papers\figures 目录下的图片重复」,或调用:
check_image_duplicates(folder="G:\papers\figures", threshold=8, recursive=true)
N 0 obj 分段 + 递归字典解析(含对象流 ObjStm、间接颜色空间、SMask 排除)→ 按页面内容流 Do 操作符精确映射页码(支持 Image-xxx 等带连字符名称、Form 递归)。详细设计见 SPEC.md,算法口径见 CHANGELOG.md。
.
├── host.js # Host 半部分(动态插件)
├── client.js # Client 半部分(动态插件)
├── hash-worker.mjs # 哈希引擎(Node + jimp + sharp + PDF 解析)
├── make-demo.mjs # 生成演示图
├── package.json # jimp / sharp / pdf-lib 依赖 + 元数据
├── cordis.patch.yml # 持久化安装用的 bundle patch(可选)
├── SPEC.md # 设计规范(v1.1 基线 + 实现状态补充)
├── CONTRIBUTING.md # 贡献指南
├── CODE_OF_CONDUCT.md # 行为准则
├── CHANGELOG.md # 更新日志
├── README.md
├── LICENSE # MIT
└── .github/
├── workflows/ci.yml # CI:语法 + 自检 + 目录/PDF 冒烟
├── ISSUE_TEMPLATE/ # Bug / 功能请求模板
└── PULL_REQUEST_TEMPLATE.md
作者是一名生命科学博士,这个工具最早就是为了自己投稿前查自己稿件的图片问题而写的。它围绕真实论文图片(组织切片、Western blot、凝胶电泳、流式图、PDF 稿件)打磨,算法与流程经过多轮真实稿件验证。
诚实地讲:作者不是专业开发者(代码可能不符合“工程最佳实践”),但产品目标是实打实解决科研图片查重的痛点。因此:
limit);拖拽模式单批 ≤60 张;PDF 单文件 ≤100MB、检测限时 240s。MIT — 见 LICENSE。收录 ≠ 背书;请只对你有权使用的图片运行检测。
© 2026 PetCT
CLASSIFICATION EVIDENCE
系统优先读取 GitHub Topics,再与站内分类词典和词根规则比对。当前命中: image-duplicate-detection、pdf-analysis、perceptual-hash、research-integrity、scientific-images。