WeKnora
Tencent
Open-source LLM knowledge platform: turn raw documents into a queryable RAG, an autonomous reasoning agent, and a self-maintaining Wiki.
PROJECT TOPICS
INSTALL REFERENCE
dsh plugin --profile web add github:cwbcheng/dsh-knowledge-graph
该命令指向仓库当前默认分支;尚无绑定当前 commit 的完整验证结果。
PROJECT README
DSH(DeepSeek Harness)Cordis 插件:把任意一段资料正文、包含文字 / 图示 / 表格的图片——或一段 AI 会话执行轨迹——用 AI 拆解成一张知识图,并在知识图与原文之间双向定位。
贴原文 → AI 异步拆图 → 双向锚点定位。是 NovelStudio「资料 ⇄ 知识图」落地为独立、可复用插件的形态。
documentId 是随机稳定的逻辑文档 UUID,sourceId 是全文 SHA-256 的不可变版本身份,chunkId 绑定 sourceId + batch + paragraph range,因此不同文档/追加版本不会因局部 chunk-0001 重号而覆盖。常驻模式把全文、canonical graph 与无损 checkpoint 保存在 SQLite;刷新后浏览器只凭 documentId/runId 恢复,只有 Host 重启遗留的 running 任务才允许从 checkpoint 续跑,显式 failed/cancelled 任务绝不自动重试。attachments.saveImages() 验证并保存,再用多模态模型生成带图片范围的视觉转写;知识抽取器只消费这份转写。对于已导入 Markdown 文件夹且保留附件的知识图,在「图片解读与节点」中可搜索、筛选并勾选任意 1–4 张未解读图片,将转写追加为有来源标记的段落与候选节点,不覆盖原始 Markdown 或旧节点内容。逐图查看原图、转写、识别疑点与全图关联节点;超出当前渲染窗口的节点也可点击定位。结果页保留原图预览与 source.visualSource 回链。视觉转写可把箭头 / 连线、分组 / 包含、对象对应、顺序和具有图例语义的颜色 / 形状编码拆成独立关系单元;无法准确映射到内置 relation 的关系保留为原子 fact / claim,不强套错误边。AI 转写不是原书文字,也不能单凭文字引用证明像素内容正确;新增节点保持待复核,关键文字、数值、表格和连线关系须对照原图。fact 事实 · claim 主张 · inference 推论 · concept 概念 · definition 定义 · example 例子 · counter_example 反例 · rule 规则。supports 支持 · example 例子 · counter_example 反例 · defines 定义 · infers 推断 · causes 因果 · is_a 属于 · contains 包含 · driven_by 受驱动于 · not_is 不是 · analogy 类比说明 · aims_at 旨在。claim 而不是 fact;保留“可能 / 多数 / 通常 / 必须 / 如果”等原文限定;存在更精确关系时不退化成 supports。learning-view-v1):第二套抽取本体,不是对既有图的重切。节点类型与关系类型改为于建国《学习观》的本体:知识(concept 概念 / feature 特征 / rule 规律 / discrimination_model 判别模型 / connection_model 联结模型)与学习材料(intension_description 内涵描述 / feature_description 特征描述 / positive_example 正例 / negative_example 负例 / contrast_group 对比例组 / extension_contrast 外延对比 / relation_material 关系材料 / factor_material 因素材料 / property_material 性质材料 / segment_example_group 分段例组 / verification_material 验证材料 / data_or_experience 数据或经验 / memory_material 记忆材料)分开建节点,共 18 类节点 + 21 类关系。每份材料由两个正交坐标刻画:modelKind(判别 / 联结)与 layer(上料 / 下料),从而能诊断知识坍缩——上层丢失、下层丢失、下上错配、判联错配、联结空载、记言代学、言存义空、义存言空、验证复用旧例、缺验证、学习材料当记忆材料。抽取仍然只走 LLM,产出的仍是可存 / 可查 / 可导 / 可增补的知识图;未标注本体的既有文档一律按原来的命题本体处理,行为不变。怎么用:抽取表单右上角的「知识图模式」选《学习观》即可;默认仍是命题本体,且默认值不作为参数发送,老行为不变。一份文档按它自己被抽取时的本体显示(图上有模式徽章、图例、坐标网格、诊断条与边属性),已存在的老文档仍是命题图,要看《学习观》版本需重新抽取一次;模式只影响新抽取,不会改写文档的本体。边上的属性也来自本体:maps_between 的 role(输入/输出)、contrasts 的正负、compares_* 的 mode(对比/类比)都会拼进边的标签,值标签由本体下发,命题本体不声明属性也就不显示。布局也读本体:分层视图的主干道、卫星吸引与分支道改由该文档 relationTypes 的 family / weight 现算,所以《学习观》知识图按它自己的结构铺开,不会因为关系名不在命题表里而退化成毛线团。规范见 docs/learning-view-ontology.md。causes/infers,各本体由 relationTypes[].family = backbone 声明)作为主路径,把卫星关系放成邻近分支,并将方向关系(family = directional)作为有界软邻近偏好。这些关系集合与权重全部来自当前文档的本体,不在客户端写死。多条边共享节点或行间通道时,箭头入口、水平通道和垂直走廊分别分轨,并为密集的水平轨道保留更高的层间通道;相邻关系标签发生碰撞时会在可读距离内确定性错位;极端拥挤且无可用位置时默认隐藏标签芯片,悬停或选中对应关系仍会显示,避免线段、标签及箭头挤在一起。新用户默认使用分层布局,已有本地布局偏好保持不变。… 省略),完整内容随时可在详情卡片中查看;− 100% +(50%–200% 步进 10%)/ 长按节点查看原文摘录 / 键盘可达。documentId、标题、计数等轻量索引,回看时从 Host/SQLite 重新载入正文与 canonical graph,避免把书级正文复制进 localStorage。evidenceId,每个被接纳的回答片段都必须有节点、关系或原文段落证据。点击检索结果或 citation 可回链图与原文;节点即使位于当前 800 节点渲染窗口之外,也会先按 node ID 加载 canonical 子图再定位。documentId/revision 引用,因此切换标签页或刷新页面后会从 canonical state 恢复,拆分进行中切走再切回会自动续接轮询;会话继续产生新事件后,可点 追加新事件 只拆解新增部分并在同一 revisioned document 上增量合并(跨事件建立关系边);轨迹事件列与图列的宽度、结果区高度均可拖拽调整并记忆。先从左侧栏的「知识图」打开工作台,生成知识图,或从历史记录打开一张已保存的图。工作台按当前工作分为四区,切换不会自动调用模型、修改知识图或取消正在运行的审校任务:
工作区切换保留当前输入草稿、检索结果、筛选和问题上下文。模型选择留在页头,知识图模式和生成并发放在「运行设置」中。正在运行的深度审校进度不会随工作区隐藏;完成后点「查看审校报告」直接进入审校区。
| 功能 | 入口与操作 | 会发生什么 |
|---|---|---|
| 增量审校 | 在「审校处理」点「增量审校」,核对弹窗中可复用批次、待审批次、模型和最低请求数,再确认。 | 仅复用输入、原文、模型及审校规则依赖均未变化且已保存的历史批次;变化部分重新调用 LLM,本地规则仍检查全图。与「AI 全图深度审校」的全新审校不同。复用不等于免费或零请求,也不会自动采纳修复。需要已保存的 canonical 图和可复用的历史审校批次;没有可复用批次时计划会显示仍需全部审校。 |
| 问题组与批量修复 | 在「审校处理」的「批量二次核实」中,保留「显示全部问题」可跨组核实当前筛选的下一批;也可按问题类型或原文选择一组。核实后先点「检查冲突与修改」,逐项查看判定及修改前后,最后点「确认保存本批处理」或「确认保存本组处理」。 | 同组共享图与原文上下文,但每个问题独立核实;批量仅接纳原文逐字支持的安全修复,其他结论留待单独处理。冲突项不会强行写入。保存是一次带版本校验的提交;若此后没有其他图修改,可撤销上一批/组保存,不能覆盖后续编辑。核实会调用所选模型,建议先用小批量。 |
| 阅读地图 | 在结果区点「阅读地图」,按来源章节进入,按「图中概念线索」筛选条目;点条目或「原文 P…」引文定位图与原文,可翻页或跳页。 | 给大图提供「章节 → 知识条目 → 可核对原文」的阅读路径。「概念线索」和阅读起点是从图派生的候选组织方式,不是作者亲自标出的核心论点;没有可核对引文的条目会明确提示。打开地图不改图、不调用 LLM。 |
| 联结模型工作台 | 在「图文阅读」点「联结模型」,从全图目录按章节、关键词、概念作用或待核对状态筛选。查看输入、映射与条件、输出,以及规律、例子和原文。方向修改需先预览,再明确确认保存。 | 使用已有 connection_model、maps_between 及用户确认的可选模型结构。旧模型不会自动转换;未定角色、异常关系和错误示例保持可见,不从节点顺序或名称猜方向。阅读不修改图,保存有版本校验。 |
| 独立槽位、分支与配对实例 | 在模型详情点「核对结构」,分别整理槽位的概念、输入输出角色、单位和时间状态;同一概念可作为多个独立槽位。填写条件、映射、边界的来源身份与引文,按槽位和分支记录情境、状态及推测过程。「下上对照」按分支浏览实例,点击实例状态高亮对应槽位。原有图谱端点可另行展开,差异和异常不会被新槽位遮住。 | 每项更改须预览修改前后并确认,只更新该模型的 modelStructure,不自动添加关系边。原文引用必须匹配已存来源;用户整理、AI 建议与待核对内容明确区分。配对完整性与分支覆盖不代表规律已验证;映射是结构化文本,不执行公式或推测链。失败、切换与版本变化保留草稿,旧版本不能覆盖新图,删除被引用概念会被阻止。 |
| 结构缺口与原文选取 | 在模型详情点「结构缺口」,查看缺少的输入输出、分支条件、配对状态和来源记录;点击缺口进入对应草稿字段。尚无实例绑定时,先明确「补齐输入槽位」或「补齐输出槽位」,再填写空状态。分支字段可「从原文选取」连续片段,保留限定语与出处,预览后确认保存。 | 诊断覆盖该模型的全部已记录分支与实例,分页显示;不是正确性或学习掌握度评分。候选原文包含模型及相关材料上下文,不保证支持所选字段。原文选取不调用 AI、不自动补全或写图;替换现有内容须确认,编辑后旧预览失效。读取和提交均沿用已存段落身份,不因新版全文切分改变引用编号。旧 Host 缺少能力标记时明确禁用诊断与原文选取。 |
| 模型比较 | 在模型详情点「模型比较」,明确选择第二个模型;默认筛选共享概念端点,也可取消筛选搜索全图。并列核对输入、输出、完整联结表述、条件、材料和引文;「查看模型 A/B」打开完整材料,「挑战模型 A/B」进入对应模型的反例练习。 | 相同概念身份、已记录角色、单位与时间状态是结构比较依据,不是模型等价或矛盾的判定。同名但不同身份的端点单列,未定或重复关系不会被算作完整方向。已整理的条件分支可并排阅读,旧模型显示未结构化;不自动推断适用性,不建立类比边或推测链。 |
| 两步推测草稿 | 在模型详情点「两步推测」,明确选择第二个模型和两个分支,填写全部已知输入、预测、条件及应用过程;按独立槽位选择承接上一步的输出,分别记录含义、单位口径、时间状态与对象范围的核对依据。「检查推测缺口」标明停在哪一步,草稿可导出 JSON。 | 候选覆盖全图,仅按概念身份与已记录的输出→输入方向筛选,不代表相容、因果或可迁移。缺少任一输入、方向不明、单位或时间状态未定或冲突、错误示例、类型说明及已驳回模型会阻断;上一步有缺口时,其手填输出不能供给下一步。同名异身份不能直接承接,不自动换算、逆推、执行公式或合成概率。完整状态仅说明字段齐备,含义、对象与适用性仍是未独立核验的用户自述;限定语、字段来源与循环风险保留。仅缓存当前标签页的个人草稿,不写正式图谱或长期学习记录;切换第二模型需确认,旧版本保留文字但暂停检查,必须明确对照后换基准。 |
| 草稿导回继续编辑 | 已选择两模型的草稿即使尚未检查或仍有缺口,也可导出 JSON。「导入推测草稿」读取文件后先预览文档、模型、来源版本、情境和槽位数量,再明确确认替换当前文字;兼容已有检查结果导出文件。 | 文件最多 2 MiB;错误格式、文档或模型身份不匹配、未来版本及缺失模型不覆盖当前草稿。文件中的旧检查结果和模型快照不作为当前依据;只恢复可编辑文字,旧版本仍须明确对照后换基准。读取期间编辑或切换范围会取消过时导入,不自动检查、保存长期学习记录或修改图谱。 |
| 情境预测与反例挑战 | 在联结模型详情点「情境预测」,选择新情境预测或反例挑战。后者先写基准情境与预测,再写只改变的一项、保持不变的条件、改变后的预测和能反驳联结的观察。保存预测后显式展开原文,填写并保存复盘。 | 学习记录独立于正式图谱,保留当时模型与引文快照,最初预测和已完成复盘不可覆盖;两类练习的历史和标签页草稿分别保存。仅改标点或排版的情境变化会被拒绝,是否真正受控、是否构成反例仍未核验;边界外不适用不是边界内被反驳。不会自动打分、声称掌握或修改图谱。常驻 Host 支持持久保存,临时动态 Host 会明确提示持久化不可用。 |
| 我的理解 | 在联结模型详情点「我的理解」,独立填写输入判别、联结规律、输出判别、条件、边界与疑问,对照原文模型后保存;可关联已有预测或复盘,填写修改理由,追加修订版本。 | 复用学习记录存储,不另建个人图数据库;保留当时模型、字段来源与练习快照,不覆盖正式图谱、旧表述或练习。并发修订和图谱版本变化阻止旧草稿直接保存,重读后草稿仍在,须明确对照新基准。无来源或表述不完整仍可作为个人记录,不自动评对错、掌握或新颖性。历史与各类可选练习展示最近 100 条,最多关联 10 条。 |
| 渐构靶图 | 在「图文阅读」切换「渐构靶图」,从概念、判别模型或联结模型建立个人靶图。上层整理输入内涵、规律与输出内涵,下层配对具体情境、全部输入、推测过程和输出;支持多个必要输入、多例指向同一输出,以及尚无例子指向的陪域取值。 | 表述、例子和修订独立保存为个人记录,不写正式图谱。预测须先保存再填写对照,保存后不能事后改写;可查看预测时的上层快照。草稿按文档、节点身份及图谱版本隔离,旧版草稿可重新打开但不能覆盖新版。个人判断、资料答案、观察记录和 AI 建议均不是独立核验或掌握证明。详见 渐构靶图。 |
| 验证结果记录 | 打开已保存的预测或反例挑战,记录真实观察、参考资料、公式或规则推导、AI 建议或个人复盘;填写实际条件、比较依据与自述诊断。真实观察须确认已发生并记录日期和时区;原文引用须先显式展开当时对照。结果可追加更正,修订个人理解时冻结关联预测的最近 5 条结果。 | 复用学习记录,绑定最初预测、来源版本与当时练习版本;所有来源仍未独立核验,不是自动判分、外部证实或掌握证明。更正不计作另一份独立证据;并发更正须明确改用最新基准,保存回应丢失可按同一请求恢复。来源更新后仍可补记旧预测的观察,但不算当前模型的验证,旧引文不能定位到新来源。外部链接不自动读取,AI 不自动调用;每次预测展示最近 100 条结果,有限快照明确标注。新前端连接旧 Host 会阻止结果写入。 |
| 模型学习记录 | 在模型详情点「学习记录」,查看按来源分开的比较计数,按情境预测/反例挑战、来源、比较或诊断环节筛选,逐页打开最初预测和具体结果。 | 统计完整历史,先折叠更正链再筛选与分页,每格按预测去重;不同来源和多个比较列可能重叠,不合计为独立证据、正确率或掌握分数。一致与不同并存时不选胜者。旧图谱版本与当前版本分开计数,自述未见不证明新情境。列表每页 20 次预测,结果预览最多 5 条;筛选命中的更早结果可直接定位,不受最近 100 条历史窗口限制。 |
| 诊断对应材料 | 在已保存结果点「查看诊断对应材料」,对照输入/输出角色、条件与边界或规律的当时材料,再点「带这次预测修订我的理解」,明确关联后编辑和保存个人修订。 | 按快照中的角色、材料类型与来源选取,不推断错误原因;尚未展开原文时引用仍隐藏,旧引文无法定位新来源。缺失材料明确提示,不自动补公式、调用 AI 或生成正确答案。关联不会替换已有草稿,也不静默保存;仍最多关联 10 次练习。 |
| 任务视图 | 先调整当前搜索词、筛选、章节、关注节点、关系聚拢、布局或阅读地图,再回到「图文阅读」展开「任务视图」,输入名称并点「另存新视图」。以后从下拉框选择并点「打开视图」;「更新所选视图」用当前状态覆盖它。 | 相当于当前文档的浏览书签,不是待办任务或另一张图。每张图最多保存 20 个;保存的是视图状态,不复制节点或原文。「删除」只删除书签,不删除知识图。图更新后重新打开会核查节点和章节,已失效的位置会清除并提示。 |
| 跨书概念档案 | 在「检索与学习」点「跨书概念档案」,选当前图的概念,查看同名候选或输入关键词点「查找候选」。核对各书的来源与原文引文后,勾选「纳入对照」,标注「相关,待辨析 / 不同用法、分歧 / 可能同义」,填写适用条件、时间及说明,再点「保存候选对照」。 | 保存一个可重开、编辑、删除的对照档案,不合并各书节点;同名只产生候选,不自动判为同义。来源表述是否忠实与现实中是否正确是两件事。来源图变化时档案会标记过期,需重新核对。 |
| 学习模式 | 在「检索与学习」点「学习模式」,选择「概念辨析」「机制解释」或「新情境应用」,阅读带原文定位的题目,填写回答;新情境题还需写一个不能照搬原文的具体场景。选自评后点「保存练习与自评」,可在「学习记录」中复盘。 | 练习从现有图和可定位引文派生,不是原文,也不自动判对错或证明掌握。缺少依据时对应题型不可用。回答、自评与原文知识图分开保存;图更新后旧练习保留但标为旧版。 |
联结模型目录的关键词也覆盖通过当前 canonical 概念与原文引用校验的已记录条件、规律和边界。新增字段搜索按同一字段内的完整短语筛选,只规范化全角、大小写与空白,保留运算符和箭头,不把 x > 3 与 x < 3 合为同一命中,也不把分散在不同字段或分支的词拼成一个条件。目录保留原文顺序、全图数量和既有章节/概念/角色筛选;响应中的 modelFieldMatches 最多列出 8 个分支/字段位置与声明的来源身份,余量明确,依据是 recorded_text_not_applicability,不代表适用性、正确性或掌握度。来源备注和实例不在这个目录搜索范围内;无效结构仍可按模型身份或标题找到并核对。
历史恢复、canonical 导出、联结模型目录、阅读地图和关系聚拢按完整 documentId 定位,不截取前缀、不去除首尾空白,也不合并全角或同名标识。这组只读入口的标识上限为 4096 个 JavaScript 字符,仍受各路由原有请求体预算限制;超限或类型错误明确拒绝,找不到完整标识时不会回退到前缀文档或客户端提供的图。候选列表也保留完整文档标识。本轮涉及的图提交、抽取、审校和个人学习记录入口没有扩大文档标识范围,仍限制为 160 字且无首尾空白;不支持的标识拒绝或报告未找到,不能截断后修改另一份文档。长标识文档的个人记录保存、任务视图和图片读取等其他入口尚未扩展,不应把只读恢复成功当作整个编辑流程已支持,也不能外推其他接口的身份契约。
以上视图、档案和练习都要求当前资料已保存为 canonical 文档。结构核对还要求 Host 返回对应版本的能力标记;新前端连接旧 Host 时保留阅读入口,明确提示版本尚未就绪并阻止结构写入,不把仅加载新前端当作完整部署。审校、核实和修复有模型费用或修改风险,先读计划与预览;阅读地图、任务视图、概念档案候选检索和现有图派生练习不需要模型调用。开发者另有审校质量基准和全图发现基准:样本由 Codex 复核,不是独立人工真值。隔离环境曾用 DeepSeek V4.1 Flash 对合成案例和一段公版原文实际运行并保留结果;这些小规模样本不能代表真实书籍的准确率,也不能把模拟预测当作模型成绩。
关系聚拢的文档版本、中心、各层邻接、分页顺序、节点内容和关联边来自同一 SQLite 读取快照。读取期间的更新或删除不会把新内容标成旧版本,也不会因另一份去空白后同名文档的版本而误报冲突;后续查询仍严格核查 expectedRevision,旧版分页不能接到新版图上。方向与层数仅表示已记录边的浏览范围,不认证因果、可逆性、条件成立或模型真伪。
原文段落的类型标签旁有 × 按钮,可在确认后删除该段落、该类型在当前节点窗口中的对应节点,以及这些节点的全部关联关系(含跨窗口关系)。原文、其他段落和其他类型的节点保留。修改通过已有版本校验保存到 SQLite,刷新后不会恢复;生成任务进行中不允许此操作。适合手动清理被误识别为知识的目录、署名等内容。
以下为早期图文对照截图,当前工作台入口按上面的四个工作区组织。
┌─────────────────────────────── 浮动工作台 ───────────────────────────────┐
│ ● 知识库 · 资料 ⇄ 知识图 [ × ] │
│ 知识库 │
│ 当前资料标题 [模型] [历史] [重新开始] │
│ [运行设置] │
│ [图文阅读] [检索与学习] [审校处理 · 待处理数] [资料] │
│ [原文 ⇄ 知识图] │
│ N 节点 · M 关系 [阅读地图] [任务视图] [导出] │
│ 原图 N 张 · 未解读 M 张 [打开图片节点] [图片解读与节点] │
│ [原文段落…带类型徽标] ‖ [知识图 SVG…] [− 100% +] │ ← 可拖宽竖条 │
│ ─────────────── 可拖高横条 ──────────────── │ │
└─────────────────────────────────────────────────────────────────────────┘
对话区「轨迹知识图」标签页:
┌────────────────────────── 轨迹 ⇄ 知识图 ──────────────────────────┐
│ 拆解本会话轨迹:用户消息 / 工具调用 / 工具结果 / AI 回复 │
│ 一句话总结:… │
│ [轨迹事件…带类型徽章] ‖ [知识图 SVG…] [− 100% +] ← 可拖宽竖条 │
│ ──────────── 可拖高横条 ──────────── │
│ (切换标签页 / 刷新页面后结果自动恢复) │
└────────────────────────────────────────────────────────────────────┘
这是一个 DSH 动态 Cordis 插件:一份 Host 代码(Node 进程)+ 一份 Client 代码(浏览器),纯 JS、零依赖、无需构建。通过 DSH Web 界面的 Cordis 插件机制加载,步骤适用于任何 DSH Web 会话。
dsh web);资料工作台不要求已有会话;agentDefaultModel)。插件默认跟随系统当前模型;工作台与「轨迹知识图」顶部均提供模型下拉框,可手动指定拆分、追加、AI 审校、质疑与外部核查使用的模型(选择会保存在浏览器本地);未配置时会给出明确的中文错误提示。图片抽取需要支持 image 输入的多模态模型;模型下拉框会标注已知的「图像 / 仅文本」能力,能力未知的模型允许尝试,但提供方拒绝图片时会以 model_image_unsupported 明确失败。git clone https://github.com/cwbcheng/dsh-knowledge-graph.git
cd dsh-knowledge-graph
| 文件 | 作用 |
|---|---|
src/index.host.js |
Host 半:异步 AI 拆分任务引擎(图片 admission / 多模态视觉转写、段落编号、分批、schema 校验、typed 诊断、模型路由、会话轨迹序列化)+ 知识图验证/质疑引擎 + canonical 结构化检索与 evidence-ID 证据问答 |
src/index.client.js |
Client 半:浮动工作台 UI、图渲染、双向定位、共享检索/证据问答面板、验证与质疑面板、修复应用/审计、历史、宽高调节、轨迹知识图标签页 |
src/kg-store.mjs |
SQLite 持久化层:文档、内容块、节点、关系、证据、候选实体/声明、抽取 checkpoint 与大图有界消费查询 |
方式 A:让 Agent 帮你安装(推荐)
在任意会话中把下面这句话发给 Agent(把路径换成你 clone 的位置):
请读取
dsh-knowledge-graph仓库的src/index.host.js和src/index.client.js,把这两个文件定义为 Cordis 插件的 Host 半和 Client 半,然后运行它。
Agent 会依次调用 cordis_define(定义)→ cordis_run(运行),并在界面上弹出运行审批卡片。
方式 B:自己复制源码定义
cordis_define(由 Agent 执行,或按你环境的 Cordis 工具流程操作);src/index.host.js 的内容,Client 半粘贴 src/index.client.js 的内容;export default function hostPlugin() { / export default function clientPlugin() { 这一行和文件末尾对应的 },保留中间的 return { ... }; 部分(文件头部注释可保留也可删掉)。不熟悉
cordis_define工具的话直接用方式 A,Agent 会自动处理好上面的取函数体步骤。
方式 C:常驻安装(推荐,重启不丢)
把本仓库安装为 web profile 的组合插件(与 dsh-hud 相同的社区插件包形态):Host 半走 webServer 路由、Client 半是 __ModuleLoader__ 浏览器模块,随 dsh web 启动自动加载,不需要每次重启后重新定义,也无需审批。
# 1. 在 profile 目录添加依赖与 bundle($DSH_HOME 默认 ~/.dsh)
cd ~/.dsh/profiles/web
# 在 package.json 的 dependencies 中加:
# "dsh-knowledge-graph": "github:cwbcheng/dsh-knowledge-graph#main"
# 在 package.json 的 dsh.profile.bundles 中加:
# "dsh-knowledge-graph"
pnpm install
# 2. 重启 dsh web(Ctrl+C 后重新 `dsh web`)
重启后:对话标题右侧出现「知识图」按钮。窗口位置、筛选和历史索引等轻量 UI 状态保存在浏览器 localStorage;正文、图、checkpoint 与 revision 由 Host/SQLite 持久化。
| 文件 | 作用(常驻包) |
|---|---|
lib/index.js |
Host 半:任务引擎 + /api/dsh-knowledge-graph 路由(抽取/追加、task status、document-load/canonical 来源成员校验 image-load/document-export、revisioned graph-commit、graph-query、answer-graph、安全 resume-extract、验证/质疑等)+ 自动 SQLite canonical graph / checkpoint 持久化 |
lib/client.js |
Client 半:__ModuleLoader__ 浏览器模块(fetch RPC + 手动样式注入) |
cordis.patch.yml |
bundle patch:向组合插入 dsh-knowledge-graph 行 |
src/与lib/是同一插件的两种部署形态:src/供动态插件(方式 A/B)使用,lib/供常驻组合(方式 C)使用,逻辑保持一致。
定义成功后运行会进入 awaiting approval(等待批准) 状态:
CLI 使用 Node node:sqlite,要求 Node 22.13+(无需 experimental-sqlite 启动参数)。导入必须用 DSH_KG_DB 或 --db 显式指定目标数据库,包含完整 sourceText,并通过与 Host 相同的确定性验收;导入文件不能自行授予 entailment verified。默认只允许创建新文档,覆盖已有文档必须传 --expected-revision N。
# 初始化数据库
npm run kg -- init --db ./data/knowledge.sqlite
# 导入含完整 sourceText 的完整图(不可使用截断的 task/result 窗口)
npm run kg -- import-graph --db ./data/knowledge.sqlite --input ./graph.json
# 查看候选实体或声明
npm run kg -- list-candidates --db ./data/knowledge.sqlite --kind entity --status candidate
npm run kg -- list-candidates --db ./data/knowledge.sqlite --kind claim --status candidate
# 接受 / 驳回候选
npm run kg -- set-candidate --db ./data/knowledge.sqlite --kind entity --id ent_xxx --status accepted
npm run kg -- set-candidate --db ./data/knowledge.sqlite --kind claim --id clm_xxx --status rejected
# 查看已持久化文档与 checkpoint
npm run kg -- list-documents --db ./data/knowledge.sqlite
npm run kg -- show-document --db ./data/knowledge.sqlite --id document_xxx
npm run kg -- save-checkpoint --db ./data/knowledge.sqlite --input checkpoint.json --run-id run_xxx
npm run kg -- load-checkpoint --db ./data/knowledge.sqlite --run-id run_xxx
# 查看可恢复版本;恢复会用 CAS 产生新版本
npm run kg -- list-revisions --db ./data/knowledge.sqlite --id document_xxx
npm run kg -- restore-revision --db ./data/knowledge.sqlite --id document_xxx --revision 2 --expected-revision 5
常驻包的 lib/index.js 会在每个成功 chunk 和任务完成时自动写入 SQLite;数据库路径由 DSH_KG_DB 指定,未指定时为当前工作目录的 .dsh-knowledge-graph.sqlite。npm run test:kg 会在内存 SQLite 中验证文档、chunk、evidence、候选状态变更、checkpoint 保存与恢复;npm run test:kg-consumption 覆盖动态 RPC / 常驻 HTTP / SQLite 检索语义、800 节点窗口之外与 600+ 常见候选之后的精确召回、relation-only 查询、上下文预算、revision fence、非法过滤器、node/edge/source citation 认证、未知及「真实但无关」evidenceId 拒绝和共享前端入口;npm run test:kg-timeout 使用不合作 provider 回归真实 wall-clock deadline、晚到 iterator 清理与即时取消;npm run test:kg-image 覆盖动态 / 常驻图片 admission、多模态 content block、文字 / 表格 / 图示转写、颜色分组与对象对应关系遗漏补漏、text-only 模型 typed 拒绝、visual provenance、canonical 来源成员校验图片读取、伪造 visual checkpoint 拒绝、转写后即时 checkpoint / runId 恢复及 SQLite 不落原始 base64;npm run test:kg-performance 在 10000+ 节点 / 关系图上验证 keyset 分页和有界返回;npm run test:kg-candidates 额外验证候选列表和状态更新。常驻包构建时会同步生成 lib/kg-store.mjs。
覆盖图时会在同一事务中保存上一版图和原文单元快照。旧版本中只有计数、没有快照的历史明确不可恢复,不会凭空补回内容。快照随修改次数增长,应随数据库备份。浏览器的“移出历史 / 清空历史”只隐藏索引,不删除 SQLite 文档;“恢复历史”可重新显示这些文档。
npm test 还包含独立流水线、CAS 与历史异步竞态、模拟 OCR 中断恢复和 CRX 载荷校验。流水线的使用与安全边界见 OCR 流水线。
日常启动、关闭脚本位于 DSH 仓库 deepseek-harness/scripts/,不在本插件仓库中。在 WSL 中执行(需已安装下方的 systemd 用户服务):
cd /mnt/d/github/deepseek-harness
npm run dsh:start # 等待知识图接口认证及就绪,打印本次地址
npm run dsh:stop # 先暂停可恢复任务,再关闭服务
# 也可从任意目录直接执行:
bash /mnt/d/github/deepseek-harness/scripts/start-dsh.sh
bash /mnt/d/github/deepseek-harness/scripts/stop-dsh.sh
这两个入口管理同一个 dsh-kgsrc-web.service,重复启动不会新建实例,关闭后不会被守护器自动拉起。运行环境、解释执行参数、profile 和数据库沿用服务配置;不会设置开机自启、重新导入资料或自动解除崩溃重启限流。默认使用 /opt/node-v24.14.0/bin/node 执行控制脚本,可通过 DSH_DEV_NODE 指定其他 Node。
关闭前若有可恢复任务,会请求暂停并等待检查点落盘;不能暂停、状态查询失败或暂停未完成时会拒绝关闭。暂停的任务在下次启动后需要手动“继续任务”。确实要强制中断服务时使用 npm run dsh:stop -- --force,这可能丢失最后一个检查点之后的未保存工作,但不会删除已有图或检查点。
DSH_CONTROL_TIMEOUT_SECONDS 调整启动/暂停的等待时间(默认 90 秒)。控制器默认连接 127.0.0.1:3099,可读取 DSH_SERVICE_UNIT / DSH_DEV_PROFILE / DSH_DEV_PORT / DSH_DEV_LOG / DSH_DEV_PID 指向其他已安装服务;这些变量只选择控制目标,不会改写 systemd 服务配置,必须与目标服务一致。
想让它跑在 /mnt/d/github 里那份 dsh 源码构建上(而不是 npx 装的那份),用 scripts/dev-web.sh:
cd /mnt/d/github/dsh-knowledge-graph
npm run dev:web # 前台启动,Ctrl-C 结束
npm run dev:web -- --detach # 后台启动并打印带 token 的地址
npm run dev:web:stop # 停掉后台实例
npm run dev:web -- --rebuild # 先 pnpm install + build(含本插件)
它沿用本地 DSH_REPO checkout,不会自动拉取或切换 Git 分支;缺少构建产物或显式 --rebuild 时安装依赖并构建。随后从随包 web 模板创建缺失的 profile,把本插件作为 bundle 层装进去,最后用独立端口和独立 profile 启动,不会碰其他实例。启动后会请求一次 ontology-list 确认插件真的回答了,因为插件加载失败时外壳照样能起来,「起来了」不等于「能用」。源码或构建脚本比 lib 新时会自动重建插件。端口被占用时直接报错退出,不抢端口。
每次启动会将插件的 lib 运行模块、package.json 和 bundle patch 固定到 $DSH_HOME/plugin-artifacts/dsh-knowledge-graph/<构建哈希>,profile 通过本地 link: 指向该份快照。正在运行的实例不再因开发目录的后续构建而提前更换客户端;只有下一次明确启动才同时加载新的 Host 和客户端。相同构建复用,旧快照保留,不自动清理。复制期间产物变化、既有快照校验失败或安装后未指向预期快照,均拒绝启动,不以包管理器退出 0 代替安装验证。
快照只固定本插件的构建代码,不复制资料库、学习记录、凭据、源码或整个 node_modules;已安装依赖通过链接复用,因此不是整个 Harness 与依赖的可复现发布包。安装需要 PATH 中的 pnpm;仅有 Corepack 时,启动器使用其已有 pnpm shim,不改全局安装。此保护须在使用新版启动器启动后才生效,已经运行的源码链接实例不会被自动迁移或重启。
可用 DSH_REPO / DSH_DEV_PORT / DSH_DEV_PROFILE / DSH_DEV_LOG 覆盖默认值(默认 /mnt/d/github/deepseek-harness、3099、kgsrc)。
启动器会打印实际 Node 路径和版本,优先使用 PATH 中的 Node 24+,也可用 DSH_DEV_NODE=/opt/node-v24.14.0/bin/node npm run dev:web 显式指定。只在此启动器内拒绝已观察到原生崩溃的 22.20.0,不修改 NVM 默认版本;这是运行时规避,不代表已经证明或修复了 V8/系统层崩溃根因。源码和构建脚本更新后自动重建插件。
每次启动先归档旧日志,再读取本次进程的 token,并用 token 换取 cookie 验证本体目录接口的 HTTP 状态和 JSON 内容。只输出 URL 不算就绪;检查失败或进程退出会返回非零状态并清理此次启动的进程。DSH_DEV_STARTUP_SECONDS 可调整就绪等待时间(默认 60 秒)。前后台均记录真实 Node PID 和启动时间;--stop 只停止匹配的进程,绝不按端口杀其他服务。旧格式 PID 文件不能用于停止进程。
--detach 只负责脱离终端,不会在 Node 崩溃后重启。此机器的 Node 24.14.0 也曾在 Builtins_RegExpPrototypeTestFast 路径发生 SIGSEGV,升级版本不能视为根治。npm run dev:web -- --safe-runtime 可作为诊断性规避:只对 DSH 服务使用 --no-opt --no-maglev --no-sparkplug --regexp-interpret-all,禁用 JavaScript 优化/基线编译和正则 JIT,保留 WebAssembly,不改变全局 Node 配置或构建进程。代价是 JavaScript 更慢;它不能排除原生扩展、WSL 或硬件故障。不要替换为 --jitless:此版本 Node 的原生 fetch 依赖 WebAssembly,完全禁用会导致模型请求立即失败,即使服务入站健康检查仍能通过。
长任务可以使用 scripts/dsh-kgsrc-web.service 提供的 systemd 用户服务,安装前检查里面的仓库与 Node 路径。不要与同端口的前台/脱离终端实例同时启动:
2026-09-18 实测:解释执行模式下仍发生过原生崩溃,但守护服务与页面检查点恢复成功。这个模式不是“防崩溃保证”,也不能代替底层故障排查。证据与验证边界见 运行时故障记录。
mkdir -p ~/.config/systemd/user
cp scripts/dsh-kgsrc-web.service ~/.config/systemd/user/
systemctl --user daemon-reload
systemctl --user start dsh-kgsrc-web
systemctl --user status dsh-kgsrc-web
journalctl --user -u dsh-kgsrc-web -n 50
# 停止必须是有意操作,正在执行的模型请求会中断:
systemctl --user stop dsh-kgsrc-web
服务每次异常退出后等待 10 秒重启,5 分钟内最多启动 3 次,超过后保持失败状态,不无限重试。故障日志保留在 journal 和轮转后的 /tmp/dsh-kgsrc-web.log.previous.*;就绪通过前 systemd 的 active 仅表示启动器存活。需要看到日志中的认证健康检查成功才算插件可用。服务使用原 profile、DSH_HOME 和数据库,不重建任务;已保存的检查点仍由插件自己的恢复规则处理。不设置登录/开机自启,避免未经确认恢复付费模型请求。修复反复崩溃的原因后,才使用 systemctl --user reset-failed dsh-kgsrc-web 和 start。
隔离的服务恢复对抗测试:KG_TEST_SYSTEMD=1 npm run test:dev-web。它对临时假服务注入不可捕获的 SIGKILL,验证进程重建、接口重新就绪、重启限流及主动停止;不杀真实 DSH,也不调用模型或读写知识图数据库。
kg:quality-regression 固定使用 2844 字的 world-recognition 原文与 calibrated-v2 的 25 个 QA case。修复后观察基线为 24/25;默认门禁要求 trusted QA 至少 23/25(最多退化 1 case)、score 至少 92、节点至少 20。节点下限只是 catastrophic-collapse sentinel,不能替代 QA 分数。--graph 模式也会先校验 graph.sourceText 的字符数和 SHA-256;缺少原文或换了文章时返回 frozen_source_missing / frozen_source_mismatch,不会输出误导性分数。
# 检查已有 graph(不会调用模型)
npm run kg:quality-regression -- --graph ./graph.json
# 调用当前 DSH Host 做真实抽取,再检查并保存结果
npm run kg:quality-regression -- \
--base-url http://127.0.0.1:3080 \
--provider codex-proxy \
--model gpt-5.6-sol \
--output ./quality-run.json
CI 也可以设置 DSH_KG_QA_BASE_URL、DSH_KG_QA_PROVIDER、DSH_KG_QA_MODEL 后直接运行 npm run kg:quality-regression。门禁同时校验冻结原文的字符数与 SHA-256,防止通过改评测原文或 QA 尺子掩盖回归。
cordis_define(在同一个插件下追加新 Package),再 cordis_run(update 模式)切换到新版本;若你之前点了双勾,新版本会自动运行。pnpm install(拉取最新 #main)并重启 dsh web 即可。cordis_undefine。package.json 移除依赖与 bundles 条目,pnpm install 后重启。窗口布局、历史索引等轻量 UI 数据保存在浏览器 localStorage;书级正文、canonical graph、checkpoint 与 graph revision 在常驻模式保存在 Host/SQLite。卸载前如需长期保留知识内容,请保留对应 SQLite 数据库或先导出 JSON/CSV。
原图本身也是知识图节点。新生成的图片知识图或 Markdown 图会保存 image 来源节点;旧资料在「图文阅读」点击 打开图片节点,即可把已保留的图片加入 canonical 图并显示图片子图,不调用模型。重复打开不会重复建节点或增加图版本。第一次入图会增加版本,已有审校报告的版本状态随之更新,但不会改写原文或已有知识节点。
图片节点直接显示原图缩略图,可以放大查看;在图片详情中点击 定位图片节点,可聚焦该图片及其关联节点。视觉转写产生的内容节点通过 解读自图片(visual_source)连接到原图。未解读图片也能独立入图,但不会把附近正文自动认作图片内容。同名文件不是同一图片,不能按名称自动合并。
在「检索与学习」的节点类型筛选中选择 图片,可以检索全图中的图片节点并点击定位,不受当前图窗口限制。
image 和 visual_source 是受管理的来源记录,不扩大模型可生成的语义本体。来源连线不表示支持、因果或真实性认证,不能通过普通命题编辑、删除标签或关系合并来改写;内容节点改换转写来源后,对应连线会同步更新。图片节点和来源引用随完整 JSON 导出保留,图片字节仍由附件服务保存,不内嵌进 JSON。PNG 导出会嵌入已加载的图中缩略图;未加载的图片会明确阻止导出,需先查看相关图片子图。
在 图片解读与节点 点击一张图片,可放大原图、查看带段落编号的完整转写与识别疑点,再点击关联节点回到图文对照。节点数量来自完整 canonical 图,不受当前 800 节点窗口限制;没有抽出节点时明确显示「已保留转写,但没有关联节点」,不会把转写成功等同于建图成功。直接上传的图片也可在此核对。
常驻 Web 插件中,有持久化检查点的资料拆分、追加拆分和轨迹拆分任务提供 暂停任务,包括拆分后的关系补全与审校阶段。暂停会中断当前模型请求,保留已经落盘的内容块、并发待合并结果与关系候选;未完成的请求在继续时重试。
工作台的 生成并发 统一控制正文拆分、关系补全和关系审校,支持 1、2、4 路,默认 2 路;轨迹拆分仍保持串行。关系补全按固定分组顺序合并,每组完成即保存检查点;关系审校继续逐条验收完整证据,每批最多 16 条。遇到模型限流后,本次任务后续关系请求会降为串行,不通过缩减覆盖范围或跳过审校来提速。进度区显示后处理的并发上限、执行中请求数,以及已有的保存和审校进度。
未完成任务列表支持逐条删除:确认后清除该任务的拆分检查点和待合并结果,不删除已保存的知识图、原文或其他任务。删除不可撤销;后台任务运行或收尾时不允许删除,列表版本过期时需刷新后再次确认。
已有正文知识图至少包含两个节点时,可点击 继续关系检索(最多 N 批)。默认勾选「有上限连续检索」,预算为 3 批,可改为 1–20 的整数。Host 检索未覆盖主目标、独立审校候选关系,并分批保存;达到本次预算或本轮覆盖完成即停止,不再默认承诺持续到本轮完成。取消勾选则固定只检索 1 批;图已经连通也可以继续检索。
generation.relationCompletion 与运行中的 progress.completion 记录 maxBatches、completedBatches 和 stopReason。budget_exhausted 表示达到本次预算,不表示本轮检索完成;coverage_complete 仅表示本轮主目标已经覆盖;single_batch 表示单批停止。旧记录缺少预算或停止原因时会明确标为未记录,不推断为完成。relation_weave_failed 停止任务,不能跳过缺失组进入后处理或发布正式图。恢复时只重试未完成的发现组,不重新支付已缓存成功组的发现请求;缓存候选仍须接受独立语义审校。合法 edges: [] 与真正孤立的有效事实不因此失败。两种 Host 入口的 extract、append-extract 与 relation-retry 接受数值参数 relationBatchBudget(整数 1–20,非法值在模型调用前拒绝)。省略时,初始抽取/追加 API 默认 1 批;relation-retry 的 continuous: true 默认 3 批,其余默认 1 批。UI 显式传入所选整数,取消连续模式时传入 1。relation-retry 仍须传入 documentId 和当前 expectedRevision,省略 continuous 时保留单批默认行为。
结果上方非折叠区域显示 结构质量诊断:正文节点/关系数、孤立节点及比例、最大连通簇大小及比例、孤立概念锚点、背景说明节点数和本轮关系检索覆盖。孤立概念可定位回原文核查。这里有三类不同问题,不能互相代替:
因此,「确定性错误 0」不意味着图结构健康;「暂无结构警报」不是语义认证;「本轮检索已覆盖」也不等于所有关系已找到。结构提示是建议,不阻止合法独立事实保存,不要求强行连通,不按同主题自动添加边。正文至少 8 个知识节点时,孤立比例达到 40% 或最大连通簇不足 20% 会提示碎片化;孤立概念锚点另行提示。这些阈值不是验收门槛。
诊断来源明确区分:
graph.graphStructureQuality 是 Host 对当前载入版本的 完整 canonical 图生成的诊断;历史转发为 graph.view.graphStructureQuality 的形态也兼容。它不受 800 节点窗口、章节筛选或画布显示层影响。generation.structureQuality 是生成时快照,不是编辑后的当前图实时诊断。旧 Host 未提供全图诊断时,只有确实完整加载的图才能在客户端只读计算;截断窗口或查询子图只显示快照标签,或明确提示全图尚未评估,不用窗口中的孤立比例评价全图。totalTargets、searchedTargets、remainingTargets 指被作为重点检索主目标的记录,不是曾进入模型上下文的节点数;旧记录可能包含背景说明目标,不能直接等同于正文节点数量。缺少/不一致的覆盖记录表示未评估,未知计数不是 0;complete 仍不证明语义正确。画布上方的 图谱显示层(只读) 提供「全部」「正文知识」「版本与来源说明」,默认全部。仅筛选 GraphCanvas 的展示,不改变原文、本体、检索/编辑使用的 canonical 数据,不把投影写回知识图;边的选择、质疑和删除仍映射回原来的边对象及索引。正文与背景间的跨层边只在全部层同时呈现两端时显示。图像节点不参与知识结构连通性指标,但显示层保留属于该层的原图节点对象。原文点击、外部定位或定位被筛选隐藏的节点会恢复全部层;普通可见画布节点选择不会重置所选层。
内容层优先使用合法 contentLayer: "main" | "source_context"。旧图没有显式标记时,按所属章节与明确的编辑说明标题保守识别,例如「版本说明」「底本说明」「校勘说明」「转写说明」「来源说明」;普通正文中出现「版本」「来源」「年代」等词,以及笼统的「序言」,不自动归入背景说明。旧图默认全部展示,不自动迁移、删节点或改正文/本体。
无密钥 UI 回归见 kg-generation-structure-ui-smoke.mjs:直接读取客户端源码,用 stub h、只读 source helper 和 inert Host 执行快照与回调断言,不依赖生成 bundle、模型密钥或真实模型调用。
node scripts/kg-generation-structure-ui-smoke.mjs
生成正文知识图或轨迹知识图后,下方会出现共享的 「使用这张知识图」 面板:
answered、insufficient、out_of_scope 都是成功的语义结果。document-load({ query: nodeId }) 加载该节点及其邻居后再定位,而不是把“当前没渲染”误判为“图中不存在”。graph-query:有界结构化检索动态插件调用 host.call('graph-query', body);常驻包调用 POST /api/dsh-knowledge-graph/graph-query。公开请求以 logical document 为边界:
{
"documentId": "document_xxx",
"expectedRevision": 4,
"query": "断点恢复",
"nodeIds": [],
"types": ["fact", "rule"],
"relations": ["supports", "causes"],
"sectionIds": ["section-2"],
"groundingStatuses": ["grounded"],
"entailmentStatuses": ["verified", "uncertain", "unverified"],
"limit": 20,
"hops": 1,
"direction": "both",
"maxNodes": 80,
"maxEdges": 240
}
nodeIds / types / sectionIds / groundingStatuses / entailmentStatuses 是 hard filter;非法枚举返回 typed invalid_input,不会静默丢弃后退为全图查询。types / relations 按文档自身的 canonical 本体校验。《学习观》文档可筛选 connection_model / factor_material 等 18 类材料及 maps_between / states_mapping 等 21 类关系;未标本体的旧文档仍使用命题本体。受管理的 image / visual_source 在两种模式均可筛选。请求自带的 ontology / graph 不能替换已保存文档的本体;常驻校验与检索共用同一个 SQLite 读取快照,非法值或超过 40 项的列表整体拒绝。relations 限制返回/扩展的关系类型;direction 为 both | in | out。relations 也可单独作为 selector:Host/SQLite 会先从匹配关系的端点播种直接候选,而不是从文档开头任取节点;没有匹配关系时返回空结果。存储边方向不等于模型输入/输出角色:maps_between 的角色仍由 role 记录,缺失角色不会被推测补齐。matches 只包含直接命中;graph.nodes/edges 还可包含 0–2 跳邻居。直接命中的原文单元优先于邻居证据进入预算,预算截断量通过 metrics.sourceRefsOmitted 暴露。connection_model.modelStructure 已记录分支的 condition / mapping / boundary 文本,不要求把条件复制到模型标题。只解析通过形状契约的上述文本,不搜索来源备注、实例、任意扩展字段或 JSON 序列化内容;未知角色、假设、错误示例和冲突来源仍可被发现,不因此获认证。命中记录的 modelFieldMatches 最多给出 8 个分支/字段位置及声明的来源种类,余量明确,basis: recorded_text_not_applicability;部分关键词跨字段命中不变成完整短语或条件满足证明。现有客户端可以据关键词找到模型,但本轮没有新增字段命中高亮界面。documentId、revision、matches、有界 graph、可回链 sourceUnits 和 metrics,不返回完整 sourceText。动态与常驻模式都对公开 node/edge/evidence 做字段与长度投影,sourceUnits 不再重复携带 quote 数组,并对聚合上下文设置硬 envelope;metrics.contextChars/contextBudget 可用于观测。limit_exceeded,不改变正式存储,也不返回看似可用的截断身份。此保证限于消费检索与问答读取,不扩大其他学习或写入 API 的身份长度契约。maxNodes/maxEdges 时也会严格遵守。modelContexts 是单独的有界模型记录,最多检查已返回节点中的 8 个模型,合计不超过 48000 字且不扩大原有总 envelope。recorded_core 仅表示记录的独立槽位和全部条件分支已读取、身份与引文可在同一 canonical 快照内匹配,不是语义正确、事实成立或掌握证明。同一概念的多个槽位、未知角色、单位、时间状态、内容身份、限定语和 source/user/AI/unknown 来源保持原样;概念引用不占用或扩大 graph.nodes 的窗口。具体实例不在这个核心投影内,examplesIncluded: 0 / examplesOmitted 只说明核心范围,完整实例仍从模型详情读取。modelExampleContexts 单独读取已返回完整核心的成对实例,最多 8 条,每个模型按存储顺序检查前 2 条;合计最多 12000 字,与核心共用原有总预算。情境、独立槽位绑定、分支、过程和来源整条保留,单条超过 8000 字或预算不足则整条省略,不裁掉必要输入。全局与分模型计数区分包含、省略、实际检查、无效引用和预算省略;未检查的实例不能假定有效、覆盖全部分支或不存在。核心未读取时不返回无法解释角色的实例。fieldCheck 只报告缺失绑定、未知角色、未指定分支和过程是否已有文字,basis: recorded_fields_not_applicability,不判断条件满足、单位相容、计算正确或事实成立。source/user/AI/unknown 是声明的材料来源,不是观察结果认证;source 引文也必须在同一快照的实际原文中完整匹配才有引用入口,超出引用长度的引文不经截断获权。问答把实例与其完整核心作为一条 JSON 接纳,若放不下可保留完整核心并明确省略实例,不混配模型;这些已含输出的材料不是未见题或新情境验证,也不自动写学习记录。omitted_budget / invalid,没有结构则为 not_recorded;超过 8 个的模型通过 omittedModels 报告。字段来源引文补入实际原文读取,只有 source 身份及当前返回原文中的匹配引文可进入问答引用目录。个人或 AI 字段不能独立成为来源证据。问答的 24000 字提示词预算也按整条模型 JSON 接纳或省略,并单独说明省略量,不执行公式、逆推或模型链。document_units 回填和可选 source fallback,不再先查 SQLite、再把结果交给 Host 做第二次检索/重组。词汇候选和 source fallback 使用 keyset 分页,避免随页码增长的 OFFSET 重扫;queryId 包含全部规范化 selector 与有效预算。expectedRevision 与 canonical revision 不一致时返回 revision_conflict,避免把旧 UI 状态与新图混用。抽取、重新抽取、追加与 checkpoint 恢复也会记录启动时 revision,并在发布 canonical replacement 时执行同样 fencing。busy_timeout,在建表与迁移前生效;调用者明确设置的非零超时保持不变。短时独立读写锁可等待释放,但持续锁仍报错并回滚,原始 revision 条件不自动刷新,不在应用层反复重放写入;不更改日志模式或降低持久化门禁。answer-graph:canonical graph + 原文证据问答answer-graph 是异步任务,复用既有 task-status / task-cancel:
{
"documentId": "document_xxx",
"expectedRevision": 4,
"question": "为什么检查点能够支持断点续跑?",
"types": [],
"sectionIds": [],
"hops": 1,
"model": { "provider": "...", "model": "..." }
}
启动响应:
{ "taskId": "kg_xxx" }
任务完成后的核心结果:
{
"status": "answered",
"answer": "根据这份资料:\n恢复要依靠检查点。",
"answerStyle": "natural",
"parts": [
{ "id": "part-1", "text": "恢复要依靠检查点。", "evidenceIds": ["ev3"], "mode": "natural" }
],
"citations": [
{
"id": "ev3",
"targetKind": "node",
"targetId": "n12",
"nodeId": "n12",
"paragraph": 8,
"quote": "恢复依赖检查点。",
"groundingStatus": "grounded",
"entailmentStatus": "unverified"
}
]
}
安全与可信边界:
attachments.saveImages();之后任务、checkpoint、canonical graph、task-status 与 SQLite 都只保留不可变 attachment ref / 元数据,不持久化原始 base64。saveImages() 前预检已明确声明为仅文本的模型,避免这类确定性失败写入附件。DSH 当前公开附件契约是持久化、内容寻址存储且没有插件可调用的删除 API;因此能力未知的模型、模型超时或视觉 schema 失败发生在 admission 之后时,底层附件的保留周期由所配置的 DSH attachment backend 决定。对敏感图片应同时遵循该 backend 的留存 / 清理策略。image-load 不接受任意 attachment id:它先按 documentId(及可选 expected revision)加载 canonical source,再确认 imageId 确实属于 source.visualSource.images,最后才读取有界图片字节。公开 graph 可包含 attachment ref 以保留证据来源,但不直接包含像素字节。image-inspect 是只读接口,必须提交匹配的 expectedRevision,并检查图片的文档归属。它返回该图片的转写和每页最多 50 个关联节点,不包含原始图片字节,不调用模型,也不改变图谱或审校状态;版本冲突时拒绝混合旧图片与新节点结果。image-load 与其他 canonical document API 一样依赖 DSH Web 的同源 / 工作区信任边界;documentId 是高熵随机 UUID,但不是多租户授权令牌。不要把同一 DSH Web origin 暴露给互不信任的租户;Chrome 扩展的 /dsh-kg allowlist 不开放 image-load。documentId 的请求,Host/SQLite 只从服务端加载 canonical graph 与 source;客户端提交的 graph / text 不会成为事实源。evidenceId。模型只能返回 parts[].evidenceIds,不能自行声明 nodeId/paragraph/quote。answered part。通过初筛的草稿会接受一次单独的逐句语义核验:核验输入只含问题、草稿和对应的已认证原文 quote;只有核验明确判为 supported 且返回的 evidenceId 属于该草稿时,模型写的自然解释才会展示。核验缺失、格式错误、拒绝或超时时,该 part 只展示 Host 从已认证引文生成的原文摘录,标记为 extractive;所有 part 都无法准入时降级为 insufficient。answerStyle 区分 natural、mixed 和 extractive,每个 part 保留 mode 与回链引文。Host 在回答外统一注明“根据资料”,不把 grounded 或模型自评置信度当作外部事实验证。insufficient/out_of_scope 只返回固定语义文案;追问查询由 citation target ID / paragraph 确定性生成,界面只展示人可读的段落标签。targetKind=node | edge | source 分别支持节点命题、关系命题和图覆盖不足时的原文段落证据。关系结论可直接引用 edge evidence,而不是只拿端点节点充当关系证明。groundingStatus=grounded 只表示 quote 可回到 canonical 原文,不等价于外部事实已证实;外部真实性仍应使用「外部事实核查」。entailmentStatus 会原样进入 citation,UI 不会把 unverified/uncertain/unsupported 包装成已验证事实。llm.stream() 建立连接和完整异步迭代;生成阶段超时以 typed timeout 失败,独立核验阶段超时则退回原文摘录,取消均以 cancelled 结束。即使 provider 忽略 AbortSignal 或 iterator.return() 不返回,任务也会立即释放前台 busy 状态,晚到 iterator 会在进入 next() 前被幂等关闭,部分输出不会发布。运维/回归可用 DSH_KG_MODEL_TIMEOUT_CAP_MS(最小 20ms)把各调用点原有 deadline 统一下调;未设置时保留各阶段既有预算。在任意网页上选中文字,点浮动按钮「拆成知识图」,一键调用本机 DSH 服务生成知识图(弹窗内可直接拆分、看图、回链原文)。
extension/ 目录,零依赖打包:viewer.js 由 scripts/build-viewer.mjs 从 src/index.client.js 切片生成(d3/*.js 为内嵌 d3 模块的独立文件——MV3 扩展页禁止 eval,popup 用 <script src> 预载后 viewer 自动走全局 d3 快速路径),修改源文件后运行 node scripts/build-viewer.mjs 重新生成。chrome://extensions → 开启右上角「开发者模式」→ 把 dist/dsh-knowledge-graph.crx 直接拖进页面 → 点「添加扩展程序」。首次会提示"Chromium 无法验证此扩展程序的来源",属正常(未上架商店),照常使用。extension/ 目录。--load-extension 命令行加载(Chrome for Testing / Chromium 等未品牌化构建仍支持)。~/.config/dsh-knowledge-graph/extension-signing.pem,权限 0600),然后通过环境变量传给打包脚本:npm ci --prefix scripts/signing --ignore-scripts
export DSH_KG_EXTENSION_KEY="$HOME/.config/dsh-knowledge-graph/extension-signing.pem"
npm run pack:extension
私钥必须已经存在;脚本不会在缺失时自动生成新密钥。扩展 ID 由它派生,换密钥会改变 ID 并使旧安装失效。不要把私钥复制到 dist/ 或提交到 Git。脚本写入 dist/dsh-knowledge-graph.crx 和 dist/extension-release.json,逐文件校验 CRX 内部载荷与 extension/ 一致。CI 用 Python 3 复核载荷、版本和 SHA-256 发布记录,不需要私钥。
dsh web 且插件版本包含 /dsh-kg 扩展端点(常驻安装需先更新插件并重启 dsh web)。端点默认只接受本项目新 CRX 的扩展来源 chrome-extension://kffpcpfkpmfkicdnlckdphiplnhlbkof;若使用「加载已解压」导致扩展 ID 不同,启动 dsh web 前设置 DSH_KG_EXTENSION_ORIGINS=chrome-extension://你的扩展ID。只有显式设置 DSH_KG_ALLOW_LOCAL_ORIGIN=1 时才额外允许 localhost/127.0.0.1 来源,并返回 PNA 预检头;空 Origin 和任意其他扩展来源都会被拒绝。扩展路由还使用 endpoint allowlist,只开放 extract / task-status / task-cancel / list-models,不会暴露 document-load / graph-query / answer-graph / graph-commit 等 canonical 文档接口。chrome.runtime.sendMessage → Service Worker 写入 chrome.storage.session 并 chrome.action.openPopup()(Chrome 127+);弹窗读取选中文本后调用 http://127.0.0.1:3080/dsh-kg/extract,轮询 task-status 渲染知识图。DSH 服务地址可在弹窗底部修改并记忆(chrome.storage.local 的 kgBase)。┌─────────────── Host(Node 进程) ───────────────┐ ┌────────── Client(浏览器)──────────┐
│ extract / append-extract / task-status / │ │ │
│ trajectory-extract / trajectory-status │ │ 浮动窗口(shell.overlay) │
│ verify-graph (quick/standard) │ │ 输入区(可收起) │
│ question-graph (node/edge/graph) │ │ 原文 ⇄ 知识图(宽高可拖) │
│ fact-check (quick/deep, wikipedia evidence) │ │ 验证与质疑面板 / 修复应用 / 审计 │
│ graph-query / answer-graph (evidence IDs) │ │ 结构化检索 / 证据问答消费面板 │
│ split paragraphs (numbered) ───────────────►│ │ 外部事实核查面板 │
│ serializeTrace(会话事件) ───────────────────►│ │ 历史 / 诊断 / toast(悬浮) │
│ append: 已有图节点清单注入提示词 ────────────►│ │ 全局侧栏「知识图」按钮 + run 卡片启动条│
│ batches → llm.stream (typed retry ×2) │ │ 会话标签页「轨迹知识图」 │
│ schema validate → merge (dedupe/warnings) │ │ 轨迹 ⇄ 知识图双向定位 │
│ task Map; busy lock; 2h purge │ └──────────────────────────────────────┘
└────────────────────────────────────────────────┘
n1 开始命名节点,Host 在合并前无条件重编号冲突 id 并同步重写边,避免长文档后续批次的节点被当成重复 id 丢弃。evidence[{ documentId, sourceId, chunkId, paragraph, quote }]。Host 在写入门重新验证 quote 确实存在于对应 source unit,并按 paragraph 对应的 source-version/chunk 补齐 provenance;无法认证的 quote 不会被包装成 evidence。相同 Node/Edge 在后续 source-version 再次出现时会合并 evidence,而不是丢掉后来的证据。仅仅证明两个端点分别出现过,不足以证明 supports / causes / infers 等 relation。documentId 的检索/问答请求由 Host memory 或 SQLite 加载 canonical state,并用 expectedRevision 做 fencing;SQLite 一次完成 type/section/status/text 预过滤、全候选评分、有索引的 from/to relation 扩展、精确 source-unit 回填与可选 fallback,不再进行 SQLite → Host 双重检索。词汇候选按 (paragraph,node_id)、原文单元按 paragraph 做 keyset 分页并只保留 bounded top set,因此不会因为前 600 个常见词候选遮住后文精确命中,也不会因越来越大的 OFFSET 反复跳过旧页。响应把直接 matches 与扩展 graph 分开,优先保留直接证据,并限制节点、关系、evidence、原文及聚合 context envelope。evidenceId;模型输出 parts[{ text, evidenceIds }],Host 逐 part、逐句过滤未知/空引用,并用确定性词汇支撑、否定极性与 authority-status gate 拒绝「真实 ID + 无关/反向命题」、跨句限定词泄漏及未限定的未验证声明;通过后也不采用模型自由文本,而是从认证证据确定性渲染 part,再自行拼接最终 answer。这样 citation 不是事后给整段自由文本挂一个装饰性链接,而是每个被接纳命题的结构化准入条件。validateGraphInvariantsHost() 是生成与快速体检共用的 deterministic truth gate。每个 batch 在 merge 前都会经过 schema normalize + invariant 检查;blocking invariant 会把 typed 错误回灌给模型做定向重试(最多 3 次),paragraph 等可确定问题由 Host 安全修复,最终仍不合格的边可安全省略,但无法安全修复/锚定的节点会让任务以 invariant_violation 显式失败。所有 batch merge 完成后还会再做一次整图 gate,只有 invariantErrors=0 才能写入 canonical graph / SQLite。生成审计同时统计 evidence-backed / candidate / unsupported claim;没有可认证 quote 的声明不会被标成 grounded。paragraph 只是 anchor,不能等价于 claim evidence。可在 source 中认证的 quote 才使节点进入 groundingStatus=grounded;只有 anchor、没有 evidence 的节点为 candidate,伪造/无法认证的 quote 为 unsupported。语义蕴含另由 entailmentStatus=verified|unsupported|uncertain|unverified 表示;当前 deterministic gate 只认证 provenance,不会因为 quote 存在就声称“节点 text 已被语义证明”。快速体检分别显示锚点覆盖、证据覆盖和语义已验证比例。anchor_unresolved:node:...)中。[start, end) 偏移。轨迹首次拆解产生 documentId/revision/sourceId;后续 append 只提交 sessionId + documentId + expectedRevision,Host/SQLite 读取完整 canonical graph 与持久化的 traceText/traceEvents 后增量追加。浏览器 localStorage 只保存轨迹 documentId/revision 引用,不保存整图/全文,因此 >800 节点重复追加也不会把不可见节点当作不存在。graph.verification.auditLog。窗口化以后浏览器不再分配连续 canonical node id:新增节点使用 node_<UUID>,Host/SQLite 仍会拒绝不可见节点 ID 碰撞。merge_nodes 通过 semantic operation merge_node(from→into) 交给 Host 在完整 canonical graph 上执行,因此窗口外 incident edges 会被重定向而不是静默删除。所有提交都受 expectedRevision + invariant gate 保护;blocking 修改返回 invariant_violation,并发冲突返回 revision_conflict。timeout 与 cancelled 使用独立 typed 状态。取消 hook 在操作完成后移除,各 runner 在 finally 清理 activeTask;即使 provider 不合作,前台任务也不会被永久占住。nextBatchIndex、截至当前的完整语义图和任务启动时冻结的 baseRevision;append 还保存 baseSource / baseStaging。trajectory checkpoint 额外保存 traceEvents 与追加时的 baseTraceText/baseTraceEvents。无论通过 /extract 提交 checkpoint,还是 Host 重启后走 /resume-extract,恢复前都必须确认 canonical revision 仍等于该 frozen base;旧 checkpoint 不会被重新绑定到新 revision。常驻 /extract 还会在异步 revision lookup 前原子占用 busy slot,两个并发请求不能同时入场。已完成 batch 不重跑;checkpoint v2 不按 800 节点截断,并由 Host/SQLite 持久化;确定性失败不会自动续跑。checkpoint.relationWeave 候选记录,绑定原文、基础图、本体与分组计划。Host 重启后按 runId 恢复,只重试未保存的组;写入失败立即终止,不把内存进度显示成已落盘。候选不会提前覆盖正式图,恢复后仍需独立语义审校。进度区和未完成任务列表显示已落盘组数。旧检查点兼容,但无法追溯修复前从未保存的关系候选。scripts/kg-weave-recovery-smoke.mjs 使用真实子进程强制终止、SQLite 写入失败及检查点篡改验证这些边界。已生成图上的持续补全仍按检索与审校完成的轮次提交正式图。document-load 直接在 SQLite 执行 LIMIT/OFFSET,子图查询只读取直接命中节点、bounded incident edges 与一跳邻居,不再先把整图 materialize 到 Node 内存。浏览器一次最多加载 800 个节点,提供上一页 / 下一页 / 指定页跳转与按节点 ID、文本、类型或章节查询。JSON/CSV 完整导出仍显式读取 canonical graph。documentId | kind | nodeId 稳定键保存,保留原文 evidence 和回链能力。src/kg-store.mjs 把图结果写入文档 / chunk / node / edge 表,并按节点类型生成带 evidence 的候选实体与候选声明;canonical revision 提交时会删除已经失效的候选,同时用稳定 candidate id 保留仍存在候选的 accepted/rejected 状态。用户也可以通过 CLI 更新审核状态。kgExtractor 服务;它实现 extractChunk(input),输入一个自有 JSON 内容块和已有节点 id,返回标准图对象或 JSON 文本。未提供时自动回退到当前 LLM 路径,因此动态插件和常驻包都不增加硬依赖。KnowledgeGraphDto { summary: string, source?, staging?, nodes[], edges[], warnings[], generation?, verification? }
GenerationAudit { invariantVersion, status: 'succeeded' | 'succeeded_with_warnings', invariantErrors: 0, sourceAudit, retryCount, collapseRetryCount, autoRepairCount, autoRepairs[], initial: { nodes, edges }, coverage: { attemptedBatches, repairedBatches, addedNodes, addedEdges, prunedNodes }, connectivity?, grounding: { groundedNodes, candidateNodes, unsupportedNodes, evidenceBackedClaims, candidateClaims, unsupportedClaims, entailmentVerifiedNodes, entailmentStatus } }
Source { id, documentId, title, chars, paragraphCount, chunkCount, sectionCount, sections[] }
Staging { sourceId, documentId, chunkCount, chunks[] }
Evidence { documentId, sourceId, chunkId, paragraph, quote }
Checkpoint { version: 2, taskKind, sourceId, documentId, baseRevision?, baseSource?, baseStaging?, traceEvents?, baseTraceText?, baseTraceEvents?, nextBatchIndex, totalBatches, graph /* 无损 */, staging }
GraphView { nodes[<=800], edges[], view: { kind: 'window' | 'query', nodeOffset, nodeLimit, totalNodes, totalEdges, truncated, query?, matchedNodes? } }
GraphQueryResult { documentId, revision, query, matches[{ nodeId, score, reasons[] }], graph /* 有界直接命中 + 邻居 */, sourceUnits[], metrics }
GraphAnswerResult { status: 'answered'|'insufficient'|'out_of_scope', answer, parts[{ id, text, evidenceIds[] }], citations[{ id, targetKind: 'node'|'edge'|'source', targetId, paragraph, quote, ...provenance }], supportingNodeIds[], retrieval }
GraphOperation { kind: 'merge_node', fromNodeId, intoNodeId }
EntityCandidate { id, documentId, nodeId?, text, type, status: 'candidate' | 'accepted' | 'rejected', evidence[] }
ClaimCandidate { id, documentId, nodeId?, text, type, status: 'candidate' | 'accepted' | 'rejected', confidence?, evidence[] }
ExtractionRun { runId, documentId?, sourceId?, status, nextBatchIndex, totalBatches, checkpoint }
GraphExtractorService { extractChunk({ title, chunk, paragraphOffset, existingNodeIds, prompt, attempt }) -> KnowledgeGraphBatch | JSON }
Node { id, type, typeLabel?, text, quote?, paragraph?, evidence?: Evidence[], groundingStatus: 'grounded'|'candidate'|'unsupported', entailmentStatus: 'verified'|'unsupported'|'uncertain'|'unverified', documentId?, sourceId?, chunkId?, sectionId?, sectionTitle? }
Edge { fromNodeId, toNodeId, relation, relationLabel?, evidence?: Evidence[], documentId?, sourceId?, chunkId? }
GraphVerification {
lastReport?: VerificationReport,
stale?: boolean,
auditLog?: [{ ts, action, targetId, detail, reportId, before?, after? }]
}
VerificationReport {
reportId, mode: 'quick' | 'standard' | 'question',
createdAt, model?, scope: { kind: 'full' | 'node' | 'edge' | 'graph', ids[] },
summary, metrics: { checkedNodes, checkedEdges, errorCount, warningCount,
suggestionCount, anchorCoverage, evidenceCoverage,
entailmentCoverage, paragraphCoverage },
issues: Issue[]
}
Issue {
id, source: 'local' | 'ai' | 'question',
severity: 'error' | 'warning' | 'suggestion',
category: 'grounding' | 'type' | 'relation' | 'duplicate' | 'contradiction'
| 'completeness' | 'summary' | 'other',
targetKind: 'node' | 'edge' | 'graph', targetId: string | null,
title, detail, evidence: [{ paragraph?, quote? }],
confidence: 0..1,
proposedFix: { action: 'none' | 'update_node' | 'delete_node' | 'add_node'
| 'update_edge' | 'delete_edge' | 'add_edge' | 'merge_nodes'
| 'update_summary', nodePatch?, edgePatch?, mergeIntoId?, summaryPatch? },
status: 'open' | 'accepted' | 'rejected' | 'applied'
}
FactCheckState { lastReport?: ExternalFactCheckReport, stale?: boolean }
ExternalFactCheckReport {
reportId, mode: 'quick' | 'deep', createdAt, model?,
summary, metrics: { totalClaims, supported, contradicted,
partially_supported, insufficient, unverifiable,
out_of_scope, supportedRate },
claims: ExternalClaim[], warnings?
}
ExternalClaim {
id, nodeId?, kind, paragraph?, quote, claim,
checkworthy: 0..1,
verdict: 'supported' | 'contradicted' | 'partially_supported'
| 'insufficient' | 'unverifiable' | 'out_of_scope',
confidence: 0..1, rationale?, correction?,
evidence: [{ id, provider: 'wikipedia' | 'rules', url?, title?,
snippet, domainAuthority }],
evidenceQuote?, status: 'open' | 'accepted' | 'rejected'
}
paragraph(段落编号,确定性回链)与 quote(原文逐字摘录)。verification / factCheck 可选,旧版本生成的历史数据没有这些字段时按未验证/未核查处理,完全向后兼容。MIT © cwbcheng
CLASSIFICATION EVIDENCE
系统优先读取 GitHub Topics,再与站内分类词典和词根规则比对。当前命中: knowledge-graph。