返回目录
文件与数据 插件

dsh-data-analysis

chengxianglibra/dsh-data-analysis

data analysis plugin for deepseek harness.

Stars
2
Forks
0
Issues
0
更新
8 天前

PROJECT TOPICS

项目标签

INSTALL REFERENCE

安装参考

未验证
dsh plugin --profile web add github:chengxianglibra/dsh-data-analysis

该命令指向仓库当前默认分支;尚无绑定当前 commit 的完整验证结果。

PROJECT README

README

DSH Data Analysis

简体中文 | English

DeepSeek Harness 中,用自然语言完成数据分析, 浏览和复用业务指标定义,并将结果整理为可交互、可离线阅读的图表、报告和看板。 语义分析能力由 Marivo 提供。

本项目是个人维护的社区插件,并非 DeepSeek 官方发行或维护的软件。

能力与特性

你想做什么 插件提供的能力
回答业务问题 用自然语言分析指标趋势、比较不同时间或业务分组、探索变化原因
分析本地文件 上传文件或指定工作区中的文件,直接分析并生成图表、报告
连接数据 配置数据源、管理连接凭证并测试连接;默认支持 DuckDB、Trino、ClickHouse
统一分析口径 与助手一起整理和复用指标、维度等业务定义,浏览对象及其关系
明确分析对象 在输入框通过 @ 搜索并引用已有语义对象
展示分析结果 生成包含结论、指标卡、图表、表格和来源说明的报告或看板
继续探索 交互筛选、调整呈现,并引用报告内容继续提问
阅读与分享 保存和查看历史版本,下载 HTML 供离线阅读与分享

安装

环境准备

  • Node.js ^22.19.0 || >=24.0.0:22.x 需至少 22.19.0,或使用 24.0.0 及以上版本;不支持 23.x。
  • 已通过 npx @deepseek-ai/dsh web 启动并配置好 DeepSeek Harness >=0.1.5-rc.1
  • 命令行中可使用 pnpm,供 Harness 安装插件。
  • Python 3.10+,命令行可运行 python3(Windows 为 python),且支持 venv/ensurepip;部分 Linux 发行版需额外安装 python3-venv

无需预装 Marivo。首次启动会自动准备分析环境,需要联网下载依赖,请等待准备完成。

安装并启动

以下命令均通过 npx 运行 Harness,无需全局安装或将 dsh 添加到 PATH。

将插件安装到 Web Profile:

npx @deepseek-ai/dsh plugin --profile web add @chengxianglibra/dsh-data-analysis

安装后启动 Web Profile;如果已在运行,请先退出再重新启动:

npx @deepseek-ai/dsh web

在 Web 界面选择分析使用的工作区(Workspace),新建会话并发送一条消息。 会话标题旁会显示“数据源”“语义层”“报告”三个入口,相关页面在右侧标签页打开。以下以 Web 界面为例。

如何使用

1. 准备数据

本地文件:上传文件后直接提问,或指定工作区中已有文件,无需先配置数据源或建立业务定义。 支持 CSV、JSON、Parquet 和 Excel .xlsx;首次读取 .xlsx 需要联网下载扩展。 旧版 .xls 请先转换为 .xlsx、CSV 或 Parquet。

数据库:在会话标题旁打开“数据源”,查看当前工作区的连接与配置状态:

  1. 点击“新增数据源”,选择引擎,填写名称及连接信息。
  2. 如果需要身份认证,在“连接凭证”中填写用户名、密码或令牌。
  3. 保存并测试连接,根据结果检查地址、凭证或访问权限。

已有数据源可通过“编辑配置”修改连接信息,名称和引擎保持不变;保存后重新测试。 已保存的凭证值不会回显,留空可沿用。请通过凭证表单提交密码或令牌,不要粘贴到聊天消息中。

分析过程中需要新增或修复数据源时,助手可打开配置页。你可以填写新连接,或选择“使用已有数据源”, 点击“保存并测试,成功后继续”,连接与目标数据访问验证通过后,助手会继续分析。

2. 用自然语言提出分析问题

说明使用哪些数据、时间范围、指标口径和希望得到的结果。例如:

使用订单数据,分析 2026 年 8 月的销售额和订单量,与 7 月比较,按渠道拆分,并说明数据来源和口径。

检查最近七天的查询耗时,找出耗时最高的查询类型,给出趋势图和明细表。

如果还没有整理业务定义,可以先让助手帮助梳理:

先查看当前数据源中有哪些订单相关表,和我确认销售额、支付订单数的统计口径,再保存为可复用的业务定义。

需要报告时,直接说明希望的内容:

将这次分析整理为一份报告,包含结论、关键指标、趋势图、渠道对比表和来源说明,并提供可下载的 HTML。

3. 浏览和引用业务定义

点击“语义层”,按分类或关键词查找指标、维度等对象,查看业务定义和对象关系。 支持独立打开对象,方便对照阅读。

在聊天输入框输入 @,搜索并选择当前工作区的对象;多词搜索可输入 @"monthly revenue"。 选中后即可围绕指定对象提问,让助手使用一致的业务口径开展分析。

4. 阅读、调整和追问报告

当前会话交付新报告后,会自动在右侧打开。通过“报告”目录可按标题查找报告,并排阅读不同报告和版本。 发现新版本时,页面会提示更新,你可以选择何时切换。没有活动会话时,也可通过侧栏的“报告”入口阅读工作区中的报告。

  • 探索数据:筛选图表和表格,调整支持的图形及展示字段。交互使用报告中已保存的数据;获取新数据或重新计算时,在会话中提出要求。
  • 查看来源:查看报告内容附带的来源信息,核对分析依据。
  • 调整呈现:在最新版本页面点击“编辑报告”,编辑标题、正文、指标标签和图表/表格配置,移动或删除内容,支持撤销、重做和保存。
  • 继续追问:在支持的报告内容菜单中选择“加入提问”,将相关内容引用到输入框,补充问题后发送。
  • 查看历史:保存编辑后可在历史侧栏查看和下载已保存的版本,历史版本只读。

页面筛选不会重新计算指标卡,也不会写入保存的报告。希望保留当前筛选结果时,使用“导出当前视图”。

5. 下载与分享

报告右上角的导出菜单提供两种方式:

选项 适合的用途
下载完整报告 下载所查看版本的完整 HTML 报告,供离线阅读
导出当前视图 将当前筛选、图形和表格排序固定为 HTML,附带来源版本及导出时间,分享当前看到的内容

也可以直接让助手将报告导出为 HTML 文件。下载的文件可用浏览器打开,离线阅读和交互,无需连接原始数据源。 编辑模式下,请先保存或取消编辑再导出。

分析超时设置

在“设置 → 插件 → 插件配置 → 数据分析”中可调整 Python 分析的默认超时时间,默认为 120 秒, 保存后对下一次分析调用生效。实际执行时限仍受 Harness 执行策略约束。

许可证

本项目采用 MIT License

CLASSIFICATION EVIDENCE

分类依据

项目类型插件
功能分类文件与数据
规则置信度

系统优先读取 GitHub Topics,再与站内分类词典和词根规则比对。当前命中: data-analysis、data-analytics。