wangxiang0605qvq
dsh-vision-ocr
DSH 图片识别插件:输入框一键选图发送识别请求(需自备支持图像输入的模型与 API Key)
- Stars
- 0
- Language
- JavaScript
- Created
- Aug 14, 2026
- Updated
- Aug 14, 2026
Introduction
dsh-vision-ocr — 图片识别插件 | Image Recognition Plugin
DeepSeek Harness(DSH)图片识别插件:在对话输入框左侧添加「识别图片」按钮,选中图片后自动发送识别请求,让模型描述图中物品、场景、颜色及文字内容。
功能
- 输入框识别按钮:在对话输入框左侧(
conversation.input.left槽位)显示图片图标按钮。 - 多图选择:点击后弹出文件选择器,支持一次选择多张图片。
- 一键发送:选中图片后立即通过对话服务的草稿图片管线发送识别请求,消息携带真实的 image parts(需当前模型支持图像输入)。
- 错误提示:发送失败(如模型不支持图片、无活动会话)时在按钮上方显示错误气泡。
- 纯浏览器实现:宿主端为空占位,无任何密钥逻辑,全部行为在前端完成。
安装
1. 复制包文件
将本仓库整体复制到 DSH 的 plugins 目录下(按你的部署方式,也可能在 profile 的 node_modules 下):
# 以本机 plugins 目录为例
Copy-Item -Recurse . "D:\deepseek harness\plugins\dsh-vision-ocr"
2. 注册插件
在 profile 的补丁配置(例如 ~/.dsh/profiles/web/cordis.patch.yml)中插入:
- insert:
- id: vision-ocr
name: "@deepseek-ai/dsh-vision-ocr"
inject: ["slots", "conversation", "sessions"]
config: {}
3. 重启并刷新
重启 DSH,然后在浏览器中硬刷新(Ctrl+F5)页面。对话输入框左侧会出现图片图标按钮。
使用前提:自行配置支持图像的模型与 API Key
本插件不附带任何模型或密钥,识别请求通过你当前会话已配置的模型发送。使用前请确保满足以下条件,否则发送会被 DSH 拒绝并提示 attachment-error: Model "xxx" does not support image input.:
- 选择支持图像输入的模型:在 DSH 的模型设置(Models 设置页)中,为当前会话选择一个支持
image输入模态的视觉模型,例如:- 智谱 GLM-5V-Turbo 等 GLM-4V/5V 系列
- 其他任何声明支持图像输入的模型(如部分多模态开源/云端模型)
- 配置该模型的 API Key:通过 DSH 的 credentials 服务(Models 设置页)保存对应提供商的 API Key,或在启动 DSH 的环境变量中导出。
- 当前会话使用该模型:识别按钮发送的请求走当前会话的模型选择,请确认会话已切换到视觉模型再使用。
本插件本身不读取、不存储、不传输任何 API Key——密钥仅由 DSH 的凭据体系管理与调用。
说明
- 模型要求:识别请求通过当前会话的模型发送,需要支持图像输入。若模型不支持图片,发送会被 DSH 拒绝并提示
attachment-error。 - 依赖 DSH 内置包:
@deepseek-ai/dsh-client-runtime、@deepseek-ai/dsh-client-ui-conversation、@deepseek-ai/dsh-client-ui-slots等(见package.jsonpeerDependencies)。 - 客户端
lib/client.js是供 DSH web 加载的模块格式,请勿直接用浏览器打开。
License
MIT