Back to home

wangxiang0605qvq

dsh-vision-ocr

DSH 图片识别插件:输入框一键选图发送识别请求(需自备支持图像输入的模型与 API Key)

Stars
0
Language
JavaScript
Created
Aug 14, 2026
Updated
Aug 14, 2026

Introduction

dsh-vision-ocr — 图片识别插件 | Image Recognition Plugin

DeepSeek Harness(DSH)图片识别插件:在对话输入框左侧添加「识别图片」按钮,选中图片后自动发送识别请求,让模型描述图中物品、场景、颜色及文字内容。

功能

  • 输入框识别按钮:在对话输入框左侧(conversation.input.left 槽位)显示图片图标按钮。
  • 多图选择:点击后弹出文件选择器,支持一次选择多张图片。
  • 一键发送:选中图片后立即通过对话服务的草稿图片管线发送识别请求,消息携带真实的 image parts(需当前模型支持图像输入)。
  • 错误提示:发送失败(如模型不支持图片、无活动会话)时在按钮上方显示错误气泡。
  • 纯浏览器实现:宿主端为空占位,无任何密钥逻辑,全部行为在前端完成。

安装

1. 复制包文件

将本仓库整体复制到 DSH 的 plugins 目录下(按你的部署方式,也可能在 profile 的 node_modules 下):

# 以本机 plugins 目录为例
Copy-Item -Recurse . "D:\deepseek harness\plugins\dsh-vision-ocr"

2. 注册插件

在 profile 的补丁配置(例如 ~/.dsh/profiles/web/cordis.patch.yml)中插入:

- insert:
    - id: vision-ocr
      name: "@deepseek-ai/dsh-vision-ocr"
      inject: ["slots", "conversation", "sessions"]
      config: {}

3. 重启并刷新

重启 DSH,然后在浏览器中硬刷新(Ctrl+F5)页面。对话输入框左侧会出现图片图标按钮。

使用前提:自行配置支持图像的模型与 API Key

本插件不附带任何模型或密钥,识别请求通过你当前会话已配置的模型发送。使用前请确保满足以下条件,否则发送会被 DSH 拒绝并提示 attachment-error: Model "xxx" does not support image input.

  1. 选择支持图像输入的模型:在 DSH 的模型设置(Models 设置页)中,为当前会话选择一个支持 image 输入模态的视觉模型,例如:
    • 智谱 GLM-5V-Turbo 等 GLM-4V/5V 系列
    • 其他任何声明支持图像输入的模型(如部分多模态开源/云端模型)
  2. 配置该模型的 API Key:通过 DSH 的 credentials 服务(Models 设置页)保存对应提供商的 API Key,或在启动 DSH 的环境变量中导出。
  3. 当前会话使用该模型:识别按钮发送的请求走当前会话的模型选择,请确认会话已切换到视觉模型再使用。

本插件本身不读取、不存储、不传输任何 API Key——密钥仅由 DSH 的凭据体系管理与调用。

说明

  • 模型要求:识别请求通过当前会话的模型发送,需要支持图像输入。若模型不支持图片,发送会被 DSH 拒绝并提示 attachment-error
  • 依赖 DSH 内置包:@deepseek-ai/dsh-client-runtime@deepseek-ai/dsh-client-ui-conversation@deepseek-ai/dsh-client-ui-slots 等(见 package.json peerDependencies)。
  • 客户端 lib/client.js 是供 DSH web 加载的模块格式,请勿直接用浏览器打开。

License

MIT