xsoc1/dsh-image-vision
纯文本 DeepSeek 的聊天识图插件:view_image 工具转发任意 OpenAI 兼容 VLM(本地 Ollama 或云端),对话框粘贴/拖拽的图片自动改写为 view_image 路径标记供模型查看。
关于此插件
- viewimage 工具:模型带着问题调用它(OCR、数数、读图表、看 UI 布局……任意视觉问题),插件把图片和问题转发给任意 OpenAI 兼容的 VLM 端点(本地 Ollama / 智谱 / DashScope / 豆包……),答案以文本返回。 - 图片附件桥:在聊天对话框拖拽或粘贴图片即可发送——dsh web 输入框原生接收图片附件,本插件在模型请求前把附件改写为 [用户上传的图片: ] 标记,并引导模型调用 viewimage 查看,纯文本模型因此"看见"你上传的图。
$ dsh plugin --profile web add @dsh-external/dsh-image-vision$ dsh plugin --profile web add github:xsoc1/dsh-image-vision健康评分构成
42 / 100评分综合许可证、社区信号、文档与分发情况,并非代码审计。安装前请审阅源码与 manifest。
安全信息
关键指标
Related
相关插件
- 连接常用消息平台:支持钉钉、飞书、Lark、微信、企业微信、QQ 和 Telegram。 - 多个账号分别配置:同一平台可添加多个账号,各自选择工作区、模型、推理强度、权限和私聊准入。 - 手机上完成任务交互:下任务、读回复、回答单选或多选问题;已批准用户可在私聊中批准或拒绝工具执行。 - 聊天记录互不混淆:每个 IM 聊天对应独立会话,在网页工作区「频道」中回看。 - 按平台扫码或填写凭据:## 界面预览
DeepSeek 的主力对话模型和 GLM-5.3 本体仍是纯文本,无法读图。GLM-5.3-Flash 已是原生多模态。ModLens 借助外挂视觉引擎,为纯文本模型补上视觉能力。ModLens 支持直接粘贴图片识别,无需先保存成文件再提供路径。
通过扫码、App Manifest 或已有机器人凭据把 IM 机器人接入 DeepSeek Harness,并让本机 Harness 主动连接公网 AI Office。一个插件、一个设置入口,统一管理内置 IM 渠道和 AI Office Connector。每个 IM 渠道都支持接入多个机器人,各机器人的连接状态、工作区、模型和会话绑定彼此独立;iMessage 是本机 Messages.app 身份接入的例外,详见iMessage 渠道说明。
@xmanrui/dsh-im 的拟人化分支(基于上游 4.21.2):人化消息发送(发送延迟 + 输入中两阶段)、message_break 与 streaming 共存、状态表情、回复引用、per-bot 全量拟人化覆盖、no_reply 回收工具,覆盖微信/飞书/钉钉/企业微信/QQ/Telegram/Slack/WhatsApp 全通道。
DeepSeek 和 GLM 等模型没有联网能力或联网能力羸弱。ModSearch 通过外挂方式大幅增强模型联网搜索、X 搜索、单页抓取能力。装完即用:默认引擎是 Firecrawl 的免注册通道,每月 1,000 免费 credits,不用注册账号,不用 API key,不用绑卡。
- 下班路上,agent 在电脑上跑任务,你想掏出手机看看它干到哪了、结果如何 - 出门在外,突然想让电脑上的 agent 查点资料、写段代码,但没有远程桌面、没有 SSH - 电脑在宿舍/办公室,你人在外面,想随时"操控你的 DeepSeek Harness"——发任务、看输出、点审批