SEMANTIC DIRECTORY · plugin-directory-semantic-v3-18

视觉与文档理解输入

为文本模型处理图片、截图、PDF、验证码和其他视觉文档输入,包括 OCR、视觉模型转述、图像问答、截图转代码和多模态输入适配;不包含图像生成或编辑。

使用关键词搜索
来源目录 discovery.composite.2026-09-06.v1-0-5.b92b985e31df规范结构 · 823 个节点 · 14829 个插件
叶子目录视觉模型桥接与接入

纳入为纯文本模型透明接入视觉能力的桥接插件,以及视觉模型后端、provider、网关、凭据和通道配置等接入基础设施;包括图片拦截后转写、视觉模型路由、按需视觉工具和视觉回退。不纳入面向具体图片或文档内容的识别、解析、转换与结构化产出,也不纳入图像生成、编辑或模型训练。

50 个插件
叶子目录视觉内容解析与结构化产出

纳入直接处理图片、截图、PDF、验证码及其他视觉文档并产出可使用结果的插件,包括 OCR、文本提取、图像问答、截图分析、HTML/SVG/Mermaid 转换、UI 复原、矢量化、像素对比、人体关键点与边界框等。不纳入将视觉能力注入其他模型调用链的桥接、视觉后端接入网关、图像生成或图像编辑。

23 个插件

分类属于公开语义索引事实,不是最终推荐;兼容性、权限与来源证据仍需分别核对。