SEMANTIC DIRECTORY · plugin-directory-semantic-v3-18

Vision & Document Understanding Input

为文本模型处理图片、截图、PDF、验证码和其他视觉文档输入,包括 OCR、视觉模型转述、图像问答、截图转代码和多模态输入适配;不包含图像生成或编辑。

Use keyword search
Source catalog discovery.composite.2026-09-06.v1-0-5.b92b985e31dfCanonical structure · 823 nodes · 14829 plugins
Leaf categoryVision Model Bridging & Integration

纳入为纯文本模型透明接入视觉能力的桥接Plugin,以及视觉模型后端、provider、网关、凭据和通道配置等接入基础设施;包括图片拦截后转写、视觉模型路由、按需视觉工具和视觉回退。不纳入面向具体图片或文档内容的识别、解析、转换与结构化产出,也不纳入图像生成、编辑或模型训练。

50 plugins
Leaf categoryVisual Content Extraction & Structured Output

纳入直接处理图片、截图、PDF、验证码及其他视觉文档并产出可使用结果的Plugin,包括 OCR、文本提取、图像问答、截图分析、HTML/SVG/Mermaid 转换、UI 复原、矢量化、像素对比、人体关键点与边界框等。不纳入将视觉能力注入其他模型调用链的桥接、视觉后端接入网关、图像生成或图像编辑。

23 plugins

Categories are public semantic index facts, not a final recommendation. Compatibility, permissions, and source evidence remain separate.