SEMANTIC DIRECTORY · plugin-directory-semantic-v3-18
视觉与文档理解输入
为文本模型处理图片、截图、PDF、验证码和其他视觉文档输入,包括 OCR、视觉模型转述、图像问答、截图转代码和多模态输入适配;不包含图像生成或编辑。
纳入为纯文本模型透明接入视觉能力的桥接插件,以及视觉模型后端、provider、网关、凭据和通道配置等接入基础设施;包括图片拦截后转写、视觉模型路由、按需视觉工具和视觉回退。不纳入面向具体图片或文档内容的识别、解析、转换与结构化产出,也不纳入图像生成、编辑或模型训练。
50 个插件叶子目录视觉内容解析与结构化产出纳入直接处理图片、截图、PDF、验证码及其他视觉文档并产出可使用结果的插件,包括 OCR、文本提取、图像问答、截图分析、HTML/SVG/Mermaid 转换、UI 复原、矢量化、像素对比、人体关键点与边界框等。不纳入将视觉能力注入其他模型调用链的桥接、视觉后端接入网关、图像生成或图像编辑。
23 个插件分类属于公开语义索引事实,不是最终推荐;兼容性、权限与来源证据仍需分别核对。