SEMANTIC DIRECTORY · plugin-directory-semantic-v3-18
Vision & Document Understanding Input
为文本模型处理图片、截图、PDF、验证码和其他视觉文档输入,包括 OCR、视觉模型转述、图像问答、截图转代码和多模态输入适配;不包含图像生成或编辑。
纳入为纯文本模型透明接入视觉能力的桥接Plugin,以及视觉模型后端、provider、网关、凭据和通道配置等接入基础设施;包括图片拦截后转写、视觉模型路由、按需视觉工具和视觉回退。不纳入面向具体图片或文档内容的识别、解析、转换与结构化产出,也不纳入图像生成、编辑或模型训练。
50 pluginsLeaf categoryVisual Content Extraction & Structured Output纳入直接处理图片、截图、PDF、验证码及其他视觉文档并产出可使用结果的Plugin,包括 OCR、文本提取、图像问答、截图分析、HTML/SVG/Mermaid 转换、UI 复原、矢量化、像素对比、人体关键点与边界框等。不纳入将视觉能力注入其他模型调用链的桥接、视觉后端接入网关、图像生成或图像编辑。
23 pluginsCategories are public semantic index facts, not a final recommendation. Compatibility, permissions, and source evidence remain separate.