模型选择
Vision 工具采用多级自动选择 + 自动兜底策略,无需手动配置即可使用:- 主模型 — 优先使用当前配置的主模型进行图像识别(需要是多模态模型)
- 其他已配置模型 — 自动发现已配置 API Key 的其他多模态模型作为备选
支持的模型
智谱和 MiniMax 的文本模型不支持图像理解,因此始终使用对应的视觉专用模型,无需手动指定。
当 use_linkai=true 时,默认使用 LinkAI 的多模态模型进行
自定义配置
如果希望指定 Vision 使用的模型,可在config.json 中配置,例如:
参数
支持的图片格式:jpg、jpeg、png、gif、webp
使用场景
- 描述图片中的内容
- 提取图片中的文字(OCR)
- 识别物体、颜色、场景
- 分析截图、文档扫描图片等
超过 1MB 的图片会自动压缩后上传,所有图片(包括远程 URL)会统一转为 base64 传输,确保兼容所有模型后端。
