zhipu_ai_api_key 即可启用全部能力。
文本对话
图像理解
glm-5.3-flash 本身即多模态,作为主模型时 Agent 的 Vision 工具会直接使用它识别图像。纯文本 chat 模型(glm-5.2、glm-5.1、glm-5-turbo 等)不支持视觉,此时视觉调用会自动回落到专用的 glm-5v-turbo 模型。配置 zhipu_ai_api_key 后无需额外设置。
语音识别
凭证自动复用
zhipu_ai_api_key。语音文件建议小于 25MB,超大文件可能被服务端拒绝。
向量
embedding-3、embedding-2。修改 embedding 后需执行 /memory rebuild-index 命令重建索引。