dashscope_api_key 启用。
文本对话
图像理解
配置dashscope_api_key 后 Agent 的 Vision 工具会自动调用千问的视觉模型识别图像。qwen3.7-plus / qwen3.6-plus / qwen3.5-plus / qwen3-max 等模型本身就是多模态;若主模型是纯文本(如 qwen-turbo),会自动回落到 qwen-vl-max。
如需手动指定 Vision 模型:
qwen3.7-plus、qwen3.6-plus、qwen3.5-plus、qwen3-max。
图像生成
qwen-image-2.0、qwen-image-2.0-pro。
语音识别
凭证自动复用
dashscope_api_key。单段音频建议小于 10MB、时长不超过 300 秒。
语音合成
常用音色示例:
完整音色(普通话 / 各地方言 / 双语等)可在 Web 控制台的「模型管理 → 语音合成」下拉框中可视化选择。
向量
text-embedding-v4。修改 embedding 后需执行 /memory rebuild-index 命令重建索引。