跳转到主要内容
通义千问(DashScope / 百炼)是国内覆盖最完整的厂商之一,文本、图像理解、图像生成、语音识别、语音合成与向量能力均可用一份 dashscope_api_key 启用。
通过 Web 控制台的「模型管理」页面可一站式配置以下全部能力,无需手动改配置文件。

文本对话

图像理解

配置 dashscope_api_key 后 Agent 的 Vision 工具会自动调用千问的视觉模型识别图像。qwen3.7-plus / qwen3.6-plus / qwen3.5-plus / qwen3-max 等模型本身就是多模态;若主模型是纯文本(如 qwen-turbo),会自动回落到 qwen-vl-max 如需手动指定 Vision 模型:
支持模型:qwen3.7-plusqwen3.6-plusqwen3.5-plusqwen3-max

图像生成

可选模型:qwen-image-2.0qwen-image-2.0-pro

语音识别

凭证自动复用 dashscope_api_key。单段音频建议小于 10MB、时长不超过 300 秒。

语音合成

常用音色示例: 完整音色(普通话 / 各地方言 / 双语等)可在 Web 控制台的「模型管理 → 语音合成」下拉框中可视化选择。

向量

默认模型 text-embedding-v4。修改 embedding 后需执行 /memory rebuild-index 命令重建索引。