跳转到主要内容
小米 MiMo 是原生全模态大模型,单 mimo_api_key 即可同时启用文本对话、图像理解与语音合成。
通过 Web 控制台的「模型管理」页面可一站式配置以下全部能力,无需手动改配置文件。

文本对话

模型选择

思考模式

MiMo V2.5 系列默认开启「思考模式」:模型在输出最终回答前会先输出 reasoning_content(思维链),提升复杂任务表现。 通过全局配置 enable_thinking 控制是否展示(也可在 Web 控制台 - 配置页面切换):

图像理解

配置 mimo_api_key 后,Agent 的 Vision 工具可以自动使用 MiMo 视觉模型:
  • 当主模型本身是多模态时(mimo-v2.5-pro / mimo-v2.5),直接由主模型识别图像,无需额外配置
  • 当主模型是其他厂商时,Vision 工具会根据顺序自动 fallback 到 mimo-v2.5-pro
如需手动指定 Vision 模型,可在配置文件中显式配置:

语音合成

预置音色

也可在 Web 控制台的「模型管理 → 语音合成」下拉框中可视化选择。

风格控制

MiMo TTS 支持在合成文本中嵌入 音频标签 来控制情绪、语调、方言、角色甚至唱歌。标签需出现在 最终被合成为语音的文本(即 Agent 回复内容) 中,整体风格标签写在开头:
支持半角 ()、全角 ()[] 三种括号。常见风格示例: 示例:
  • (磁性)夜已经深了,城市还在呼吸。
  • (东北话)哎呀妈呀,这天儿也忒冷了吧!
  • (粤语)呢个真係好正啊!
  • (唱歌)原谅我这一生不羁放纵爱自由…
也可以在文本任意位置插入细粒度音频标签来控制呼吸、笑声、停顿等,例如:
完整标签列表参见 MiMo 语音合成文档
CowAgent 在调用 TTS 时会将 Agent 的回复原文(含 (...) 标签)直接送入 MiMo 合成。你可以在人设 / 系统提示词里要求模型「在回复开头用 (风格) 标签控制语气」,即可让 IM 渠道(微信 / 飞书 / 钉钉 / 企微)的语音回复带上情绪、方言、唱歌等效果。