mimo_api_key 即可同时启用文本对话、图像理解与语音合成。
文本对话
模型选择
思考模式
MiMo V2.5 系列默认开启「思考模式」:模型在输出最终回答前会先输出reasoning_content(思维链),提升复杂任务表现。
通过全局配置 enable_thinking 控制是否展示(也可在 Web 控制台 - 配置页面切换):
图像理解
配置mimo_api_key 后,Agent 的 Vision 工具可以自动使用 MiMo 视觉模型:
- 当主模型本身是多模态时(
mimo-v2.5-pro/mimo-v2.5),直接由主模型识别图像,无需额外配置 - 当主模型是其他厂商时,Vision 工具会根据顺序自动 fallback 到
mimo-v2.5-pro
语音合成
预置音色
也可在 Web 控制台的「模型管理 → 语音合成」下拉框中可视化选择。
风格控制
MiMo TTS 支持在合成文本中嵌入 音频标签 来控制情绪、语调、方言、角色甚至唱歌。标签需出现在 最终被合成为语音的文本(即 Agent 回复内容) 中,整体风格标签写在开头:()、全角 () 或 [] 三种括号。常见风格示例:
示例:
- (磁性)夜已经深了,城市还在呼吸。
- (东北话)哎呀妈呀,这天儿也忒冷了吧!
- (粤语)呢个真係好正啊!
- (唱歌)原谅我这一生不羁放纵爱自由…
