跳转到主要内容
Google Gemini 支持文本对话、图像理解和图像生成(Nano Banana 系列),一个 gemini_api_key 即可启用全部能力。
通过 Web 控制台的「模型管理」页面可一站式配置以下全部能力,无需手动改配置文件。

文本对话

图像理解

Gemini 全系列模型均原生支持视觉,配置 gemini_api_key 后 Agent 的 Vision 工具会自动使用主模型识别图像,无需额外配置。 如需手动指定 Vision 模型:

图像生成