モデル選択
Vision ツールは多段階の自動選択 + 自動フォールバック戦略を採用しており、手動設定なしで利用できます:- メインモデル — 現在設定されているメインモデルを優先的に使用して画像認識を行います(マルチモーダルモデルである必要があります)
- その他の設定済みモデル — API Key が設定済みのその他のマルチモーダルモデルを自動的に検出して候補とします
対応モデル
智谱と MiniMax のテキストモデルは画像理解に対応していないため、常に対応するビジョン専用モデルが使用されます。手動で指定する必要はありません。
use_linkai=true の場合、デフォルトで LinkAI のマルチモーダルモデルが使用されます。
カスタム設定
Vision で使用するモデルを指定したい場合は、config.json に以下のように設定できます:
パラメータ
対応画像形式:jpg、jpeg、png、gif、webp
ユースケース
- 画像コンテンツの説明
- 画像からのテキスト抽出(OCR)
- オブジェクト、色、シーンの認識
- スクリーンショットやスキャン文書などの分析
1MB を超える画像は自動的に圧縮してアップロードされます。すべての画像(リモート URL を含む)は base64 に統一変換して送信され、すべてのモデルバックエンドとの互換性を確保します。
