メインコンテンツへスキップ
Vision API を使用してローカル画像や画像 URL を分析します。コンテンツの説明、テキスト抽出(OCR)、オブジェクト認識などに対応しています。

モデル選択

Vision ツールは多段階の自動選択 + 自動フォールバック戦略を採用しており、手動設定なしで利用できます:
  1. メインモデル — 現在設定されているメインモデルを優先的に使用して画像認識を行います(マルチモーダルモデルである必要があります)
  2. その他の設定済みモデル — API Key が設定済みのその他のマルチモーダルモデルを自動的に検出して候補とします
現在のプロバイダーで呼び出しに失敗した場合、成功するかすべて失敗するまで自動的に次のプロバイダーを試行します。

対応モデル

智谱と MiniMax のテキストモデルは画像理解に対応していないため、常に対応するビジョン専用モデルが使用されます。手動で指定する必要はありません。
use_linkai=true の場合、デフォルトで LinkAI のマルチモーダルモデルが使用されます。

カスタム設定

Vision で使用するモデルを指定したい場合は、config.json に以下のように設定できます:
指定したモデルが優先的に使用され、ツールはモデル名に応じて対応するプロバイダーへ自動ルーティングします。呼び出しに失敗した場合は、他の設定済みプロバイダーへ自動的にフォールバックします。 ほとんどの場合、設定は不要です。メインモデルがマルチモーダルに対応しているか、ビジョン対応の API Key が 1 つでも設定されていれば自動的に動作します。

パラメータ

対応画像形式:jpg、jpeg、png、gif、webp

ユースケース

  • 画像コンテンツの説明
  • 画像からのテキスト抽出(OCR)
  • オブジェクト、色、シーンの認識
  • スクリーンショットやスキャン文書などの分析
1MB を超える画像は自動的に圧縮してアップロードされます。すべての画像(リモート URL を含む)は base64 に統一変換して送信され、すべてのモデルバックエンドとの互換性を確保します。