Vision

Bildanalyse und OCR: eine Frage zu einem Bild stellen, eine Textantwort erhalten.

Anfrage

http
POST /v1/vision/analyze
json
{
  "prompt": "Que voit-on sur cette image ? Reponds en une phrase.",
  "image_url": "https://exemple.com/photo.jpg",
  "model": null,
  "routing_strategy": "auto"
}

image_url muss eine öffentlich zugängliche URL sein. Um eine gerade hochgeladene Datei zu analysieren, durchlaufen Sie zunächst den Upload-Ablauf (siehe POST /v1/uploads/presign) und verwenden Sie dann die zurückgegebene URL.

Antwort

json
{
  "text": "Un chat roux assis sur le rebord d'une fenetre, regardant dehors.",
  "model": "gemini-3.1-pro-preview",
  "provider": "google"
}

Gängige Anwendungsfälle

  • Bildbeschreibung für Barrierefreiheit
  • Textextraktion (OCR) — fordern Sie ausdrücklich die Transkription des sichtbaren Textes an
  • Analyse von gescannten Dokumenten, Rechnungen, Formularen

Anbieter

OpenAI (GPT-4o und Vision-Modelle), Google (Gemini).