Vision

Analyse d'image et OCR : posez une question sur une image, obtenez une reponse en texte.

Requete

http
POST /v1/vision/analyze
json
{
  "prompt": "Que voit-on sur cette image ? Reponds en une phrase.",
  "image_url": "https://exemple.com/photo.jpg",
  "model": null,
  "routing_strategy": "auto"
}

image_url doit etre une URL publiquement accessible. Pour analyser un fichier que vous venez d'uploader, passez d'abord par le flux d'upload (voir POST /v1/uploads/presign) puis utilisez l'URL renvoyee.

Reponse

json
{
  "text": "Un chat roux assis sur le rebord d'une fenetre, regardant dehors.",
  "model": "gemini-3.1-pro-preview",
  "provider": "google"
}

Cas d'usage courants

  • Description d'image pour l'accessibilite
  • Extraction de texte (OCR) — demandez explicitement de retranscrire le texte visible
  • Analyse de documents scannes, factures, formulaires

Fournisseurs

OpenAI (GPT-4o et modeles vision), Google (Gemini).