Visión

Análisis de imagen y OCR: haz una pregunta sobre una imagen, obtén una respuesta en texto.

Solicitud

http
POST /v1/vision/analyze
json
{
  "prompt": "Que voit-on sur cette image ? Reponds en une phrase.",
  "image_url": "https://exemple.com/photo.jpg",
  "model": null,
  "routing_strategy": "auto"
}

image_url debe ser una URL públicamente accesible. Para analizar un archivo que acabas de subir, pasa primero por el flujo de subida (ver POST /v1/uploads/presign) y usa luego la URL devuelta.

Respuesta

json
{
  "text": "Un chat roux assis sur le rebord d'une fenetre, regardant dehors.",
  "model": "gemini-3.1-pro-preview",
  "provider": "google"
}

Casos de uso habituales

  • Descripción de imagen para accesibilidad
  • Extracción de texto (OCR) — pide explícitamente que se transcriba el texto visible
  • Análisis de documentos escaneados, facturas, formularios

Proveedores

OpenAI (GPT-4o y modelos de visión), Google (Gemini).