视觉

图像分析与 OCR:针对一张图片提问,获得文本形式的回答。

请求

http
POST /v1/vision/analyze
json
{
  "prompt": "Que voit-on sur cette image ? Reponds en une phrase.",
  "image_url": "https://exemple.com/photo.jpg",
  "model": null,
  "routing_strategy": "auto"
}

image_url 必须是可公开访问的 URL。要分析刚上传的文件,请先完成上传流程(见 POST /v1/uploads/presign),然后使用返回的 URL。

响应

json
{
  "text": "Un chat roux assis sur le rebord d'une fenetre, regardant dehors.",
  "model": "gemini-3.1-pro-preview",
  "provider": "google"
}

常见使用场景

  • 为无障碍访问生成图像描述
  • 文本提取(OCR)——明确要求转录图片中可见的文字
  • 扫描文档、发票、表单的分析

供应商

OpenAI(GPT-4o 及视觉模型)、Google(Gemini)。