비전

이미지 분석 및 OCR: 이미지에 대해 질문하고 텍스트로 답변을 받습니다.

요청

http
POST /v1/vision/analyze
json
{
  "prompt": "Que voit-on sur cette image ? Reponds en une phrase.",
  "image_url": "https://exemple.com/photo.jpg",
  "model": null,
  "routing_strategy": "auto"
}

image_url은 공개적으로 접근 가능한 URL이어야 합니다. 방금 업로드한 파일을 분석하려면 먼저 업로드 흐름(POST /v1/uploads/presign 참고)을 거친 다음 반환된 URL을 사용하세요.

응답

json
{
  "text": "Un chat roux assis sur le rebord d'une fenetre, regardant dehors.",
  "model": "gemini-3.1-pro-preview",
  "provider": "google"
}

일반적인 사용 사례

  • 접근성을 위한 이미지 설명
  • 텍스트 추출(OCR) — 보이는 텍스트를 전사해 달라고 명시적으로 요청하세요
  • 스캔한 문서, 청구서, 양식 분석

제공업체

OpenAI(GPT-4o 및 비전 모델), Google(Gemini).