Skip to main content
입력 이미지와 프롬프트를 받아 Gemini 계열 모델로 이미지 내용 설명, 텍스트 추출, 시각 질의응답을 수행합니다. 이미지 캡셔닝, OCR, 상품 정보 추출, 문서 이해에 사용하며, 결과는 이미지가 아닌 텍스트로 반환됩니다.

요청 방법

비동기 태스크입니다. 호출이 접수되면 TaskId가 즉시 발급되고, 처리 결과는 DescribeImageTaskDetail로 조회합니다. StatusFINISH이고 ErrMsg가 비어 있어야 성공입니다. Definition 프리셋 값과 모델의 매핑은 다음과 같습니다.

요청 파라미터

응답 파라미터

DescribeImageTaskDetail 조회 결과의 주요 필드는 다음과 같습니다.

호출 예시

응답 예시

ProcessImage 응답:
DescribeImageTaskDetail 조회 결과:

주의사항

Prompt는 필수입니다. 생략하면 태스크를 제출할 수 없습니다.
DefinitionModelName은 상호 배타입니다. Definition을 쓰면 ScheduleIdStdExtInfo.ModelConfig를 함께 전달하지 않고, ModelName을 쓰면 ScheduleId=30200과 함께 전달합니다. 둘 다 생략하면 기본 모델 Google/gemini-2.5-flash가 적용됩니다.
StatusFINISH여도 성공을 의미하지 않습니다. ErrMsg가 비어 있는지 반드시 함께 확인합니다.
결과는 이미지가 아니라 텍스트 Content입니다. 생성 결과 파일을 기대하는 다른 이미지 기능과 출력 형태가 다릅니다.
URL 입력은 공개 접근이 가능해야 하고, COS 입력은 MPS 서비스에 해당 Bucket의 읽기 권한이 있어야 합니다.
Last modified on August 16, 2026