pdf.jjuns.net — 한국어 PDF OCR API v1 ===================================== 스캔한 책 인쇄물(고딕·굴림 등) PDF에서 한글 텍스트를 추출합니다. 엔진: PaddleOCR PP-OCRv5 (korean) / 텍스트 레이어가 있는 PDF는 즉시 추출. 모든 요청에 X-API-KEY 헤더 필요 (키 발급: 관리자 페이지 또는 a@tion.kr 문의). CORS 전면 허용 — 외부 도메인의 브라우저/서버 어디서든 바로 호출 가능. 결과는 7일 보관 후 자동 삭제. 1) 업로드 (비동기) curl -s -X POST https://pdf.jjuns.net/ocr/v1/upload.php \ -H "X-API-KEY: " -F "file=@book.pdf" → {"ok":true,"job_id":"...","status":"queued","status_url":"...","result_url":"..."} 소형 PDF는 sync=1 로 완료까지 대기(최대 60초, 응답에 text 포함): curl -s -X POST "https://pdf.jjuns.net/ocr/v1/upload.php?sync=1" \ -H "X-API-KEY: " -F "file=@page.pdf" correct=1 : LLM 오탈자 후교정 (숫자/금액 보존, 내용 변경 금지 규칙 적용) curl -s -X POST "https://pdf.jjuns.net/ocr/v1/upload.php?correct=1" \ -H "X-API-KEY: " -F "file=@book.pdf" → 결과의 llm_correct 필드로 적용 여부 확인, format=raw로 교정 전 원문 조회 가능 model=<모델명> : 교정 모델 선택 (기본 claude-haiku-4-5). 접두어로 프로바이더 자동 판별: claude-* → Anthropic (예: claude-haiku-4-5) gpt-* → OpenAI (예: gpt-5.4-mini) gemini-* → Google (예: gemini-2.5-flash) sonar* → Perplexity (예: sonar) grok-* → xAI (예: grok-4-fast) 예) .../upload.php?correct=1&model=gpt-5.4-mini 각 프로바이더 키는 서버 /opt/ocr/.{anthropic,openai,gemini,perplexity,xai}_key 파일에 저장. 키가 없으면 교정 없이 OCR 결과만 반환 (llm_correct=unavailable_no_key). 2) 진행 상태 curl -s "https://pdf.jjuns.net/ocr/v1/status.php?id=" -H "X-API-KEY: " → status: queued | processing | done | error (+ pages_done / pages_total) 3) 결과 텍스트 전문: .../ocr/v1/result.php?id= (페이지 구분자 \f) 구조화 JSON: .../ocr/v1/result.php?id=&format=json (줄/신뢰도/좌표) 제한: PDF 100MB, 2000페이지 이하. 처리 속도 약 1~2초/페이지.