RAG 문서 파싱 FAQ: HWP부터 API·SDK 연동까지
기업에서 생성형 AI를 사내 문서와 연결할 때는 RAG뿐 아니라, AI가 문서를 어떤 형태로 읽고 활용할 수 있게 만들지가 중요해요. 특히 기업 문서에는 본문뿐 아니라 표·차트·각주·메모처럼 의미를 해석하는 데 필요한 정보가 함께 담겨 있어, 이를 제대로 추출하고 정리하는 문서 파싱이 RAG 구축의 중요한 출발점이 돼요.
이번 글에서는 RAG에서 문서 파싱이 어떤 역할을 하는지부터 지원 포맷, 정보 추출 범위, API·SDK 연동, 도입 전 확인할 사항까지 정리해볼게요.
1. RAG란
사내 문서를 ChatGPT처럼 검색할 수 있나요?
가능해요. 사내 문서 DB를 LLM(Large Language Model, 대규모 언어 모델)과 연결하는 RAG(Retrieval-Augmented Generation, 검색 증강 생성)기술을 적용하면 사내 문서를 기반으로 답변하는 AI 검색 시스템을 구축할 수 있어요.
RAG는 사내 문서를 미리 검색 가능한 형태로 준비해두고, 사용자가 질문하면 관련 문서를 찾아 그 내용을 LLM에 전달하는 방식이에요. LLM은 질문을 이해하고 답변을 생성하는 AI 모델로, ChatGPT 같은 생성형 AI 서비스의 기반이 돼요. 범용 LLM이 알지 못하는 사내 정보를 RAG 검색을 통해 전달함으로써 내부 문서를 기반으로 답변할 수 있어요.
사내 문서는 RAG에서 어떻게 처리되나요?
사내 문서를 생성형 AI와 연결하려면 먼저 문서에서 필요한 정보를 추출하고 구조를 정리한 뒤, 검색에 적합한 형태로 가공해야 해요. 이후 사용자가 질문하면 관련 정보를 찾아 LLM에 전달하고, LLM이 이를 근거로 답변을 생성해요.
정제·추출: 문서에서 텍스트·표·이미지와 구조 정보를 추출해 정리
청킹: 검색하기 좋은 의미 단위로 문서를 분할
임베딩: 각 청크를 벡터로 변환
검색: 질문과 관련성이 높은 정보를 탐색
생성: 검색된 내용을 바탕으로 LLM이 답변 생성
즉, 정제·추출 → 청킹 → 임베딩 → 검색 → 생성의 흐름으로 볼 수 있어요. 이 중 문서를 처음 읽고 정리하는 단계가 이후 검색에 사용할 데이터의 기반이 돼요.
RAG에서 문서 파싱은 왜 중요한가요?
RAG에서 문서 파싱은 HWP·Word·이미지 등 다양한 문서에서 텍스트와 표 같은 정보를 추출하고, 검색에 활용하기 쉬운 구조화된 데이터로 정리하는 과정이에요.
이때 중요한 것은 각 정보가 원본 문서에서 어떤 의미와 관계를 가지고 있었는지를 함께 유지하는 것이에요. 파싱 결과가 잘 정리돼 있어야 이후 청킹과 검색에서도 필요한 정보를 맥락에 맞게 활용할 수 있어요.
따라서 RAG에서는 원본 문서의 내용과 구조를 얼마나 정확하게 추출하고 보존하느냐가 검색 품질의 기반이 돼요.
2.RAG 문서 파싱, 자주 묻는 질문
Q1. 문서 파싱, 어떤 문서에서 어떤 정보까지 추출할 수 있나요?
Polaris AI DataInsight는 워드·한글·시트·슬라이드 등 다양한 문서에서 텍스트뿐 아니라 표·이미지·차트와 그 안의 구조·속성 정보까지 추출해, JSON·XML·MD 등 구조화된 형식으로 변환해요.
문서 기반 애플리케이션(검색, QA, 분석 등)에 바로 적용할 수 있도록 자동화된 파이프라인을 제공하고, 이런 정보를 구조화해 RAG 검색과 답변에 활용할 수 있어요.
1) HWP를 포함한 다양한 문서 포맷 지원
HWP·HWPX·DOCX·PPTX·XLSX를 지원해요. HWP처럼 파서에 따라 지원 여부가 달라지는 문서도 처리할 수 있어요.
2) 본문 외에 문서 내부의 객체와 속성 정보
제목·본문뿐 아니라 머리글·꼬리말·각주·미주를 구분하고, 내부 레이아웃까지 분석해 분류해요. 수식·주석·북마크·숨긴 셀처럼 놓치기 쉬운 정보도 추출 대상으로 다뤄요. 하이퍼링크·메모·슬라이드 노트·애니메이션 정보 같은 속성 정보도 포함돼요.
3) 표·차트의 구조와 원본 데이터
표는 셀의 텍스트뿐 아니라 병합 구조와 행·열 위치, 표 안의 표나 이미지 같은 복합 요소까지 추출 대상으로 다뤄요. 차트에서는 화면에 보이는 값이 아니라 항목별 실제 데이터값(raw data)을 추출하고, 시트의 경우 셀에 담긴 수식 정보까지 함께 가져와요.
4) 요약·키워드와 객체 설명
문서 요약·핵심 키워드와 이미지·표·차트 설명 생성도 가능해요. 요약과 키워드는 관련 문서를 선별하는 보조 정보로, 객체 설명은 이미지나 차트의 내용을 텍스트 검색에 연결하는 데 활용할 수 있어요.
Q2. 파싱 결과에는 정해진 스키마(문서 구조 규격)가 있나요?
네. Polaris AI DataInsight는 문서에서 추출한 결과를 정의된 스키마에 따라 구조화해 제공해요. HWP·DOCX·PPTX·XLSX처럼 구조가 다른 문서도 통합 스키마를 통해 일관된 형태로 처리할 수 있어요.
스키마에는 제목·본문·표·이미지 등 문서 요소와 관련 속성이 포함되며, 이를 활용해 DB 적재나 RAG 파이프라인에 연결하기 쉬워요.
현재 Playground에서는 통합 스키마 기준의 결과를 확인할 수 있으며, 세부 제공 방식은 연동 환경에 따라 달라질 수 있어요.
Q3. 대량의 문서를 동시에 처리할 수 있나요?
가능해요. 다만 실제 처리 가능한 문서 수와 동시 처리량은 배포 환경과 인프라 구성에 따라 달라져요.
API 방식은 클라우드 환경에서 제공되며, 필요한 처리량에 따라 서버 자원을 확장할 수 있어요. SDK를 활용해 온프레미스 환경에 구축하는 경우에는 고객사가 운영하는 서버 사양과 시스템 구성에 따라 처리량이 달라질 수 있어요.
따라서 대량 문서 처리가 필요한 경우에는 예상 문서 수, 파일 크기, 처리 빈도, 운영 환경 등을 기준으로 실제 필요한 처리 규모를 별도로 확인하는 것이 필요해요.
Q4. 문서 파싱 결과의 품질은 어떻게 검증하나요?
문서 파싱 품질은 NID, TEDS 같은 평가 지표를 활용해 관리할 수 있어요. NID는 문서 내용이 원래 읽는 순서대로 잘 추출됐는지, TEDS는 표의 구조와 셀 내용이 원본과 비슷하게 복원됐는지를 평가하는 지표예요.
문서 파싱 솔루션을 검토할 때도 이러한 평가 기준을 참고해, 실제 업무 문서에서 읽기 순서가 유지되는지, 표 구조와 셀 내용이 원본과 얼마나 정확하게 복원되는지 확인해보는 것이 좋아요.
Q5. 문서 파싱 API, 어떻게 연동하나요?
Polaris AI DataInsight의 Doc Extract API는 문서를 전송하면 추출 결과를 같은 요청의 응답으로 반환하는 방식이에요. API Key로 인증한 뒤 문서를 업로드하면, 처리 결과를 ZIP 파일로 받을 수 있어요.
문서 전송
발급받은 API Key를 요청 헤더에 넣고,multipart/form-data방식으로 문서 파일을 전송해요.POST https://datainsight-api.polarisoffice.com/api/v1/datainsight/doc-extract추출 결과 수신
처리에 성공하면 HTTP 200 응답과 함께 ZIP 파일이 반환돼요. ZIP에는 JSON·Markdown·XML 형식의 추출 결과와 문서 내 이미지 파일이 포함돼요.RAG 파이프라인 연결
추출된 텍스트·표·구조 정보를 확인한 뒤, 필요한 형식을 선택해 청킹 → 임베딩 → 검색 인덱스 저장 단계로 연결하면 돼요.
현재 베타 서비스 기준으로 지원하고 있어요. 실제 상용 환경의 지원 범위와 처리 규모는 별도로 확인이 필요해요.
Q6. 기존 그룹웨어나 문서관리시스템의 문서를 RAG에 활용할 수 있나요?
가능해요. 기업이나 공공기관에는 오랜 기간 축적된 레거시 문서가 많지만, 기존에는 필요한 내용을 사용자가 직접 찾아보거나 단순 검색 시스템으로 활용하는 경우가 많았어요.
Polaris AI DataInsight를 활용하면 이러한 문서에서 텍스트·표·이미지와 구조 정보를 추출해 내부 지식베이스로 구축하고, 이를 RAG와 연결해 AI 검색이나 질의응답에 활용할 수 있어요.
다만 실제 연동 방식은 시스템 환경에 따라 달라질 수 있어, API·커넥터 지원 여부, 인증 방식, 문서 접근 권한, 연동 방식 등을 사전에 확인해야 해요.
Q7. API와 SDK 중 어떤 방식으로 연동해야 하나요?
Polaris AI DataInsight는 API(Application Programming Interface)와 SDK(Software Development Kit)로 연동할 수 있어요. 기존 시스템의 개발 환경과 문서 처리 방식을 고려해 선택하면 돼요.
구분 | API | SDK |
|---|---|---|
연동 방식 | API 서버에 문서를 전송하고 처리 결과를 응답으로 수신 | 라이브러리·개발 도구를 기존 애플리케이션이나 서버에 통합 |
적합한 환경 | 웹 서비스, 서버 간 연동, 빠른 PoC | 기존 제품 내 기능 탑재, 내부 시스템과 긴밀한 통합 |
문서 처리 위치 | API 제공 환경에서 처리 | SDK 구성과 배포 환경에 따라 달라질 수 있음 |
보안 검토 포인트 | 외부 전송 여부, API Key 관리, 네트워크 정책 | 내부 서버 설치 여부, 라이브러리 배포·운영 정책 |
단순 연동이나 빠른 PoC에는 API가 편리하고, 기존 애플리케이션에 개발 기능을 통합하려는 경우 SDK를 검토할 수 있어요. 다만 SDK의 실제 문서 처리 위치와 온프레미스 지원 여부는 제공되는 구성에 따라 달라질 수 있으므로 별도 확인이 필요해요.
Q8. 기업용 RAG 구축 시 문서 처리 솔루션은 어떤 기준으로 선택해야 하나요?
기업용 문서 파싱 솔루션은 기능 목록만 확인하기보다, 실제 업무 문서를 기준으로 PoC를 진행해 추출 품질과 운영 적합성을 함께 검증하는 것이 중요해요. 같은 문서 포맷이라도 표 구조, 각주, 메모, 차트, 문단 구성에 따라 처리 결과가 달라질 수 있기 때문이에요.
확인 항목 | 실제 테스트할 내용 |
|---|---|
실제 업무 문서 | HWP/HWPX를 포함한 사내 주요 문서가 정상적으로 처리되는지 |
추출 결과 | 표·각주·메모·차트 등 필요한 정보와 관계가 유지되는지 |
처리 성능 | 대량 문서나 동시 요청을 안정적으로 처리할 수 있는지 |
운영 환경 | Windows/Linux, 폐쇄망 등 실제 구축 환경을 지원하는지 |
연동 방식 | API·SDK를 기존 그룹웨어·EDMS·RAG 시스템과 연결할 수 있는지 |
검수·운영 | 오류 확인, 모니터링, 결과 검증을 위한 관리 방식이 제공되는지 |
PoC에서는 실제 업무 문서와 예상 질문을 함께 선정해 문서 처리부터 검색 결과까지 확인해보는 것이 좋아요. 단순히 텍스트가 추출되는지만 보는 것이 아니라, 필요한 정보가 누락되지 않는지, 문서 내 정보의 관계가 유지되는지, 현재 시스템 환경에서 안정적으로 운영할 수 있는지를 함께 검증해야 해요.
HWP/HWPX와 복잡한 문서 객체를 처리해야 하거나 API·SDK 기반 연동이 필요한 경우에는 Polaris AI DataInsight의 실제 추출 결과도 함께 비교해볼 수 있어요.
→Polaris AI DataInsight 직접 사용해보기
RAG 구축의 시작, 문서 파싱부터 확인하세요
RAG에 사내 문서를 활용할 때는 텍스트 추출 여부뿐 아니라 업무에 필요한 정보와 그 관계가 검색 과정까지 제대로 전달되는지를 함께 확인해야 해요.
Polaris AI DataInsight는 HWP·HWPX·DOCX·PPTX·XLSX 등 다양한 문서에서 텍스트, 표, 이미지, 차트와 구조 정보를 추출해 JSON·Markdown·XML 등으로 제공해요
RAG 구축을 위해 문서 파싱을 검토하고 있다면, Polaris AI DataInsight로 다양한 문서의 구조화부터 기존 시스템 연동까지 확인해보세요.
📌 핵심 요약
RAG는 사내 문서를 검색해 관련 내용을 LLM에 전달하고, 그 정보를 근거로 답변을 생성하는 방식이에요.
문서 파싱은 HWP·DOCX·PPTX·XLSX 등 문서에서 텍스트·표·이미지·각주 같은 정보를 추출하고 정리하는 과정이에요.
RAG용 문서 파싱 솔루션을 선택할 때는 지원 포맷, 표·차트 등 추출 범위, 처리 성능, API·SDK 연동, 폐쇄망 등 운영 환경을 함께 확인하는 것이 중요해요.
실제 도입 전에는 사내 문서로 PoC를 진행해 필요한 정보가 제대로 추출되고 검색에 활용되는지 검증하는 것이 좋아요.
참고자료
Microsoft, Microsoft Learn — RAG Chunking Phase
Microsoft, Develop a RAG Solution - Chunking Phase