목록으로 돌아가기

ChatGPT에 HWP 문서를 그대로 올리면 거짓말을 하는 이유 (AI 환각 해결법)

AI & RAG2026-08-13· 읽기 시간 4분

최근 많은 기업들이 사내 문서를 바탕으로 답변을 생성하는 RAG(Retrieval-Augmented Generation) 시스템을 구축하거나, ChatGPT와 Claude 같은 LLM에 직접 HWP(한글) 문서나 PDF 파일을 업로드하여 업무 효율을 높이고 있습니다.

하지만 문서를 있는 그대로 업로드할 경우, AI가 문서에 없는 엉뚱한 내용을 지어내거나 숫자를 틀리게 답변하는 AI 환각(Hallucination) 현상을 자주 겪게 됩니다. 그 이유는 무엇일까요?

표(Table) 데이터가 파괴될 때 발생하는 끔찍한 결과

가장 치명적인 환각은 재무제표, 인사기록부, 실적 보고서와 같이 표(Table) 형태로 정리된 데이터에서 발생합니다.

예를 들어, 다음과 같은 사내 실적 보고서 HWP 파일이 있다고 가정해 봅시다.

연도부서매출액(억원)영업이익(억원)
2023영업1팀50050
2023영업2팀35020

이 파일을 ChatGPT에 그대로 업로드하거나, 일반적인 텍스트 추출 도구(예: hwp5txt)를 사용해 RAG 데이터 전처리를 수행하면, LLM이 읽어들이는 텍스트는 다음과 같이 치명적으로 손실됩니다.

<표>

AI는 이 텍스트 덩어리를 보고 표 안에 있던 매출액과 영업이익 데이터가 통째로 증발했기 때문에 맥락을 전혀 파악할 수 없게 됩니다. 결과적으로 표 안에 있던 중요한 데이터 관련 질문을 받았을 때, 자신이 모른다는 사실을 숨긴 채 전혀 엉뚱한 거짓말(환각)을 생성하게 됩니다.

해결책: RAG 데이터 전처리의 핵심은 '마크다운(Markdown)'

이러한 HWP ChatGPT 업로드 시의 환각 문제를 해결하려면, 문서의 시각적 구조를 AI가 이해할 수 있는 의미론적 구조로 변환하는 RAG 데이터 전처리 과정이 필수적입니다. 그리고 가장 완벽한 해답은 **마크다운(Markdown)**입니다.

MDChange와 같은 전문 파싱 도구를 사용해 HWP 파일을 마크다운으로 변환하면, 표 데이터는 다음과 같은 완벽한 마크다운 문법으로 변환됩니다.

| 연도 | 부서 | 매출액(억원) | 영업이익(억원) | |---|---|---|---| | 2023 | 영업1팀 | 500 | 50 | | 2023 | 영업2팀 | 350 | 20 |

LLM은 마크다운 표 문법을 100% 네이티브하게 이해합니다. 이렇게 전처리된 데이터를 주입하면 AI는 숫자를 헷갈리지 않고 정확히 답변을 생성해 내며, 치명적인 환각(Hallucination) 현상을 원천적으로 차단할 수 있습니다.

성공적인 AI 도입의 첫걸음은 완벽한 데이터 전처리에서 시작됩니다. 표가 깨지지 않는 완벽한 HWP 파싱 기술을 경험해 보세요!

완벽한 표 파싱 및 대량 문서 자동화가 필요하신가요?

MDChange의 B2B 엔터프라이즈 전용 API를 도입하여 사내 HWP/HWPX 문서의 RAG 데이터 생성을 자동화하세요.