LLM API 비용 관점에서 본 HWP 마크다운 변환의 경제성
LLM API를 활용한 기업 내 문서 처리 시스템을 구축할 때, 개발자와 아키텍트가 간과하기 쉬운 비용 요소가 있습니다. 바로 입력 텍스트의 품질이 토큰 수에 직접적인 영향을 미친다는 사실입니다.
OpenAI, Anthropic, Google 등의 LLM API는 모두 입력 토큰과 출력 토큰의 합산으로 비용이 청구됩니다. 같은 정보를 담고 있더라도, 어떻게 텍스트를 구조화하느냐에 따라 토큰 수가 달라질 수 있습니다.
텍스트 덤프가 만들어내는 '노이즈 토큰'
HWP 파일을 단순 텍스트 추출 방식으로 처리하면 다음과 같은 노이즈가 발생합니다.
1. 불필요한 연속 공백과 줄바꿈
표 셀 경계가 공백 문자의 나열로 표현되어, 실제 데이터보다 구분자 공백이 더 많은 텍스트 블록이 생성됩니다. 토크나이저는 이 공백들도 토큰으로 처리합니다.
2. 반복적인 페이지 헤더/푸터
페이지 번호, 문서 제목, 날짜가 페이지마다 반복되어 삽입됩니다. 100페이지 문서라면 이 반복 패턴만으로도 수백 개의 불필요한 토큰이 추가됩니다.
3. 표 구조 붕괴로 인한 재서술 필요
표가 1차원 텍스트로 무너지면 LLM이 데이터를 정확히 이해하지 못해 AI에게 추가적인 설명 프롬프트를 넣어야 하는 악순환이 발생합니다.
예시 계산: 1만 페이지 분량 가상 시나리오
이하는 실제 측정값이 아닌 가상 예시 계산임을 명시합니다. 실제 결과는 문서 특성, 포맷, 내용 밀도에 따라 크게 달라질 수 있습니다.
A4 1페이지를 HWP에서 단순 텍스트로 추출할 경우를 가정합니다.
| 구분 | 단순 텍스트 추출 (예시) | 마크다운 구조화 (예시) |
|---|---|---|
| 페이지당 평균 토큰 수 | ~800 토큰 | ~600 토큰 |
| 1만 페이지 총 입력 토큰 | 800만 토큰 | 600만 토큰 |
| GPT-4o 기준 입력 비용 ($2.50/1M) | 약 $20.00 | 약 $15.00 |
위 예시에서 페이지당 200 토큰(약 25%)의 차이가 발생한다고 가정했을 때, 1만 페이지 규모에서는 약 200만 토큰, 비용으로는 약 $5의 차이가 나타납니다. 처리 문서 규모가 수십만 페이지로 늘어날수록 이 차이의 절대값이 커집니다.
다시 강조하지만, 위 수치는 설명을 위한 가상 시나리오입니다. 실제 절감폭은 문서의 표 비중, 페이지 구성, 사용하는 LLM 모델에 따라 크게 다릅니다.
마크다운 구조화가 어텐션(Attention) 효율성을 높이는 원리
비용 절감 외에도, 구조화된 마크다운 입력은 LLM의 어텐션 메커니즘 활용 효율을 높입니다.
Transformer 기반 LLM은 입력 시퀀스의 모든 토큰 쌍 간 어텐션을 계산합니다. 노이즈 토큰(불필요한 공백, 반복 헤더)이 많을수록 어텐션 헤드가 의미 없는 토큰 관계 계산에 리소스를 낭비하게 됩니다.
반면 마크다운의 # 헤더, | 표 구분자, - 목록 기호는 LLM 훈련 데이터에서 수없이 등장한 구조적 신호(Structural Signal)입니다. 이 패턴을 통해 모델은 문서의 계층과 경계를 빠르게 파악하고, 질문과 관련성 높은 부분에 어텐션을 집중시킬 수 있습니다.
결론
LLM API를 활용한 대규모 문서 처리 파이프라인에서, 입력 텍스트의 구조적 품질은 비용과 정확도 모두에 영향을 미칩니다. HWP를 마크다운으로 전처리하는 단계를 파이프라인에 추가하는 것은, 단순한 편의성 개선을 넘어 운영 비용과 AI 응답 품질에 실질적인 영향을 줄 수 있는 아키텍처 결정입니다.
기업 규모의 HWP 문서 처리 파이프라인 구축을 검토 중이라면, MDChange B2B API를 통해 구체적인 요건을 논의해 보세요.