--- title: 같은 의미, 3배 요금 — 한국어 토큰 비효율의 실체와 대응법 date: 2026-09-29 model: admin category: knowhow summary: 한국어는 같은 의미도 영어보다 토큰을 2~3배 더 쓴다. 토크나이저 원리부터 언어별 소비량, 비용·컨텍스트·속도 문제와 실전 대응법까지 정리했다. tags: 토큰, 토크나이저, 한국어, 비용최적화, BPE --- 한국어로 AI 서비스를 운영하면 같은 작업에 영어보다 토큰을 2~3배 더 쓰고, API 비용도 그만큼 더 나온다. 이는 모델 성능 문제가 아니라 토크나이저가 영어 중심으로 설계된 구조적 원인이며, 모델 선택과 프롬프트 전략으로 완화할 수 있다. ## 토큰이란: 1글자도 1단어도 아니다 LLM이 텍스트를 처리하는 가장 작은 단위, 토큰은 글자나 단어와 1:1로 대응하지 않는다. 주류 방식인 BPE(Byte Pair Encoding)는 자주 등장하는 문자열 패턴을 하나의 토큰으로 묶고, 낯선 단어는 더 작은 조각으로 쪼갠다. - `hamburger` → `[hamburger]` 1토큰 (자주 쓰이므로 통째로 등록) - `unbelievably` → `[un] [believ] [ably]` 3토큰 (덜 흔하므로 분할) 즉, 토큰 수는 텍스트 길이가 아니라 **그 언어가 토큰 사전에 얼마나 잘 등록되어 있는가**로 결정된다. ## 왜 영어가 압도적으로 유리한가 토크나이저의 사전은 학습 데이터에서 자주 등장한 조합 위주로 만들어진다. 학습 데이터의 60~80%가 영어 웹 문서(Common Crawl, Wikipedia 등)이다 보니, 영어 단어와 구절은 통째로 1토큰으로 등록되어 있고, 비영어권 언어는 바이트 단위까지 잘게 쪼개진다. 영어 기준 1토큰은 약 4개 알파벳(약 0.75단어)에 해당한다. ## 언어별 토큰 소비량 비교 (영어 = 1, 추정치) | 언어 | 문자 체계 | 영어 대비 배수 | 원인 | | --- | --- | --- | --- | | 영어 | 라틴 | 1.0x | 학습 데이터의 절대다수, 단어 단위 토큰화 | | 프랑스어/독일어 | 라틴 | 1.2x ~ 1.5x | 악센트 기호, 독일어 긴 합성어 분할 | | 러시아어 | 키릴 | 2.0x ~ 2.5x | 다른 문자 체계, 바이트 단위 분리 빈번 | | 한국어 | 한글 | 2.5x ~ 3.5x | 교착어의 조사·어미 결합 + 구형 모델의 자모/바이트 분리 | | 일본어/중국어 | 한자/가나 | 2.5x ~ 4.0x | 수만 개 한자가 사전에 미등재되어 잘게 분할 | 모델의 토크나이저마다 편차가 있으니, 정확한 수치는 아래 코드로 직접 재는 것을 권장한다. ```python # tiktoken으로 직접 측정 (pip install tiktoken) import tiktoken enc = tiktoken.get_encoding("cl100k_base") for s in ["Hello, how are you?", "안녕하세요, 어떻게 지내세요?"]: print(s, "→", len(enc.encode(s)), "tokens") ``` ## 토큰 격차가 만드는 3가지 실질 문제 1. **비용 비대칭**: 과금 기준은 글자 수가 아니라 토큰 수다. 한국어 서비스는 동일 작업에 영어의 2~3배를 낸다. 2. **컨텍스트 윈도우 축소**: 32K 토큰 한도에서 영어 문서는 수십 페이지를 넣지만, 한국어 문서는 3분의 1 수준만 들어가 장문 요약·분석에 불리하다. 3. **생성 속도 저하**: 모델은 토큰을 하나씩 순차 생성한다. 3배 많은 토큰을 뱉어야 하니 한국어 응답은 물리적으로 느려진다. ## 실전 대응법 3가지 1. **다국어 토크나이저 모델 선택**: GPT-4o, Llama 3, Claude 3.5 이후 모델은 비영어권 사전을 대폭 확장했다. 구형 모델 고수는 곧 비용 고수다. 2. **지시는 영어, 출력은 한국어**: 시스템 프롬프트와 few-shot 예시는 영어로 쓰고 출력 언어만 한국어로 지정하면 입력 토큰을 크게 아낄 수 있다. 3. **장문은 분할·요약 파이프라인으로**: 컨텍스트가 부족하면 통째로 넣지 말고 청크 분할 후 map-reduce식 요약을 쓴다. 토큰 효율은 모델 스펙표에 잘 드러나지 않지만, 운영비에 직접 찍히는 숫자다. 한국어 서비스를 한다면 토크나이저 사전부터 확인할 일이다.