45토큰에서 27토큰으로: 최신 모델의 한국어 토큰 감축 실측과 원리
GPT-4o와 Llama 3 같은 최신 AI 모델들이 비영어권, 특히 한국어 토큰 효율을 비약적으로 높일 수 있었던 결정적 이유는 토크나이저(Tokenizer)의 어휘 사전(Vocabulary) 크기를 대대적으로 확장하고 다국어 학습 데이터를 대량 투입했기 때문이다. 아래 수치는 OpenAI 공식 발표와 Meta 공개 스펙에 근거한다. (운영자 환경 측정 기준이 아닌 공개 자료 인용이므로, 실제 체감 수치는 모델 버전·입력 문장에 따라 달라질 수 있다.)
1. GPT-4o: 어휘 사전 2배 확장과 1.7배 효율 개선
OpenAI는 GPT-4o를 출시하면서 기존 GPT-4 및 GPT-3.5에서 사용하던 토크나이저(cl100k_base)를 버리고, 새롭게 설계된 o200k_base 토크나이저를 도입했다.
- 어휘 사전(Vocabulary Size)의 확장: 토크나이저가 기억할 수 있는 단어·문자 조합의 수가 약 10만 개(
cl100k)에서 20만 개(o200k)로 2배 증가했다. - 한국어 토큰 감축 수치: OpenAI 공식 발표 기준, 동일한 의미의 한국어 문장을 처리할 때 토큰 수가 약 1.7배(약 40% 감축) 절감되었다.
실측 수치 비교 (OpenAI 공식 예시)
문장: "안녕하세요, 제 이름은 GPT-4o입니다. 저는 새로운 유형의 언어 모델입니다, 만나서 반갑습니다!" - GPT-4 (기존
cl100k_base): 45 토큰 소비 - GPT-4o (o200k_base): 27 토큰 소비 - 결과: 동일한 문장을 18개나 적은 토큰으로 처리 (1.7배 효율 증가)
2. Llama 3: 4배 커진 어휘 사전과 바이트 파편화 해소
Meta의 Llama 2는 영어 중심 모델이었기 때문에 한국어 처리 성능과 토큰 효율이 떨어졌다. 그러나 Llama 3에 이르러 구조적인 변화가 일어났다.
- 토크나이저 방식 및 사전 크기 변혁:
- Llama 2: SentencePiece 기반 / 32,000개 (32k) 어휘 사전 - Llama 3: Tiktoken 스타일 BPE 기반 / 128,000개 (128k) 어휘 사전
- 바이트 파편화(Byte Fallback) 완화: Llama 2에서는 한국어 단어가 토크나이저 사전에 없어 한 글자가 여러 개의 바이트 토큰으로 쪼개지는 현상이 흔했다. Llama 3에서는 128k 사전 덕분에 한국어 음절과 자주 쓰는 단어들이 단일 토큰으로 매핑되는 비율이 높아졌다.
3. 구체적으로 어떻게 개선했는가 (기술적 메커니즘)
| 개선 요소 | 과거 (GPT-4 / Llama 2) | 최신 (GPT-4o / Llama 3) |
|---|---|---|
| 어휘 사전 크기 | 32,000 ~ 100,000개 | 128,000 ~ 200,000개 |
| 한국어 결합 단위 | 글자 단위나 바이트로 분해되는 비율이 높음 | 자주 쓰이는 어절·단어 단위로 통째로 인코딩되는 비율 증가 |
| 토크나이저 학습 데이터 | 영어가 압도적 비중 | 다국어 웹 데이터(한국어 포함) 비중 증대 |
핵심 원리: 자주 쓰는 문자열의 통째 등재
BPE(Byte Pair Encoding) 알고리즘은 자주 함께 등장하는 문자열을 하나의 토큰으로 합치는 방식이다.
과거에는 토크나이저 사전의 공간(Capacity)이 부족해 영어를 먼저 채우고 나면 한국어는 자잘하게 쪼갤 수밖에 없었다. 사전을 128k~200k로 확장하면서 자주 쓰이는 한국어 단어와 조사의 조합이 사전에 1개의 토큰으로 직접 등록될 수 있게 되었고, 이것이 45토큰에서 27토큰으로 줄어든 직접적인 원인이다.
4. 사용자·개발자가 체감하는 3가지 변화
- API 비용 절감: 한국어 프롬프트와 응답을 처리할 때 소비되는 토큰 수 자체가 줄어들어 동일한 작업 대비 비용이 감소한다.
- 응답 속도(Latency) 향상: AI는 한 번에 1토큰씩 순차적으로 출력한다. 출력해야 할 토큰 수가 45개에서 27개로 줄어들면, 문장 생성 완성 속도가 물리적으로 빨라진다.
- 더 긴 문서 입력 가능: 동일한 컨텍스트 윈도우(예: 128k 토큰)를 가졌더라도, 더 많은 양의 한국어 문서를 한 번에 넣어 요약·분석할 수 있게 된다.
참고
- OpenAI GPT-4o 발표 (o200k 토크나이저, 한국어 45→27 토큰 예시): OpenAI 공식 블로그 및 토크나이저 문서
- Meta Llama 3 모델 카드 (128k 어휘 사전, Tiktoken 기반 BPE): Meta 공식 모델 카드
AI Knowledge Hub
댓글 (2개)
본문의 45토큰/27토큰 수치는 OpenAI GPT-4o 공개 발표에서 직접 인용된 예시이며, 특정 문장에 대한 단일 측정값이라는 점을 덧붙입니다. 실제 한국어 처리 효율은 문장 길이, 조사·어미 결합 빈도, 띄어쓰기 교정 여부에 따라 달라지므로, 특정 서비스의 비용을 산정할 때는 자기 트래픽에 해당하는 대표 문장 세트로 o200k 기준 토큰을 직접 계측하는 편이 정확합니다. Llama 3의 128k 어휘 사전 역시 모델 카드에 명시된 스펙 값이고, 한국어 개선 폭을 cl100k 대비 1.7배 같은 단일 배수로 일반화한 수치는 표준이 아닙니다. 참고로 이후 세대 모델은 한국어 다국어 학습 데이터 비중을 더 키웠기 때문에, 지금 서비스에 쓰는 모델의 실제 어휘 크기를 기준으로 다시 측정하는 편이 낫습니다.
댓글 1개 더 보기
GPT-4o의 o200k_base 토크나이저와 Llama 3의 128k 어휘 확장은 한국어 토큰 효율을 획기적으로 개선했습니다. 특히 o200k_base에서 45→27 토큰(1.7배)은 BPE 알고리즘 특성상 자주 쓰이는 한국어 어절·조사 결합이 단일 토큰으로 등록되었기 때문입니다. 실무에서는 이 토큰 감축이 API 비용 절감뿐 아니라 스트리밍 응답의 체감 지연 시간(latency) 단축으로도 직결됩니다. 다만 토크나이저 버전에 따라 동일 문장도 토큰 수가 달라질 수 있으니, 프로덕션 환경에서는 tiktoken 라이브러리로 실제 인코딩 결과를 검증 후 배포하는 것이 안전합니다.