--- title: 45토큰에서 27토큰으로: 최신 모델의 한국어 토큰 감축 실측과 원리 date: 2026-09-29 model: admin category: knowhow summary: GPT-4o의 o200k 토크나이저는 한국어 토큰을 45개에서 27개로 줄였다. 어휘 사전 확장이 가져온 실측 수치와 BPE 원리를 정리한다. tags: 토큰, 토크나이저, GPT-4o, Llama3, 한국어 --- GPT-4o와 Llama 3 같은 최신 AI 모델들이 비영어권, 특히 **한국어 토큰 효율을 비약적으로 높일 수 있었던 결정적 이유는 토크나이저(Tokenizer)의 어휘 사전(Vocabulary) 크기를 대대적으로 확장하고 다국어 학습 데이터를 대량 투입했기 때문**이다. 아래 수치는 OpenAI 공식 발표와 Meta 공개 스펙에 근거한다. (운영자 환경 측정 기준이 아닌 공개 자료 인용이므로, 실제 체감 수치는 모델 버전·입력 문장에 따라 달라질 수 있다.) ## 1. GPT-4o: 어휘 사전 2배 확장과 1.7배 효율 개선 OpenAI는 GPT-4o를 출시하면서 기존 GPT-4 및 GPT-3.5에서 사용하던 토크나이저(`cl100k_base`)를 버리고, 새롭게 설계된 **`o200k_base`** 토크나이저를 도입했다. - **어휘 사전(Vocabulary Size)의 확장:** 토크나이저가 기억할 수 있는 단어·문자 조합의 수가 **약 10만 개(`cl100k`)에서 20만 개(`o200k`)로 2배 증가**했다. - **한국어 토큰 감축 수치:** OpenAI 공식 발표 기준, 동일한 의미의 한국어 문장을 처리할 때 **토큰 수가 약 1.7배(약 40% 감축) 절감**되었다. ### 실측 수치 비교 (OpenAI 공식 예시) > **문장:** "안녕하세요, 제 이름은 GPT-4o입니다. 저는 새로운 유형의 언어 모델입니다, 만나서 반갑습니다!" > > - **GPT-4 (기존 `cl100k_base`):** **45 토큰** 소비 > - **GPT-4o (`o200k_base`):** **27 토큰** 소비 > - **결과:** 동일한 문장을 **18개나 적은 토큰**으로 처리 (1.7배 효율 증가) ## 2. Llama 3: 4배 커진 어휘 사전과 바이트 파편화 해소 Meta의 Llama 2는 영어 중심 모델이었기 때문에 한국어 처리 성능과 토큰 효율이 떨어졌다. 그러나 Llama 3에 이르러 구조적인 변화가 일어났다. - **토크나이저 방식 및 사전 크기 변혁:** - **Llama 2:** SentencePiece 기반 / **32,000개 (32k)** 어휘 사전 - **Llama 3:** Tiktoken 스타일 BPE 기반 / **128,000개 (128k)** 어휘 사전 - **바이트 파편화(Byte Fallback) 완화:** Llama 2에서는 한국어 단어가 토크나이저 사전에 없어 한 글자가 여러 개의 바이트 토큰으로 쪼개지는 현상이 흔했다. Llama 3에서는 128k 사전 덕분에 한국어 음절과 자주 쓰는 단어들이 단일 토큰으로 매핑되는 비율이 높아졌다. ## 3. 구체적으로 어떻게 개선했는가 (기술적 메커니즘) | 개선 요소 | 과거 (GPT-4 / Llama 2) | 최신 (GPT-4o / Llama 3) | | --- | --- | --- | | **어휘 사전 크기** | 32,000 ~ 100,000개 | **128,000 ~ 200,000개** | | **한국어 결합 단위** | 글자 단위나 바이트로 분해되는 비율이 높음 | **자주 쓰이는 어절·단어 단위로 통째로 인코딩되는 비율 증가** | | **토크나이저 학습 데이터** | 영어가 압도적 비중 | **다국어 웹 데이터(한국어 포함) 비중 증대** | ### 핵심 원리: 자주 쓰는 문자열의 통째 등재 BPE(Byte Pair Encoding) 알고리즘은 **자주 함께 등장하는 문자열을 하나의 토큰으로 합치는 방식**이다. 과거에는 토크나이저 사전의 공간(Capacity)이 부족해 영어를 먼저 채우고 나면 한국어는 자잘하게 쪼갤 수밖에 없었다. 사전을 128k~200k로 확장하면서 자주 쓰이는 한국어 단어와 조사의 조합이 **사전에 1개의 토큰으로 직접 등록**될 수 있게 되었고, 이것이 45토큰에서 27토큰으로 줄어든 직접적인 원인이다. ## 4. 사용자·개발자가 체감하는 3가지 변화 1. **API 비용 절감:** 한국어 프롬프트와 응답을 처리할 때 소비되는 토큰 수 자체가 줄어들어 **동일한 작업 대비 비용이 감소**한다. 2. **응답 속도(Latency) 향상:** AI는 한 번에 1토큰씩 순차적으로 출력한다. 출력해야 할 토큰 수가 45개에서 27개로 줄어들면, **문장 생성 완성 속도가 물리적으로 빨라진다**. 3. **더 긴 문서 입력 가능:** 동일한 컨텍스트 윈도우(예: 128k 토큰)를 가졌더라도, 더 많은 양의 한국어 문서를 한 번에 넣어 요약·분석할 수 있게 된다. ## 참고 - OpenAI GPT-4o 발표 (o200k 토크나이저, 한국어 45→27 토큰 예시): OpenAI 공식 블로그 및 토크나이저 문서 - Meta Llama 3 모델 카드 (128k 어휘 사전, Tiktoken 기반 BPE): Meta 공식 모델 카드