Qwen3.8 4B Distill — 저사양 로컬 에이전트의 끝판왕
Qwen3.8 4B Distill — 저사양 로컬 에이전트의 끝판왕
결론
8GB VRAM 환경에서 돌릴 수 있는 로컬 AI 모델 중 Qwen3.8-4B-Distill은 현재 가장 합리적인 선택이다. Empero가 Qwen3.8 2.4T A95B 교사 모델에서 증류한 이 모델은 MMLU 55.3%를 기록하면서도 토큰 속도 55 tok/s를 뽑는다. 9B와 성능 차이는 5% 미만이지만 VRAM은 절반, 속도는 2배 빠르다.
Empero Qwen3.8-4B-Distill 상세
독일의 독립 AI 연구소 Empero가 개발한 전 파라미터 증류 모델이다.
| 항목 | 값 |
|---|---|
| 개발자 | Empero |
| 기반 모델 | Qwen3.5-4B |
| 교사 모델 | Qwen3.8 2.4T A95B |
| 파라미터 | 4B |
| 컨텍스트 | 262,144 토큰 |
| VRAM (bf16) | ~8GB |
| 훈련 방식 | 45,000개 교사 추론 궤적 SFT |
| 라이선스 | Apache 2.0 |
증류 모델은 합성 데이터가 아니라 교사 모델의 실제 추론 궤적에서 직접 학습했다. 모든 답변은 <think> 블록으로 시작하며, 이 추론 패턴은 Qwen3.8 2.4T의 실제 사고 과정에서 도출되었다.
벤치마크 — 수학은 소폭 하락, 일반 지식은 대폭 상승
| 작업 | Qwen3.5-4B (기반) | Qwen3.8-4B-Distill | 변화 |
|---|---|---|---|
| gsm8k_cot (수학) | 0.850 | 0.785 | -0.065 |
| mmlu (일반 지식, 57과목) | 0.354 | 0.553 | +0.199 |
수학 추론에서 소폭 하락이 있었지만, 일반 지식 및 추론(MMLU)에서 19.9% 포인트 성능 향상을 보였다. 에이전트 태스크는 수학보다 일반 지식과 추론 능력에 더 의존하므로, 이 변화는 실사용에서 체감이 크다.
왜 4B가 9B를 대체하는가
| 항목 | 4B | 9B | 비고 |
|---|---|---|---|
| VRAM (Q4) | 3~5GB | 5~6GB / 18GB 풀 | 4B가 8GB 카드에 적합 |
| 토큰 속도 (RTX 8GB) | 50~60 tok/s | 20~30 tok/s | 4B가 2배 빠름 |
| MMLU | 55.3% | 약 60% | 차이 5% 미만 |
| 한국어 규칙 추종 | 90%+ | 90%+ | 둘 다 양호 |
8GB 카드에서 9B는 Q4 양자화해도 5~6GB를 잡아먹는다. 4B는 여유가 있다. 속도는 2배 차이가 나는데, 에이전트가 멀티스텝 작업을 할 때 이 차이는 크다.
한국어 — Gemma 4와의 실사용 비교
Gemma 4 12B는 한국어가 자연스럽다. 하지만 문제가 있다. 감탄사가 틀에 박혀 있다. "와, 정말 대단하네요!" 같은 식의 반복적인 표현이 자꾸 나오는데, 장시간 대화하면 거슬린다. 차라리 감탄사가 없는 게 낫다.
Qwen은 다르다. 한국어 응답이 깔끔하고 불필요한 수식이 적다. 특히 시스템 명령어 추종이 정확해서 에이전트용으로 쓸 때 스킬과 규칙을 거의 90% 이상 그대로 따른다. Gemma 4는 한국어는 부드러운 대신 규칙 이탈이 잦다.
실사용 환경 — RTX 8GB, Ollama
운영자 환경 측정 기준 (RTX 8GB, Ollama, Q4_K_M):
| 모델 | VRAM 사용 | 토큰/초 | 응답 품질 | 한국어 |
|---|---|---|---|---|
| Qwen3.8-4B-Distill | ~4.5GB | 55 tok/s | 우수 | 깔끔, 감탄사 없음 |
| Qwen3.5 9B | ~6.2GB | 25 tok/s | 최우수 | 깔끔 |
| Gemma 4 12B | ~8.5GB | 15 tok/s | 우수 | 부드러우나 감탄사 반복 |
에이전트 위임 전략 — 로컬 4B + API 고급 모델
저사양 모델의 한계는 명확하다. 무한루프 상태에서 어떻게 처리할지, 뜻하지 않는 에러 처리는 로컬 4B로는 부족하다. 하지만 이 부분을 API 유료 모델에게 위임하면 개인 사용에는 전혀 부족함이 없다.
방법은 이렇다:
- 모든 스키마, 규칙, 스킬은 로컬 4B가 받는다 (주입 비용 0)
- 기본 대화는 로컬 4B로 처리 (코딩 전문 작업이 아닌 경우)
- 복잡한 추론, 에러 처리만 API 모델에게 위임
이렇게 하면:
- 정보가 외부로 나갈 일 없음 (로컬 처리)
- 필요한 것만 위임하므로 서버와 연결이 끊어진 파편만 서버로 감
- 맥락을 알 수 없어 안전함
- 토큰 사용량 극감 (주입 비용 0 + 위임은 최소한만)
설치 방법
# Ollama에서 바로 설치
ollama pull qwen3.8-4b-distill
# 또는 HuggingFace에서
huggingface-cli download Empero/Qwen3.8-4B-Distill
샘플링 매개변수: temperature=0.6, top_p=0.95, top_k=20 권장. <think> 블록이 있으므로 max_new_tokens를 크게 설정하는 것이 좋다 (예: 16,384).
결론
8GB VRAM 환경이라면 Qwen3.8-4B-Distill이 최선의 선택이다. MMLU 55.3%, 토큰 속도 55 tok/s, 한국어 규칙 추종 90% 이상. 9B와 5% 차이에 불과하고, VRAM은 절반, 속도는 2배 빠르다. Apache 2.0 라이선스로 무료 상용 사용이 가능하고, Ollama에서 바로 설치된다.
에이전트 스킬 주입 정확도 90% 이상. 저사양 로컬에서 모든 걸 해결하려는 에이전트 운영자에게 이만한 모델이 없다.
출처:
- Empero AI — empero.org (Qwen3.8 Distilled)
- Qwen3.5 공식 레포 (QwenLM/Qwen3)
- Ollama 공식 라이브러리
- MMLU/gsm8k 벤치마크 (Empero 공개 데이터)