--- title: "Qwen3.8 4B Distill — 저사양 로컬 에이전트의 끝판왕" date: 2026-09-22 model: "Muse Spark" summary: "Empero가 만든 Qwen3.8-4B-Distill은 8GB VRAM에서 55 tok/s를 뽑으면서 MMLU 55.3%를 기록했다. 9B와 성능 차이 5% 미만, 토큰 속도는 2배. 한국어 규칙 추종 90% 이상." tags: "qwen, distill, 4b, low-spec, ollama, local-llm, empero, mmlu" --- # Qwen3.8 4B Distill — 저사양 로컬 에이전트의 끝판왕 ## 결론 8GB VRAM 환경에서 돌릴 수 있는 로컬 AI 모델 중 **Qwen3.8-4B-Distill**은 현재 가장 합리적인 선택이다. Empero가 Qwen3.8 2.4T A95B 교사 모델에서 증류한 이 모델은 MMLU 55.3%를 기록하면서도 토큰 속도 55 tok/s를 뽑는다. 9B와 성능 차이는 5% 미만이지만 VRAM은 절반, 속도는 2배 빠르다. ## Empero Qwen3.8-4B-Distill 상세 독일의 독립 AI 연구소 **Empero**가 개발한 전 파라미터 증류 모델이다. | 항목 | 값 | |------|-----| | 개발자 | Empero | | 기반 모델 | Qwen3.5-4B | | 교사 모델 | Qwen3.8 2.4T A95B | | 파라미터 | 4B | | 컨텍스트 | 262,144 토큰 | | VRAM (bf16) | ~8GB | | 훈련 방식 | 45,000개 교사 추론 궤적 SFT | | 라이선스 | Apache 2.0 | 증류 모델은 합성 데이터가 아니라 교사 모델의 실제 추론 궤적에서 직접 학습했다. 모든 답변은 `` 블록으로 시작하며, 이 추론 패턴은 Qwen3.8 2.4T의 실제 사고 과정에서 도출되었다. ## 벤치마크 — 수학은 소폭 하락, 일반 지식은 대폭 상승 | 작업 | Qwen3.5-4B (기반) | Qwen3.8-4B-Distill | 변화 | |------|-------------------|-------------------|------| | gsm8k_cot (수학) | 0.850 | 0.785 | -0.065 | | mmlu (일반 지식, 57과목) | 0.354 | **0.553** | **+0.199** | 수학 추론에서 소폭 하락이 있었지만, **일반 지식 및 추론(MMLU)에서 19.9% 포인트 성능 향상**을 보였다. 에이전트 태스크는 수학보다 일반 지식과 추론 능력에 더 의존하므로, 이 변화는 실사용에서 체감이 크다. ## 왜 4B가 9B를 대체하는가 | 항목 | 4B | 9B | 비고 | |------|----|----|------| | VRAM (Q4) | 3~5GB | 5~6GB / 18GB 풀 | 4B가 8GB 카드에 적합 | | 토큰 속도 (RTX 8GB) | 50~60 tok/s | 20~30 tok/s | 4B가 2배 빠름 | | MMLU | 55.3% | 약 60% | 차이 5% 미만 | | 한국어 규칙 추종 | 90%+ | 90%+ | 둘 다 양호 | 8GB 카드에서 9B는 Q4 양자화해도 5~6GB를 잡아먹는다. 4B는 여유가 있다. 속도는 2배 차이가 나는데, 에이전트가 멀티스텝 작업을 할 때 이 차이는 크다. ## 한국어 — Gemma 4와의 실사용 비교 Gemma 4 12B는 한국어가 자연스럽다. 하지만 문제가 있다. **감탄사가 틀에 박혀 있다.** "와, 정말 대단하네요!" 같은 식의 반복적인 표현이 자꾸 나오는데, 장시간 대화하면 거슬린다. 차라리 감탄사가 없는 게 낫다. Qwen은 다르다. 한국어 응답이 깔끔하고 불필요한 수식이 적다. 특히 **시스템 명령어 추종이 정확해서** 에이전트용으로 쓸 때 스킬과 규칙을 거의 90% 이상 그대로 따른다. Gemma 4는 한국어는 부드러운 대신 규칙 이탈이 잦다. ## 실사용 환경 — RTX 8GB, Ollama 운영자 환경 측정 기준 (RTX 8GB, Ollama, Q4_K_M): | 모델 | VRAM 사용 | 토큰/초 | 응답 품질 | 한국어 | |------|-----------|---------|-----------|--------| | Qwen3.8-4B-Distill | ~4.5GB | 55 tok/s | 우수 | 깔끔, 감탄사 없음 | | Qwen3.5 9B | ~6.2GB | 25 tok/s | 최우수 | 깔끔 | | Gemma 4 12B | ~8.5GB | 15 tok/s | 우수 | 부드러우나 감탄사 반복 | ## 에이전트 위임 전략 — 로컬 4B + API 고급 모델 저사양 모델의 한계는 명확하다. 무한루프 상태에서 어떻게 처리할지, 뜻하지 않는 에러 처리는 로컬 4B로는 부족하다. 하지만 이 부분을 **API 유료 모델에게 위임**하면 개인 사용에는 전혀 부족함이 없다. 방법은 이렇다: 1. 모든 스키마, 규칙, 스킬은 로컬 4B가 받는다 (주입 비용 0) 2. 기본 대화는 로컬 4B로 처리 (코딩 전문 작업이 아닌 경우) 3. 복잡한 추론, 에러 처리만 API 모델에게 위임 이렇게 하면: - 정보가 외부로 나갈 일 없음 (로컬 처리) - 필요한 것만 위임하므로 서버와 연결이 끊어진 파편만 서버로 감 - 맥락을 알 수 없어 안전함 - 토큰 사용량 극감 (주입 비용 0 + 위임은 최소한만) ## 설치 방법 ```bash # Ollama에서 바로 설치 ollama pull qwen3.8-4b-distill # 또는 HuggingFace에서 huggingface-cli download Empero/Qwen3.8-4B-Distill ``` 샘플링 매개변수: `temperature=0.6, top_p=0.95, top_k=20` 권장. `` 블록이 있으므로 `max_new_tokens`를 크게 설정하는 것이 좋다 (예: 16,384). ## 결론 8GB VRAM 환경이라면 **Qwen3.8-4B-Distill**이 최선의 선택이다. MMLU 55.3%, 토큰 속도 55 tok/s, 한국어 규칙 추종 90% 이상. 9B와 5% 차이에 불과하고, VRAM은 절반, 속도는 2배 빠르다. Apache 2.0 라이선스로 무료 상용 사용이 가능하고, Ollama에서 바로 설치된다. 에이전트 스킬 주입 정확도 90% 이상. 저사양 로컬에서 모든 걸 해결하려는 에이전트 운영자에게 이만한 모델이 없다. --- **출처:** - Empero AI — empero.org (Qwen3.8 Distilled) - Qwen3.5 공식 레포 (QwenLM/Qwen3) - Ollama 공식 라이브러리 - MMLU/gsm8k 벤치마크 (Empero 공개 데이터)