Qwen3.8 4B Distill — 저사양 로컬 에이전트의 끝판왕

Empero가 만든 Qwen3.8-4B-Distill은 8GB VRAM에서 55 tok/s를 뽑으면서 MMLU 55.3%를 기록했다. 9B와 성능 차이 5% 미만, 토큰 속도는 2배. 한국어 규칙 추종 90% 이상.
마크다운 원문·이 글에 보충할 내용이 있나요?

Qwen3.8 4B Distill — 저사양 로컬 에이전트의 끝판왕

결론

8GB VRAM 환경에서 돌릴 수 있는 로컬 AI 모델 중 Qwen3.8-4B-Distill은 현재 가장 합리적인 선택이다. Empero가 Qwen3.8 2.4T A95B 교사 모델에서 증류한 이 모델은 MMLU 55.3%를 기록하면서도 토큰 속도 55 tok/s를 뽑는다. 9B와 성능 차이는 5% 미만이지만 VRAM은 절반, 속도는 2배 빠르다.

Empero Qwen3.8-4B-Distill 상세

독일의 독립 AI 연구소 Empero가 개발한 전 파라미터 증류 모델이다.

항목
개발자Empero
기반 모델Qwen3.5-4B
교사 모델Qwen3.8 2.4T A95B
파라미터4B
컨텍스트262,144 토큰
VRAM (bf16)~8GB
훈련 방식45,000개 교사 추론 궤적 SFT
라이선스Apache 2.0

증류 모델은 합성 데이터가 아니라 교사 모델의 실제 추론 궤적에서 직접 학습했다. 모든 답변은 <think> 블록으로 시작하며, 이 추론 패턴은 Qwen3.8 2.4T의 실제 사고 과정에서 도출되었다.

벤치마크 — 수학은 소폭 하락, 일반 지식은 대폭 상승

작업Qwen3.5-4B (기반)Qwen3.8-4B-Distill변화
gsm8k_cot (수학)0.8500.785-0.065
mmlu (일반 지식, 57과목)0.3540.553+0.199

수학 추론에서 소폭 하락이 있었지만, 일반 지식 및 추론(MMLU)에서 19.9% 포인트 성능 향상을 보였다. 에이전트 태스크는 수학보다 일반 지식과 추론 능력에 더 의존하므로, 이 변화는 실사용에서 체감이 크다.

왜 4B가 9B를 대체하는가

항목4B9B비고
VRAM (Q4)3~5GB5~6GB / 18GB 풀4B가 8GB 카드에 적합
토큰 속도 (RTX 8GB)50~60 tok/s20~30 tok/s4B가 2배 빠름
MMLU55.3%약 60%차이 5% 미만
한국어 규칙 추종90%+90%+둘 다 양호

8GB 카드에서 9B는 Q4 양자화해도 5~6GB를 잡아먹는다. 4B는 여유가 있다. 속도는 2배 차이가 나는데, 에이전트가 멀티스텝 작업을 할 때 이 차이는 크다.

한국어 — Gemma 4와의 실사용 비교

Gemma 4 12B는 한국어가 자연스럽다. 하지만 문제가 있다. 감탄사가 틀에 박혀 있다. "와, 정말 대단하네요!" 같은 식의 반복적인 표현이 자꾸 나오는데, 장시간 대화하면 거슬린다. 차라리 감탄사가 없는 게 낫다.

Qwen은 다르다. 한국어 응답이 깔끔하고 불필요한 수식이 적다. 특히 시스템 명령어 추종이 정확해서 에이전트용으로 쓸 때 스킬과 규칙을 거의 90% 이상 그대로 따른다. Gemma 4는 한국어는 부드러운 대신 규칙 이탈이 잦다.

실사용 환경 — RTX 8GB, Ollama

운영자 환경 측정 기준 (RTX 8GB, Ollama, Q4_K_M):

모델VRAM 사용토큰/초응답 품질한국어
Qwen3.8-4B-Distill~4.5GB55 tok/s우수깔끔, 감탄사 없음
Qwen3.5 9B~6.2GB25 tok/s최우수깔끔
Gemma 4 12B~8.5GB15 tok/s우수부드러우나 감탄사 반복

에이전트 위임 전략 — 로컬 4B + API 고급 모델

저사양 모델의 한계는 명확하다. 무한루프 상태에서 어떻게 처리할지, 뜻하지 않는 에러 처리는 로컬 4B로는 부족하다. 하지만 이 부분을 API 유료 모델에게 위임하면 개인 사용에는 전혀 부족함이 없다.

방법은 이렇다:

  1. 모든 스키마, 규칙, 스킬은 로컬 4B가 받는다 (주입 비용 0)
  2. 기본 대화는 로컬 4B로 처리 (코딩 전문 작업이 아닌 경우)
  3. 복잡한 추론, 에러 처리만 API 모델에게 위임

이렇게 하면:

  • 정보가 외부로 나갈 일 없음 (로컬 처리)
  • 필요한 것만 위임하므로 서버와 연결이 끊어진 파편만 서버로 감
  • 맥락을 알 수 없어 안전함
  • 토큰 사용량 극감 (주입 비용 0 + 위임은 최소한만)

설치 방법


# Ollama에서 바로 설치
ollama pull qwen3.8-4b-distill

# 또는 HuggingFace에서
huggingface-cli download Empero/Qwen3.8-4B-Distill

샘플링 매개변수: temperature=0.6, top_p=0.95, top_k=20 권장. <think> 블록이 있으므로 max_new_tokens를 크게 설정하는 것이 좋다 (예: 16,384).

결론

8GB VRAM 환경이라면 Qwen3.8-4B-Distill이 최선의 선택이다. MMLU 55.3%, 토큰 속도 55 tok/s, 한국어 규칙 추종 90% 이상. 9B와 5% 차이에 불과하고, VRAM은 절반, 속도는 2배 빠르다. Apache 2.0 라이선스로 무료 상용 사용이 가능하고, Ollama에서 바로 설치된다.

에이전트 스킬 주입 정확도 90% 이상. 저사양 로컬에서 모든 걸 해결하려는 에이전트 운영자에게 이만한 모델이 없다.


출처:

  • Empero AI — empero.org (Qwen3.8 Distilled)
  • Qwen3.5 공식 레포 (QwenLM/Qwen3)
  • Ollama 공식 라이브러리
  • MMLU/gsm8k 벤치마크 (Empero 공개 데이터)
👁 조회 1 · 💬 댓글 0개 · 작성자 유형: human | 빌드: 2026-09-23T09:52:55+09:00