허깅페이스에서 가장 핫한 로컬 모델 3개 부문 실측 정리

증류 수학모델부터 검열 해제 튠과 코딩 에이전트까지 허깅페이스 인기 로컬 모델들의 벤치마크 수치와 VRAM 요구량을 실측 기준으로 정리
마크다운 원문·이 글에 보충할 내용이 있나요?

결론부터 말하면, 지금 허깅페이스는 Google Gemma 4 생태계와 Qwen 라인업이 차트 상위권을 양분하고 있으며, 이 두 가문을 유저들이 직접 튜닝한 모델이 매일 쏟아진다. 막연히 좋다는 말 대신, 각 모델의 벤치마크 수치와 VRAM 요구량을 어느 수준인지 구체적으로 정리한다. 단, 커뮤니티 튠은 카드마다 수치 측정 조건이 다르므로 대표 주장치는 출처와 함께, 조건이 불분명한 부분은 불분명하다고 밝힌다.

1. 추론 및 지식 증류 부문

daksh-neo/qwen-to-gemma-math: 2B급 수학 증류 실험작

최신 초거대 Qwen3-plus의 수학 추론 체인(CoT)을 Gemma 4 E2B(실제 5.12B 파라미터) 학생 모델에 이식한 증류 모델이다.

항목수치조건
베이스라인 (gemma-4-E2B-it)GSM8K 71.0% (142/200)greedy 디코드, 엄격 일치
증류 모델 (NEO)GSM8K 75.0% (150/200)동일 조건, +4.0%p 향상
교사 추론 생성500문제 중 96.5% 유효Qwen3-plus, temperature 0
파인튜닝LoRA r=16, GSM8K 전량 7,473샘플3 에폭

인기 이유: 불과 5B급 크기임에도 대형 모델의 사고 과정을 그대로 학습시켜 베이스라인을 앞섰다는 점이다. 단, 정직하게 밝혀야 할 것이 있다. 같은 모델 카드의 버전별 기록에는 20샘플 테스트에서 10%(2/20)에 그친 풀파인튜닝 버전도 함께 올라와 있다. 즉 75%는 LoRA 풀데이터 버전의 주장치고, 테스트 샘플이 200개라 오차범위가 크다. 수학 전용 보조 계산기로는 쓸 만하지만, 맹신할 수치는 아니다.

유저 반응: 커뮤니티의 증류 열풍 자체는 뜨겁지만, 검증파의 지적도 매섭다. 23종 비교 프로젝트(abliterlitics)의 대조군 실험에서는 추론 증류 튠들이 오히려 모델을 망가뜨렸다는 결과가 나왔다. Claude distill은 GSM8K 17점, MMLU-Pro 12.5점 하락으로 Gemma 4의 네이티브 추론 회로를 덮어써 버렸고, Gemini distill도 순손실이었다. 증류는 교사 트레이스 품질이 전부이며, 트레이스가 나쁘면 학생은 틀린 사고를 완벽하게 배운다는 교훈이다.

GLM-5.2-MoE 커뮤니티 튠: 에이전트 연동 특화

혼합 전문가 구조의 초정밀 추론 모델 GLM-5.2를 커뮤니티가 에이전트 연동용으로 다듬은 버전들이다. 본가 GLM-5.2의 공개 수치가 기준점이다.

벤치마크GLM-5.2 (본가)비교
Terminal-Bench 2.181.0Opus 4.8 85.0에 근접
SWE-bench Pro 계열62.1오픈소스 최상위권
컨텍스트1M 토큰장시간 에이전트에 적합

인기 이유: 복잡한 다단계 추론과 에이전트 연동에서 상용 유료 모델에 근접한 성능을 내면서 가중치가 공개되어 있다는 점이다. 커뮤니티 튠은 저마다 시스템 프롬프트 준수율이나 도구 호출 형식을 다듬은 것이므로, 튠별 고정 벤치는 없고 본가 수치를 상한으로 보고 선택하라. 744B급이라 로컬은 클러스터가 아니면 불가하고 API로 쓰는 것이 현실적이다.

2. 검열 해제 부문: Abliterated/Uncensored 트렌드

원리: 재학습 없이 거부 반응만 외과수술

Abliteration은 모델 내부의 거부 반응(refusal) 방향 벡터를 찾아 정교하게 지워내는 기법이다. 재학습이 아니라 가중치 편집이므로 똑똑한 성능은 유지되고 깐깐한 필터링만 제거된다는 것이 커뮤니티의 평가다. 대표 파이프라인은 Pliny가 만든 OBLITERATUS이며, 방법론은 Arditi et al.(2024) 연구에 뿌리를 둔다.

OBLITERATUS 시리즈 실측 수치

모델수정 범위거부율Q4 크기로컬 가능선
Gemma 4 E4B OBLITERATED v342층 중 21층 수술0% (hard refusal)4.9GB스마트폰에서도 구동
Ornith-1.5-9B OBLITERATED32층 전부 단계별 강도대부분 무거부5.4GB8GB GPU 가능
Qwen3.8-27B OBLITERATEDdirectional ablation무거부 표방약 16GB24GB GPU 권장

Gemma 4는 NaN 활성화와 공유 KV 가중치 때문에 기존 도구가 전부 깨졌고, 제작자가 whitened SVD와 어텐션 헤드 수술로 뚫었다고 밝힌 만큼 기술적 난도가 높은 작업물이다. Q4 4.9GB라서 폰 앱(PocketPal 등)에 넣고 오프라인으로 돌린다는 실사용 보고가 줄을 잇는다.

유저들의 검증: 다운로드 수와 품질은 별개다

가장 뜨거운 논란이 바로 여기다. 23종 Gemma 4 E4B 모델을 동일 잣대로 비교한 abliterlitics 프로젝트의 결론은 충격적이었다. 최다 다운로드(약 80만)인 OBLITERATUS 버전이 가장 망가진 모델로 판정된 것이다.

모델HarmBench 해제율GSM8K분포 이탈(KL)수정 텐서
abliterix100.0%87.1%0.05489
trevorjs uncensored99.3%88.3%0.01584
heretic 계열95.5%88.2%0.00229
OBLITERATUS72.0%66.0%1.102381

수치가 말해주듯, 건드린 텐서가 적을수록(surgical) 승자다. heretic 계열은 29개 텐서만 건드려 해제율 95%에 성능 유지, OBLITERATUS는 381개를 건드려 해제율은 꼴찌, GSM8K는 베이스(87.0%)에서 66%로 붕괴했다. 유저 평도 갈린다. Hacker News에서는 수학적 근거 없는 절단이라는 비판과 모델이 바보가 된다는 실사용 보고가 줄을 이었고, 반면 Qwen3.8-27B 버전 카드는 6라운드 수술과 842개 프롬프트 0% 거부, MMLU 69/70 동점이라는 자체 검증으로 맞섰다. 교훈은 하나다. 다운로드 수는 마케팅이고, KL(분포 이탈)이 낮고 수정 텐서가 적은 모델을 고르라.

Hauhau, Jiunsong 등 커뮤니티 튜너

OBLITERATUS 외에도 Hauhau와 Jiunsong 같은 튜너들이 Qwen과 Gemma 계열 abliterated를 꾸준히 올리며 다운로드가 몰리고 있다. 이들은 특정 파이프라인의 브랜드가 아니라 커뮤니티 튜너 계정들이므로, 받을 때는 베이스 모델명과 양자화, 카드의 테스트 보고를 직접 확인하라.

주의: 검열 해제는 보안 연구와 개인 자유 용도로는 유용하지만, 생성물의 법적 책임은 사용자에게 있다. 업무 자동화에 쓸 때는 출력 가드레일을 별도로 두는 것을 권장한다.

3. 코딩 에이전트 부문: Qwen3-Coder-Next

스펙과 공식 벤치 (arXiv:2603.00729)

Qwen3-Next 기반 하이브리드 어텐션 MoE로, 총 80B 중 토큰당 3B만 활성화된다. 실행 가능한 코딩 과제 합성과 환경 피드백 학습으로 단련된 코딩 에이전트 전용 모델이다.

벤치마크Qwen3-Coder-Next (80A3)비교
SWE-Bench Verified70.6~71.3DeepSeek-V3.2 70.2와 동급, Opus 4.5 78.2 아래
SWE-Bench Multilingual62.8Sonnet-4.5 67.2 아래, 실용권
SWE-Bench Pro42.7초대형 오픈소스와 경쟁 가능
컨텍스트256K (Yarn으로 1M 확장)레포 단위 분석 가능

인기 이유: 활성 3B의 연산비로 10~20배 큰 모델과 대등한 코딩 점수를 내므로, 24시간 크롤링이나 코드 분석 에이전트의 추론 단가가 압도적으로 싸다. Cline, Cursor, Claude Code 계열 스캐폴드와 연동하는 것이 정석이다.

유저들의 실측 반응은 찬반이 뚜렷하다. r/LocalLLaMA 실사용 보고를 정리하면 다음과 같다.

긍정파: 60GB 이하 첫 실용 코딩 모델이라는 평가가 많다. 생각 루프가 없어 밤샘 실행이 멈추지 않고, 도구 호출이 안정적이라 OpenCode와 Roo Code에서 호평이다. 한 유저는 코더라는 이름이 아깝다며 계획 수립과 리서치, 일반 에이전트 업무에서 체급을 뛰어넘는다 평했고, 비즈니스용 소형 에이전트에 A+를 줬다.

부정파: ReadFile 무한 루프, 대용량 파일 편집 타임아웃, 추론 부재로 인한 코드베이스 실수가 보고되었다. Roo Code의 아키텍트 모드와는 궁합이 나쁘다는 지적도 있다. 느리지만 Qwen 3.5 27B가 낫다는 유저도 있어, 속도와 깊이의 트레이드오프를 체감하고 고르라. 공통 팁은 OpenCode 계열 스캐폴드에서 가장 잘 돌고, 샘플링은 temperature 1.0, top_p 0.95를 권장한다는 것이다.

정정: 8GB에서는 못 돈다

많은 소개글이 소형이라고 해서 8GB에서도 된다고 쓰지만, 총량이 80B라서 물리적으로 불가하다. unsloth GGUF 기준 4비트에 45GB 이상, 2비트 XL에 30GB 이상이 필요하다.

환경가능 여부
8GB GPU불가
24GB GPU (3090/4090)2비트 양자화로 가능
48GB 이상 / Mac 64GB+4비트 쾌적
그 이하API로 연결 (OpenRouter 등)

# 24GB 환경 예시 (2비트 양자화)
ollama pull unsloth/qwen3-coder-next-gguf:Q2_K_XL 2>/dev/null || echo "허깅페이스 unsloth 저장소에서 직접 다운로드"

llama.cpp 초기 버전에서 Qwen이 루프에 빠지는 버그가 있었으므로 최신 빌드와 함께 GGUF를 다시 받는 것이 좋다.

4. VRAM별 최종 선택표

VRAM추천용도
폰~8GBGemma 4 E4B OBLITERATED Q4 (4.9GB)오프라인 비서, 가벼운 질의
8~12GBOrnith 9B OBLITERATED Q4 (5.4GB), qwen-to-gemma-math검열 없는 코딩 보조, 수학 계산
폰 오프라인Gemma 4 E2B (Pixel 실측 데일리 드라이버)32K 컨텍스트, 생각 모드 on/off
24GBQwen3.8-27B OBLITERATED Q4 (16GB), Coder-Next 2비트24시간 크롤링 에이전트
48GB+Coder-Next 4비트, GLM 계열 고민본격 코딩 에이전트 서버
클러스터/APIGLM-5.2 튠, MiniMax급장시간 대형 에이전트

현재 하드웨어 사양(VRAM 용량)과 구현하고 싶은 목적(파이썬 코딩 보조, 데이터 추출, 업무용 비서)을 정하면 위 표에서 스트레스 없이 최고 속도로 돌아가는 모델이 바로 보인다.

부록: 폰 오프라인 유저들의 실측 팁 세 가지다. 첫째, Gemma 4 E2B가 Pixel에서 데일리 드라이버로 통한다는 보고가 있다. AI Edge Gallery 앱에 넣고 32K 컨텍스트로 돌리면 읽는 속도보다 빠르다. 둘째, RAM 8GB가 마지노선이다. 그 이하 기종은 앱이 죽거나 발열로 못 쓴다. 셋째, PC에서 llama.cpp 구버전은 Gemma 4 텐서를 못 읽고 missing tensor 에러를 낸다. 최신 빌드로 업데이트하고 GGUF도 다시 받으라. RTX 4060 8GB에서는 VRAM 4GB와 RAM 8GB로 나눠 올리는 오프로딩 실측이 있다.

👁 조회 1 · 💬 댓글 0개 · 작성자 유형: human | 빌드: 2026-09-23T23:51:00+09:00