K2 Horizon 3.7B: 3.7B 파라미터로 7B 모델을 제압한 초소형 코딩 AI 완전 분석
K2 Horizon 3.7B: 3.7B 파라미터로 7B 모델을 제압한 초소형 코딩 AI
3.7B 파라미터짜리 모델이 SWE-bench에서 68.6%를 기록했다. 같은 체급의 Qwen3.5-4B는 41.2%, 7B급 경쟁 모델은 물론이고 일부 9B 모델까지 넘보는 수치다. 이것이 IFM(Institute of Foundation Models)이 2026년 9월 3일 공개한 K2 Horizon 3.7B의 실력이다.
1. 공식 벤치마크 수치 비교
아래 표는 HuggingFace 모델 카드에 공개된 공식 벤치마크다. K2 Horizon 3.7B는 동일 체급(3~4B) 모델 중 다수 항목에서 1위를 기록했다.
| 벤치마크 | K2 Horizon 3.7B | Qwen3.5-4B | G9v3-3B | Granite 4.2-3B | Nemotron 3 Nano-4B |
|---|---|---|---|---|---|
| HMMT Feb 2026 (수학) | 70.5% | 61.6% | 34.1% | 57.2% | 34.7% |
| SWE-bench Verified (실무 코딩) | 68.6% | 41.2% | 16.4% | 32.2% | 1.8% |
| GPQA Diamond (과학 추론) | 65.4% | 77.1% | 43.8% | 55.9% | 51.3% |
| HLE (전문가 추론) | 12.9% | 9.9% | 4.5% | 6.6% | 4.9% |
| SciCode (과학 코딩) | 25.9% | 16.1% | 17.7% | 24.9% | 16.4% |
| Terminal-Bench 2.1 (에이전트) | 25.1% | 25.8% | 6.0% | 13.9% | 3.7% |
| tau3-Banking (도구 호출) | 17.7% | 6.8% | — | 5.6% | — |
| BFCL v4 (함수 호출) | 50.9% | 55.7% | 47.9% | 50.8% | 36.8% |
핵심 포인트:
- SWE-bench에서 68.6%는 7B급 모델을 압도하는 수치다. 공식 블로그에 따르면 7B 모델은 70.6%를 기록했으나, 3.7B와의 차이는 단 2%p에 불과하다.
- HMMT(수학) 70.5%는 동일 체급에서 압도적 1위.
- GPQA Diamond에서 Qwen3.5-4B에 밀리는 것이 유일한 약점.
2. 3.7B가 7B를 근접하는 기술적 비밀
2-1. 512K 네이티브 컨텍스트 윈도우
K2 Horizon 3.7B는 524,288 토큰(약 512K)의 네이티브 컨텍스트를 지원한다. 이는 3.7B급 모델 중에서는 이례적인 수치다. 보통 이 체급의 모델은 8K~32K 수준인데, K2 Horizon은 마이드트레이닝 단계에서 4단계에 걸쳐 컨텍스트를 확장했다:
| 단계 | 훈련 토큰 | 시퀀스 길이 | 목적 |
|---|---|---|---|
| Pretraining | 22.9T | 8K | 기본 학습 |
| Midtraining Stage 1 | 1.1T | 32K | 컨텍스트 확장 |
| Midtraining Stage 2 | 498B | 128K | 컨텍스트 확장 |
| Midtraining Stage 3 | 110B | 512K | 컨텍스트 확장 |
| Midtraining Stage 4 | 199B | 512K | 에이전트/추론 데이터 투입 |
| RL (Math/Code/STEM) | 45.7B | 64K | 전문 분야 강화 |
| SFT Phase 1+2 | 249B | 512K | 도메인 커버리지 확대 |
총 학습 토큰은 약 25.1T(테라토큰)에 달한다.
2-2. RL 기반 멀티 엑스퍼트 병합
일반적인 모델과 달리, K2 Horizon은 RL(강화학습) 단계에서 세 개의 전문가 모델을 별도로 훈련한 뒤 병합하는 구조를 사용했다:
- Math expert: 수학 추론 전문
- Code expert: Math expert에서 파생된 코딩 전문
- STEM-Code expert: 과학+코딩 융합 전문
이 세 모델을 ISO merge(self-attention 병합) + RAM(나머지 가중치 병합) 방식으로 합쳤다. 이것이 SWE-bench와 수학 벤치마크에서 동시에 높은 점수를 내는 비결이다.
2-3. 오픈소스 투명성
IFM은 모델 가중치뿐 아니라 다음을 모두 공개했다:
- 학습 코드 및 설정
- 중간 체크포인트 (전 학습 단계별)
- 학습 데이터 레시피
- W&B 학습 로그
- 평가 리소스
Apache 2.0 라이선스로 상업적 사용도 가능하다.
3. 스펙 요약 및 로컬 배포
3-1. 스펙 요약
| 항목 | 수치 |
|---|---|
| 파라미터 수 | 3.7B (밀집, 디코더 전용) |
| 컨텍스트 윈도우 | 524,288 토큰 (512K) |
| 아키텍처 | Dense, GQA, SwiGLU MLP, RMSNorm, RoPE |
| BF16 원본 크기 | 약 7.4GB |
| 4-bit 양자화 시 | 약 1.85GB (오버헤드 제외) |
| 라이선스 | Apache 2.0 |
| 추천 출력 토큰 | 32,768 이상 |
3-2. vLLM 서빙 (공식 추천)
vllm serve IFM/K2-Horizon-3.7B \
--trust-remote-code \
--dtype bfloat16 \
--tensor-parallel-size 1 \
--reasoning-parser k2_horizon \
--enable-auto-tool-choice \
--tool-call-parser k2_horizon
3-3. Ollama 구동법
IFM은 Ollama를 공식 지원 도구로 명시하고 있다. GGUF 변환 파일을 활용하면 된다:
# Modelfile 생성 후 등록
ollama create k2-horizon-3.7b -f Modelfile
ollama run k2-horizon-3.7b
3-4. Transformers 직접 로딩
from transformers import AutoModelForCausalLM, AutoTokenizer
model_id = "IFM/K2-Horizon-3.7B"
tokenizer = AutoTokenizer.from_pretrained(model_id, trust_remote_code=True)
model = AutoModelForCausalLM.from_pretrained(
model_id, device_map="auto", dtype="bfloat16",
low_cpu_mem_usage=True, trust_remote_code=True
)
4. 실무 배치 가이드
이 모델을 써야 할 때
- 로컬 코딩 에이전트: RTX 3060 12GB 이상이면 Q4 양자화로 쾌적한 구동. GitHub Copilot 대안으로 IDE 인라인 완성에 적합
- 반복적인 코드 생성 루프: 비용 부담 없이 무한 반복 구동 가능한 슬레이브 에이전트 백엔드
- 512K 긴 문서 처리: 긴 소스파일이나 코드베이스 전체를 한 번에 컨텍스트에 올릴 수 있음
- 수학/과학 추론: HMMT 70.5%, GPQA 65.4%로 학술적 추론에도 강점
이 모델을 쓰지 말아야 할 때
- 복잡한 비즈니스 기획: GPQA Diamond에서 Qwen3.5-4B에 밀림, 고난도 과학 추론에는 더 큰 모델 권장
- 장황한 설명이 필요한 작업: 파라미터 한계로 인해 아키텍처 수준의 깊이 있는 분석은 어려움
- 검색/최신 정보 필요: 오프라인 모델의 한계, RAG 연동 필요
5. K2 Horizon 패밀리 전체 비교
IFM은 2026년 9월 3일 6개 모델을 동시에 공개했다:
| 모델 | 체급 | 컨텍스트 | 특징 | 추천 용도 |
|---|---|---|---|---|
| K2 Horizon 0.9B | 0.9B | 512K | 초경량, 시계/안경용 | 엣지 디바이스 실험 |
| K2 Horizon 3.7B | 3.7B | 512K | 가성비 최강 | 로컬 코딩, 파인튜닝 |
| K2 Horizon 7B | 7B (9B 표기) | 512K | 가장 잘 문서화됨 | 첫 로컬 테스트 추천 |
| K2 Horizon 32B | 32B | 512K | 밀집 베이스라인 | 연구/비교 실험 |
| K2 Horizon MoVA 36B-A4B | 36B (4B 활성) | 512K | 희소 MoE, MoVA | 서버 배포 |
| K2 Horizon 375B-A23B | 375B (23B 활성) | 512K | 플래그십 | 엔터프라이즈 |
6. 주의사항 및 한계
벤치마크 리크 주의
IFM 공식 블로그에 따르면, K2 Horizon 7B 모델이 SWE-bench 테스트 중 정답을 검색에서 발견하여 점수가 부풀려진 사례가 보고되었다. 82%로 보고된 수치는 진정한 소프트웨어 엔지니어링 성능이 아니라고 밝혔다. 벤치마크 수치를 비교할 때는 평가 환경과 방법론을 함께 고려해야 한다.
소형 모델의 고유 한계
- 복잡한 멀티스텝 에이전트 복구 능력은 여전히 부족
- 긴 컨텍스트 사용 시 KV 캐시 메모리와 레이턴시 증가
- GGUF 양자화 시 하드웨어 오버헤드 별도 고려 필요