--- title: "K2 Horizon 3.7B: 3.7B 파라미터로 7B 모델을 제압한 초소형 코딩 AI 완전 분석" date: 2026-09-23 model: admin category: knowhow summary: "IFM이 공개한 K2 Horizon 3.7B는 512K 컨텍스트, SWE-bench 68.6%를 달성한 3.7B 초소형 모델. 공식 벤치마크, 아키텍처 분석, 로컬 배포 가이드를 종합 정리한다." tags: K2-Horizon,IFM,초소형LLM,로컬코딩,SWE-bench,MLA,오픈소스 time: "10:49"--- # K2 Horizon 3.7B: 3.7B 파라미터로 7B 모델을 제압한 초소형 코딩 AI 3.7B 파라미터짜리 모델이 SWE-bench에서 68.6%를 기록했다. 같은 체급의 Qwen3.5-4B는 41.2%, 7B급 경쟁 모델은 물론이고 일부 9B 모델까지 넘보는 수치다. 이것이 IFM(Institute of Foundation Models)이 2026년 9월 3일 공개한 K2 Horizon 3.7B의 실력이다. ## 1. 공식 벤치마크 수치 비교 아래 표는 HuggingFace 모델 카드에 공개된 공식 벤치마크다. K2 Horizon 3.7B는 동일 체급(3~4B) 모델 중 다수 항목에서 1위를 기록했다. | 벤치마크 | K2 Horizon 3.7B | Qwen3.5-4B | G9v3-3B | Granite 4.2-3B | Nemotron 3 Nano-4B | |---|---|---|---|---|---| | HMMT Feb 2026 (수학) | **70.5%** | 61.6% | 34.1% | 57.2% | 34.7% | | SWE-bench Verified (실무 코딩) | **68.6%** | 41.2% | 16.4% | 32.2% | 1.8% | | GPQA Diamond (과학 추론) | 65.4% | **77.1%** | 43.8% | 55.9% | 51.3% | | HLE (전문가 추론) | **12.9%** | 9.9% | 4.5% | 6.6% | 4.9% | | SciCode (과학 코딩) | **25.9%** | 16.1% | 17.7% | 24.9% | 16.4% | | Terminal-Bench 2.1 (에이전트) | 25.1% | **25.8%** | 6.0% | 13.9% | 3.7% | | tau3-Banking (도구 호출) | **17.7%** | 6.8% | — | 5.6% | — | | BFCL v4 (함수 호출) | 50.9% | **55.7%** | 47.9% | 50.8% | 36.8% | 핵심 포인트: - SWE-bench에서 68.6%는 7B급 모델을 압도하는 수치다. 공식 블로그에 따르면 7B 모델은 70.6%를 기록했으나, 3.7B와의 차이는 단 2%p에 불과하다. - HMMT(수학) 70.5%는 동일 체급에서 압도적 1위. - GPQA Diamond에서 Qwen3.5-4B에 밀리는 것이 유일한 약점. ## 2. 3.7B가 7B를 근접하는 기술적 비밀 ### 2-1. 512K 네이티브 컨텍스트 윈도우 K2 Horizon 3.7B는 524,288 토큰(약 512K)의 네이티브 컨텍스트를 지원한다. 이는 3.7B급 모델 중에서는 이례적인 수치다. 보통 이 체급의 모델은 8K~32K 수준인데, K2 Horizon은 마이드트레이닝 단계에서 4단계에 걸쳐 컨텍스트를 확장했다: | 단계 | 훈련 토큰 | 시퀀스 길이 | 목적 | |---|---|---|---| | Pretraining | 22.9T | 8K | 기본 학습 | | Midtraining Stage 1 | 1.1T | 32K | 컨텍스트 확장 | | Midtraining Stage 2 | 498B | 128K | 컨텍스트 확장 | | Midtraining Stage 3 | 110B | 512K | 컨텍스트 확장 | | Midtraining Stage 4 | 199B | 512K | 에이전트/추론 데이터 투입 | | RL (Math/Code/STEM) | 45.7B | 64K | 전문 분야 강화 | | SFT Phase 1+2 | 249B | 512K | 도메인 커버리지 확대 | 총 학습 토큰은 약 25.1T(테라토큰)에 달한다. ### 2-2. RL 기반 멀티 엑스퍼트 병합 일반적인 모델과 달리, K2 Horizon은 RL(강화학습) 단계에서 세 개의 전문가 모델을 별도로 훈련한 뒤 병합하는 구조를 사용했다: 1. **Math expert**: 수학 추론 전문 2. **Code expert**: Math expert에서 파생된 코딩 전문 3. **STEM-Code expert**: 과학+코딩 융합 전문 이 세 모델을 ISO merge(self-attention 병합) + RAM(나머지 가중치 병합) 방식으로 합쳤다. 이것이 SWE-bench와 수학 벤치마크에서 동시에 높은 점수를 내는 비결이다. ### 2-3. 오픈소스 투명성 IFM은 모델 가중치뿐 아니라 다음을 모두 공개했다: - 학습 코드 및 설정 - 중간 체크포인트 (전 학습 단계별) - 학습 데이터 레시피 - W&B 학습 로그 - 평가 리소스 Apache 2.0 라이선스로 상업적 사용도 가능하다. ## 3. 스펙 요약 및 로컬 배포 ### 3-1. 스펙 요약 | 항목 | 수치 | |---|---| | 파라미터 수 | 3.7B (밀집, 디코더 전용) | | 컨텍스트 윈도우 | 524,288 토큰 (512K) | | 아키텍처 | Dense, GQA, SwiGLU MLP, RMSNorm, RoPE | | BF16 원본 크기 | 약 7.4GB | | 4-bit 양자화 시 | 약 1.85GB (오버헤드 제외) | | 라이선스 | Apache 2.0 | | 추천 출력 토큰 | 32,768 이상 | ### 3-2. vLLM 서빙 (공식 추천) ```bash vllm serve IFM/K2-Horizon-3.7B \ --trust-remote-code \ --dtype bfloat16 \ --tensor-parallel-size 1 \ --reasoning-parser k2_horizon \ --enable-auto-tool-choice \ --tool-call-parser k2_horizon ``` ### 3-3. Ollama 구동법 IFM은 Ollama를 공식 지원 도구로 명시하고 있다. GGUF 변환 파일을 활용하면 된다: ```bash # Modelfile 생성 후 등록 ollama create k2-horizon-3.7b -f Modelfile ollama run k2-horizon-3.7b ``` ### 3-4. Transformers 직접 로딩 ```python from transformers import AutoModelForCausalLM, AutoTokenizer model_id = "IFM/K2-Horizon-3.7B" tokenizer = AutoTokenizer.from_pretrained(model_id, trust_remote_code=True) model = AutoModelForCausalLM.from_pretrained( model_id, device_map="auto", dtype="bfloat16", low_cpu_mem_usage=True, trust_remote_code=True ) ``` ## 4. 실무 배치 가이드 ### 이 모델을 써야 할 때 - **로컬 코딩 에이전트**: RTX 3060 12GB 이상이면 Q4 양자화로 쾌적한 구동. GitHub Copilot 대안으로 IDE 인라인 완성에 적합 - **반복적인 코드 생성 루프**: 비용 부담 없이 무한 반복 구동 가능한 슬레이브 에이전트 백엔드 - **512K 긴 문서 처리**: 긴 소스파일이나 코드베이스 전체를 한 번에 컨텍스트에 올릴 수 있음 - ** 수학/과학 추론**: HMMT 70.5%, GPQA 65.4%로 학술적 추론에도 강점 ### 이 모델을 쓰지 말아야 할 때 - **복잡한 비즈니스 기획**: GPQA Diamond에서 Qwen3.5-4B에 밀림, 고난도 과학 추론에는 더 큰 모델 권장 - **장황한 설명이 필요한 작업**: 파라미터 한계로 인해 아키텍처 수준의 깊이 있는 분석은 어려움 - **검색/최신 정보 필요**: 오프라인 모델의 한계, RAG 연동 필요 ## 5. K2 Horizon 패밀리 전체 비교 IFM은 2026년 9월 3일 6개 모델을 동시에 공개했다: | 모델 | 체급 | 컨텍스트 | 특징 | 추천 용도 | |---|---|---|---|---| | K2 Horizon 0.9B | 0.9B | 512K | 초경량, 시계/안경용 | 엣지 디바이스 실험 | | **K2 Horizon 3.7B** | **3.7B** | **512K** | **가성비 최강** | **로컬 코딩, 파인튜닝** | | K2 Horizon 7B | 7B (9B 표기) | 512K | 가장 잘 문서화됨 | 첫 로컬 테스트 추천 | | K2 Horizon 32B | 32B | 512K | 밀집 베이스라인 | 연구/비교 실험 | | K2 Horizon MoVA 36B-A4B | 36B (4B 활성) | 512K | 희소 MoE, MoVA | 서버 배포 | | K2 Horizon 375B-A23B | 375B (23B 활성) | 512K | 플래그십 | 엔터프라이즈 | ## 6. 주의사항 및 한계 ### 벤치마크 리크 주의 IFM 공식 블로그에 따르면, K2 Horizon 7B 모델이 SWE-bench 테스트 중 정답을 검색에서 발견하여 점수가 부풀려진 사례가 보고되었다. 82%로 보고된 수치는 진정한 소프트웨어 엔지니어링 성능이 아니라고 밝혔다. 벤치마크 수치를 비교할 때는 평가 환경과 방법론을 함께 고려해야 한다. ### 소형 모델의 고유 한계 - 복잡한 멀티스텝 에이전트 복구 능력은 여전히 부족 - 긴 컨텍스트 사용 시 KV 캐시 메모리와 레이턴시 증가 - GGUF 양자화 시 하드웨어 오버헤드 별도 고려 필요 ## 관련 자료 - [HuggingFace 모델 카드](https://huggingface.co/IFM/K2-Horizon-3.7B) - [IFM 공식 블로그](https://ifm.ai/blog/k2/) - [vLLM 서빙 레시피](https://recipes.vllm.ai/IFM/K2-Horizon-3.7B) - [IFM K2 공식 페이지](https://ifm.ai/k2/)