그래픽카드별 로컬 AI 모델 추천 완전 가이드 (2026)
그래픽카드별 로컬 AI 모델 추천 완전 가이드
내 그래픽카드로 어떤 모델을 돌릴 수 있을까? 이 질문에 대한 답입니다.
1. 핵심 원리: VRAM이 곧 모델 한계
실행 가능 모델 = GPU VRAM ≥ 모델 파일 크기 + KV 캐시 여유
| 양자화 | 8B 모델 | 14B 모델 | 32B 모델 | 70B 모델 |
|---|---|---|---|---|
| Q4_K_M | ~4.9 GB | ~9.0 GB | ~19.5 GB | ~43.0 GB |
| Q8_0 | ~8.5 GB | ~16.4 GB | ~37.0 GB | ~75.0 GB |
VRAM이 모델 크기보다 작으면 실행 자체가 불가합니다. 메모리 대역폭이 아무리 빨라도 방법이 없습니다.
2. NVIDIA GPU 스펙 비교
RTX 30 시리즈 (Ampere)
| GPU | VRAM | 메모리 대역폭 | 특징 |
|---|---|---|---|
| RTX 3060 12GB | 12GB | 360 GB/s | VRAM 넉넉, 대역폭 낮음 |
| RTX 3060 Ti 8GB | 8GB | 448 GB/s | VRAM 부족 |
| RTX 3070 8GB | 8GB | 448 GB/s | VRAM 부족 |
| RTX 3080 10GB | 10GB | 760 GB/s | 대역폭 좋음 |
| RTX 3080 Ti 12GB | 12GB | 912 GB/s | 대역폭 우수 |
| RTX 3090 24GB | 24GB | 936 GB/s | 최고의 VRAM 가성비 |
RTX 40 시리즈 (Ada Lovelace)
| GPU | VRAM | 메모리 대역폭 | 특징 |
|---|---|---|---|
| RTX 4060 8GB | 8GB | 272 GB/s | entry-level |
| RTX 4060 Ti 16GB | 16GB | 288 GB/s | VRAM 넉넉, 대역폭 낮음 |
| RTX 4070 12GB | 12GB | 504 GB/s | 균형 |
| RTX 4070 Super 12GB | 12GB | 504 GB/s | 가성비 |
| RTX 4070 Ti 12GB | 12GB | 504 GB/s | |
| RTX 4070 Ti Super 16GB | 16GB | 672 GB/s | 16GB 스위트스팟 |
| RTX 4080 16GB | 16GB | 717 GB/s | 고성능 |
| RTX 4090 24GB | 24GB | 1,008 GB/s | 소비자 최강 |
RTX 50 시리즈 (Blackwell) — GDDR7 탑재
| GPU | VRAM | 메모리 대역폭 | 특징 |
|---|---|---|---|
| RTX 5060 Ti 16GB | 16GB | 448 GB/s | 신가성비왕 |
| RTX 5070 12GB | 12GB | 672 GB/s | |
| RTX 5070 Ti 16GB | 16GB | 896 GB/s | 16GB 고속 |
| RTX 5080 16GB | 16GB | 960 GB/s | |
| RTX 5090 32GB | 32GB | 1,792 GB/s | 왕의 왕 |
3. GPU별 추천 모델
🟢 RTX 3060 12GB (중고 ~15~20만원)
12GB VRAM으로 8B 모델 완전 구동 가능합니다.
| 추천 모델 | 양자화 | 파일 크기 | 예상 TPS |
|---|---|---|---|
| Qwen3-4B | Q4_K_M | 2.3 GB | ~50 |
| Gemma 4 E4B | Q4_K_M | 2.5 GB | ~48 |
| K2-Horizon-3.7B | Q4_K_M | 2.3 GB | ~50 |
| Llama 3.1 8B | Q4_K_M | 4.9 GB | 42 |
| Qwen3 8B | Q4_K_M | 4.9 GB | 40 |
| Qwen 2.5 14B | Q4_K_M | 9.0 GB | 22 (여유 없음) |
한마디: "15~20만원으로 8B 모델은 쾌적하게, 14B는 빡빡하게"
🔵 RTX 3090 24GB (중고 ~60~70만원) — 🏆 최고의 가성비
24GB VRAM으로 32B 모델까지 완전 구동, 70B까지 부분 구동.
| 추천 모델 | 양자화 | 파일 크기 | 예상 TPS |
|---|---|---|---|
| Qwen3-4B | Q4_K_M | 2.3 GB | ~120 |
| Llama 3.1 8B | Q4_K_M | 4.9 GB | 95 |
| Qwen3 8B | Q8_0 | 8.5 GB | ~65 |
| Qwen 2.5 14B | Q4_K_M | 9.0 GB | 55 |
| Gemma 4 12B | Q4_K_M | 7.5 GB | ~60 |
| Qwen3 32B | Q4_K_M | 19.5 GB | 28 |
| Gemma 4 28B (MoE) | Q4_K_M | 17.0 GB | ~35 |
| Llama 3.3 70B | Q2_K | ~30 GB | 10 (부분 오프로드) |
한마디: "60~70만원으로 32B 모델을 완전히 돌리는 왕"
🔷 RTX 4070 Ti Super 16GB (~115만원)
16GB + 672 GB/s로 14B 모델에 최적.
| 추천 모델 | 양자화 | 파일 크기 | 예상 TPS |
|---|---|---|---|
| Qwen3-4B | Q4_K_M | 2.3 GB | ~100 |
| Llama 3.1 8B | Q4_K_M | 4.9 GB | 72 |
| Qwen 2.5 14B | Q4_K_M | 9.0 GB | 47 |
| Gemma 4 12B | Q4_K_M | 7.5 GB | ~55 |
| Qwen3 32B | Q4_K_M | 19.5 GB | ❌ (VRAM 초과) |
한마디: "115만원으로 14B 모델의 스위트스팟"
⭐ RTX 4060 Ti 16GB (~49만원)
16GB지만 대역폭이 288 GB/s로 낮습니다. VRAM 용량만으로 승부.
| 추천 모델 | 양자화 | 파일 크기 | 예상 TPS |
|---|---|---|---|
| Qwen3-4B | Q4_K_M | 2.3 GB | ~55 |
| Llama 3.1 8B | Q4_K_M | 4.9 GB | 34 |
| Qwen 2.5 14B | Q4_K_M | 9.0 GB | 22 |
| Gemma 4 12B | Q4_K_M | 7.5 GB | ~28 |
한마디: "49만원으로 16GB — 14B는 느리지만 실행은 됨"
🏆 RTX 4090 24GB (~315만원)
소비자 GPU 최강의 속도 + 24GB VRAM.
| 추천 모델 | 양자화 | 파일 크기 | 예상 TPS |
|---|---|---|---|
| Qwen3-4B | Q4_K_M | 2.3 GB | ~200 |
| Llama 3.1 8B | Q4_K_M | 4.9 GB | 135 |
| Qwen 2.5 14B | Q4_K_M | 9.0 GB | 78 |
| Qwen3 32B | Q4_K_M | 19.5 GB | 42 |
| Gemma 4 28B (MoE) | Q4_K_M | 17.0 GB | ~55 |
| Llama 3.3 70B | Q4_K_M | 43 GB | 18 (부분 오프로드) |
한마디: "315만원으로 8B는 135 TPS, 32B는 42 TPS — 잠시도 기다리지 않음"
👑 RTX 5090 32GB (~740만원)
GDDR7의 1,792 GB/s 대역폭 + 32GB VRAM. 로컬 AI의 종결자.
| 추천 모델 | 양자화 | 파일 크기 | 예상 TPS |
|---|---|---|---|
| Qwen3-4B | Q4_K_M | 2.3 GB | ~280 |
| Llama 3.1 8B | Q4_K_M | 4.9 GB | 145 |
| Qwen 2.5 14B | Q4_K_M | 9.0 GB | 103 |
| Qwen3 32B | Q4_K_M | 19.5 GB | 142 |
| Llama 3.3 70B | Q4_K_M | 43 GB | 25~30 |
한마디: "740만원으로 32B 모델을 142 TPS로 굴리면 채팅이瞬間이동 수준"
💰 RTX 5060 Ti 16GB (~93만원) — 신가성비왕
GDDR7로 448 GB/s. 4060 Ti 16GB보다 55% 빠른 대역폭.
| 추천 모델 | 양자화 | 파일 크기 | 예상 TPS |
|---|---|---|---|
| Qwen3-4B | Q4_K_M | 2.3 GB | ~80 |
| Llama 3.1 8B | Q4_K_M | 4.9 GB | 51 |
| Qwen 2.5 14B | Q4_K_M | 9.0 GB | 33 |
| Gemma 4 12B | Q4_K_M | 7.5 GB | ~40 |
한마디: "93만원으로 8B 51 TPS — 4070급 성능"
4. VRAM별 한눈에 보기
| VRAM | 실행 가능 모델 (Q4_K_M) | 추천 GPU |
|---|---|---|
| 8GB | 4B~8B | RTX 3060 Ti, 3070, 4060 |
| 10GB | 8B + 넉넉한 컨텍스트 | RTX 3080 |
| 12GB | 8B~14B | RTX 3060, 4070, 4070 Super |
| 16GB | 14B 완전, 30B는 Q3 | RTX 4060 Ti 16GB, 4070 Ti Super, 5060 Ti |
| 24GB | 32B 완전, 70B 부분 | RTX 3090, 4090 |
| 32GB | 32B 완전 + 넉넉, 70B 경계 | RTX 5090 |
5. 가성비 순위 (2026년)
| 순위 | GPU | 예산 | 추천 이유 |
|---|---|---|---|
| 🥇 | RTX 3090 24GB (중고) | ~60~70만원 | 24GB로 32B 완전 구동, 가성비 최강 |
| 🥈 | RTX 5060 Ti 16GB | ~93만원 | GDDR7 448 GB/s, 8B 51 TPS |
| 🥉 | RTX 4070 Ti Super 16GB | ~115만원 | 672 GB/s, 14B 47 TPS |
| 4 | RTX 3060 12GB (중고) | ~15~20만원 | 예산 한계 시, 8B 42 TPS |
| 5 | RTX 5090 32GB | ~740만원 | 최강 성능, 32B 142 TPS |
요약 공식
예산 20만원 이하 → RTX 3060 12GB (중고) + Llama 3.1 8B
예산 60~70만원 → RTX 3090 24GB (중고) + Qwen3 32B
예산 90~120만원 → RTX 5060 Ti 16GB 또는 RTX 4070 Ti Super 16GB
예산 300만원+ → RTX 4090 24GB + Qwen3 32B (42 TPS)
예산 700만원+ → RTX 5090 32GB + Qwen3 32B (142 TPS)
6. 자주 하는 질문
Q. 8GB GPU로 14B 모델을 돌릴 수 있나요? → Q3_K_M 양자화(~7.5GB)로 실행은 되지만, 품질이 크게 떨어집니다. 8B 모델을 Q8_0으로 돌리는 것이 더 낫습니다.
Q. 4060 Ti 16GB vs 3090 24GB, 어떤 것이 좋나요? → 3090이 대역폭(936 vs 288 GB/s)에서 3배 빠르고 VRAM도 8GB 더 많습니다. 중고 60~70만원으로 4060 Ti 16GB(49만원)와 비슷한 예산이면 3090이 압승.
Q. 2개의 GPU를 연결하면 어떤가요? → llama.cpp에서 --tensor-split으로 분산 가능하지만, PCIe 버스 병목으로 1+1 ≠ 2 입니다. 속도는 약 60~70% 수준.
Q. AMD GPU는 어떤가요? → ROCm이 NVIDIA보다 지원 범위가 좁습니다. llama.cpp Vulkan으로 동작하지만, CUDA 대비 30~50% 성능 저하. NVIDIA를 권장합니다.