--- title: "그래픽카드별 로컬 AI 모델 추천 완전 가이드 (2026)" date: 2026-09-23 time: "22:30" model: "deepseek-v3" category: knowhow summary: "보유한 그래픽카드에 따라 어떤 로컬 AI 모델을 돌릴 수 있는지 VRAM별/모델별 벤치마크로 정리. RTX 3060부터 RTX 5090까지 18종 GPU별 추천 모델, 추론 속도(TPS), 가성비 순위까지." tags: GPU, RTX 3090, RTX 4090, RTX 5090, VRAM, 추론 속도, 로컬 AI, Ollama, llama.cpp, 양자화, 가성비 --- # 그래픽카드별 로컬 AI 모델 추천 완전 가이드 내 그래픽카드로 어떤 모델을 돌릴 수 있을까? 이 질문에 대한 답입니다. --- ## 1. 핵심 원리: VRAM이 곧 모델 한계 ``` 실행 가능 모델 = GPU VRAM ≥ 모델 파일 크기 + KV 캐시 여유 ``` | 양자화 | 8B 모델 | 14B 모델 | 32B 모델 | 70B 모델 | |--------|---------|----------|----------|----------| | **Q4_K_M** | ~4.9 GB | ~9.0 GB | ~19.5 GB | ~43.0 GB | | **Q8_0** | ~8.5 GB | ~16.4 GB | ~37.0 GB | ~75.0 GB | **VRAM이 모델 크기보다 작으면 실행 자체가 불가합니다.** 메모리 대역폭이 아무리 빨라도 방법이 없습니다. --- ## 2. NVIDIA GPU 스펙 비교 ### RTX 30 시리즈 (Ampere) | GPU | VRAM | 메모리 대역폭 | 특징 | |-----|------|-------------|------| | RTX 3060 12GB | **12GB** | 360 GB/s | VRAM 넉넉, 대역폭 낮음 | | RTX 3060 Ti 8GB | 8GB | 448 GB/s | VRAM 부족 | | RTX 3070 8GB | 8GB | 448 GB/s | VRAM 부족 | | RTX 3080 10GB | 10GB | 760 GB/s | 대역폭 좋음 | | RTX 3080 Ti 12GB | 12GB | 912 GB/s | 대역폭 우수 | | RTX 3090 24GB | **24GB** | **936 GB/s** | **최고의 VRAM 가성비** | ### RTX 40 시리즈 (Ada Lovelace) | GPU | VRAM | 메모리 대역폭 | 특징 | |-----|------|-------------|------| | RTX 4060 8GB | 8GB | 272 GB/s | entry-level | | RTX 4060 Ti 16GB | **16GB** | 288 GB/s | VRAM 넉넉, 대역폭 낮음 | | RTX 4070 12GB | 12GB | 504 GB/s | 균형 | | RTX 4070 Super 12GB | 12GB | 504 GB/s | 가성비 | | RTX 4070 Ti 12GB | 12GB | 504 GB/s | | | RTX 4070 Ti Super 16GB | **16GB** | **672 GB/s** | **16GB 스위트스팟** | | RTX 4080 16GB | 16GB | 717 GB/s | 고성능 | | RTX 4090 24GB | **24GB** | **1,008 GB/s** | **소비자 최강** | ### RTX 50 시리즈 (Blackwell) — GDDR7 탑재 | GPU | VRAM | 메모리 대역폭 | 특징 | |-----|------|-------------|------| | RTX 5060 Ti 16GB | **16GB** | 448 GB/s | **신가성비왕** | | RTX 5070 12GB | 12GB | 672 GB/s | | | RTX 5070 Ti 16GB | **16GB** | **896 GB/s** | 16GB 고속 | | RTX 5080 16GB | 16GB | 960 GB/s | | | RTX 5090 32GB | **32GB** | **1,792 GB/s** | **왕의 왕** | --- ## 3. GPU별 추천 모델 ### 🟢 RTX 3060 12GB (중고 ~15~20만원) 12GB VRAM으로 8B 모델 완전 구동 가능합니다. | 추천 모델 | 양자화 | 파일 크기 | 예상 TPS | |----------|--------|----------|---------| | **Qwen3-4B** | Q4_K_M | 2.3 GB | ~50 | | **Gemma 4 E4B** | Q4_K_M | 2.5 GB | ~48 | | **K2-Horizon-3.7B** | Q4_K_M | 2.3 GB | ~50 | | **Llama 3.1 8B** | Q4_K_M | 4.9 GB | **42** | | **Qwen3 8B** | Q4_K_M | 4.9 GB | 40 | | Qwen 2.5 14B | Q4_K_M | 9.0 GB | 22 (여유 없음) | **한마디:** "15~20만원으로 8B 모델은 쾌적하게, 14B는 빡빡하게" --- ### 🔵 RTX 3090 24GB (중고 ~60~70만원) — 🏆 최고의 가성비 24GB VRAM으로 32B 모델까지 완전 구동, 70B까지 부분 구동. | 추천 모델 | 양자화 | 파일 크기 | 예상 TPS | |----------|--------|----------|---------| | **Qwen3-4B** | Q4_K_M | 2.3 GB | ~120 | | **Llama 3.1 8B** | Q4_K_M | 4.9 GB | **95** | | **Qwen3 8B** | Q8_0 | 8.5 GB | ~65 | | **Qwen 2.5 14B** | Q4_K_M | 9.0 GB | **55** | | **Gemma 4 12B** | Q4_K_M | 7.5 GB | ~60 | | **Qwen3 32B** | Q4_K_M | 19.5 GB | **28** | | **Gemma 4 28B (MoE)** | Q4_K_M | 17.0 GB | ~35 | | Llama 3.3 70B | Q2_K | ~30 GB | 10 (부분 오프로드) | **한마디:** "60~70만원으로 32B 모델을 완전히 돌리는 왕" --- ### 🔷 RTX 4070 Ti Super 16GB (~115만원) 16GB + 672 GB/s로 14B 모델에 최적. | 추천 모델 | 양자화 | 파일 크기 | 예상 TPS | |----------|--------|----------|---------| | **Qwen3-4B** | Q4_K_M | 2.3 GB | ~100 | | **Llama 3.1 8B** | Q4_K_M | 4.9 GB | **72** | | **Qwen 2.5 14B** | Q4_K_M | 9.0 GB | **47** | | **Gemma 4 12B** | Q4_K_M | 7.5 GB | ~55 | | Qwen3 32B | Q4_K_M | 19.5 GB | ❌ (VRAM 초과) | **한마디:** "115만원으로 14B 모델의 스위트스팟" --- ### ⭐ RTX 4060 Ti 16GB (~49만원) 16GB지만 대역폭이 288 GB/s로 낮습니다. VRAM 용량만으로 승부. | 추천 모델 | 양자화 | 파일 크기 | 예상 TPS | |----------|--------|----------|---------| | **Qwen3-4B** | Q4_K_M | 2.3 GB | ~55 | | **Llama 3.1 8B** | Q4_K_M | 4.9 GB | **34** | | **Qwen 2.5 14B** | Q4_K_M | 9.0 GB | **22** | | **Gemma 4 12B** | Q4_K_M | 7.5 GB | ~28 | **한마디:** "49만원으로 16GB — 14B는 느리지만 실행은 됨" --- ### 🏆 RTX 4090 24GB (~315만원) 소비자 GPU 최강의 속도 + 24GB VRAM. | 추천 모델 | 양자화 | 파일 크기 | 예상 TPS | |----------|--------|----------|---------| | **Qwen3-4B** | Q4_K_M | 2.3 GB | ~200 | | **Llama 3.1 8B** | Q4_K_M | 4.9 GB | **135** | | **Qwen 2.5 14B** | Q4_K_M | 9.0 GB | **78** | | **Qwen3 32B** | Q4_K_M | 19.5 GB | **42** | | **Gemma 4 28B (MoE)** | Q4_K_M | 17.0 GB | ~55 | | Llama 3.3 70B | Q4_K_M | 43 GB | 18 (부분 오프로드) | **한마디:** "315만원으로 8B는 135 TPS, 32B는 42 TPS — 잠시도 기다리지 않음" --- ### 👑 RTX 5090 32GB (~740만원) GDDR7의 1,792 GB/s 대역폭 + 32GB VRAM. 로컬 AI의 종결자. | 추천 모델 | 양자화 | 파일 크기 | 예상 TPS | |----------|--------|----------|---------| | **Qwen3-4B** | Q4_K_M | 2.3 GB | ~280 | | **Llama 3.1 8B** | Q4_K_M | 4.9 GB | **145** | | **Qwen 2.5 14B** | Q4_K_M | 9.0 GB | **103** | | **Qwen3 32B** | Q4_K_M | 19.5 GB | **142** | | **Llama 3.3 70B** | Q4_K_M | 43 GB | **25~30** | **한마디:** "740만원으로 32B 모델을 142 TPS로 굴리면 채팅이瞬間이동 수준" --- ### 💰 RTX 5060 Ti 16GB (~93만원) — 신가성비왕 GDDR7로 448 GB/s. 4060 Ti 16GB보다 55% 빠른 대역폭. | 추천 모델 | 양자화 | 파일 크기 | 예상 TPS | |----------|--------|----------|---------| | **Qwen3-4B** | Q4_K_M | 2.3 GB | ~80 | | **Llama 3.1 8B** | Q4_K_M | 4.9 GB | **51** | | **Qwen 2.5 14B** | Q4_K_M | 9.0 GB | **33** | | **Gemma 4 12B** | Q4_K_M | 7.5 GB | ~40 | **한마디:** "93만원으로 8B 51 TPS — 4070급 성능" --- ## 4. VRAM별 한눈에 보기 | VRAM | 실행 가능 모델 (Q4_K_M) | 추천 GPU | |------|------------------------|---------| | **8GB** | 4B~8B | RTX 3060 Ti, 3070, 4060 | | **10GB** | 8B + 넉넉한 컨텍스트 | RTX 3080 | | **12GB** | 8B~14B | RTX 3060, 4070, 4070 Super | | **16GB** | 14B 완전, 30B는 Q3 | RTX 4060 Ti 16GB, 4070 Ti Super, 5060 Ti | | **24GB** | 32B 완전, 70B 부분 | RTX 3090, 4090 | | **32GB** | 32B 완전 + 넉넉, 70B 경계 | RTX 5090 | --- ## 5. 가성비 순위 (2026년) | 순위 | GPU | 예산 | 추천 이유 | |------|-----|------|----------| | 🥇 | **RTX 3090 24GB (중고)** | ~60~70만원 | 24GB로 32B 완전 구동, 가성비 최강 | | 🥈 | **RTX 5060 Ti 16GB** | ~93만원 | GDDR7 448 GB/s, 8B 51 TPS | | 🥉 | **RTX 4070 Ti Super 16GB** | ~115만원 | 672 GB/s, 14B 47 TPS | | 4 | **RTX 3060 12GB (중고)** | ~15~20만원 | 예산 한계 시, 8B 42 TPS | | 5 | **RTX 5090 32GB** | ~740만원 | 최강 성능, 32B 142 TPS | ### 요약 공식 ``` 예산 20만원 이하 → RTX 3060 12GB (중고) + Llama 3.1 8B 예산 60~70만원 → RTX 3090 24GB (중고) + Qwen3 32B 예산 90~120만원 → RTX 5060 Ti 16GB 또는 RTX 4070 Ti Super 16GB 예산 300만원+ → RTX 4090 24GB + Qwen3 32B (42 TPS) 예산 700만원+ → RTX 5090 32GB + Qwen3 32B (142 TPS) ``` --- ## 6. 자주 하는 질문 **Q. 8GB GPU로 14B 모델을 돌릴 수 있나요?** → Q3_K_M 양자화(~7.5GB)로 실행은 되지만, 품질이 크게 떨어집니다. 8B 모델을 Q8_0으로 돌리는 것이 더 낫습니다. **Q. 4060 Ti 16GB vs 3090 24GB, 어떤 것이 좋나요?** → 3090이 대역폭(936 vs 288 GB/s)에서 3배 빠르고 VRAM도 8GB 더 많습니다. 중고 60~70만원으로 4060 Ti 16GB(49만원)와 비슷한 예산이면 3090이 압승. **Q. 2개의 GPU를 연결하면 어떤가요?** → llama.cpp에서 `--tensor-split`으로 분산 가능하지만, PCIe 버스 병목으로 1+1 ≠ 2 입니다. 속도는 약 60~70% 수준. **Q. AMD GPU는 어떤가요?** → ROCm이 NVIDIA보다 지원 범위가 좁습니다. llama.cpp Vulkan으로 동작하지만, CUDA 대비 30~50% 성능 저하. NVIDIA를 권장합니다.