엔비디아 vs AMD 로컬 AI 환경 완전 비교 — CUDA, ROCm, Vulkan 실전 가이드
엔비디아 vs AMD — 로컬 AI 환경에서의 실질적 차이
로컬 PC에 그래픽카드를 장착할 때, 우리는 항상 두 거인 앞에서 고민한다. "가성비의 AMD인가, AI 생태계의 NVIDIA인가." 이 글에서는 단순 스펙 비교가 아니라, 실제 로컬 AI를 돌릴 때 체감되는 차이를 명령어 중심으로 정리한다.
1. 하드웨어 아키텍처 — 왜 속도가 다른가
NVIDIA: 전문 코어 분업
NVIDIA GPU 내부 구조
├── CUDA Core (수천~수만개) — 범용 연산
├── RT Core — 레이 트레이싱 전용
├── Tensor Core — AI/딥러닝 가속 (FP16/INT8/FP4)
└── NVENC/NVDEC — 하드웨어 인코딩/디코딩
Tensor Core는 AI 추론에서 핵심이다. FP16 연산이 CUDA Core보다 수십 배 빠르며, DLSS, Stable Diffusion, LLM 추론 모두 이 코어를 활용한다.
AMD: 범용 연산 + 거대 캐시
AMD GPU 내부 구조
├── Stream Processor (수천~수만개) — 범용 연산
├── Infinity Cache — GPU 내부 초고속 캐시 (VRAM 병목 감소)
├── Ray Accelerator — 레이 트레이싱 가속
└── AMF — 하드웨어 인코딩
AMD는 Tensor Core에 해당하는 특화 AI 코어가 없다. 대신 Infinity Cache로 VRAM 대역폭 한계를 극복하고, 범용 SP로 모든 것을 처리한다.
2. 소프트웨어 생태계 — 이것이 진짜 차이다
NVIDIA: CUDA 독점
# CUDA 설치 확인
nvidia-smi
# 출력 예: CUDA Version: 12.6
# PyTorch에서 CUDA 사용 확인
python3 -c "import torch; print(torch.cuda.is_available())"
# True
전 세계 AI 프레임워크의 90% 이상이 CUDA에 최적화되어 있다. PyTorch, TensorFlow, llama.cpp, vLLM, Stable Diffusion — 모두 CUDA를 먼저 지원하고, AMD 지원은 뒤따른다.
AMD: ROCm (Linux 중심)
# ROCm 설치 (Ubuntu 22.04 기준)
# https://rocm.docs.amd.com/en/latest/
sudo apt install rocm-hip-runtime
# 또는
curl -sL https://repo.radeon.com/rocm/rocm.gpg.key | sudo apt-key add -
sudo apt update
sudo apt install rocm-dev
# ROCm GPU 확인
rocm-smi
# PyTorch에서 ROCm 사용 확인
python3 -c "import torch; print(torch.cuda.is_available())"
# True (ROCm은 HIP 인터페이스로 CUDA와 호환)
주의: ROCm은 리눅스에서만 안정적이다. 윈도우에서는 아직 성숙하지 않았다. AMD 공식 지원 GPU 목록에서 내 모델이 빠져 있으면 아예 설치되지 않을 수 있다.
AMD: Vulkan (범용 백엔드)
# Vulkan 드라이버 확인
vulkaninfo | grep "deviceName"
# llama.cpp에서 Vulkan 사용
./llama-server -m model.gguf \
--gpu-layers 999 \
--vulkan \
--ctx-size 4096
# Ollama에서 Vulkan 사용 (환경변수)
CUDA_VISIBLE_DEVICES=0 OLLAMA_GPU_DRIVER=vulkan ollama serve
Vulkan은 NVIDIA와 AMD 모두에서 동작하는 범용 그래픽 API다. llama.cpp는 Vulkan 백엔드를 지원하며, AMD GPU에서 ROCm보다 빠른 경우도 있다. 단, CUDA 대비 10~30% 성능 손실이 일반적이다.
3. 로컬 AI 추론 성능 비교
llama.cpp 벤치마크 (Q4_K_M, Qwen3 8B)
| GPU | TPS (토큰/초) | 백엔드 | 비고 |
|---|---|---|---|
| RTX 4090 24GB | 135 | CUDA | 최강 |
| RTX 3090 24GB | 95 | CUDA | 중고 가성비 왕 |
| RTX 4070 Super 12GB | 75 | CUDA | |
| RTX 4060 Ti 16GB | 55 | CUDA | |
| AMD R9700 AI Pro 32GB | 64 | Vulkan | ROCm보다 5배 빠름 |
| AMD R9700 AI Pro 32GB | 26 | ROCm | 최적화 미흡 |
| RTX 3060 12GB | 45 | CUDA | 입문 추천 |
27B 모델 구동 가능성
| GPU | 27B Q4 TPS | 실사용 가능? |
|---|---|---|
| RTX 4090 24GB | 42 tok/s | 쾌적 |
| RTX 3090 24GB | 28 tok/s | 사용 가능 |
| R9700 AI Pro 32GB | 26 tok/s | 사용 가능 |
| RTX 4060 Ti 16GB | 8 tok/s | 느림 |
| RTX 4060 8GB | 4.5 tok/s | 실사용 불가 |
핵심: 27B 모델은 24GB+ VRAM이 필요하다. RTX 4060 8GB에서는 CPU 오프로딩이 발생하여 사실상 사용 불가하다. R9700 AI Pro의 32GB는 이 영역에서 NVIDIA 소비자 GPU보다 유리하다.
4. 드라이버 설치 실전 가이드
NVIDIA 드라이버 (Ubuntu)
# 방법 1: Ubuntu 드라이버 관리자
sudo ubuntu-drivers autoinstall
# 방법 2: NVIDIA 공식 PPA
sudo add-apt-repository ppa:graphics-drivers/ppa
sudo apt update
sudo apt install nvidia-driver-560
# 설치 확인
nvidia-smi
AMD 드라이버 (Linux)
# 방법 1: ROCm (AI 추론용)
# https://rocm.docs.amd.com/en/latest/
sudo apt install rocm-dev
# 방법 2: Mesa Vulkan 드라이버 (게이밍/범용)
sudo apt install mesa-vulkan-drivers
# 설치 확인
vulkaninfo | grep "deviceName"
rocm-smi
드라이버 안정성 비교
| 항목 | NVIDIA | AMD |
|---|---|---|
| 설치 난이도 | 쉬움 (원클릭) | 보통 (수동 설정 필요) |
| 윈도우 호환 | 완벽 | 보통 |
| 리눅스 호환 | 우수 | 양호 (최근 대폭 개선) |
| 업데이트 빈도 | 빈번 | 보통 |
| AI 프레임워크 지원 | 즉시 | 시간차 (수개월~1년) |
5. 실전 세팅 — Ollama와 llama.cpp
Ollama (NVIDIA)
# Ollama 설치
curl -fsSL https://ollama.com/install.sh | sh
# 모델 실행 (자동으로 GPU 감지)
ollama run qwen3:8b
# GPU 레이어 확인
ollama ps
Ollama (AMD, Vulkan)
# Vulkan 백엔드로 실행
OLLAMA_GPU_DRIVER=vulkan ollama serve
# 또는 ROCm 환경변수
HSA_OVERRIDE_GFX_VERSION=11.0.0 ollama serve
llama.cpp (NVIDIA)
# CUDA 빌드
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
cmake -B build -DGGML_CUDA=ON
cmake --build build --config Release -j$(nproc)
# 추론 실행
./build/bin/llama-server \
-m ~/models/qwen3-8b-q4_k_m.gguf \
--n-gpu-layers 999 \
--ctx-size 8192 \
--flash-attn \
--host 0.0.0.0 --port 8080
llama.cpp (AMD, Vulkan)
# Vulkan 빌드
cmake -B build -DGGML_VULKAN=ON
cmake --build build --config Release -j$(nproc)
# 추론 실행
./build/bin/llama-server \
-m ~/models/qwen3-8b-q4_k_m.gguf \
--gpu-layers 999 \
--ctx-size 8192 \
--host 0.0.0.0 --port 8080
6. 선택 가이드
NVIDIA를 사야 할 때
- 로컬 AI가 주 목적: Stable Diffusion, LLM, 파인튜닝 등
- CUDA 생태계 필요: PyTorch, TensorFlow, vLLM 등
- 윈도우 + 리눅스 모두 사용: 드라이버 호환성 확실
- 빠른 토큰 생성 필요: RTX 4090 135 tok/s는 현재 최강
AMD를 사야 할 때
- 27B+ 대형 모델 실행: 32GB VRAM이 핵심 (R9700 AI Pro)
- 리눅스 전용 환경: Vulkan/ROCm이 안정적인 리눅스
- 비용 대비 VRAM: 동가 대비 더 많은 VRAM 필요
- 프라이버시 중시: 클라우드 없이 로컬에서 대형 모델 구동
한 줄 결론
> "AI와 소프트웨어 생태계가 목적이라면 NVIDIA, 32GB+ 대용량 VRAM으로 대형 모델을 로컬에서 돌리는 것이 목적이라면 AMD R9700 AI Pro가 현실적 대안이다."
본 벤치마크는 운영자 단일 환경에서 측정된 참고 수치이며, 하드웨어 구성 및 소프트웨어 버전에 따라 실제 성능은 달라질 수 있습니다.