--- title: 엔비디아 vs AMD 로컬 AI 환경 완전 비교 — CUDA, ROCm, Vulkan 실전 가이드 date: 2026-09-23 time: "22:40" model: admin category: knowhow summary: NVIDIA CUDA와 AMD ROCm/Vulkan의 로컬 AI 추론 성능 차이를 실제 명령어와 함께 비교. GPU 선택, 드라이버 설치, llama.cpp/Ollama 세팅법까지 실무 중심으로 정리. tags: NVIDIA,AMD,CUDA,ROCm,Vulkan,로컬AI,GPU,llama.cpp,Ollama --- # 엔비디아 vs AMD — 로컬 AI 환경에서의 실질적 차이 로컬 PC에 그래픽카드를 장착할 때, 우리는 항상 두 거인 앞에서 고민한다. "가성비의 AMD인가, AI 생태계의 NVIDIA인가." 이 글에서는 단순 스펙 비교가 아니라, **실제 로컬 AI를 돌릴 때 체감되는 차이**를 명령어 중심으로 정리한다. ## 1. 하드웨어 아키텍처 — 왜 속도가 다른가 ### NVIDIA: 전문 코어 분업 ``` NVIDIA GPU 내부 구조 ├── CUDA Core (수천~수만개) — 범용 연산 ├── RT Core — 레이 트레이싱 전용 ├── Tensor Core — AI/딥러닝 가속 (FP16/INT8/FP4) └── NVENC/NVDEC — 하드웨어 인코딩/디코딩 ``` Tensor Core는 AI 추론에서 핵심이다. FP16 연산이 CUDA Core보다 수십 배 빠르며, DLSS, Stable Diffusion, LLM 추론 모두 이 코어를 활용한다. ### AMD: 범용 연산 + 거대 캐시 ``` AMD GPU 내부 구조 ├── Stream Processor (수천~수만개) — 범용 연산 ├── Infinity Cache — GPU 내부 초고속 캐시 (VRAM 병목 감소) ├── Ray Accelerator — 레이 트레이싱 가속 └── AMF — 하드웨어 인코딩 ``` AMD는 Tensor Core에 해당하는 특화 AI 코어가 없다. 대신 Infinity Cache로 VRAM 대역폭 한계를 극복하고, 범용 SP로 모든 것을 처리한다. ## 2. 소프트웨어 생태계 — 이것이 진짜 차이다 ### NVIDIA: CUDA 독점 ``` # CUDA 설치 확인 nvidia-smi # 출력 예: CUDA Version: 12.6 # PyTorch에서 CUDA 사용 확인 python3 -c "import torch; print(torch.cuda.is_available())" # True ``` 전 세계 AI 프레임워크의 90% 이상이 CUDA에 최적화되어 있다. PyTorch, TensorFlow, llama.cpp, vLLM, Stable Diffusion — 모두 CUDA를 먼저 지원하고, AMD 지원은 뒤따른다. ### AMD: ROCm (Linux 중심) ```bash # ROCm 설치 (Ubuntu 22.04 기준) # https://rocm.docs.amd.com/en/latest/ sudo apt install rocm-hip-runtime # 또는 curl -sL https://repo.radeon.com/rocm/rocm.gpg.key | sudo apt-key add - sudo apt update sudo apt install rocm-dev # ROCm GPU 확인 rocm-smi # PyTorch에서 ROCm 사용 확인 python3 -c "import torch; print(torch.cuda.is_available())" # True (ROCm은 HIP 인터페이스로 CUDA와 호환) ``` **주의**: ROCm은 리눅스에서만 안정적이다. 윈도우에서는 아직 성숙하지 않았다. AMD 공식 지원 GPU 목록에서 내 모델이 빠져 있으면 아예 설치되지 않을 수 있다. ### AMD: Vulkan (범용 백엔드) ```bash # Vulkan 드라이버 확인 vulkaninfo | grep "deviceName" # llama.cpp에서 Vulkan 사용 ./llama-server -m model.gguf \ --gpu-layers 999 \ --vulkan \ --ctx-size 4096 # Ollama에서 Vulkan 사용 (환경변수) CUDA_VISIBLE_DEVICES=0 OLLAMA_GPU_DRIVER=vulkan ollama serve ``` Vulkan은 NVIDIA와 AMD 모두에서 동작하는 범용 그래픽 API다. llama.cpp는 Vulkan 백엔드를 지원하며, AMD GPU에서 ROCm보다 빠른 경우도 있다. 단, CUDA 대비 10~30% 성능 손실이 일반적이다. ## 3. 로컬 AI 추론 성능 비교 ### llama.cpp 벤치마크 (Q4_K_M, Qwen3 8B) | GPU | TPS (토큰/초) | 백엔드 | 비고 | |-----|---------------|--------|------| | RTX 4090 24GB | **135** | CUDA | 최강 | | RTX 3090 24GB | **95** | CUDA | 중고 가성비 왕 | | RTX 4070 Super 12GB | **75** | CUDA | | | RTX 4060 Ti 16GB | **55** | CUDA | | | AMD R9700 AI Pro 32GB | **64** | **Vulkan** | ROCm보다 5배 빠름 | | AMD R9700 AI Pro 32GB | **26** | ROCm | 최적화 미흡 | | RTX 3060 12GB | **45** | CUDA | 입문 추천 | ### 27B 모델 구동 가능성 | GPU | 27B Q4 TPS | 실사용 가능? | |-----|-----------|-------------| | RTX 4090 24GB | 42 tok/s | 쾌적 | | RTX 3090 24GB | 28 tok/s | 사용 가능 | | **R9700 AI Pro 32GB** | **26 tok/s** | **사용 가능** | | RTX 4060 Ti 16GB | 8 tok/s | 느림 | | RTX 4060 8GB | 4.5 tok/s | **실사용 불가** | **핵심**: 27B 모델은 24GB+ VRAM이 필요하다. RTX 4060 8GB에서는 CPU 오프로딩이 발생하여 사실상 사용 불가하다. R9700 AI Pro의 32GB는 이 영역에서 NVIDIA 소비자 GPU보다 유리하다. ## 4. 드라이버 설치 실전 가이드 ### NVIDIA 드라이버 (Ubuntu) ```bash # 방법 1: Ubuntu 드라이버 관리자 sudo ubuntu-drivers autoinstall # 방법 2: NVIDIA 공식 PPA sudo add-apt-repository ppa:graphics-drivers/ppa sudo apt update sudo apt install nvidia-driver-560 # 설치 확인 nvidia-smi ``` ### AMD 드라이버 (Linux) ```bash # 방법 1: ROCm (AI 추론용) # https://rocm.docs.amd.com/en/latest/ sudo apt install rocm-dev # 방법 2: Mesa Vulkan 드라이버 (게이밍/범용) sudo apt install mesa-vulkan-drivers # 설치 확인 vulkaninfo | grep "deviceName" rocm-smi ``` ### 드라이버 안정성 비교 | 항목 | NVIDIA | AMD | |------|--------|-----| | 설치 난이도 | 쉬움 (원클릭) | 보통 (수동 설정 필요) | | 윈도우 호환 | 완벽 | 보통 | | 리눅스 호환 | 우수 | 양호 (최근 대폭 개선) | | 업데이트 빈도 | 빈번 | 보통 | | AI 프레임워크 지원 | 즉시 | 시간차 (수개월~1년) | ## 5. 실전 세팅 — Ollama와 llama.cpp ### Ollama (NVIDIA) ```bash # Ollama 설치 curl -fsSL https://ollama.com/install.sh | sh # 모델 실행 (자동으로 GPU 감지) ollama run qwen3:8b # GPU 레이어 확인 ollama ps ``` ### Ollama (AMD, Vulkan) ```bash # Vulkan 백엔드로 실행 OLLAMA_GPU_DRIVER=vulkan ollama serve # 또는 ROCm 환경변수 HSA_OVERRIDE_GFX_VERSION=11.0.0 ollama serve ``` ### llama.cpp (NVIDIA) ```bash # CUDA 빌드 git clone https://github.com/ggerganov/llama.cpp cd llama.cpp cmake -B build -DGGML_CUDA=ON cmake --build build --config Release -j$(nproc) # 추론 실행 ./build/bin/llama-server \ -m ~/models/qwen3-8b-q4_k_m.gguf \ --n-gpu-layers 999 \ --ctx-size 8192 \ --flash-attn \ --host 0.0.0.0 --port 8080 ``` ### llama.cpp (AMD, Vulkan) ```bash # Vulkan 빌드 cmake -B build -DGGML_VULKAN=ON cmake --build build --config Release -j$(nproc) # 추론 실행 ./build/bin/llama-server \ -m ~/models/qwen3-8b-q4_k_m.gguf \ --gpu-layers 999 \ --ctx-size 8192 \ --host 0.0.0.0 --port 8080 ``` ## 6. 선택 가이드 ### NVIDIA를 사야 할 때 - **로컬 AI가 주 목적**: Stable Diffusion, LLM, 파인튜닝 등 - **CUDA 생태계 필요**: PyTorch, TensorFlow, vLLM 등 - **윈도우 + 리눅스 모두 사용**: 드라이버 호환성 확실 - **빠른 토큰 생성 필요**: RTX 4090 135 tok/s는 현재 최강 ### AMD를 사야 할 때 - **27B+ 대형 모델 실행**: 32GB VRAM이 핵심 (R9700 AI Pro) - **리눅스 전용 환경**: Vulkan/ROCm이 안정적인 리눅스 - **비용 대비 VRAM**: 동가 대비 더 많은 VRAM 필요 - **프라이버시 중시**: 클라우드 없이 로컬에서 대형 모델 구동 ### 한 줄 결론 > "AI와 소프트웨어 생태계가 목적이라면 NVIDIA, 32GB+ 대용량 VRAM으로 대형 모델을 로컬에서 돌리는 것이 목적이라면 AMD R9700 AI Pro가 현실적 대안이다." --- *본 벤치마크는 운영자 단일 환경에서 측정된 참고 수치이며, 하드웨어 구성 및 소프트웨어 버전에 따라 실제 성능은 달라질 수 있습니다.*