DGX Spark 실체: 128GB VRAM인데 왜 RTX 4090보다 느린가
DGX Spark 실체: 128GB인데 왜 RTX 4090보다 느린가
DGX Spark는 128GB 통합 메모리로 100B+ 모델을 로컬에서 구동할 수 있는 혁신적인 장비이지만, 추론 속도는 RTX 4090보다 3배 느립니다. 핵심은 "용량이 아닌 대역폭"에 있습니다.
1. DGX Spark란 무엇인가
하드웨어 스펙
| 항목 | DGX Spark | RTX 4090 |
|---|---|---|
| 출시가 | $3,999 | $1,599 |
| 프로세서 | GB10 Grace Blackwell | AD102 |
| 메모리 | 128GB LPDDR5X | 24GB GDDR6X |
| 대역폭 | 273 GB/s | 1,008 GB/s |
| CUDA 코어 | 6,144 | 16,384 |
| 텐서코어 | 192 (5세대) | 512 (4세대) |
| 소비전력 | 240W (실제 ~100W) | 450W |
| 크기 | 150×150×50.5mm | 304×137mm |
통합 메모리의 마법
DGX Spark는 CPU와 GPU가 같은 128GB 메모리 풀을 NVLink-C2C로 공유합니다. 기존 GPU는 VRAM이 별도로 존재하고 PCIe 버스를 통해 데이터를 주고받지만, DGX Spark는 이 병목이 없습니다.
이 덕분에 70B 모델 FP16(140GB 필요)을 양자화 없이 단일 시스템에서 실행할 수 있습니다. RTX 4090으로는 70B 모델을 단독으로 돌릴 수 없습니다.
라인업
| 제품 | 가격 | 특징 |
|---|---|---|
| NVIDIA DGX Spark | $3,999 | 공식 모델, DGX OS |
| ASUS Ascent GX10 | ~$3,999 | 가장 소형 (150×150×51mm) |
| GIGABYTE AI TOP ATOM | ~$3,999 | 가성비 중심 |
| Dell Pro Max with GB10 | ~$4,500+ | 기업 도입 특화 |
모든 제품이 동일한 GB10 칩을 사용하며, 2대 연결 시 256GB로 405B 모델까지 구동 가능합니다.
2. 왜 128GB인데 느린가: 대역폭 병목
핵심 공식
토큰 생성 속도(TPS) ≈ 메모리 대역폭(GB/s) ÷ 모델 크기(GB)
각 토큰을 생성할 때마다 전체 모델 가중치를 메모리에서 읽어야 합니다. 따라서 읽는 속도(대역폭)가 곧 속도가 됩니다.
실제 계산: 8B 모델 (Q4_K_M, ~4.9GB)
| 하드웨어 | 대역폭 | 이론 TPS | 실제 TPS |
|---|---|---|---|
| RTX 4090 | 1,008 GB/s | ~206 | 116 |
| RTX 5090 | 1,792 GB/s | ~366 | 140~150 |
| DGX Spark | 273 GB/s | ~56 | 35 |
| Mac Mini M4 | ~100 GB/s | ~20 | 42~52 |
RTX 4090이 DGX Spark보다 3.3배 빠릅니다. 24GB짜리 게이밍 그래픽카드가 128GB짜리 AI 슈퍼컴퓨터를 앞서는 것입니다.
왜 이런 일이 생기는가
메모리 대역폭 비교:
| 메모리 타입 | 대역폭 | 사용처 |
|---|---|---|
| LPDDR5X (DGX Spark) | 273 GB/s | 통합 메모리 |
| GDDR6X (RTX 4090) | 1,008 GB/s | 소비자 GPU |
| GDDR7 (RTX 5090) | 1,792 GB/s | 소비자 GPU |
| HBM3 (H100) | 3,350 GB/s | 데이터센터 |
| HBM3e (B200) | 8,000 GB/s | 데이터센터 |
DGX Spark가 사용하는 LPDDR5X는 省전력에 특화된 메모리입니다. 전력 소모를 줄이기 위해 대역폭을 희생한 것이죠. 반면 GDDR6X/HBM은 성능에 집중한 메모리입니다.
비유하자면:
- RTX 4090 = 고속도로 4차선 (좁지만 빠름)
- DGX Spark = 도심 대로 8차선 (넓지만 신호 대기로 느림)
3. 모델별 실전 벤치마크
소형 모델 (8B 이하): RTX 4090 압승
| 모델 | RTX 4090 | DGX Spark | 차이 |
|---|---|---|---|
| Llama 3.1 8B Q4 | 116 tps | 35 tps | RTX 4090 3.3배 |
| Qwen3 4B Q4 | 165 tps | ~50 tps | RTX 4090 3.3배 |
| Gemma 4 E4B Q4 | 150 tps | ~45 tps | RTX 4090 3.3배 |
중형 모델 (13~30B): DGX Spark 접근
| 모델 | RTX 4090 | DGX Spark | 차이 |
|---|---|---|---|
| Qwen 2.5 14B Q4 | 45 tps | 75~95 tps | DGX Spark 1.8배 |
| Llama 3.1 70B Q4 | 실행 불가 | 35~45 tps | DGX Spark 승 |
| Qwen3 32B Q4 | 실행 불가 (VRAM 초과) | 50~65 tps | DGX Spark 승 |
대형 모델 (70B+): DGX Spark만 실행 가능
| 모델 | RTX 4090 | DGX Spark | 비고 |
|---|---|---|---|
| Llama 3.1 70B FP16 | 불가 (140GB 필요) | 15~20 tps | DGX Spark 유일 |
| Llama 3.1 70B Q4 | 불가 (35GB 필요) | 35~45 tps | |
| Qwen3 235B (듀얼) | 불가 | 11.73 tps | 2대 연결 |
NVIDIA 공식 벤치마크 (NVFP4, TRT-LLM)
| 모델 | 프롬프트 처리 | 토큰 생성 |
|---|---|---|
| Llama 3.1 8B NVFP4 | 10,257 tok/s | 38.65 tok/s |
| Qwen3 14B NVFP4 | 5,929 tok/s | 22.71 tok/s |
| GPT-OSS-20B MXFP4 | 3,670 tok/s | 28.74 tok/s |
| GPT-OSS-120B MXFP4 | 1,725 tok/s | 55.37 tok/s |
| Qwen3 235B (듀얼) | 23,477 tok/s | 11.73 tok/s |
4. DGX Spark가 진짜 유용한 경우
✅ DGX Spark가 승리하는 시나리오
1. 70B+ 모델 실행
- RTX 4090은 70B 모델을 단독으로 돌릴 수 없습니다
- DGX Spark는 양자화 없이 FP16으로 70B 모델을 구동합니다
- "돌아가느냐 마느냐"의 문제이므로 대역폭은 중요하지 않습니다
2. 파인튜닝
- QLoRA로 70B 모델을 파인튜닝할 때 128GB 메모리가 필수적입니다
- NVIDIA 공식 벤치마크: 70B QLoRA 파인튜닝 시 5,079 tok/s
3. 대용량 컨텍스트 + 대형 모델
- 70B 모델 + 128K 컨텍스트 = KV 캐시에만 16~30GB 소모
- 128GB 통합 메모리에서 여유롭게 처리
4. 완전한 폐쇄망 보안
- 128GB로 대형 모델을 클라우드 없이 로컬에서 구동
- 금융, 의료, 국방 등 민감 데이터 처리에 최적
5. 멀티모달 워크로드
- CPU + GPU가 같은 메모리를 공유하므로 이미지/비디오 처리 시 복사 불필요
❌ RTX 4090/5090이 승리하는 시나리오
1. 8B 이하 소형 모델
- RTX 4090이 3.3배 빠름 (116 vs 35 tps)
- 8B 모델은 24GB VRAM 안에 충분히 들어감
2. 빠른 토큰 생성이 필요한 작업
- 챗봇, 코딩 어시스턴트 등 응답 속도가 중요한 경우
- RTX 5090은 1,792 GB/s로 DGX Spark보다 6.6배 빠름
3. 비용 효율
- RTX 4090 $1,599 vs DGX Spark $3,999
- 8B 모델 기준: 2.5배 저렴하면서 3.3배 빠름
4. 게임 겸용
- RTX 4090은 게임 + AI 겸용 가능
- DGX Spark는 AI 전용 (ARM 리눅스)
5. 어떤 장비를 선택해야 하는가
결정표
| 상황 | 추천 장비 | 이유 |
|---|---|---|
| 8B 이하 로컬 AI | RTX 4090/5090 | 3배 빠르고 2.5배 저렴 |
| 70B 모델 구동 | DGX Spark | 유일한 선택지 |
| 70B 파인튜닝 | DGX Spark | 128GB 메모리 필수 |
| 预算 100만원 이하 | Mac Mini M4 24GB | 8B 42~52 TPS |
| 预算 180만원 | Mac Mini M4 Pro 48GB | 32B 12~18 TPS |
| 预算 400만원+ | DGX Spark | 70B+ FP16 실행 |
수학적 기준
모델 크기(GB) > VRAM(GB) → DGX Spark 승 (실행 자체가 가능한 문제)
모델 크기(GB) < VRAM(GB) → RTX 4090 승 (대역폭으로 속도 결정)
6. 결론
DGX Spark의 128GB 통합 메모리는 "넓은 도로"이고, RTX 4090의 1,008 GB/s GDDR6X는 "고속도로"입니다.
- 128GB로 70B 모델을 돌릴 수 있다는 것은 혁신적입니다
- 하지만 8B 모델의 속도는 RTX 4090이 3배 빠릅니다
- "VRAM이 많으면 빠르다"는 착각은 메모리 대역폭이라는 병목을 간과한 것
핵심 교훈: 추론 속도는 VRAM 용량이 아니라 메모리 대역폭이 결정합니다. DGX Spark는 "더 큰 모델을 실행할 수 있는 장비"이지, "더 빠른 장비"는 아닙니다.