--- title: "DGX Spark 실체: 128GB VRAM인데 왜 RTX 4090보다 느린가" date: 2026-09-23 time: "22:10" model: "deepseek-v3" category: knowhow summary: "NVIDIA DGX Spark(128GB 통합메모리)의 실체를 분석. VRAM 용량이 클수록 빠르다는 착각을 깨고, 왜 RTX 4090(24GB)이 8B 모델에서 3배 빠른지 대역폭 관점에서 설명. DGX Spark가 진짜 유용한 경우(70B+ 파인튜닝)와 GPU가 나은 경우를 정리." tags: DGX Spark, NVIDIA, GB10, 통합메모리, VRAM, 추론 속도, RTX 4090, 메모리 대역폭, 미니 슈퍼컴퓨터, 로컬 AI --- # DGX Spark 실체: 128GB인데 왜 RTX 4090보다 느린가 DGX Spark는 128GB 통합 메모리로 100B+ 모델을 로컬에서 구동할 수 있는 혁신적인 장비이지만, **추론 속도는 RTX 4090보다 3배 느립니다**. 핵심은 "용량이 아닌 대역폭"에 있습니다. --- ## 1. DGX Spark란 무엇인가 ### 하드웨어 스펙 | 항목 | DGX Spark | RTX 4090 | |------|-----------|----------| | **출시가** | $3,999 | $1,599 | | **프로세서** | GB10 Grace Blackwell | AD102 | | **메모리** | 128GB LPDDR5X | 24GB GDDR6X | | **대역폭** | **273 GB/s** | **1,008 GB/s** | | **CUDA 코어** | 6,144 | 16,384 | | **텐서코어** | 192 (5세대) | 512 (4세대) | | **소비전력** | 240W (실제 ~100W) | 450W | | **크기** | 150×150×50.5mm | 304×137mm | ### 통합 메모리의 마법 DGX Spark는 CPU와 GPU가 **같은 128GB 메모리 풀**을 NVLink-C2C로 공유합니다. 기존 GPU는 VRAM이 별도로 존재하고 PCIe 버스를 통해 데이터를 주고받지만, DGX Spark는 이 병목이 없습니다. 이 덕분에 **70B 모델 FP16(140GB 필요)을 양자화 없이 단일 시스템에서 실행**할 수 있습니다. RTX 4090으로는 70B 모델을 단독으로 돌릴 수 없습니다. ### 라인업 | 제품 | 가격 | 특징 | |------|------|------| | **NVIDIA DGX Spark** | $3,999 | 공식 모델, DGX OS | | **ASUS Ascent GX10** | ~$3,999 | 가장 소형 (150×150×51mm) | | **GIGABYTE AI TOP ATOM** | ~$3,999 | 가성비 중심 | | **Dell Pro Max with GB10** | ~$4,500+ | 기업 도입 특화 | 모든 제품이 동일한 GB10 칩을 사용하며, 2대 연결 시 256GB로 405B 모델까지 구동 가능합니다. --- ## 2. 왜 128GB인데 느린가: 대역폭 병목 ### 핵심 공식 ``` 토큰 생성 속도(TPS) ≈ 메모리 대역폭(GB/s) ÷ 모델 크기(GB) ``` 각 토큰을 생성할 때마다 전체 모델 가중치를 메모리에서 읽어야 합니다. 따라서 **읽는 속도(대역폭)가 곧 속도**가 됩니다. ### 실제 계산: 8B 모델 (Q4_K_M, ~4.9GB) | 하드웨어 | 대역폭 | 이론 TPS | 실제 TPS | |----------|--------|---------|---------| | **RTX 4090** | 1,008 GB/s | ~206 | **116** | | **RTX 5090** | 1,792 GB/s | ~366 | **140~150** | | **DGX Spark** | 273 GB/s | ~56 | **35** | | **Mac Mini M4** | ~100 GB/s | ~20 | **42~52** | RTX 4090이 DGX Spark보다 **3.3배 빠릅니다**. 24GB짜리 게이밍 그래픽카드가 128GB짜리 AI 슈퍼컴퓨터를 앞서는 것입니다. ### 왜 이런 일이 생기는가 **메모리 대역폭 비교:** | 메모리 타입 | 대역폭 | 사용처 | |-------------|--------|--------| | LPDDR5X (DGX Spark) | **273 GB/s** | 통합 메모리 | | GDDR6X (RTX 4090) | **1,008 GB/s** | 소비자 GPU | | GDDR7 (RTX 5090) | **1,792 GB/s** | 소비자 GPU | | HBM3 (H100) | **3,350 GB/s** | 데이터센터 | | HBM3e (B200) | **8,000 GB/s** | 데이터센터 | DGX Spark가 사용하는 LPDDR5X는 **省전력에 특화된 메모리**입니다. 전력 소모를 줄이기 위해 대역폭을 희생한 것이죠. 반면 GDDR6X/HBM은 성능에 집중한 메모리입니다. **비유하자면:** - RTX 4090 = 고속도로 4차선 (좁지만 빠름) - DGX Spark = 도심 대로 8차선 (넓지만 신호 대기로 느림) --- ## 3. 모델별 실전 벤치마크 ### 소형 모델 (8B 이하): RTX 4090 압승 | 모델 | RTX 4090 | DGX Spark | 차이 | |------|----------|-----------|------| | Llama 3.1 8B Q4 | **116 tps** | 35 tps | RTX 4090 **3.3배** | | Qwen3 4B Q4 | **165 tps** | ~50 tps | RTX 4090 **3.3배** | | Gemma 4 E4B Q4 | **150 tps** | ~45 tps | RTX 4090 **3.3배** | ### 중형 모델 (13~30B): DGX Spark 접근 | 모델 | RTX 4090 | DGX Spark | 차이 | |------|----------|-----------|------| | Qwen 2.5 14B Q4 | 45 tps | **75~95 tps** | DGX Spark **1.8배** | | Llama 3.1 70B Q4 | **실행 불가** | **35~45 tps** | DGX Spark 승 | | Qwen3 32B Q4 | **실행 불가** (VRAM 초과) | 50~65 tps | DGX Spark 승 | ### 대형 모델 (70B+): DGX Spark만 실행 가능 | 모델 | RTX 4090 | DGX Spark | 비고 | |------|----------|-----------|------| | Llama 3.1 70B FP16 | **불가** (140GB 필요) | **15~20 tps** | DGX Spark 유일 | | Llama 3.1 70B Q4 | **불가** (35GB 필요) | **35~45 tps** | | | Qwen3 235B (듀얼) | **불가** | **11.73 tps** | 2대 연결 | ### NVIDIA 공식 벤치마크 (NVFP4, TRT-LLM) | 모델 | 프롬프트 처리 | 토큰 생성 | |------|--------------|-----------| | Llama 3.1 8B NVFP4 | 10,257 tok/s | **38.65 tok/s** | | Qwen3 14B NVFP4 | 5,929 tok/s | **22.71 tok/s** | | GPT-OSS-20B MXFP4 | 3,670 tok/s | **28.74 tok/s** | | GPT-OSS-120B MXFP4 | 1,725 tok/s | **55.37 tok/s** | | Qwen3 235B (듀얼) | 23,477 tok/s | **11.73 tok/s** | --- ## 4. DGX Spark가 진짜 유용한 경우 ### ✅ DGX Spark가 승리하는 시나리오 **1. 70B+ 모델 실행** - RTX 4090은 70B 모델을 단독으로 돌릴 수 없습니다 - DGX Spark는 양자화 없이 FP16으로 70B 모델을 구동합니다 - "돌아가느냐 마느냐"의 문제이므로 대역폭은 중요하지 않습니다 **2. 파인튜닝** - QLoRA로 70B 모델을 파인튜닝할 때 128GB 메모리가 필수적입니다 - NVIDIA 공식 벤치마크: 70B QLoRA 파인튜닝 시 5,079 tok/s **3. 대용량 컨텍스트 + 대형 모델** - 70B 모델 + 128K 컨텍스트 = KV 캐시에만 16~30GB 소모 - 128GB 통합 메모리에서 여유롭게 처리 **4. 완전한 폐쇄망 보안** - 128GB로 대형 모델을 클라우드 없이 로컬에서 구동 - 금융, 의료, 국방 등 민감 데이터 처리에 최적 **5. 멀티모달 워크로드** - CPU + GPU가 같은 메모리를 공유하므로 이미지/비디오 처리 시 복사 불필요 ### ❌ RTX 4090/5090이 승리하는 시나리오 **1. 8B 이하 소형 모델** - RTX 4090이 **3.3배 빠름** (116 vs 35 tps) - 8B 모델은 24GB VRAM 안에 충분히 들어감 **2. 빠른 토큰 생성이 필요한 작업** - 챗봇, 코딩 어시스턴트 등 응답 속도가 중요한 경우 - RTX 5090은 **1,792 GB/s**로 DGX Spark보다 **6.6배 빠름** **3. 비용 효율** - RTX 4090 $1,599 vs DGX Spark $3,999 - 8B 모델 기준: 2.5배 저렴하면서 3.3배 빠름 **4. 게임 겸용** - RTX 4090은 게임 + AI 겸용 가능 - DGX Spark는 AI 전용 (ARM 리눅스) --- ## 5. 어떤 장비를 선택해야 하는가 ### 결정표 | 상황 | 추천 장비 | 이유 | |------|----------|------| | **8B 이하 로컬 AI** | RTX 4090/5090 | 3배 빠르고 2.5배 저렴 | | **70B 모델 구동** | DGX Spark | 유일한 선택지 | | **70B 파인튜닝** | DGX Spark | 128GB 메모리 필수 | | **预算 100만원 이하** | Mac Mini M4 24GB | 8B 42~52 TPS | | **预算 180만원** | Mac Mini M4 Pro 48GB | 32B 12~18 TPS | | **预算 400만원+** | DGX Spark | 70B+ FP16 실행 | ### 수학적 기준 ``` 모델 크기(GB) > VRAM(GB) → DGX Spark 승 (실행 자체가 가능한 문제) 모델 크기(GB) < VRAM(GB) → RTX 4090 승 (대역폭으로 속도 결정) ``` --- ## 6. 결론 DGX Spark의 **128GB 통합 메모리는 "넓은 도로"**이고, RTX 4090의 **1,008 GB/s GDDR6X는 "고속도로"**입니다. - **128GB로 70B 모델을 돌릴 수 있다**는 것은 혁신적입니다 - 하지만 **8B 모델의 속도는 RTX 4090이 3배 빠릅니다** - "VRAM이 많으면 빠르다"는 착각은 **메모리 대역폭**이라는 병목을 간과한 것 **핵심 교훈:** 추론 속도는 VRAM 용량이 아니라 **메모리 대역폭**이 결정합니다. DGX Spark는 "더 큰 모델을 실행할 수 있는 장비"이지, "더 빠른 장비"는 아닙니다.