--- title: Mac mini M4 Pro vs RTX 4090 로컬 LLM 종단간 비교, UMA와 분리형 VRAM의 아키텍처 승부 date: 2026-09-23 time: 19:15 model: deepseek-v4-flash category: knowhow summary: 같은 모델을 올려도 Mac mini와 RTX 4090은 정반대 방향으로 빠르고 느리다. 통합 메모리와 분리형 VRAM의 아키텍처 차이, 메모리 대역폭이 토큰 속도를 결정하는 원리, 8B급과 27B~70B급에서의 실측 수치, 용도별 선택 기준을 정리했다. tags: Mac-mini, M4-Pro, RTX-4090, UMA, VRAM, 대역폭, 로컬-LLM, MLX, CUDA --- ## 결론부터 8B급 중소형 모델은 RTX 4090이 2~3배 빠르다. 27B~70B급 대형 모델은 Mac mini가 안정적으로 돌리고 RTX 4090은 메모리 에러가 난다. 빠른 것과 담을 수 있는 것은 다른 문제다. 이 글은 그 경계선을 숫자로 그어본다. ## 1. 아키텍처의 근본 차이, UMA vs 분리형 VRAM 두 진영은 메모리를 바라보는 철학부터 다르다. ``` [Apple Silicon UMA 구조] [ 통합 메모리 (CPU+GPU+NPU 공유) ] ── 공유 대역폭 ── [ CPU / GPU / NPU ] * 모델 전체가 메모리에 상주, 시스템 전체가 VRAM처럼 작동 [NVIDIA 분리형 구조] [ 시스템 RAM ] ── PCIe 병목 ── [ VRAM ] ── [ Tensor 코어 ] * VRAM을 넘어가면 PCIe 오프로딩 발생, 속도 붕괴 ``` | 항목 | Mac mini (M4 / M4 Pro) | NVIDIA Discrete GPU | |------|------------------------|---------------------| | 구조 | UMA, CPU와 GPU가 하나의 메모리 풀 공유 | VRAM과 시스템 RAM 물리 분리, PCIe로 이동 | | 메모리 주문 | 24GB, 48GB, 64GB로 주문하면 거의 전역을 GPU가 활용 | VRAM 용량 고정 (4090은 24GB) | | 초과 시 | 느려지지만 끝까지 동작 | PCIe 오프로딩으로 0.2~1 t/s 붕괴, 실사용 불가 | | 학습 | 파인튜닝과 학습은 제약 큼 | CUDA 환경이라 학습과 파인튜닝의 표준 | ## 2. 토큰 속도를 결정하는 단 하나의 변수, 메모리 대역폭 LLM 추론은 매 토큰마다 모델 가중치 전체를 메모리에서 읽는다. 그래서 이론 속도는 단순하다. ``` 이론 TPS ≈ 메모리 대역폭 / 모델 크기 ``` | 하드웨어 | 메모리 대역폭 | 출처 기준 | |----------|---------------|-----------| | Mac mini M4 | 약 100 GB/s | Apple 공개 스펙 계열 | | Mac mini M4 Pro | 273~300 GB/s | mljourney 등 2026년 정리 | | RTX 4090 | 1,008 GB/s | GDDR6X 384-bit | | RTX 3060 12GB | 360 GB/s | GDDR6 192-bit | 대역폭 비율이 그대로 속도 비율이 된다. 8B Q4(약 5GB) 모델이라면 4090은 M4 Pro의 3배 이상을 낼 수 있는 구조다. 반대로 아무리 빨라도 VRAM에 안 들어가면 소용없다. ## 3. 실측 수치, 중소형 모델 (8B~14B) 모델이 양쪽 메모리에 모두 들어가는 체급에서는 대역폭이 곧 정의다. | 모델 (Q4_K_M) | Mac mini M4 (16~24GB) | Mac mini M4 Pro | RTX 4090 24GB | |---------------|----------------------|-----------------|---------------| | 7B~8B급 | 20~52 t/s (Ollama, llama.cpp, MLX 계열 실측 범위) | 70~90 t/s | 90~135 t/s | | 13B~14B급 | 24GB 모델에서 가능, 16GB는 여유 없음 | 30~40 t/s | 55~78 t/s | 정리하면 중소형은 4090의 압승이다. 실시간 채팅과 코딩 자동완성처럼 체감 속도가 중요한 용도에서는 같은 모델을 올려도 2~3배 차이가 난다. Mac mini M4 기본형(16GB)은 7B급이 sweet spot이고, 13B급을 보려면 24GB 이상으로 가야 한다. ## 4. 실측 수치, 대형 모델 (27B~70B) 모델이 20GB를 넘어가면 경기장이 뒤집힌다. | 모델 (Q4_K_M) | Mac mini M4 Pro 48~64GB | RTX 4090 24GB | RTX 4060 8GB | |---------------|------------------------|---------------|--------------| | 27B급 (약 17GB) | 15~22 t/s 안정 서빙 | 40 t/s대 가능하나 여유 없음 | 0.2~1 t/s 붕괴 | | 32B급 (약 20GB) | 12~18 t/s | 경계선, 컨텍스트 늘리면 위험 | 실사용 불가 | | 70B급 (약 40GB) | Q4 기준 약 5 t/s로 동작 | Q2_K로 깎아야 가능, 사실상 메모리 에러 | 불가 | 이 체급부터는 맥 미니의 독무대다. 8~12GB 대중 GPU는 가중치 대부분이 시스템 RAM으로 튕겨 나가며 랙이 걸려 죽는다. 맥 미니는 대역폭이 낮아 느리지만 끊김 없이 끝까지 연산한다. 담을 수 있느냐 없느냐의 문제라 속도는 그다음이다. ## 5. 소프트웨어 스택 차이 | 항목 | Apple Silicon | NVIDIA | |------|---------------|--------| | 표준 스택 | MLX, llama.cpp (Metal, MPS) | CUDA, TensorRT, vLLM | | MLX의 강점 | Apple 전용 최적화, 메모리 효율이 좋아 통합 메모리와 궁합이 좋음 | 해당 없음 | | CUDA의 강점 | 해당 없음 | 전 세계 AI 생태계의 표준, 학습과 서빙 자료가 압도적 | | 주의점 | 새 아키텍처 모델은 llama.cpp 지원이 늦을 수 있음 | ROCm(AMD)은 논외, NVIDIA가 사실상 유일 선택지 | 실제 사례가 있다. Spark-X2.5-4B(1M 컨텍스트 표방) 모델은 llama.cpp와 Ollama가 아키텍처를 인식하지 못해 로컬에서 구동 자체가 안 됐다(운영자 환경 실측 기준). 대형 컨텍스트 모델을 노린다면 런타임 지원 여부를 먼저 확인해야 한다. 스펙표의 1M이 내 머신에서 열리는 1M은 아니다. ## 6. 돈으로 환산한 VRAM 확보 비용 | 구성 | 확보되는 GPU 활용 메모리 | 가격대 (2026년 국내 기준) | |------|--------------------------|---------------------------| | Mac mini M4 24GB | 약 24GB 통합 메모리 | 약 90~100만원 | | Mac mini M4 Pro 48GB | 약 48GB 통합 메모리 | 약 200만원대 | | RTX 4090 24GB 단품 | 24GB VRAM (본체 별도) | 약 300만원대 | | VRAM 48GB (NVIDIA) | 듀얼 GPU나 전문가 카드 필요 | 수백만원 돌파 | 같은 200만원이면 맥 쪽은 48GB를 통째로 쓰고, NVIDIA 쪽은 24GB 카드 한 장 값이다. 가성비의 방향이 정반대다. ## 7. 전력과 발열과 소음 | 항목 | Mac mini | RTX 4090 데스크톱 | |------|----------|-------------------| | 피크 전력 | 60~100W 미만 | 시스템 전체 600~800W | | 소음 | 무소음에 가까움 | 풀로드 시 팬 소음 뚜렷 | | 24시간 상시 구동 | 전기료 부담이 적어 에이전트 서버로 적합 | 전기료와 발열이 부담 | 책상 위 무소음 상시 서버가 목적이면 맥 미니가 유리하다. 전기세 걱정 없이 에이전트를 24시간 돌리는 용도와 궁합이 좋다. ## 8. 최종 선택 가이드 NVIDIA 데스크톱 워크스테이션으로 가야 하는 경우다. - 8B~14B급 가벼운 모델 위주로 100 t/s 이상의 실시간 채팅과 대규모 배치 파이프라인을 돌릴 때 - 로컬 파인튜닝과 학습까지 파이썬으로 직접 제어할 때 (학습은 CUDA가 사실상 강제) - 게임과 영상 작업까지 한 머신에서 겸할 때 Mac mini(M4 Pro)로 가야 하는 경우다. - Qwen 27B급과 70B 양자화 모델을 터지지 않게 상시 구동하고 싶을 때 - 긴 컨텍스트 에이전트와 RAG 서버를 조용히 24시간 돌리고 싶을 때 - 전기세와 소음과 발열 스트레스를 피하고 싶을 때 한 줄로 줄이면 이렇다. 속도가 목적이면 4090, 담는 것이 목적이면 맥 미니 M4 Pro다.