LM 스튜디오 + Llama 설치 완벽 가이드 — 초보자를 위한 로컬 AI 첫걸음
LM 스튜디오 + Llama 설치 완벽 가이드 — 초보자를 위한 로컬 AI 첫걸음
> "요즘 하도 로컬 AI(내 컴퓨터에서 직접 돌리는 AI)가 대세라고 하길래, 핫하다는 Qwen이나 Llama 모델을 써보려고 했다. 결론부터 말하면, 모델은 그 자체로 실행할 수 없는 '뇌(데이터)'일 뿐이다. 이 뇌를 장착하여 구동하는 프로그램이 바로 LM 스튜디오다."
밤새 삽질하고 시간 버리는 분들이 없도록, 설치부터 첫 대화까지 세세하게 알려주겠다.
0. 로컬 AI의 기본 공식 (먼저 이해하기)
로컬 AI = 몸통(실행 프로그램) + 뇌(AI 모델 파일)
| 구성요소 | 역할 | 비유 |
|---|---|---|
| LM 스튜디오 (몸통) | AI 모델을 읽고 실행하는 프로그램 | 자동차 차체 |
| Llama / Qwen (뇌) | AI의 지식 데이터 파일 | 엔진 |
> 엔진(모델)만 가지고는 차가 안 움직인다. 차체(LM 스튜디오)에 엔진을 물려야 달린다.
1단계: 몸통 설치하기 (LM Studio 다운로드)
1-1. 공식 사이트 접속
브라우저를 열고 다음 주소를 입력한다:
https://lmstudio.ai
> 참고: "LM Studio"로 검색하면 여러 사이트가 나오는데, 반드시 lmstudio.ai가 맞는지 확인한다.
1-2. 운영체제에 맞는 설치 파일 다운로드
사이트에 접속하면 화면 중앙에 큰 다운로드 버튼이 보인다.
| 운영체제 | 파일 형식 | 클릭할 버튼 |
|---|---|---|
| Windows (10/11) | .exe | "Download for Windows" |
| macOS (Intel/Apple Silicon) | .dmg | "Download for macOS" |
| Linux (Ubuntu 등) | .AppImage | "Download for Linux" |
Windows 사용자 참고:
- 파일명 보통:
LM-Studio-0.x.x.exe정도 - 파일 크기: 약 400~600MB (프로그램 자체가 꽤 큼)
- 다운로드 시간: 인터넷 속도에 따라 1~5분
1-3. 설치 진행
Windows:
- 다운로드된
.exe파일을 더블클릭한다 - "이 앱이 디바이스의 변경 사항을 허용하시겠습니까?" → [예] 클릭
- 설치 마법사가 뜨면 기본 설정(폴더 선택 등) 그대로 [Next] → [Install]
- 1~2분 정도 설치 진행 → [Finish] 클릭
macOS:
- 다운로드된
.dmg파일을 더블클릭한다 - LM Studio 아이콘이 설치 마법사로 드래그 → Applications 폴더에 복사
- Applications에서 LM Studio 실행
- "이 앱은 인증되지 않은 개발자가 배포했습니다" 경고가 뜰 수 있음 → [설정] > [보안 및 개인 정보 보호]에서 [무시하고 열기] 클릭
Linux:
chmod +x LM-Studio-*.AppImage
./LM-Studio-*.AppImage
1-4. 첫 실행 온보딩
LM Studio를 처음 실행하면 초기 설정 화면이 나온다:
- 테마 선택: 다크(Dark) / 라이트(Light) — 다크 추천
- 사용 목적 선택: "I want to run models locally" 선택
- 모델 저장 경로 선택: 기본값 그대로 추천 (드라이브 여유 있는 곳)
- 완료: [Get Started] 클릭
> 모델 파일은 상당히 크다 (3~8GB). C드라이브 용량이 부족하면 D드라이브를 추천.
2단계: 알맹이 채우기 (Llama / Qwen 모델 다운로드)
2-1. 검색창으로 모델 찾기
LM 스튜디오 왼쪽 메뉴 바에서 돋보기 모양 아이콘(🔍 Search)을 클릭한다.
상단 검색창에 다음 중 하나를 입력한다:
| 원하는 AI | 입력할 검색어 |
|---|---|
| Meta의 Llama | llama 또는 llama 3 |
| Alibaba의 Qwen | qwen 또는 qwen 3 |
| Google의 Gemma | gemma |
| Microsoft의 Phi | phi |
2-2. 검색 결과 이해하기
검색 결과가 나타나면 여러 모델이 보인다. 여기서 중요한 것은 파일명의 약어를 아는 것이다.
파일명 읽는 법:
Qwen3-8B-Q4_K_M.gguf
│ │ │ │ │
│ │ │ │ └── 파일 형식 (GGUF = 로컬 AI 표준)
│ │ │ └── 양자화 방법 (Q4_K_M = 가장 무난)
│ │ └── 파라미터 수 (8B = 80억 개)
│ └── 모델명
└── 제조사명
초보자용 양자화(Quantization) 선택표:
| 약어 | 의미 | 파일 크기 (8B 기준) | 추천 대상 |
|---|---|---|---|
| Q4_K_M | 4비트, 중간 품질 | ~4.9GB | 대부분의 사용자 (추천) |
| Q5_K_M | 5비트, 약간 더 좋은 품질 | ~5.7GB | VRAM 12GB 이상 |
| Q6_K | 6비트, 높은 품질 | ~6.6GB | VRAM 16GB 이상 |
| Q8_0 | 8비트, 거의 무손실 | ~8.5GB | VRAM 24GB 이상 |
| Q3_K_M | 3비트, 빠르지만 품질↓ | ~3.5GB | VRAM 8GB (한계 상황) |
> 모르겠으면 Q4_K_M을 골라라. 파일명에 Q4_K_M이 들어간 것을 클릭한다.
2-3. 내 컴퓨터 사양 확인하고 모델 고르기
그래픽카드 메모리(VRAM) 확인 방법:
Windows:
- 바탕화면 빈 곳에 마우스 우클릭 → [ NVIDIA 제어판 ] (NVIDIA 그래픽카드인 경우)
- 왼쪽 메뉴 [ 시스템 정보 ] 클릭
- "비디오 메모리: XXXX MB" 확인
또는:
Ctrl + Shift + Esc→ 작업 관리자 열기- 상단 [성능] 탭 → [GPU 0]
- 오른쪽 "전용 GPU 메모리" 확인
VRAM별 추천 모델:
| VRAM | 추천 모델 | 추천 양자화 |
|---|---|---|
| 8GB | Llama 3.1 8B 또는 Qwen3 8B | Q4_K_M (~4.9GB) |
| 12GB | Qwen 2.5 14B 또는 Gemma 4 12B | Q4_K_M (~9GB) |
| 16GB | Qwen3 14B 또는 Llama 3.1 8B | Q6_K 또는 Q8_0 |
| 24GB | Qwen3 32B 또는 Gemma 4 31B | Q4_K_M (~19GB) |
> 8GB VRAM이면 Llama 3.1 8B Q4_K_M이 정답. 파일 크기 ~4.9GB로 안정적으로 돌아간다.
2-4. 모델 다운로드
- 원하는 모델 항목 클릭
- 오른쪽에 파란색 [Download] 버튼 클릭
- 다운로드 진행 상황이 상단에 표시됨
- 완료되면 [Downloaded] 또는 체크 표시로 변경
다운로드 시간 참고:
- 인터넷 100Mbps 기준: 8B Q4 (~5GB) → 약 7분
- 인터넷 500Mbps 기준: 8B Q4 (~5GB) → 약 1~2분
3단계: 채팅 시작하기 (AI 구동)
3-1. 채팅 창으로 이동
왼쪽 메뉴 바에서 말풍선 모양 아이콘(Chat)을 클릭한다.
3-2. 모델 로드 (가장 중요!)
화면 맨 위를 보면 [Select a model to load]라는 드롭다운 메뉴가 있다.
- 드롭다운 클릭
- 방금 다운로드한 모델 선택 (예:
Qwen3-8B-Q4_K_M.gguf) - 모델이 로드되기 시작한다 (하단에 진행 바 표시)
- 로드 완료되면 "Model loaded" 또는 "Ready" 표시
> 첫 로드 시 RAM/VRAM에서 데이터를 읽어오므로 10~30초 정도 걸린다. 두 번째부터는 훨씬 빠르다.
3-3. 첫 대화
하단 채팅창에 아무 말이나 입력한다:
안녕! 너는 누구야?
또는
Python으로 fibonacci 함수를 짜줘
인라인 응답 옵션 (선택사항):
채팅창 옆에 설정 항목들이 있다:
| 설정 | 의미 | 추천 |
|---|---|---|
| Temperature | 답변의 창의성 (0=정확, 1=창의적) | 0.7 |
| Max Tokens | 최대 출력 길이 | 2048 |
| Context Length | 한 번에 기억하는 토큰 수 | 4096 (기본) |
> 초보자는 Temperature 0.7, Context 4096으로 두면 된다.
3-4. 오프라인에서도 작동한다
모델이 한 번 로드되면 인터넷이 끊겨도 완벽하게 작동한다. 모든 연산이 내 컴퓨터에서 일어나기 때문이다.
인터넷 연결: 외부 서버로 데이터 전송 → API 비용 발생
로컬 AI: 내 컴퓨터에서만 처리 → 비용 0원, 개인정보 안전
보충: 자주 하는 실수와 해결법
실수 1: "모델 파일을 더블클릭했다"
모델 파일(.gguf)은 더블클릭해도 아무 일도 안 일어난다. 반드시 LM 스튜디오 안에서 다운로드하고 실행해야 한다.
실수 2: "VRAM보다 큰 모델을 골랐다"
8GB VRAM에 14B 모델(Q4로 약 9GB)을 올리면:
- 증상: 매우 느리거나 아예 안 돌아감
- 해결: VRAM에 맞는 작은 모델로 교체. 또는 CPU 오프로딩 기능 사용 (LM 스튜디오 설정에서 활성화 가능하나 속도 느려짐)
실수 3: "ollama와 LM 스튜디오를 동시에 쓴다"
둘 다 같은 GPU를 사용하므로 충돌할 수 있다. 하나만 켜고 쓰는 것이 좋다.
실수 4: "영어로만 대화한다"
Llama나 Qwen 모두 한국어를 지원한다. 한국어로 질문해도 한국어로 답변한다.
요약: 3단계 정리
1단계: lmstudio.ai 접속 → 설치 파일 다운로드 → 설치
2단계: LM 스튜디오 검색창 → 모델 검색 → Q4_K_M 선택 → 다운로드
3단계: 채팅 창 → 모델 로드 → 대화 시작
> "몸통(LM 스튜디오)을 깔고, 그 안에서 알맹이(Llama)를 받는다." > 이 두 가지면 끝이다. 인터넷도, API 키도, 비용도 필요 없다.
참고: 더 나아가고 싶다면
| 단계 | 도구 | 설명 |
|---|---|---|
| CLI 사용 | Ollama | 터미널에서 ollama run llama3로 바로 실행 |
| API 서버 | LM Studio 서버 모드 | localhost:1234로 API 제공, 다른 프로그램에서 호출 가능 |
| 고급 설정 | llama.cpp | 소스에서 직접 컴파일, 옵션 자유도 최대 |
| 이미지 생성 | Stable Diffusion WebUI | 로컬 AI의 또 다른 세계 |
관련 글: