8GB VRAM의 반란 — 로컬 AI는 개인비서가 될 수 있을까?
결론부터 말하면, 8GB VRAM만으로도 로컬 AI는 이미 꽤 쓸만한 개인비서가 될 수 있다. 다만 그건 벤치마크 점수가 아니라 실제 작업 수행률로 측정해야 한다. 이 글은 그 측정을 지금부터 시작하겠다는宣言이다.
AI 열풍이 시작된 지 꽤 많은 시간이 지났다.
ChatGPT, Gemini, Claude 같은 클라우드 AI는 이제 많은 사람들에게 익숙한 서비스가 됐다.
하지만 한 가지 이상한 점이 있다.
내 주변에서 로컬 AI를 사용하는 사람은 거의 찾아볼 수 없다.
AI를 사용하는 사람은 많다. 하지만 자신의 컴퓨터에 AI 모델을 직접 설치하고 사용하는 사람은 아직 많지 않다.
어쩌면 당연한 일이다.
클라우드 AI는 웹사이트에 접속해서 질문만 하면 된다.
반면 로컬 AI를 사용하려면 Ollama나 LM Studio 같은 프로그램을 알아야 하고, 모델을 선택해야 하며, VRAM과 양자화 같은 개념도 알아야 한다.
일반 사용자 입장에서는 굳이 어려운 길을 선택할 이유가 없다.
그렇다면 로컬 AI는 일부 개발자와 AI 마니아들만 사용하는 기술로 끝나는 것일까?
나는 그렇게 생각하지 않는다.
불과 1년 사이에 완전히 달라졌다
내가 로컬 AI를 처음 적극적으로 사용하기 시작했을 때만 해도 작은 모델에게 에이전트 작업을 맡기는 것은 쉽지 않았다.
특히 VRAM 8GB 수준의 GPU에서 모델이 단순히 질문에 대답하는 것을 넘어,
- 파일을 읽고
- 필요한 도구를 선택하고
- 명령어를 실행하고
- 실행 결과를 확인하고
- 오류가 발생하면 다시 시도하고
- 여러 단계의 작업을 수행하는 것
은 상당히 어려운 일이었다.
그런데 지금은 상황이 완전히 달라졌다.
작은 로컬 모델에서도 툴 사용과 에이전트 작업이 실제로 가능해지고 있다.
모델의 크기만 커진 것이 아니다.
작은 모델의 도구 사용 능력과 지시 이해 능력 자체가 빠르게 발전하고 있다.
그리고 앞으로 나올 모델들은 지금보다 더 좋아질 것이다.
그래서 나는 로컬 AI의 다음 단계가 '개인비서'라고 생각한다
지금 우리가 AI를 사용하는 방식은 대부분 이렇다.
내가 AI에게 질문한다. AI가 답한다.
하지만 로컬 AI가 발전하면 모습이 달라질 수 있다.
내 컴퓨터에 항상 존재하는 AI가 있다.
내 파일을 알고,
내가 사용하는 프로그램을 알고,
내 작업 방식을 알고,
필요하면 인터넷을 검색하고,
파일을 수정하고,
프로그램을 실행하고,
반복적인 작업을 대신한다.
즉 단순한 챗봇이 아니라 개인비서가 되는 것이다.
그리고 개인비서라는 관점에서 보면 작은 로컬 모델의 가치가 상당히 커진다.
거대한 모델을 사용할 수 있는 고가의 GPU가 없어도 된다.
일반 사용자가 가지고 있는 PC에서 충분히 동작한다면 이야기가 달라진다.
그래서 중요한 것은 '가장 강력한 AI'가 아니다
AI 모델을 비교하는 글을 찾아보면 대부분 더 큰 모델, 더 높은 벤치마크 점수에 집중한다.
하지만 일반 사용자에게 중요한 질문은 조금 다르다.
내 컴퓨터에서 실제로 사용할 수 있는 AI는 무엇인가?
예를 들어 48GB 또는 80GB VRAM을 요구하는 모델이 아무리 뛰어나도 일반적인 PC 사용자에게는 현실적인 선택이 아닐 수 있다.
반대로 8GB VRAM 정도의 접근 가능한 하드웨어에서 상당히 많은 작업을 수행할 수 있는 작은 모델이라면 이야기가 달라진다.
그래서 앞으로의 테스트에서는 일반 사용자가 실제로 접근할 수 있는 하드웨어를 중요하게 생각하려 한다.
우리가 측정하려는 것은 모델의 크기가 아니다
앞으로 cursorai.co.kr에서는 일반적인 모델 벤치마크와 조금 다른 방식으로 AI 에이전트를 테스트하려 한다.
예를 들어 하나의 모델에게 30개의 실제 작업을 시켜본다.
기본적인 작업
- 문서 작성
- 요약
- 번역
- 파일 검색
- 파일 수정
- 코드 작성
에이전트 작업
- 프로그램 실행
- 명령어 실행
- 여러 파일 수정
- 오류 수정
- 웹 검색
- 도구 선택
- 여러 단계 작업
그리고 단순히 정답만 보는 것이 아니라,
- 작업 성공 여부
- 첫 번째 시도 성공 여부
- 잘못된 행동 횟수
- 재시도 횟수
- 오류 복구 여부
- 작업을 끝까지 수행하는지
- 작업을 포기하는지
- 작업에 걸린 시간
등을 기록하려 한다.
왜 이런 테스트가 필요한가?
현재 로컬 AI는 아직 일반 사용자에게 익숙한 기술이 아니다.
하지만 이것이 영원히 계속될 것이라고 생각하지 않는다.
하드웨어는 계속 좋아지고 있고,
작은 모델의 성능은 빠르게 올라가고 있으며,
모델을 실행하는 프로그램도 점점 쉬워지고 있다.
무엇보다 중요한 변화는 작은 모델도 에이전트가 되기 시작했다는 것이다.
만약 8GB VRAM에서도 개인비서 수준의 작업을 수행할 수 있는 모델이 계속 발전한다면, 로컬 AI의 의미는 지금과 완전히 달라질 수 있다.
그때는 사람들이
"로컬 AI를 써야 하나?"
라고 고민하는 것이 아니라,
"내 컴퓨터에 AI 하나 설치해볼까?"
라고 생각할 수도 있다.
그래서 지금부터 기록하려 한다
아직 로컬 AI는 대중적인 기술이라고 말하기 어렵다.
오히려 지금은 AI에 관심이 많은 사람들조차 로컬 모델을 직접 사용하지 않는 경우가 많다.
하지만 나는 지금이 오히려 기록을 시작하기 좋은 시점이라고 생각한다.
대중화된 다음을 기록하는 것이 아니라, 대중화되기 전부터 변화를 기록하는 것이다.
지금의 4B, 7B, 9B, 12B, 14B 모델들이
1년 뒤에는 어디까지 발전할까?
8GB VRAM에서 지금 할 수 있는 일이
1년 뒤에는 얼마나 달라질까?
그리고 로컬 AI가 정말 개인비서가 될 수 있을까?
그 답을 예측으로 결정하지 않고 실제 모델과 실제 하드웨어로 계속 측정해보려고 한다.
이것이 앞으로 cursorai.co.kr에서 기록하려는 로컬 AI 실사용 실험이다.
최고의 AI가 무엇인지 찾는 것이 아니다. 일반 사용자의 PC에서 실제로 쓸 수 있는 AI가 어디까지 왔는지를 기록하는 것이다. 그리고 그 끝에 정말로 로컬 AI가 우리의 개인비서가 될 수 있는지 확인해보려 한다.
AI Knowledge Hub
댓글 (1개)
결론부터: 측정 설계는 타당하지만, 1년 뒤 비교 가능성을 위해서는 반복 횟수와 temperature 고정, 실제 여유 VRAM 명시, 실패 유형 분리 세 가지를 규격에 넣어야 한다.