Hermes 에이전트 — 말로 지시하면 컴퓨터를 대신 조작한다
Hermes는 질문에 대답만 해주는 AI가 아니라, 사용자의 주문을 받아 실제 컴퓨터 작업을 수행하려는 오픈소스 에이전트다. 그리스 신화에서 신들의 메시지를 전하던 전령의 신 헤르메스에서 이름을 따왔다. 대화창에 말로 지시하면, 그 지시를 계획으로 나누고 도구를 조작해 결과물을 만들어내는 구조다. 이 글은 이 에이전트를 직접 설치해 로컬 환경에서 써본 정리다.
기존 AI와 무엇이 다른가
기존 대화형 AI와 Hermes의 차이는 예로 보면 쉽다.
제주도 여행 항공권 시간표를 물으면, 챗GPT 같은 AI는 정보를 찾아 텍스트로 알려주는 데 그친다. Hermes에게는 제주도 출장 일정을 말로 알리면, 내 일정을 확인하고, 최저가 항공권을 검색하고, 필요한 화면까지 준비하는 방식으로 진행한다. 즉 정보를 주는 가이드와 작업을 대행하는 비서의 차이다.
핵심은 네 가지
첫째, 도구를 직접 조작한다. 단순 글짓기가 아니라 웹 브라우저, 문서, 계산기 같은 소프트웨어를 실행하고 다룬다.
둘째, 스스로 계획을 세운다. 팀원에게 보낼 요약 메일처럼 여러 단계가 필요한 일을 맡기면, 파일 열기, 내용 요약, 메일 작성, 발송처럼 순서를 나누어 실행한다.
셋째, 오픈소스라 내 컴퓨터에 둘 수 있다. Nous Research가 공개한MIT 라이선스 프로젝트이고, GitHub의 NousResearch/hermes-agent 저장소에서 확인할 수 있다. 개인정보나 업무 데이터를 외부 서비스로 보내지 않고 로컬에서 돌리는 것이 가능하다.
넷째, 어떤 모델을 붙일지 고를 수 있다. Ollama 같은 로컬 모델을 연결해 과금 없이 구조를 익히거나 가벼운 작업을 해볼 수 있고, Claude, GPT 같은 유료 API 모델을 연결하면 실무 성격의 작업도 맡길 수 있다. 다만 로컬 모델은 개인 공부나 학습용에 가깝고, 아래 예시처럼 실제 일을 맡기려면 API 모델을 쓰는 편이 현실적이다.
"틀에 박힌 거부가 적다"는 점도 자주 언급된다. 특히 로컬 모델 환경이라, 상업 서비스에서 흔한 답변 거부가 상대적으로 적다는 뜻이다. 다만 이는 사용하는 모델의 성격에 따라 달라진다.
일상에서 이렇게 쓴다
아래 예시는 Claude, GPT 같은 유료 API 모델을 붙였을 때의 이야기다. 로컬 모델만으로는 기대만큼의 완성도가 나오기 어렵다.
중고 판매. 집에 안 쓰는 자전거를 중고 사이트에 팔려고 할 때, 시세를 확인하고 판매 글을 써주는 식의 지시가 가능하다.
병원 예약과 준비. 큰 병원 검진 예약을 앞두고, 예약 가능한 시간과 준비 사항을 확인해 표로 정리해 달라고 하면 된다.
여행 준비. 출국 전에 환율 정보와 필요한 서류, 기본 동선을 한 장짜리 목록으로 묶어 달라는 지시도 같은 맥락이다.
사진 정리. 스마트폰에 쌓인 사진을 연도별로 묶어 백업 폴더를 만들어주는 일도 가능하다.
결국 말로 지시만 하면, 그 지시를 컴퓨터 조작으로 옮기는 일꾼이라는 설명이 가장 간단하다.
직접 써본 소감
우리는 리눅스 환경에서 Hermes를 직접 설치해 봤다. 설치는 공식 스크립트로 진행했고, 데스크톱 앱과 터미널 인터페이스 두 가지 형태를 제공한다. 터미널에서 hermes 명령을 치면 대화가 시작되고, 데스크톱 앱은 별도 이름으로 실행되도록 설정할 수 있다.
로컬 모델 연결도 수월했다. Ollama에 모델을 준비하고, Hermes 설정에서 모델과 엔드포인트를 지정하면 된다. 우리가 쓴 환경에서는 4GB급 로컬 모델이 GPU에 올라가 1초 안팎의 응답을 냈고, 더 큰 모델은 하드웨어 사양에 따라 속도가 눈에 띄게 달라졌다.
다만 이 경험은 어디까지나 로컬 모델로 구조를 익히고 가벼운 작업을 해보기 위한 범위였다. 실제 일을 맡기려면 API 모델을 붙이는 쪽으로 가는 게 현실적이다.
실사용 시 주의할 점도 있다.
하나는 속도다. 로컬 모델이 느리면 "답을 안 한다"고 느낄 수 있다. 실제로 우리는 9GB급 모델에서 VRAM이 부족해 일부가 CPU로 밀리면서 응답이 크게 늦어진 경우가 있었다. 모델을 줄이거나 컨텍스트 길이를 줄이면 체감이 확실히 달라진다.
둘째는 설정이다. Hermes는 여러 참고 모델이나 보조 기능을 함께 쓸 수 있는 구조인데, 사용하지 않는 외부 모델 연결이 켜져 있으면 응답이 막히거나 지연될 수 있다. 시작할 때 어느 모델이 실제로 쓰이는지 확인하는 습관이 필요했다.
셋째는 입력 환경이다. 터미널에서 한글을 입력할 때 키보드 입력기 설정에 따라 엔터 처리가 달라지는 경우가 있었다. 이는 Hermes 자체 문제가 아니라 터미널과 입력기 조합의 문제지만, 처음 셋팅하는 사람에게 혼란을 줄 수 있다.
이 세 가지를 감안하면, Hermes는 "지시하면 컴퓨터를 대신 조작하는 일꾼"이라는 정의에 충실한 도구로 읽힌다. 다만 자동화가 끝까지 완벽하다는 뜻은 아니다. 중요한 작업은 결과를 확인하고, 속도와 설정은 사용 환경에 맞춰 조정하는 편이 낫다.
총평
Hermes는 대화형 AI의 연장선에 있되, 결과물이 텍스트가 아니라 작업 수행으로 이어진다는 점이 특징이다. 오픈소스이고 로컬 모델을 무료로 붙일 수 있어, 비용과 프라이버시를 신경 쓰는 사용자에게 어필한다.
기대치는 현실적으로 잡는 것이 좋다. 계획을 세우고 도구를 조작하는 틀은 갖추고 있지만, 얼마나 잘하느냐는 연결된 모델과 환경에 따라 달라진다. "말로 시키면 대신 해주는 일꾼"이라는 설명은 정확하다. 그 일꾼이 얼마나 손이 빠른지는 직접 붙여보고 판단할 일이다.
AI Knowledge Hub
댓글 (1개)
말로 지시하면 컴퓨터를 대신 조작한다니 흥미롭네요. 실제 사용해보니 어떤가요? 리소스 사용량이나 안정성 면에서 궁금합니다.