--- title: 에이전트는 지식의 양이 아니라 로직과 규칙으로 일한다 date: 2026-09-25 model: muse-spark category: knowhow summary: 유료 API를 깡통으로 돌려보고 깨달은 것. 에이전트 성능은 지식이 아니라 추론 루프, 스키마, 스킬 규칙에서 나온다. tags: agent, ReAct, CoT, Toolformer, Gorilla, 스키마, 스킬 --- 처음엔 착각했다. 유료 API 에이전트 모델들은 모든 스킬과 웹검색을 스스로 알아서 하는 줄 알았다. 그래서 그야말로 깡통으로 돌렸다. 아무런 스키마도 없이 질문만 던졌는데 결과에 깜짝 놀랐다. 할 수 있는 게 아무것도 없었다. 비싼 유료 모델이 그저 성능 좋은 로컬 모델, 그 이상 이하도 아니었다. 그래서 지난주 그 유료 API 모델에 같은 질문을 세 가지 방식으로 던져봤다. 질문은 이것 하나다. BFCL에서 함수 호출 잘하는 오픈모델 두 개와 특징을 표로 정리해줘. 첫 번째가 바로 그 깡통 실행이었다. 그냥 물으니 모델은 막힘없이 답했지만 두 모델 이름 중 하나가 옛날 것이었고 버전 숫자를 지어냈다. 지식으로만 답하니 그럴 수밖에 없다. 학습이 끝난 뒤 세상은 바뀌는데 모델은 멈춰 있기 때문이다. 두 번째는 추론 규칙만 바꿨다. 단계별로 생각하고 JSON 스키마로 답하라고 했다. ``` 생각-행동-관찰 순서로 풀어라. 모르면 모른다고 쓰고 search 도구를 써라. 최종 답은 {"model": "...", "feature": "...", "limit": "..."} 배열로만 내라. ``` 같은 유료 모델인데 답이 달라졌다. 지어내기 전에 멈칫하고 검색이 필요하다고 적었다. 구조가 생기니 빈틈이 보였다. 나중에 알았는데 2022년에 나온 생각 사슬 실험도 같은 얘기를 하더라. 세 번째는 스킬까지 줬다. 웹 검색과 함수 호출 스키마를 열어주고 ReAct 루프를 돌렸다. 생각, 행동(search), 관찰, 다시 생각. 이번에는 최신 BFCL 페이지까지 가서 모델명과 특징을 가져와 표를 채웠다. 모델은 그대로인데 결과물은 깡통 실행 때보다 훨씬 쓸만했다. 이 세 번의 테스트가 이 글의 결론이다. 요즘 에이전트들이 멋진 이유는 더 많이 외워서가 아니다. 어떻게 추론하고, 어떤 스키마로 응답하고, 어떤 스킬을 언제 쓰는지가 성능을 가른다. 지식의 양과 비례하는 게 아니라 로직과 스킬, 스키마, 규칙이 결합했을 때 비로소 빛을 발한다. 이제는 학습시킬 새 내용도, 무한한 새 정보도 없기 때문이다. 나중에 찾아보니 내가 느낀 게 이미 몇 년 전부터 실험으로 나와 있더라. ## 1. 답 내는 규칙을 바꾸니 답이 바뀌더라 내가 두 번째 테스트에서 한 게 바로 이거다. 중간 생각을 쓰게 했더니 정답률이 올랐다. 이걸 먼저 실험한 사람들이 있다. PaLM 540B에 예시 8개만 주고 생각 사슬을 쓰게 했더니 수학 문장제에서 파인튜닝된 큰 조합까지 넘고 당시 최고를 찍었다. 산술, 상식, 기호 추론에서 다 같았다. 모델을 키운 게 아니라 답 내는 규칙을 바꾼 거다. ## 2. 생각하고 행동하고 관찰하고, 이 루프가 환각을 잡더라 세 번째 테스트에서 돌린 생각-행동-관찰 루프, 이 이름이 ReAct더라. 추론만 하면 헛소리를 만들고, 행동만 하면 계획을 잃는다. 둘을 엮은 거다. 직접 해보니 알겠더라. 검색을 엮으니 지어내기가 줄었다. 남들도 같은 결과를 냈다. HotpotQA나 사실 검증에서 검색을 엮은 쪽이 환각과 오류 전파가 줄었고, ALFWorld에서는 기존보다 성공률이 34%p, WebShop에서는 10%p 앞섰다. 예시는 1~2개만 주고서다. | 벤치마크 | ReAct 효과 | |---|---| | HotpotQA / FEVER | 외부 검색으로 환각·오류전파 감소 | | ALFWorld | 기존 대비 +34%p 성공률 | | WebShop | 기존 대비 +10%p 성공률 | 이 루프를 돌려보니 내가 세 번째 테스트에서 본 장면 그대로더라. ## 3. 작은 애가 도구를 들면 큰 애를 이기더라 이게 제일 충격이었다. 6.7B짜리 작은 모델에 계산기, 검색, 번역, 달력을 스스로 쓰게 했더니 175B짜리를 앞선 구간이 있다. 사람이 언제 쓰라고 정해준 게 아니라 데모 몇 개만 보고 언제·무엇을·어떻게 호출할지를 스스로 익힌 거다. API 호출 전용으로 키운 7B짜리 이야기도 같다. 문서 검색기를 붙이니 GPT-4보다 API 기능 정확도가 높고 헛소리가 적었다. 문서가 바뀌어도 검색 덕에 적응했다. 결국 지식량이 아니라 인자를 얼마나 정확히 넣고 호출 규칙을 지키느냐가 승부처더라. ## 4. 학습시킬 새 내용이 진짜 없더라 공개된 인간 텍스트가 한 300조 토큰쯤 된다고 한다. 90% 구간으로 잡으면 100~1000T. 지금 추세면 2026~2032년, 한가운데가 2028년에 학습 데이터셋이 그 재고 전체랑 맞먹는단다. 오래 학습시킬수록 더 빨라지고, 좋은 데이터는 그보다 먼저 바닥난다는 얘기도 있다. 그래서 정보에도 한계가 있다는 말을 실감했다. 텍스트가 주력인 한 크기만 키워서 밀어붙이긴 어렵다. 남는 길은 합성 데이터, 데이터 많은 도메인에서 옮겨오기, 데이터를 아껴 쓰는 법. 전부 로직과 규칙의 영역이다. ## 5. 그래서 남는 것은 스키마와 스킬이다 최신 정보는 외워서 해결되지 않는다. 세 번째 테스트처럼 검색하고 함수로 호출하면 된다. 여기서 스키마가 중요하다. 어떤 함수에 어떤 인자로 답할지 정해져 있어야 기계가 실행한다. 함수 호출 잘하는지 따로 재는 리더보드가 있는 이유다. 내 체감도 같다. 큰 모델보다 작은 모델에 좋은 루프와 좋은 스키마를 얹은 쪽이 일을 끝낸다. 에이전트는 도서관이 아니라 작업자다. 도서관 크기가 아니라 작업 순서와 도구 사용법이 결과를 낸다. ## 정리 | 내가 본 장면 | 한 줄로 | |---|---| | 답 내는 규칙을 바꾸니 답이 바뀌더라 | 생각 쓰게 했더니 큰 조합까지 넘긴 경우도 있다 | | 생각-행동-관찰 루프가 지어내기를 줄이더라 | ALFWorld +34%p, WebShop +10%p 본 구간도 있다 | | 작은 애가 도구를 들면 큰 애를 이기더라 | 6.7B가 175B를, 7B가 큰 모델을 앞선 구간 존재 | | 학습시킬 새 내용은 한계가 있더라 | 300T 재고, 2026~2032 고갈 전망이 있다 | | 최신성은 검색·호출로 메우더라 | 스키마·스킬이 실행력을 결정 | 모델이 멋진 게 아니라, 모델을 쓰는 로직이 멋지다. 나는 그래서 파라미터보다 프롬프트 루프, 스키마, 스킬 정리에 시간을 쓴다. ## 읽어본 글 글 쓰면서 겹쳐본 것들. 본문 순서대로가 아니라 생각 정리하다 닿은 순서다. 1. Wei et al. 2022. Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. NeurIPS 2022. arXiv:2201.11903 2. Yao et al. 2023. ReAct: Synergizing Reasoning and Acting in Language Models. ICLR 2023. arXiv:2210.03629 3. Schick et al. 2023. Toolformer: Language Models Can Teach Themselves to Use Tools. NeurIPS 2023. arXiv:2302.04761 4. Patil et al. 2024. Gorilla: Large Language Model Connected with Massive APIs. NeurIPS 2024. arXiv:2305.15334 5. Villalobos et al. 2024. Will we run out of data? Limits of LLM scaling based on human-generated data. ICML 2024. arXiv:2211.04325