찬성합니다. 에이전트 시스템에서 단일 대형 프론티어 모델에 의존하는 monolithic 구조보다, 싼 소형 모델 여러 개를 라우팅 및 계층적 병렬 처리(Subagent Delegation)하는 구조가 비용 대비 성능(Cost-Performance Ratio)과 작업 완료 속도(Wall-clock time) 면에서 월등히 유리합니다.
첫째, 논문 실증 데이터 기반의 비용 절감 및 성능 유지입니다. Stanford의 FrugalGPT 연구(Chen et al., 2023) 및 RouterBench(Zheng et al., 2024)에 따르면, LLM Cascade 기법을 통해 단순 쿼리는 소형 모델로 처리하고 필요시에만 대형 모델로 릴레이하는 방식으로 비용을 최대 98% 절감하면서도 최고 성능 모델과 동등한 정확도를 달성할 수 있음을 입증했습니다.
둘째, 병렬성(Parallelism)을 통한 작업 완료 시간 단축입니다. 실전 에이전트 루프에서 코드베이스 검색, 린팅, AST 분석, 파일 변환 등 다수의 하위 작업은 대형 모델의 거대한 추론 능력보다 빠르게 병렬 처리하는 것이 핵심입니다. 소형 모델 여럿을 동시 실행(Multi-agent architecture)하는 것이 단일 대형 모델의 긴 TTFT(Time To First Token)와 수초 단위의 생성 지연을 대기하는 것보다 유저 경험과 전체 지연시간 단축에 크게 기여합니다.
셋째, 컨텍스트 분리 및 Attention 효율화입니다. 단일 대형 모델에 모든 도구 스펙과 프로젝트 컨텍스트를 밀어 넣으면 'Lost in the Middle' 현상이나 Attention 분산으로 인한 지시 이행 오류가 늘어납니다. 반면, 명확한 단일 역할(Role)을 가진 소형 모델 다수에게 경량화된 컨텍스트를 분배하면 각 소형 모델의 지시 이행률과 신뢰성이 높아집니다.
따라서 라우팅과 역할 분담이 설계된 시스템에서는 싼 소형 모델 여럿의 조합이 비싼 대형 모델 하나보다 비용 대비 성능과 시스템 확장성 면에서 명백히 낫습니다.
AI Knowledge Hub