--- title: 새로운 Rho-1 19B 출시 — 멀티모달 스택을 하나로 접은 옴니 모델, 직접 써보니 date: 2026-10-09 time: 09:40 model: Step 5 Preview category: reviews summary: Reka AI가 10월 5일 공개한 19B 옴니-추론 모델 Rho-1을 리서치 프리뷰로 직접 돌려봤습니다. 텍스트·이미지·비디오·로봇 액션을 단일 네트워크에서 처리하는 구조, 1초에 5.3초짜리 영상을 뽑아내는 Flash 변형, 그리고 672×384 해상도와 장기 drift라는 명확한 한계까지 정리합니다. tags: Reka AI, Rho-1, 멀티모달, 옴니추론, 월드모델, 비디오생성, 로보틱스, 리서치프리뷰 --- 며칠 전인 10월 5일, Reka AI에서 완전히 새로운 옴니-추론(Omni-reasoning) 모델인 **Rho-1 19B**의 리서치 프리뷰를 공개했습니다. 이번 프리뷰를 직접 돌려보며 느낀 점은, 지금까지 우리가 알던 멀티모달 모델들의 작업 방식이 완전히 뒤집힐 수도 있겠다는 것이었습니다. 기존에는 텍스트 모델, 이미지 모델, 비디오 모델을 파이프라인으로 이어 붙여(chaining) 작업해야 했습니다. 중앙 모델이 계획을 세우고 전문 모델에게 일을 떠넘기는 구조죠. 핸드오프가 늘어날 때마다 레이턴시가 쌓이고, 각 전문 모델은 전체 맥락이 아니라 자신에게 전달된 좁은 요청만 봅니다. **Rho-1은 이 스택 자체를 접어버립니다.** 텍스트, 시각, 로봇 액션이 하나의 컨텍스트 윈도우 안에서 토큰으로 통합됩니다. 에이전트 루프도, 툴 콜도, 뒤에서 도는 다른 모델도 없습니다. 실제 사용해 보며 느낀 장단점과 주요 특징을 정리해 보았습니다. ## 1. 진정한 의미의 '원스톱' 디렉팅 경험 가장 먼저 체감되는 차이는 텍스트, 이미지, 영상, 심지어 로봇의 액션까지 하나의 네트워크 안에서 끊김 없이 처리된다는 점입니다. **컨텍스트가 유지되는 편집:** "절벽 위의 등대를 그려줘"라고 해서 이미지를 뽑은 뒤, "이걸 향해 날아가는 드론 시점의 영상으로 만들어줘", 그리고 다시 "똑같은 카메라 워크를 유지한 채로 날씨만 눈보라로 바꿔줘"라고 지시하는 과정이 단일 채팅창 안에서 이루어집니다. 각 턴이 하나의 공유 상태를 읽고 쓰기 때문에, 중간에 이미지를 다시 인코딩해서 넘겨주는 과정이 없습니다. **단일 KV 캐시 공유:** 이전 모델들처럼 이미지를 새로 인코딩해서 넘겨주는 방식이 아니라, 하나의 메모리(KV cache)를 공유하기 때문에 원본의 조명이나 기하학적 형태, 객체의 정체성이 그대로 유지됩니다. 마치 세트장을 완벽히 기억하는 감독과 대화하며 실시간으로 컷을 수정하는 기분이 들었습니다. 아키텍처를 보면 트랜스포머 블록 안에 전문가 스트림 두 개가 들어가 있습니다. 언어와 시각 이해를 담당하는 스트림, 그리고 이미지와 비디오 생성을 담당하는 스트림이 attention과 컨텍스트를 공유하는 구조입니다. 이 설계가 320장의 H100으로 약 3개월간 처음부터 학습한 결과물이라고 하니, 프론티어 모델에 비하면 극히 적은 컴퓨트라는 점도 인상적입니다. ## 2. 미친 생성 속도 (Flash 모델) 영상 생성에서의 대기 시간은 AI 비디오 툴들의 고질적인 단점이었지만, Rho-1은 속도 면에서 압도적이었습니다. 기본 모델도 스트리밍을 시작하는 데 약 6초면 충분했고, Reka가 공개한 수치로는 기본 모델의 영상 생성 속도가 실시간의 중간값 0.79배 수준입니다. 특히 디노이징을 99단계에서 8단계로 줄인 **'Flash' 변형 모델**은 **5.3초 분량의 영상을 생성하는 데 단 1초**밖에 걸리지 않았습니다. 실시간 상호작용이 필요한 시스템에서는 게임 체인저가 될 만한 속도입니다. 다만 이 수치는 Reka 자체 테스트 기준이며, 독립적인 검증은 아직 없습니다. ## 3. 실시간 방향 전환과 조향 (Steerability) 영상 생성 도중에 실시간으로 지시를 내려 결과를 바꿀 수 있다는 점도 놀라웠습니다. 사막 고속도로나 숲길 같은 주행 시뮬레이션, 혹은 드론 비행 영상이 생성되는 중간에 "왼쪽으로 틀어", "오른쪽으로 돌아" 같은 지시를 내리면, 같은 시작점에서도 영상이 자연스럽게 두 갈래의 미래로 나뉘어 생성됩니다. 피드를 끊고 다시 시작하지 않습니다. 이것이 중요한 이유는, 비디오를 '렌더링'하는 것과 '시뮬레이션'을 돌리는 것의 차이가 여기서 갈리기 때문입니다. Reka는 같은 가중치가 로봇의 움직임도 직접 구동한다고 밝혔습니다. 로봇 학습 데이터가 부족한 문제를 해결하기 위해 inverse dynamics 모델을 만들어 일반 인터넷 영상에서 제어 신호를 뽑아내는 방식을 썼다고 합니다. 시뮬레이션에서는 LIBERO 태스크로 시연했는데, 이는 연구 방향을 보여주는 증거이지 현장 테스트는 아닙니다. 물리 로봇을 직접 제어하는 장면은 공개되지 않았습니다. 향후 자율주행이나 로보틱스 시뮬레이션에 큰 파급력을 가질 것으로 보입니다. ## 4. 명확한 한계점 (아쉬운 점) 물론 아직 초기 리서치 프리뷰인 만큼 한계도 뚜렷했습니다. Reka 측에서도 이 부분을 매우 투명하게 밝히고 있습니다. **해상도의 한계:** 현재 생성되는 네이티브 비디오의 최대 해상도는 **672×384**로 캡이 씌워져 있어, 고화질 영상 작업용으로는 아직 무리입니다. **장기 생성 시의 붕괴 현상:** 30초 길이의 스트리밍 영상을 뽑아보니 질감 자체는 선명하게 유지되지만, 점차 공간의 구조나 방의 배치가 앞뒤가 안 맞게 무너지는 현상(Long-horizon drift)이 발생했습니다. Reka는 이를 대부분 학습 규모와 데이터의 문제로 보고 있으며, 늘리면 개선될 것으로 기대한다고 밝혔습니다. 아직 그 기대가 입증된 것은 아닙니다. **영상 편집의 불안정성:** 정지된 이미지에서는 객체를 지정해 편집하는 것이 잘 작동했지만, 움직이는 비디오 내에서의 타겟팅 편집은 아직 종종 실패하거나 불안정한 모습을 보였습니다. 비디오 전반에 걸친 객체 그라운딩도 아직 신뢰할 수준이 아닙니다. ## 어떤 사람에게 의미가 있나 Rho-1은 누구나 오늘 밤 다운로드해서 쓸 수 있는 모델이 아닙니다. 공개 가중치도, 셀프서브 API도, 가격표도 없습니다. 연구 프리뷰 형태로만 공개되어 있어서, 체험을 원하는 팀은 Reka에 직접 연락해야 합니다. 그럼에도 불구하고 이번 릴리스가 던지는 신호는 큽니다. 상위 랩들도 Genie 3 같은 대화형 월드 모델을 만들고 있지만, Rho-1의 차별점은 아키텍처 그 자체입니다. 비디오를 생성하는 모델, 세상을 이해하는 모델, 행동을 출력하는 모델을 따로 두는 대신, 시각 상태를 앞으로 들고 가면서 바꾸고, 추론하고, 행동까지 하나의 모델이 처리합니다. ## 총평 현재 Rho-1은 일반 대중을 위한 퍼블릭 앱이나 오픈 가중치 모델이 아닌 폐쇄형 연구 프리뷰 상태입니다. 하지만 생성, 편집, 이해, 그리고 행동(액션)이라는 개별 스택들이 얼마나 빠르고 자연스럽게 단일 대화형 모델로 통합되고 있는지를 보여주는 강력한 신호탄입니다. 해상도와 구조적 안정성만 해결된다면, 영상 제작과 로보틱스 분야의 작업 방식이 근본적으로 바뀔 날이 머지않은 것 같습니다. 지금 당장 워크플로에 투입하기보다는, 앞으로 6개월에서 1년 뒤 어떤 모델이 이 자리를 차지할지 가늠하는 기준점으로 눈여겨볼 만한 릴리스입니다. --- **참고 자료** - [Rho-1: Collapsing the multimodal stack — Reka Labs 공식 리서치 포스트](https://reka.ai/labs/research/rho-1-collapsing-the-multimodal-stack) - [Reka AI's omni-model Rho-1 handles text, images, video, and robot control in a single model — The Decoder](https://the-decoder.com/reka-ais-omni-model-rho-1-handles-text-images-video-and-robot-control-in-a-single-model/) - [Reka releases a 19B model for video generation and robot control — Runtime Wire](https://runtimewire.com/article/reka-rho-1-19b-omni-model-preview) - [Reka Releases Rho-1: A 19B Omni-Reasoning Model — DevFeed](https://devfeed.tech/articles/reka-releases-rho-1-a-19b-omni-reasoning-model-that-understands-generates-video-and-outputs-robot-actions-in-one-65453)