|
30일 서울 서초동 삼성 사옥에서 열린 ‘삼성 AI 포럼 2026’ 패널 디스커션에서는 호안 카를로스 니에블레스 삼성리서치 상무가 좌장을 맡은 가운데, 김윤형 삼성리서치 상무(MIT 교수)와 란제이 크리슈나 워싱턴대 교수가 참여해 에이전틱 AI와 피지컬 AI의 융합 방안을 깊이 있게 논의했다.
이들 전문가들은 디지털 에이전트와 물리 로봇 간의 근본적인 차이점에 주목했다. 디지털 환경은 텍스트 중심의 이산적(Discrete) 세계이지만, 물리 세계는 실시간으로 변하고 충돌이 발생하는 연속적(Continuous) 환경이라는 지적이다.
크리슈나 교수는 “웹이나 컴퓨터 환경에서 작동하는 에이전트는 정적인 환경 위에서 움직이지만, 물리 세계의 에이전트는 세상의 역학을 직접 이해해야 한다”며 “인간이 물건을 던졌을 때 궤적을 예측해 잡아내는 등의 연속적 제어는 텍스트 중심의 언어 공간만으로는 처리하기 극도로 어렵다”고 설명했다.
‘실패 비용’ 차이도 핵심 제약으로 꼽혔다. 김윤형 상무는 “디지털 세계에서는 수백만 번의 시도를 거치는 비효율적인 강화학습이나 추론을 사용할 수 있지만, 물리 세계에서는 한 번의 실수가 치명적인 사고로 이어질 수 있다”며 “수학 문제를 잘 푸는 LLM의 지능을 로봇에 그대로 이식한다고 해서 물리 세계 제어로 자연스럽게 전이되는 것은 아니다”고 강조했다.
‘연속 학습’과 ‘DRAM 효율적’ 온디바이스 아키텍처 필수
이 같은 한계를 극복하기 위해 새로운 아키텍처와 시스템 구조의 필요성이 제시됐다. 김 상무는 기존 트랜스포머의 어텐션 한계를 극복하는 ‘선형 어텐션(Linear Attention) 하이브리드’ 및 맥락을 잠재 공간으로 압축하는 ‘컴팩션(Compaction)’ 기술을 통해 무한한 데이터 환경에서도 지속해서 지식을 습득하는 ‘연속 학습’ 아키텍처를 제시했다.
아울러 로봇과 같은 피지컬 AI 기기는 개인정보 보호와 즉각적인 반응성을 위해 클라우드가 아닌 온디바이스 배포가 필수적이며, 이를 위해 엣지 기기의 핵심 제약인 D램 용량을 효율화하는 ‘루프형 트랜스포머(Looped Transformer)’ 등의 구조가 결합돼야 한다고 덧붙였다.
|
상위 계획과 하위 제어 분리하는 ‘계층적 에이전트’가 해법
피지컬 AI의 실질적 구현을 위한 시스템 해법으로는 ‘계층적 에이전트 시스템(Hierarchical Agentic System)’이 제시됐다. 상위 레이어의 LLM이 전체적인 장기 계획을 세우고 맥락을 기억하는 역할을 맡고, 하위 레이어의 제어 모델은 더 작고 빠른 속도로 실시간 물리적 변화에 반응하도록 역할을 분리하는 방식이다.
크리슈나 교수는 “오디오 영역에서 대형 모델과 유저 사이를 중계하는 소형 인터랙션 모델이 성과를 내듯, 로보틱스에서도 실시간 환경 변화에 가볍고 빠르게 대응하는 소형 제어 모델과 상위 LLM이 결합하는 아키텍처가 핵심 해법이 될 것”이라고 진단했다.
그는 이어 “물리 세계의 추론을 위해 해킹 불가능한 고성능 시뮬레이션 환경을 구축하고, 텍스트와 시각/비디오 생성을 자유롭게 오가며 반가상 시나리오를 그려보는 ‘교차 시각 추론(Interleaved visual reasoning)’ 데이터를 확보하는 것이 앞으로의 성패를 가를 것”이라고 전망했다.






