2026-10-01

Korea Scoop

한국 특종 – 인기 급상승 뉴스

[위클리_피지컬AI] 피지컬 AI 산업에 뛰어든 생성형 AI 영상 제작 플랫폼 외 강형석 2026.10.01. [IT동아 강형석 기자] 생성형 인공지능(AI)이 세상을 바꿨다면, 피지컬 AI(실물 인공지능)는 세상을 뒤흔들 것으로 전망된다. 생성형 AI는 온라인상에서 원하는 결과물을 얻고 | KS News

[위클리_피지컬AI] 피지컬 AI 산업에 뛰어든 생성형 AI 영상 제작 플랫폼 외
            
            
              강형석
              
                2026.10.01.

              
            
            
              [IT동아 강형석 기자] 생성형 인공지능(AI)이 세상을 바꿨다면, 피지컬 AI(실물 인공지능)는 세상을 뒤흔들 것으로 전망된다. 생성형 AI는 온라인상에서 원하는 결과물을 얻고 | KS News

[IT동아 강형석 기자] 생성형 인공지능(AI)이 세상을 바꿨다면, 피지컬 AI(실물 인공지능)는 세상을 뒤흔들 것으로 전망된다. 생성형 AI는 온라인상에서 원하는 결과물을 얻고 창의적인 활동을 가능케 하지만, 피지컬 AI는 산업현장부터 일상환경, 재해극복까지 사람이 하기 어려운 영역을 폭넓게 풀어낼 잠재력을 지녔기 때문이다. 현재 전 세계 기술 기업들이 피지컬 AI 경쟁에 뛰어들었고, 기술 개발도 활발하게 이어진다. [위클리_피지컬AI]는 지난 한 주간 주목받은 기술 기업 소식과 연구 성과를 다루고자 한다.

생성형 AI 영상 제작 플랫폼 기업 런웨이가 로봇용 모델을?

생성형 AI 영상 제작 플랫폼 런웨이(Runway)가 2026년 10월 1일 로봇 제어 모델 ‘프락시스-1(Praxis-1)’을 공개했다. 학습을 마친 AI 모델의 가중치(학습으로 얻은 수치값)를 외부에 내놓는 ‘오픈웨이트’ 방식의 월드 액션 모델이다. 현실의 변화를 예측하는 월드 모델의 토대가 되는 대규모 영상 사전학습(영상을 미리 대량으로 익히는 과정)을 로봇 제어로 옮겨 온 형태다.

[위클리_피지컬AI] 피지컬 AI 산업에 뛰어든 생성형 AI 영상 제작 플랫폼 외
            
            
              강형석
              
                2026.10.01.

              
            
            
              [IT동아 강형석 기자] 생성형 인공지능(AI)이 세상을 바꿨다면, 피지컬 AI(실물 인공지능)는 세상을 뒤흔들 것으로 전망된다. 생성형 AI는 온라인상에서 원하는 결과물을 얻고 | KS News
생성형 AI 영상 제작 플랫폼 런웨이가 로봇 AI 모델, 프락시스-1을 공개했다 / 출처=런웨이

런웨이가 사업 영역을 넓힌 근거는 이렇다. 사람들이 하루에 찍어 올리는 일상 영상이 어느 로봇 연구소의 원격조종 시연보다 많다는 것이다. 연구진은 제삼자 시점 영상을 늘릴수록 정책(로봇이 상황에 맞춰 행동을 정하는 규칙) 성능이 좋아진다는 점도 강조했다. 공개 자료를 보면 로봇 모델을 미세조정(특정 작업에 맞춘 추가 훈련)한 뒤 물체의 최종 배치 오차는 웹 영상으로 처음부터 사전학습했을 때 16.1cm, 로봇 원격조종 영상으로 학습했을 때 16.0cm로 거의 같았다. 일반 영상으로 만든 모델도 로봇 학습의 기반이 될 수 있다는 뜻이다.

런웨이는 폐쇄형 대신 오픈웨이트를 택한 이유로 높은 호환성과 개방성을 들었다. 피지컬 AI 시장에서 미국이 주도권을 쥐는 일이 제조업 경쟁력 회복과 생산성 향상, 안보에 중요하다는 설명도 덧붙였다. 하지만 산업 현장에서는 상업적 이용 라이선스 조건이 훨씬 중요해서, 이런 명분만으로는 의미가 크지 않다. 런웨이는 해당 조건을 밝히지 않았다.

기술적 한계도 남아 있다. 런웨이가 직접 꼽은 문제는 네 가지다. ▲같은 모양의 물체 여럿 중 목표 하나를 고르는 일 ▲식기가 겹치고 가려진 어수선한 장면 ▲얼음이나 투명 플라스틱처럼 거리를 가늠할 단서가 약한 물체 ▲붙잡을 자리가 정해지지 않은 천이다. 영상 속 정보가 로봇에 충분히 전달되지 못하고 단편적인 분석에 그친 탓으로 풀이된다. 프락시스-1이 시장의 주목을 받으려면 데이터를 더 정확히 분류하고 다듬는 작업이 필요하다.

IFR, 산업용 로봇 보고서 공개 ‘휴머노이드 비중은 미미’

국제로봇연맹(IFR)이 2026년 9월 24일 독일 프랑크푸르트에서 ‘월드 로보틱스 2026’ 산업용 로봇 보고서를 공개했다. 2025년 전 세계 공장에서 가동된 산업용 로봇은 전년보다 9% 늘어난 500만 대로 집계됐다. 한 해 동안 새로 설치된 로봇도 11% 증가해 60만 대를 넘었다.

성장은 중국이 이끌었다. 중국의 2025년 설치 대수는 35만 4000대로, 전년보다 약 6만 대(20%) 늘었다. 전 세계 신규 설치의 59%가 중국에 몰린 셈이다. 미국은 12% 증가한 3만 8500대였고, 일본은 19% 줄어든 3만 6219대에 그쳤다. 한국은 1% 감소한 3만 대 수준으로 집계됐다.

2025년 한 해 동안 새로 설치된 로봇은 60만 대로 집계됐다 / 출처=IFR
2025년 한 해 동안 새로 설치된 로봇은 60만 대로 집계됐다 / 출처=IFR

IFR은 시장 전망을 낙관했다. 2026년 신규 설치는 9% 늘어 65만 5000대, 2029년에는 80만 6000대 안팎에 이를 것으로 내다봤다. 성장 동력으로는 공급망 안정과 무역·산업 정책 변화에 따른 제조 거점 이동, 임금이 높거나 일손이 부족한 국가의 자동화 수요를 꼽았다. 인공지능(AI), 머신비전(카메라로 사물을 알아보는 기술), 센서가 발전해 로봇이 해낼 수 있는 일이 넓어지고, 프로그래밍과 시스템 연동이 쉬워져 도입 비용이 내려가는 점도 짚었다.

눈길을 끄는 대목은 휴머노이드 로봇의 비중이다. IFR은 2025년 전 세계에서 판매된 전신(키 140cm 초과) 휴머노이드를, 연구개발과 엔터테인먼트 용도를 뺀 상업·전문 분야 기준으로 약 7000대로 파악했다. AI와 센서, 제어 기술이 나아지면서 인상적인 시범 사업은 늘었지만, 현재 쓰임새 대부분은 특정 작업에 한정되고 사람이 원격으로 조종해야 하는 경우도 많다고 평가했다. 성장을 가로막는 요인으로는 안전 표준, 높은 훈련·유지 비용, 산업 현장에서의 낮은 사업성을 들었다.

휴머노이드에 거는 기대는 크지만, 현재 산업 구조에서 차지하는 몫은 작다. 다만 로봇 AI 모델이 고도화되면 상대적으로 움직임이 자유로운 휴머노이드의 비중도 서서히 커질 전망이다.

‘메일벤치·민트’로 카메라에 문제가 생겨도 로봇이 움직인다

로봇이 카메라 영상과 언어 지시를 받아 조작 행동을 스스로 정하는 비전·언어·행동(VLA) 모델은 최근 빠르게 발전했다. 문제는 현장이다. 산업 현장이나 일상 공간에서는 전선 접촉 불량이나 통신 지연으로 카메라 신호가 언제든 끊길 수 있다. 화면 기록이 통째로 멈추는 돌발 상황은 조명 변화나 빛 번짐처럼 화질만 나빠지는 기존 시각 교란과 성격이 다르다.

시드니대학교 연구팀은 이 문제의 해법을 제안했다. 카메라 화면이 차단됐을 때 로봇이 제어를 얼마나 유지하는지 따지는 벤치마크(성능 평가 도구) ‘메일벤치(MAIL-Bench)’와, 결손 상태 적응 훈련에 선별적 시각 예측을 결합한 ‘민트(MINT)’ 프레임워크다.

민트의 설계 구조 / 출처=시각적 방해 상황에서도 VLA 모델로 로봇이 지속 행동을 위한 학습법 논문
민트의 설계 구조 / 출처=시각적 방해 상황에서도 VLA 모델로 로봇이 지속 행동을 위한 학습법 논문

메일벤치는 로보카사365(RoboCasa365) 시뮬레이터를 기반으로 가사 작업 18개와 가상 주방 장면 900개를 제공한다. 기존 평가 도구는 고정된 시각에 센서 이상을 일으켰지만, 메일벤치는 로봇이 작업을 정상적으로 끝냈을 때 걸린 고유 소요 시간을 기준으로 삼았다. 모델마다 동작 속도가 다르므로, 정상 수행 시간의 30%, 45%, 60% 시점에 영상을 인위적으로 끊어 공정성을 맞춘 것이다. 차단 단위도 개별 카메라 하드웨어가 아니라 기능별로 나눴다. 작업 공간 전체를 비추는 3인칭 시점, 그리퍼(로봇 손) 근처를 살피는 손목 시점, 전체 시각 차단 세 가지다.

결과는 예상과 달랐다. 3인칭 카메라 두 대를 잃었을 때보다 손목 카메라 한 대가 꺼졌을 때 작업 성공률이 더 크게 떨어졌다. 물체를 집어 드는 섬세한 순간에는 손끝에 달린 카메라가 나침반 역할을 하기 때문이다.

이런 충격에 대응하는 기술이 민트다. 민트는 미세조정 단계에서 화면 단절 패턴을 무작위로 주입하고, 신호가 끊긴 시점의 시각 토큰(영상을 잘게 쪼갠 정보 단위)을 어텐션 연산(어떤 정보에 집중할지 정하는 계산)에서 제외한다. 보이지 않는 화면에 매달리지 않고 관절 위치 감각과 남은 시야 정보만으로 팔을 뻗도록 신경망을 훈련하는 데 초점을 맞춘 것이다.

민트는 로봇의 영상 데이터가 상실돼도 계속 작동하도록 만드는 데 초점을 뒀다 / 출처=시각적 방해 상황에서도 VLA 모델로 로봇이 지속 행동을 위한 학습법 논문
민트는 로봇의 영상 데이터가 상실돼도 계속 작동하도록 만드는 데 초점을 뒀다 / 출처=시각적 방해 상황에서도 VLA 모델로 로봇이 지속 행동을 위한 학습법 논문

추론 단계에서는 끊긴 시점의 성격에 따라 서로 다른 생성 기법을 투입한다. 움직임 변화가 단순한 손목 화면에는 옵티컬 플로우(연속된 이미지 속 물체를 분석해 위치를 예측하는 기법)를 적용한다. 로봇과 주변 물체의 상호작용이 복잡한 3인칭 시점에는 행동 조건부 월드 모델(로봇의 행동에 따른 환경 변화를 예측하는 모델)을 써서 끊긴 화면을 실시간으로 추론한다.

연구팀은 예측의 한계를 측정하고 통제하는 신뢰도 게이팅(Confidence-Gating) 설계도 반영했다. 예측을 믿어도 되는지 점검해 기준을 통과할 때만 쓰는 장치다. AI가 생성한 가상 영상은 시간이 지날수록 현실과 오차가 벌어지고, 잘못된 환각을 맹신하면 로봇이 오작동한다. 민트는 월드 모델이 만든 가상 손목 영상을 실제 손목 카메라 화면과 실시간으로 대조해 예측 일치도를 감시한다. 예측 품질이 허용 기준 밑으로 떨어지면 가상 화면 투입을 멈추고, 앞서 익힌 결손 적응 모드로 곧바로 전환한다.

민트와 그루트 N1.5를 결합했을 때 성능표 / 출처=시각적 방해 상황에서도 VLA 모델로 로봇이 지속 행동을 위한 학습법 논문
민트와 그루트 N1.5를 결합했을 때 성능표 / 출처=시각적 방해 상황에서도 VLA 모델로 로봇이 지속 행동을 위한 학습법 논문

성과는 수치로 확인됐다. 그루트 N1.5(GR00T N1.5) 모델에 민트를 결합하자 메일벤치 종합 점수가 0.246에서 0.462로 올랐다. 카메라가 정상인 조건에서도 성공률이 0.450에서 0.544로 높아진 점이 눈에 띈다. 특정 카메라 시점에 지나치게 기대던 습성이 사라진 결과다.

연구팀은 애지봇 G2(AgiBot G2)로 알고리즘의 실효성도 검증했다. 서랍 여닫기, 컵 포개기처럼 정교한 손놀림이 필요한 실물 과제 네 가지를 마무리한 것이다. 작업 도중 머리 쪽 카메라가 갑자기 먹통이 돼도 월드 모델이 시야를 재빨리 메우거나 스스로 결손 대응 모드로 바꿔 목표를 완수했다는 게 연구팀의 설명이다. 이번 연구는 센서 환경에 의지하지 않고 감각 결손을 자연스럽게 받아들이며 생성 오류까지 통제하는 설계가 자율 로봇의 실전 움직임에 영향을 줄 수 있음을 보여준다.

IT동아 강형석 기자 (redbk@itdonga.com)

—————

원천: IT동아 (CC BY-NC-ND 2.0)

답글 남기기

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다