로봇 학습용 영상 가공 AI가 맡는다…트웰브랩스 '페가수스 1.6' 출시
피지컬 인공지능(AI)의 주요 병목으로 꼽히는 방대한 영상 데이터 가공을 AI가 자동화할 수 있는 길이 열렸다. 사람의 행동을 담은 1인칭 영상을 분석해 로봇과 휴머노이드가 학습할 수 있는 데이터로 구조화하는 방식이다. 트웰브랩스는 비전언어모델(VLM) '페가수스 1.6'을 출시했다고 7일 밝혔다. 이 모델은 사람의 시선에서 촬영한 1인칭 영상인 에고센트릭 데이터를 이해하고 구조화하는 능력을 강화했다. 에고센트릭 데이터는 작업자가 액션캠이나 스마트 글라스 등을 착용한 채 특정 동작을 수행하는 모습을 촬영한 영상이다. 로봇 학습에 활용하려면 필요한 장면을 선별하고 사람의 행동을 구간별로 나눈 뒤 손과 도구·물체의 상호작용과 결과까지 파악해야 한다. 현재 이 과정은 상당 부분 사람의 노동력에 의존한다. 공개 영상 데이터셋 '에고-엑소4D'에서는 1286시간 분량의 영상에 행동과 작업 과정 등을 표시하는 데 누적 20만 시간 이상의 작업이 투입됐다. 원본 영상 1시간을 가공하는 데 약 155시간의 수작업이 필요했던 셈이다. 페가수스 1.6은 영상 속 사람의 행동과 주변 사물, 전후 맥락을 함께 이해해 작업을 구간별로 나누고 설명한다. 작업자가 부품을 집어 도구로 작업한 뒤 완성된 물체를 옮기는 경우 각각의 행동과 등장하는 사물, 행동 순서를 파악해 구조화할 수 있다. 이를 위해 행동 분할·라벨링, 상세 캡션 라벨링, 품질 평가, 검색·큐레이션, 개인정보·컴플라이언스 탐지 등 다섯 가지 기능을 지원한다. 시간 기반 메타데이터(TBM) 기능을 이용하면 사용자가 원하는 항목과 구조를 정의해 영상 속 행동과 맥락을 시간 정보와 함께 데이터로 정리할 수 있다. 손과 물체, 도구 등을 영상 전반에서 일관되게 식별하는 개체 인식 성능도 고도화했다. 대규모 영상을 처리하는 속도와 비용 효율성도 높여 로봇·피지컬 AI 기업이 대량의 영상을 학습 데이터로 가공할 수 있도록 했다. 실제 피지컬 AI 분야 적용도 이뤄지고 있다. 미국의 한 로보틱스 학습 데이터 기업은 공장 작업 현장에서 수집한 에고센트릭 영상의 품질을 평가하고 불량 데이터를 걸러낸 뒤 선별된 영상에 상세한 설명을 추가하는 데 페가수스를 활용하고 있다. 트웰브랩스에 따르면 해당 기업은 매일 수십만 시간 규모의 영상을 로봇 학습에 활용할 수 있는 형태로 정제하고 있다. 이재성 트웰브랩스 최고경영자(CEO)는 "물건이 미끄러졌을 때 바로잡는 것과 같이 사람들이 현실 세계에서 체득한 경험은 대부분 기계가 학습할 수 있는 형태로 기록되지 않았다"며 "페가수스 1.6은 영상을 구조화된 지식으로 바꿔 피지컬 AI와 로보틱스 기업들이 실제 인간의 경험을 학습에 활용할 수 있도록 할 것"이라고 말했다.