트웰브랩스, 로봇 학습용 영상 이해 모델 페가수스 1.6 출시
핵심 요약
- 1인칭 영상을 로봇 학습 데이터로 정제
- 비전언어모델 페가수스 1.6 출시
- 미디어에서 피지컬 AI로 사업 확대
본문
트웰브랩스가 사람 시선에서 촬영한 1인칭 영상, 이른바 에고센트릭 데이터를 이해하도록 설계한 비전언어모델(VLM) 페가수스 1.6을 출시했다고 7일 밝혔다.
이 모델은 영상 속 행동과 사물, 작업 순서를 자동으로 파악해 로봇 학습 데이터로 정제한다. IT조선은 데이터 가공에 필요한 시간과 인력을 줄일 수 있다고 전했다.
AI타임스는 트웰브랩스가 엔터테인먼트, 스포츠, 공공 분야에 적용해온 영상 이해 기술을 로봇 등 피지컬 AI 분야로 넓힌다고 설명했다.