베트남 Physical AI / 1인칭 조작·원격조작·모션캡처 데이터셋


사람이 직접 물체를 조작하는 모습을 1인칭 시점 영상, 원격조작(텔레오퍼레이션), 모션캡처 등 다양한 방식으로 촬영한 로봇 학습용 데이터셋입니다. 베트남 소재 대기업 계열 파트너사가 공장·병원·요식업·숙박업 등 실제 산업 현장에서 직접 수집하고 있으며, 자사 휴머노이드 로봇 학습에 사용 중인 데이터를 기반으로 고객 요청 시 신규 촬영도 가능합니다.

각 영상에는 다음이 포함될 수 있습니다 (고객 요구사항에 맞춰 구성):

  • 촬영 방식에 따라 Mono RGB / Stereo RGB(헤드밴드) / 멀티모달 / Mocap 선택 가능
  • 손 동작 및 물체 조작 정보 (3D hand pose)
  • 물체 위치·추적 정보 (bounding box, object tracking)
  • 동작 설명문 (action narration)

데이터 활용 사례 및 분야

  • 로봇이 사람 동작을 따라 배우는 모방학습 (조작 정책 학습)
  • Physical AI / VLA(영상-언어-행동) 모델 학습
  • 원격조작 기반 로봇 제어 연구
  • 1인칭 영상 이해 (egocentric video understanding)

데이터셋 스펙

구분상세 내용
데이터 수재고 약 100,000시간(자사 로봇 학습용) / 월 수집 능력 9,000~10,000시간
데이터 타입Mono RGB, Stereo RGB(헤드밴드), 멀티모달, 텔레오퍼레이션(UMI), Mocap
수집 방식직접 수집 (공장/병원/요식업/숙박업 등 실제 현장) / 고객 요청 시 신규 독점·비독점 데이터 별도 수집 가능
언어해당 없음
파일 포맷데이터 타입별 상이 (mp4, mcap, LeRobot 포맷 등)
메타데이터미확정
통계정보미확정
업데이트 주기주간/월간(협의 가능)