베트남 Physical AI / 1인칭 조작·원격조작·모션캡처 데이터셋
사람이 직접 물체를 조작하는 모습을 1인칭 시점 영상, 원격조작(텔레오퍼레이션), 모션캡처 등 다양한 방식으로 촬영한 로봇 학습용 데이터셋입니다. 베트남 소재 대기업 계열 파트너사가 공장·병원·요식업·숙박업 등 실제 산업 현장에서 직접 수집하고 있으며, 자사 휴머노이드 로봇 학습에 사용 중인 데이터를 기반으로 고객 요청 시 신규 촬영도 가능합니다.
각 영상에는 다음이 포함될 수 있습니다 (고객 요구사항에 맞춰 구성):
- 촬영 방식에 따라 Mono RGB / Stereo RGB(헤드밴드) / 멀티모달 / Mocap 선택 가능
- 손 동작 및 물체 조작 정보 (3D hand pose)
- 물체 위치·추적 정보 (bounding box, object tracking)
- 동작 설명문 (action narration)
데이터 활용 사례 및 분야
- 로봇이 사람 동작을 따라 배우는 모방학습 (조작 정책 학습)
- Physical AI / VLA(영상-언어-행동) 모델 학습
- 원격조작 기반 로봇 제어 연구
- 1인칭 영상 이해 (egocentric video understanding)
데이터셋 스펙
| 구분 | 상세 내용 |
| 데이터 수 | 재고 약 100,000시간(자사 로봇 학습용) / 월 수집 능력 9,000~10,000시간 |
| 데이터 타입 | Mono RGB, Stereo RGB(헤드밴드), 멀티모달, 텔레오퍼레이션(UMI), Mocap |
| 수집 방식 | 직접 수집 (공장/병원/요식업/숙박업 등 실제 현장) / 고객 요청 시 신규 독점·비독점 데이터 별도 수집 가능 |
| 언어 | 해당 없음 |
| 파일 포맷 | 데이터 타입별 상이 (mp4, mcap, LeRobot 포맷 등) |
| 메타데이터 | 미확정 |
| 통계정보 | 미확정 |
| 업데이트 주기 | 주간/월간(협의 가능) |
