콘텐츠

인사이트 / 블로그

피지컬 AI, 휴머노이드 성능을 가르는 데이터의 조건

2026-09-22

view 1

휴머노이드 마라토너는 어떻게 사람보다 빨리 달렸을까

하프 마라톤 결승선을 통과하는 로봇과 뒤에서 달리는 캐릭터

지난 4월 19일, 베이징 하프 마라톤에서 아너의 휴머노이드 ’산뎬’이 50분대 기록으로 결승선을 통과했습니다. 인간 하프 마라톤 세계 기록보다 약 7분 빠른 기록입니다. 1년 전 같은 대회 로봇 우승 기록은 2시간 40분대였습니다.

영상이 보이지 않을 경우 YouTube에서 직접 보기

'50분 26초' 중국 로봇 마라톤 1년 만에 인류 추월 / YTN

시뮬레이션 학습의 성공

70%에 가까운 기록 갱신의 비결은 '시뮬레이션 학습'이었습니다. 수천 대의 가상 로봇이 동시에 달리고 넘어지며 자세를 조정했습니다. 노면 마찰, 경사, 바람, 공기 저항도 계속 바뀌었습니다. 이런 방식이 도메인 랜덤화(Domain Randomization)입니다. 현실 변수를 시뮬레이션에 넣고, 다양한 조건에서 균형을 잡도록 학습한 것입니다.

하지만··· 복잡한 우리의 일상에는?

마라톤은 코스가 정해져 있습니다. 변수도 비교적 작습니다. 노면, 경사, 바람을 반영하면 기본 학습 환경을 만들 수 있습니다. 일상은 다릅니다. 물체, 사람, 조명, 접촉 상태, 예외 상황이 계속 바뀝니다. 사람이 모든 경우를 규칙으로 정리할 수도 없습니다. 그래서 피지컬 AI에서는 데이터의 양보다 품질이 더 중요해집니다. 특히 조작, 협업, 생활 공간으로 갈수록 어떤 데이터가 실제 성능을 높이는지 검증하는 기준이 필요합니다.

같은 문제를 다르게 풀려는 엔비디아와 테슬라 

엔비디아(NVIDIA)는 Cosmos World Foundation Model과 GR00T-Dreams 같은 시뮬레이션·합성 데이터 도구를 공개하고 있습니다. 여러 로봇 개발사가 데이터를 만들고 검증할 수 있는 기반을 제공하는 방식입니다.

가상 창고에 배치된 다양한 로봇 팔과 이동 로봇, 사람 모델

NVIDIA - Physical AI Dataset

테슬라(Tesla)는 반대로 수직 통합에 가깝습니다. 휴머노이드 옵티머스의 하드웨어, 제어, 학습 데이터를 자체 체계 안에 묶습니다. 방식은 다르지만 질문은 같습니다. "데이터를 어떻게 수집하고, 어떻게 늘리며, 어떻게 검증할 것인가"죠.

로봇의 실력을 결정하는 데이터 조건 세 가지 

1) 수집: 데이터는 양보다 조건이 중요합니다

원격조작은 로봇 데이터를 모으는 대표 방식입니다. 사람이 직접 로봇을 움직이며 작업 데이터를 기록합니다. 하지만 이 방식만으로는 산업 현장에 필요한 규모를 확보하기 어렵습니다. 장비 비용, 작업자 피로, 센서 동기화 오류가 함께 누적되기 때문입니다.

시뮬레이션과 데이터 증강이 대안으로 거론되는 이유도 여기에 있습니다. 그러나 데이터를 많이 만드는 것만으로는 충분하지 않습니다. 카메라 영상과 관절값의 시간이 어긋나거나, 조명과 각도가 작업마다 크게 달라지면 모델은 안정적으로 학습하기 어렵습니다.

2) 증강: 생성보다 선별이 중요합니다

비디오 생성 모델을 활용한 데이터 증강이 주목받고 있습니다. 텍스트와 이미지를 바탕으로 로봇 작업 영상을 합성할 수 있기 때문입니다. 적은 시연 데이터로도 학습 후보를 빠르게 만들 수 있다는 장점이 있습니다.

하지만 생성된 영상이 곧바로 좋은 학습 데이터가 되는 것은 아닙니다. 충분한 모델 규모, GPU 환경, 초기 성공 데이터, 검증 체계가 함께 필요합니다. 실제 작업 영상으로 모델을 조정하고, 과업 기준에 맞는 검증 시나리오로 결과를 걸러야 합니다. 결국 증강 데이터의 성패는 얼마나 많이 생성하느냐보다, 학습에 쓸 수 있는 데이터를 얼마나 정확히 선별하느냐에 달려 있습니다.

3) 검증: 데이터 유형마다 기준이 달라야 합니다

시연 데이터, 증강 데이터, 생성 데이터는 모두 로봇 학습에 쓰일 수 있습니다. 하지만 검증 기준은 서로 달라야 합니다.

시연 데이터는 수집 조건과 형식이 일관되는지 확인해야 합니다. 같은 작업을 반복했을 때 행동 궤적이 안정적인지도 봐야 합니다.

증강 데이터는 실제 로봇 적용 결과로 판단해야 합니다. 성공률, 동작 안정성, 오차율이 어떻게 달라지는지 비교해야 합니다.

생성 데이터는 물리적으로 가능한 장면인지 확인해야 합니다. 원본 데이터 분포와 얼마나 가까운지도 함께 봐야 합니다. 보기 좋은 영상보다 실제 작업 흐름과 충돌하지 않는 영상이 더 중요합니다.

세 유형을 같은 기준으로 검증하면 원인을 추적하기 어렵습니다. 어떤 데이터가 모델을 개선했고, 어떤 데이터가 성능을 떨어뜨렸는지 구분할 수 없기 때문입니다.

피지컬 AI의 성능은 현실의 규칙과 변수를 반영한 학습 데이터를 얼마나 빠르게 만들고, 쓸 수 있는 데이터만 골라 다시 학습에 반영하느냐에 달려있습니다.

로봇 데이터 품질 검증은 부가 절차가 아닙니다. 좋은 데이터를 효율적으로 만들어내기 위한 핵심 운영 체계입니다. 앞으로의 휴머노이드 경쟁력도 이 체계를 얼마나 잘 갖추느냐에서 갈릴 것입니다.

써로마인드 관련 소식

최근 미디어에 소개된 써로마인드의 주요 소식을 확인해 보세요.
제목을 클릭하면 관련 기사 전문을 바로 읽으실 수 있습니다.