투자의 첫 걸음/뉴스기사

샤오미가 Xiaomi-Robotics-U0을 공개 및 오픈소스로 공개했습니다. 이 도구는 380억 개의 파라미터를 가진 대규모 모델을 생성하며, 생성 효율이 83배 향상되었습니다.

영구원(09One) 2026. 7. 15. 21:02

7월 15일, 패스트 테크놀로지는 샤오미가 380억 개의 매개변수를 가진 멀티모달 자기회귀 실체 생성 기본 모델인 샤오미-로봇공학-U0을 공식 출시하고 완전 오픈소스로 공개했다고 보도했습니다. 이 모델은 업계 최초로 4가지 핵심 실체 생성 작업을 통합적으로 처리할 수 있는 솔루션입니다.

 

이 모델은 로봇 장면, 궤적 및 비디오 생성 모델에 대한 업계의 기존 파편화된 접근 방식을 탈피합니다. 로봇 훈련에 필요한 이미지 및 비디오 데이터를 자율적으로 생성하고 증폭할 수 있어, 실제 로봇을 사용하여 극한 상황, 위험 상황 및 희귀 시나리오에서 데이터를 수집하는 데 드는 높은 비용과 어려움이라는 문제점을 해결합니다.

 

 

 

 

 

자체 개발한 FlashAR+ 추론 가속 솔루션을 기반으로, 생성 효율은 기존 자기회귀 아키텍처보다 거의 83배 높아 대규모 실체 데이터 생산 구현의 진입 장벽을 크게 낮췄습니다.

 

본 모델은 장면 생성, 궤적 전송, 로봇 상호작용 비디오 생성, 텍스트-이미지 변환 및 이미지 편집 등 네 가지 주요 기능을 일관되게 지원합니다. 독창적인 5차원 분리 구조 제어 패러다임을 기반으로, 자연어를 통해 작업대 레이아웃, 조작 대상, 주변 환경, 조명, 배경의 5차원을 독립적으로 조정할 수 있어, 전 과정에 걸쳐 다양한 관점에서 기하학적 일관성을 보장합니다. 화면 요소를 수정할 때 로봇 팔 자세 불일치나 장면 공간 왜곡과 같은 문제가 발생하지 않습니다.

 

이 소프트웨어는 Ark Infinite, Zhiyuan, Songling PiPER 등 다양한 로봇 본체와 호환되며, 실내, 실외, 수중, 사이버 환경 등 다양한 오픈월드 시뮬레이션 환경 생성을 지원합니다.

 

 

 

다수의 권위 있는 평가와 실제 기기 테스트를 통해 해당 모델의 뛰어난 성능이 입증되었습니다. 전 세계 126개 모델을 비교하는 WorldArena 비디오 벤치마크에서 Xiaomi-Robotics-U0는 명령 준수, 원활한 상호 작용 및 다중 시점 일관성에서 최고 성능을 보여주며 종합 1위를 차지했습니다.

 

실제 적용 전이 비교 테스트에서, 본 모델은 깊이 일관성 및 구조적 충실도와 같은 모든 지표에서 클로즈드 소스 GPT-Image-2.0보다 우수한 성능을 보였습니다. 후자는 일반적으로 시점 간 객체 정렬 오류 문제가 있어 로봇 훈련 데이터 확장에 활용하기 어렵습니다.

 

 

 

실제 환경에서 이 모델을 사용하여 증강 데이터로 훈련된 로봇은 낯선 조명이나 새로운 배경과 같은 복잡한 조건에서도 작업 완료 속도가 평균 26% 이상 향상되는 것을 보여줍니다. 또한 반사광이나 강한 색광과 같은 시각적 간섭을 자율적으로 보정하여 환경 일반화 능력을 크게 향상시킬 수 있습니다.

 

 

 

추론 단계에서 샤오미는 FlashAR+ 가속 솔루션을 출시했습니다. 이 솔루션은 vLLM 페이징 KV 캐싱 배치 스케줄링 기술과 결합하여 이미지 편집 및 임베디드 마이그레이션 프로세스 전체의 디코딩 속도를 최적화합니다. 1024*1024 해상도 이미지 생성에 소요되는 시간이 400초 이상에서 5.44초로 단축되어 산업용 배치 생성 요구 사항에 부합하면서도 이미지 품질과 물리적 상호 작용을 보장합니다.

 

현재 모든 모델 코드와 가중치는 공식 웹사이트, GitHub, Hugging Face 및 Moda 플랫폼에서 완전히 오픈 소스로 공개되어 있으며, 전 세계의 인공지능 개발자들이 사용할 수 있습니다.

 

 

 

[기사 끝] 본 기사를 재인쇄하실 경우 출처를 "Fast Technology"로 명시해 주시기 바랍니다.

담당 편집자: Jianjia