Black Forest Labs와 mimic robotics는 이미지·비디오·오디오를 공동 학습한 FLUX 3 백본에 로봇 행동 예측을 결합해, Audi 생산 현장에서 시험·배포한 FLUX-mimic을 개발함 전체 학습 연산의 95% 이상을 차지하는 비디오 예측으로 접촉·운동·무게·인과관계를 익히고, 저차원 로봇 행동도 같은 물리 현실을 나타내는 추가 양식으로 처리함 행동 예측을 추가한 직후 비디오 생성 품질이 최대 10% 하락했지만 3,500스텝 뒤 기존 수준을 회복해, 하나의 백본으로 생성과 행동 예측을 함께 수행할 수 있음을 확인함 Self-Flow로 생성·표현 학습을 통합하고 경량 행동 디코더를 연결해, 단일 NVIDIA RTX 5090에서 백본 처리 80ms 미만, 전체 로봇 반응 시간 101ms를 달성함 범용 비디오와 조작 작업을 대규모로 학습한 세계 모델은 적은 시연만으로 새 작업에 적응하고 실패 후 재시도해, 유연한 부품과 정밀 조작처럼 기존 자동화의 비용이 높았던 생산 작업에 활용됨 하나의 백본으로 콘텐츠 생성과 로봇 제어 FLUX 1·FLUX 2가 이미지 생성에 집중한 데 이어, FLUX 3는 이미지·비디오·오디오를 처음부터 함께 학습해 시청각 콘텐츠를 공동 생성함 Black Forest Labs는 mimic robotics에 FLUX 3 초기 버전을 제공하고, 양사의 로봇 학습·배포 및 기반 모델 전문성을 결합해 FLUX-mimic을 개발함 mimic은 자체 로봇과 로봇 학습, 정교한 조작, 생산 환경 배포를 담당함 Black Forest Labs는 시각 기반 모델과 다중양식 학습·모델링 역량을 제공함 FLUX-mimic은 FLUX 3 백본에 기반한 범용 조작용 비디오-액션 모델이며, mimic의 풀스택 배포 시스템에 통합됨 같은 백본이 이미지·비디오·오디오 콘텐츠를 생성하는 동시에, Physical AI에서는 행동을 수행함 비디오 예측으로 학습하는 물리 세계 FLUX 3 학습 연산의 95% 이상이 비디오 예측에 사용됨 사실적인 비디오를 만들려면 접촉, 운동, 무게, 원인과 결과를 학습해야 하며, 이를 잘못 처리하면 결과 영상도 부자연스러워짐 세계를 정확히 렌더링하는 과정은 세계가 작동하는 방식을 학습하는 과정과 연결됨 오디오는 720p 음향 포함 비디오에서 토큰의 0.5% 미만을 차지하는 저차원 양식임 비디오를 이해한 모델은 입술 움직임과 동기화된 음성, 물리적 사건에 맞물린 효과음의 인과...
FLUX 3 x mimic: 로봇을 위한 차세대 비디오-액션 모델
1 week ago
10
Related
64비트 어셈블리의 기술
52 minutes ago
1
Google이 RSS 피드 확산을 무너뜨리는 데 기여한 과정(2023)
1 hour ago
0
agent-device - AI 에이전트가 iOS/Android 기기를 제어하도록 돕는 CLI
1 hour ago
1
C에서 sizeof가 놀라울 정도로 파싱하기 어려운 이유
2 hours ago
0
자동화하지 말고, 완전히 없애버려라
2 hours ago
0
가장 빠른 AI-First 기업은 실제로 어떻게 일하는가
2 hours ago
0
AI와 개발하기: 숨은 결정을 드러내기
2 hours ago
0
미국의 오픈 모델 패러독스
2 hours ago
0
Tips
click
Trending
Popular
필리핀 “中 관영매체, 필리핀인을 원숭이로 묘사…인종차별”
2 weeks ago
124
北핵실험 연구한 美학자, 中에 20개월째 구금…외교문제 비화
2 weeks ago
104
디노티시아, ICML26서 ‘STAR-KV’ 논문 발표··· ‘KV 캐시 75% 압축에도 성능 보존’
3 weeks ago
62
삼일PwC, AI 기반 '지속가능성 공시 통합 플랫폼' 출시
3 weeks ago
59
© Clint's Theme Park 2026. All rights are reserved










English (US) ·