Tagged articles

cross-embodiment generalization

3 articles · Page 1 of 1
Data Party THU
Data Party THU
Aug 2, 2026 · Artificial Intelligence

Masked Visual Actions Enable Generalizable Robot Modeling via Pixel Trajectories

The paper introduces Masked Visual Actions, a pixel‑mask representation of robot behavior that lets a 14B video model predict future outcomes and generate robot motions across unseen embodiments, achieving higher accuracy than traditional joint‑angle or pose inputs.

cross-embodiment generalizationmasked visual actionspixel trajectories
0 likes · 9 min read
Masked Visual Actions Enable Generalizable Robot Modeling via Pixel Trajectories
Machine Learning Algorithms & Natural Language Processing
Machine Learning Algorithms & Natural Language Processing
Jul 23, 2026 · Artificial Intelligence

Painting Robot Actions into Video World Models for Bidirectional Inference (Fei‑Fei Li Co‑author)

The paper introduces Masked Visual Actions, a method that renders robot motions as pixel‑level masks for video world models, enabling both forward prediction of environment changes and inverse generation of robot actions, achieving notable success‑rate gains and cross‑embodiment generalization.

cross-embodiment generalizationinverse action generationmasked visual actions
0 likes · 10 min read
Painting Robot Actions into Video World Models for Bidirectional Inference (Fei‑Fei Li Co‑author)
Machine Learning Algorithms & Natural Language Processing
Machine Learning Algorithms & Natural Language Processing
Jul 22, 2026 · Artificial Intelligence

Masked Visual Actions: Controlling Robots with Only 15 Hours of Video

A new world model called Masked Visual Actions uses just 15 hours of robot video to predict action outcomes and generate robot behavior by representing motions as spatiotemporal pixel masks, achieving cross‑embodiment generalization, higher task success rates, and strong correlation between video evaluation and real‑world performance.

Video Predictioncross-embodiment generalizationinverse kinematics
0 likes · 9 min read
Masked Visual Actions: Controlling Robots with Only 15 Hours of Video