Tagged articles

masked visual actions

4 articles · Page 1 of 1
Data Party THU
Data Party THU
Aug 2, 2026 · Artificial Intelligence

Masked Visual Actions Enable Generalizable Robot Modeling via Pixel Trajectories

The paper introduces Masked Visual Actions, a pixel‑mask representation of robot behavior that lets a 14B video model predict future outcomes and generate robot motions across unseen embodiments, achieving higher accuracy than traditional joint‑angle or pose inputs.

cross-embodiment generalizationmasked visual actionspixel trajectories
0 likes · 9 min read
Masked Visual Actions Enable Generalizable Robot Modeling via Pixel Trajectories
Machine Learning Algorithms & Natural Language Processing
Machine Learning Algorithms & Natural Language Processing
Jul 23, 2026 · Artificial Intelligence

Painting Robot Actions into Video World Models for Bidirectional Inference (Fei‑Fei Li Co‑author)

The paper introduces Masked Visual Actions, a method that renders robot motions as pixel‑level masks for video world models, enabling both forward prediction of environment changes and inverse generation of robot actions, achieving notable success‑rate gains and cross‑embodiment generalization.

cross-embodiment generalizationinverse action generationmasked visual actions
0 likes · 10 min read
Painting Robot Actions into Video World Models for Bidirectional Inference (Fei‑Fei Li Co‑author)
Machine Heart
Machine Heart
Jul 23, 2026 · Artificial Intelligence

Rendering Robot Actions as Video for Cross‑Embodiment Bidirectional Inference

The article reviews the Masked Visual Actions approach, which renders robot motion as pixel‑level masks for video world models, enabling both forward prediction of environment changes and inverse generation of robot actions, and demonstrates significant performance gains across multiple robotic tasks and embodiments.

AIRoboCasacross-embodiment
0 likes · 10 min read
Rendering Robot Actions as Video for Cross‑Embodiment Bidirectional Inference
Machine Learning Algorithms & Natural Language Processing
Machine Learning Algorithms & Natural Language Processing
Jul 22, 2026 · Artificial Intelligence

Masked Visual Actions: Controlling Robots with Only 15 Hours of Video

A new world model called Masked Visual Actions uses just 15 hours of robot video to predict action outcomes and generate robot behavior by representing motions as spatiotemporal pixel masks, achieving cross‑embodiment generalization, higher task success rates, and strong correlation between video evaluation and real‑world performance.

Video Predictioncross-embodiment generalizationinverse kinematics
0 likes · 9 min read
Masked Visual Actions: Controlling Robots with Only 15 Hours of Video