Tagged articles

Ray‑Space Positional Encoding

1 articles · Page 1 of 1
Machine Heart
Machine Heart
Aug 23, 2026 · Artificial Intelligence

Why Video World Models Stay in Pixel Grids and How SCoPE’s Ray‑Space Encoding Frees Them

SCoPE (Sightline‑Coordinate Positional Encoding) replaces the traditional (u,v,t) pixel‑grid coordinates in video DiT models with camera‑ray coordinates injected into attention, achieving near‑zero parameter overhead while markedly improving camera control, cross‑view consistency, and revisit consistency across model scales and stylized inputs.

AttentionComputer VisionGenerative Modeling
0 likes · 9 min read
Why Video World Models Stay in Pixel Grids and How SCoPE’s Ray‑Space Encoding Frees Them