Machine Heart
Aug 23, 2026 · Artificial Intelligence
Why Video World Models Stay in Pixel Grids and How SCoPE’s Ray‑Space Encoding Frees Them
SCoPE (Sightline‑Coordinate Positional Encoding) replaces the traditional (u,v,t) pixel‑grid coordinates in video DiT models with camera‑ray coordinates injected into attention, achieving near‑zero parameter overhead while markedly improving camera control, cross‑view consistency, and revisit consistency across model scales and stylized inputs.
AttentionComputer VisionGenerative Modeling
0 likes · 9 min read
