Tagged articles

Video DiT

2 articles · Page 1 of 1
Machine Heart
Machine Heart
Aug 23, 2026 · Artificial Intelligence

Why Video World Models Stay in Pixel Grids and How SCoPE’s Ray‑Space Encoding Frees Them

SCoPE (Sightline‑Coordinate Positional Encoding) replaces the traditional (u,v,t) pixel‑grid coordinates in video DiT models with camera‑ray coordinates injected into attention, achieving near‑zero parameter overhead while markedly improving camera control, cross‑view consistency, and revisit consistency across model scales and stylized inputs.

AttentionGenerative ModelingRay‑Space Positional Encoding
0 likes · 9 min read
Why Video World Models Stay in Pixel Grids and How SCoPE’s Ray‑Space Encoding Frees Them
AIWalker
AIWalker
Feb 25, 2025 · Artificial Intelligence

Sliding Tile Attention speeds up HunyuanVideo DiT generation 3.5×

Sliding Tile Attention (STA) replaces costly full‑3D attention in video DiT models with a block‑wise sliding‑window scheme, achieving up to 10× attention speedup and a 3.53× end‑to‑end generation boost for HunyuanVideo without quality loss, as demonstrated by extensive benchmarks and kernel analyses.

GPU optimizationHunyuanVideoSliding Tile Attention
0 likes · 16 min read
Sliding Tile Attention speeds up HunyuanVideo DiT generation 3.5×