Alimama Tech
Aug 20, 2026 · Artificial Intelligence
TransVAE: Combining CNN Local Bias with Transformer Global Modeling for Scalable Visual Tokenizers
TransVAE merges early‑stage CNN local feature extraction with deep‑layer Transformer global reasoning, uses RoPE‑only positional encoding and ConvFFN to enable resolution‑agnostic scaling, and demonstrates stable improvements in reconstruction quality, latent alignment, and downstream generation across model sizes from 44 M to 2.3 B parameters.
CNNScalingTransVAE
0 likes · 12 min read
