Tagged articles

vision token compression

1 articles · Page 1 of 1
Xiaohongshu Tech REDtech
Xiaohongshu Tech REDtech
Aug 5, 2026 · Artificial Intelligence

Accelerating Xiaohongshu ‘Ask’ Inference: Slim Vision Tokens, Focused MoE

The article details how Xiaohongshu’s multimodal “Ask” service reduces visual token bloat and MoE expert compute by applying dynamic Vision Token compression (VisionZip) and similarity‑based expert re‑routing (SERE), achieving up to 13% lower first‑token latency and 16.5% faster end‑to‑end throughput while preserving answer quality.

MoE expert routingQwen modelsSERE
0 likes · 19 min read
Accelerating Xiaohongshu ‘Ask’ Inference: Slim Vision Tokens, Focused MoE