Xiaohongshu Tech REDtech
Aug 5, 2026 · Artificial Intelligence
Accelerating Xiaohongshu ‘Ask’ Inference: Slim Vision Tokens, Focused MoE
The article details how Xiaohongshu’s multimodal “Ask” service reduces visual token bloat and MoE expert compute by applying dynamic Vision Token compression (VisionZip) and similarity‑based expert re‑routing (SERE), achieving up to 13% lower first‑token latency and 16.5% faster end‑to‑end throughput while preserving answer quality.
MoE expert routingQwen modelsSERE
0 likes · 19 min read
