Designing a 200M‑Request Recommendation System with 50ms P99 Latency
The team rebuilt a recommendation platform for a 80‑million‑DAU content service, scaling daily requests from 30 M to 200 M, cutting P99 latency from 800 ms to under 50 ms by introducing a four‑layer architecture, multi‑path recall (vector, real‑time, graph), transformer‑based ranking, multi‑level caching, predictive autoscaling, and comprehensive observability.
