Tagged articles

All-to-All

2 articles · Page 1 of 1
Architects' Tech Alliance
Architects' Tech Alliance
Sep 11, 2026 · Artificial Intelligence

scaleFabric: IBGDA-Powered GPU-Autonomous Communication Validated at 100K-GPU Scale

Sugon's scaleFabric achieves China's first large-scale IBGDA deployment, letting GPUs directly drive InfiniBand NICs without CPU involvement; validated in 100K-GPU clusters, it eliminates the CPU penalty for small-packet MoE All-to-All communication, cuts latency by two orders of magnitude, and integrates NVMe-over-RDMA and XPU Direct Storage for end-to-end Token acceleration.

All-to-AllGPUDirect RDMAIBGDA
0 likes · 11 min read
scaleFabric: IBGDA-Powered GPU-Autonomous Communication Validated at 100K-GPU Scale
Baidu Intelligent Cloud Tech Hub
Baidu Intelligent Cloud Tech Hub
May 16, 2025 · Artificial Intelligence

How Baidu Cloud Achieved 4µs End-to-End Latency for Large-Scale PD Inference

Baidu Intelligent Cloud built a 4µs end-to-end low‑latency HPN cluster, optimized traffic management and communication operators, and introduced dynamic expert balancing to dramatically improve the performance of large‑scale PD‑separated inference services, showcasing the deep integration of network infrastructure with AI workloads.

AI inferenceAll-to-AllHPN
0 likes · 14 min read
How Baidu Cloud Achieved 4µs End-to-End Latency for Large-Scale PD Inference