Tagged articles

Capacity Planning

211 articles · Page 1 of 3
ITPUB
ITPUB
Sep 30, 2026 · Artificial Intelligence

How AI Agents Handle High Concurrency: Admission, Backpressure, Async & Isolation

This article details a production-grade architecture for handling high concurrency in AI agent systems, covering real load estimation, admission control with bounded queues, async task processing, hierarchical concurrency budgets for models and tools, resource isolation via bulkheads, idempotency for state consistency, graded degradation strategies, and observability-driven capacity planning.

AI AgentsAsync ProcessingBackpressure
0 likes · 18 min read
How AI Agents Handle High Concurrency: Admission, Backpressure, Async & Isolation
Golang Shines
Golang Shines
Sep 26, 2026 · Operations

Complete Disk I/O Alert Troubleshooting: From Alert to Root Cause with 5 Real Cases

This article details a complete disk I/O alert investigation in production, covering core concepts like IOPS vs throughput, iostat/iotop analysis, and five real-world cases including MySQL missing indexes, log misconfiguration, backup conflicts, Redis persistence, and filesystem mount options, providing a reusable troubleshooting methodology.

Capacity PlanningMySQLPrometheus
0 likes · 65 min read
Complete Disk I/O Alert Troubleshooting: From Alert to Root Cause with 5 Real Cases
MaGe Linux Operations
MaGe Linux Operations
Sep 26, 2026 · Operations

RAG System Operations: Vector Database Selection & Performance Tuning

This comprehensive guide covers end-to-end RAG system operations, from vector database selection and workload profiling to HNSW parameter tuning, filtering strategies, index freshness monitoring, embedding upgrades, capacity planning, backup validation, and troubleshooting methodologies with concrete examples and evaluation frameworks.

Capacity PlanningHNSWMilvus
0 likes · 64 min read
RAG System Operations: Vector Database Selection & Performance Tuning
Data Bricklaying Diary
Data Bricklaying Diary
Sep 21, 2026 · Backend Development

Scaling Isn't Just Adding Instances: End-to-End Capacity, Traffic & Cost Design

This article argues that true system scaling requires end-to-end capacity planning across ingress, task processing, dependencies, and recovery—not merely adding instances—and shows how to translate business growth into workload models, manage backpressure, set per-link capacity budgets, validate with realistic load tests, and balance cost against performance.

BackpressureCapacity PlanningCost Optimization
0 likes · 24 min read
Scaling Isn't Just Adding Instances: End-to-End Capacity, Traffic & Cost Design
Cloud Architecture
Cloud Architecture
Sep 17, 2026 · Databases

Indexes Aren't Free: Production Index Governance for High-Write Order Systems

This article presents a comprehensive index governance methodology for high-write MySQL order systems, demonstrating through a real incident how a read-optimized index caused write latency, replica lag, and timeouts, and detailing a reusable process covering query-driven design, cost measurement, validation, change buffer limits, index convergence, safe deletion, read-write routing, sharding, transactional outbox, idempotent consumers, online DDL safeguards, gating, and long-term ownership.

Capacity PlanningChange BufferDescending Indexes
0 likes · 29 min read
Indexes Aren't Free: Production Index Governance for High-Write Order Systems
Random Bulletin
Random Bulletin
Sep 17, 2026 · Operations

10M QPS Architecture #256: Shifting Mega-Promo Reliability from Reactive to Proactive

This article details a proactive framework for mega-promotion reliability at 10M QPS, covering business red lines, full-link capacity modeling, stress testing for system boundaries, actionable degradation and isolation, decision-centric observability, executable runbooks, structured war rooms, drills, and readiness gates to replace reactive firefighting.

Capacity Planningdegradation strategieshigh-concurrency architecture
0 likes · 41 min read
10M QPS Architecture #256: Shifting Mega-Promo Reliability from Reactive to Proactive
Random Bulletin
Random Bulletin
Sep 8, 2026 · Operations

Resource Profiling at 10M QPS: From Coarse Averages to Fine-Grained Capacity Decisions

This article details how to evolve resource profiling from misleading averages to fine-grained, SLO-aware capacity models that incorporate instance heterogeneity, workload fingerprints, multi-resource bottlenecks, failure domains, and online calibration to drive trustworthy scheduling, autoscaling, release gating, and degradation decisions at ten-million-QPS scale.

AutoscalingCapacity PlanningSLO-based capacity
0 likes · 38 min read
Resource Profiling at 10M QPS: From Coarse Averages to Fine-Grained Capacity Decisions
Random Bulletin
Random Bulletin
Sep 7, 2026 · Operations

Fault Injection at Scale: Turning Paper Capacity into Trusted Resilience

This article explains why traditional capacity planning fails under real faults, detailing how to build continuous fault injection practices with hypothesis-driven experiments, blast radius control, automated stop conditions, and fault capacity maps to transform theoretical headroom into verified effective throughput at 10M QPS scale.

Capacity Planningblast radiuscapacity map
0 likes · 32 min read
Fault Injection at Scale: Turning Paper Capacity into Trusted Resilience
Random Bulletin
Random Bulletin
Sep 6, 2026 · Operations

Continuous Load Testing: Keeping Capacity Evidence in Sync with System Evolution at 10M QPS

This article explains why ad-hoc load testing fails at scale and details a four-stage evolution toward continuous load testing, covering baseline regression, release gates, failure capacity verification, production safety boundaries, and organizational ownership to keep capacity evidence current with system changes.

Capacity PlanningLoad TestingQPS
0 likes · 40 min read
Continuous Load Testing: Keeping Capacity Evidence in Sync with System Evolution at 10M QPS
Random Bulletin
Random Bulletin
Sep 5, 2026 · Operations

Why Static 80% Thresholds Fail at 10M QPS: Dynamic Water Level Management

The article explains why fixed thresholds like 80% CPU are inadequate for large-scale systems, and introduces dynamic water level management that combines load, resource, service, and resilience signals with capacity profiling, trend prediction, and action latency to drive automated scaling, scheduling, rate limiting, and degradation in a closed loop.

10M QPSCapacity PlanningSLO
0 likes · 31 min read
Why Static 80% Thresholds Fail at 10M QPS: Dynamic Water Level Management
Random Bulletin
Random Bulletin
Sep 4, 2026 · Operations

Capacity Prediction at 10M QPS: From Gut Feel to Data-Driven Decisions

This article explains why experience-based capacity planning fails at 10M QPS scale and presents a data-driven framework separating business demand, system load, and resource capacity, using prediction intervals, error feedback loops, and incremental model building to turn vague traffic estimates into verifiable resource decisions.

Capacity PlanningQPS scalingdata-driven operations
0 likes · 30 min read
Capacity Prediction at 10M QPS: From Gut Feel to Data-Driven Decisions
Woodpecker Software Testing
Woodpecker Software Testing
Sep 1, 2026 · Cloud Native

Why 90% of Container Performance Issues Come From Poor Capacity Planning – An In‑Depth Look

The article explains how container performance testing must evolve from simple load simulation to chaos‑engineered, observability‑driven capacity planning, introduces a 4‑dimensional capacity model, and shows automated SLI‑based scaling using real‑world e‑commerce and finance case studies.

Capacity PlanningKuberneteschaos engineering
0 likes · 7 min read
Why 90% of Container Performance Issues Come From Poor Capacity Planning – An In‑Depth Look
Woodpecker Software Testing
Woodpecker Software Testing
Aug 25, 2026 · Industry Insights

End-to-End Load Testing: Deep Cost‑Benefit Analysis and Decision Framework

While end‑to‑end load testing is essential for high‑availability in e‑commerce, finance, and government systems, this article reveals hidden costs—environment, data, and coordination—quantifies benefits such as reduced errors, tighter capacity control, and faster fault detection, and offers a ROI matrix and practical decision guidelines.

Capacity PlanningLoad TestingROI
0 likes · 8 min read
End-to-End Load Testing: Deep Cost‑Benefit Analysis and Decision Framework
YiSu Grain
YiSu Grain
Aug 20, 2026 · Operations

Performance & Reliability Case Study: Identify Bottlenecks, Plan Capacity, Design Fault Tolerance

The article walks through a provincial internet hospital scenario where a 5,000 QPS peak load only yields about 2,200 QPS throughput, P95 latency spikes to 8 seconds and error rate hits 10%, pinpointing a database bottleneck, then outlines SQL tuning, caching, CDN, async processing, capacity planning for 6,000 QPS, high‑availability redesign, reliability calculations, and a comprehensive validation plan.

Capacity PlanningDatabase OptimizationLoad Testing
0 likes · 42 min read
Performance & Reliability Case Study: Identify Bottlenecks, Plan Capacity, Design Fault Tolerance
Linyb Geek Road
Linyb Geek Road
Aug 15, 2026 · Operations

Key Metrics Every Ops Engineer Should Monitor

This article enumerates essential operational metrics—such as CPU, memory, disk and network I/O, response time, throughput, error rates, availability, MTBF/MTTR, security logs, and capacity‑planning indicators—explaining their meanings and recommended target values to help engineers comprehensively monitor system performance, stability, and efficiency.

Capacity PlanningPerformanceavailability
0 likes · 10 min read
Key Metrics Every Ops Engineer Should Monitor
Random Bulletin
Random Bulletin
Aug 3, 2026 · Operations

Cost Optimization at Ten‑Million QPS: Turning Ignored Expenses into Core Design

At ten‑million QPS scale, the article explains why cost shifts from a hidden after‑the‑fact bill to a primary design goal, detailing how to make costs observable, improve utilization, right‑size resources, leverage Spot and reserved instances, apply architectural savings, and embed FinOps culture while preserving SLA.

Capacity PlanningCloud ComputingCost Optimization
0 likes · 22 min read
Cost Optimization at Ten‑Million QPS: Turning Ignored Expenses into Core Design
Random Bulletin
Random Bulletin
Jul 31, 2026 · Cloud Native

Scaling at Ten‑Million QPS: From Manual to Automatic Autoscaling

The article analyzes why manual capacity adjustments break down at ten‑million‑QPS scale, then walks through metric‑driven autoscaling, anti‑flapping algorithms, headroom planning, predictive scaling, stateful service challenges, and multi‑dimensional strategies to achieve a cost‑stable dynamic balance.

AutoscalingCapacity PlanningKubernetes
0 likes · 20 min read
Scaling at Ten‑Million QPS: From Manual to Automatic Autoscaling
Random Bulletin
Random Bulletin
Jul 30, 2026 · Operations

From Guesswork to Math: Modeling Capacity for Ten‑Million QPS Services

Capacity evaluation evolves from intuition‑based estimates to rigorous modeling by measuring per‑request costs with single‑machine benchmarks, applying USL and queueing theory, bounding effective capacity with SLOs, conducting full‑link shadow traffic tests, and continuously calibrating online water‑marks to turn high‑traffic resilience into a calculable engineering decision.

Capacity PlanningSLOUSL
0 likes · 19 min read
From Guesswork to Math: Modeling Capacity for Ten‑Million QPS Services
IT Learning Made Simple
IT Learning Made Simple
Jul 20, 2026 · Backend Development

Key Takeaways from “Architecture Is the Future”: Scalable Web Architecture Principles

The article distills the core ideas of the book “Architecture Is the Future”, explaining why scalability is essential for modern web services and presenting eight design principles—horizontal scaling, load balancing, fault‑tolerance, data sharding, caching, asynchronous processing, monitoring, and automation—along with organizational patterns, capacity‑planning formulas, performance‑optimization steps, and high‑availability strategies.

CachingCapacity PlanningPerformance Optimization
0 likes · 11 min read
Key Takeaways from “Architecture Is the Future”: Scalable Web Architecture Principles
Linyb Geek Road
Linyb Geek Road
Jul 12, 2026 · Operations

Designing a High‑Availability Architecture: Core Principles and Practices

This article outlines the essential principles for building a high‑availability system, covering cluster and distributed designs, fault‑tolerance, reliable hardware, disaster recovery, monitoring, security, capacity planning, and automated scaling to achieve optimal performance and resilience.

Capacity Planningautomationcluster architecture
0 likes · 6 min read
Designing a High‑Availability Architecture: Core Principles and Practices
Random Bulletin
Random Bulletin
Jun 30, 2026 · Operations

Preventing Message Queue Backlog at Ten‑Million QPS: From Reactive to Proactive

The article explains how a ten‑million‑QPS messaging system can shift from reactive fire‑fighting to proactive backlog prevention by using long‑, mid‑, and short‑term defense layers, capacity planning, predictive scaling, backpressure, and regular chaos engineering to eliminate user‑visible latency.

BackpressureCapacity Planningbacklog prevention
0 likes · 19 min read
Preventing Message Queue Backlog at Ten‑Million QPS: From Reactive to Proactive
Raymond Ops
Raymond Ops
Jun 28, 2026 · Operations

Why Large‑Model Services Keep Running Out of GPU Memory: An Ops View from KV Cache to Concurrency

The article explains why large‑model inference services frequently hit GPU memory limits, breaks down static vs. dynamic memory consumption, shows how KV‑Cache, request length, and concurrency amplify usage, and provides a step‑by‑step troubleshooting and mitigation workflow for production environments.

Capacity PlanningGPU memoryKV Cache
0 likes · 26 min read
Why Large‑Model Services Keep Running Out of GPU Memory: An Ops View from KV Cache to Concurrency
AI Agent Super App
AI Agent Super App
Jun 24, 2026 · Operations

Will AI Replace Ops Engineers by 2025? From Automated Troubleshooting to One‑Click Deployments

The article examines how AI is reshaping operations—from instant fault detection and 47‑second incident resolution to natural‑language deployment scripts, predictive capacity planning, continuous security monitoring, and automated knowledge bases—while arguing that engineers will transition from fire‑fighters to system designers.

AIOpsCapacity Planningautomation
0 likes · 15 min read
Will AI Replace Ops Engineers by 2025? From Automated Troubleshooting to One‑Click Deployments
Shuge Unlimited
Shuge Unlimited
Jun 20, 2026 · Databases

From 64 to a Million Tenants: Choosing the Right Milvus Multi‑Tenant Layer and Avoiding the 65,536 Ceiling

The article dissects Milvus's four‑layer multi‑tenant architecture—Database, Collection, Partition, and Partition Key—detailing each layer's default tenant limits, isolation strength versus scalability trade‑offs, hidden constraints like the 65,536 capacity ceiling, the Partition Key isolation switch, and practical guidance for selecting the appropriate layer in SaaS and regulated scenarios.

Capacity PlanningDatabase isolationMilvus
0 likes · 17 min read
From 64 to a Million Tenants: Choosing the Right Milvus Multi‑Tenant Layer and Avoiding the 65,536 Ceiling
Tencent TDS Service
Tencent TDS Service
Jun 5, 2026 · Operations

Is Your System Ready for the World Cup Traffic Surge? A Full‑Link Load‑Testing Guide

As the 2026 World Cup approaches, teams must prepare for massive traffic spikes across live streaming, interactive marketing, ticketing, and e‑commerce; this article outlines key scenarios, explains why full‑link load testing is essential, and provides a step‑by‑step methodology to ensure capacity and reliability.

Capacity PlanningLoad Testingfull‑link testing
0 likes · 15 min read
Is Your System Ready for the World Cup Traffic Surge? A Full‑Link Load‑Testing Guide
Cloud Architecture
Cloud Architecture
Jun 4, 2026 · Backend Development

Kafka Backlog Mastery: Root Causes, Emergency Fixes, and Production‑Grade Governance

This comprehensive guide explains why Kafka message backlog occurs, how to diagnose its root causes, and provides a step‑by‑step 5‑minute emergency response and production‑grade consumer architecture, including back‑pressure control, idempotent processing, capacity planning, observability, and cloud‑native deployment strategies.

BacklogCapacity PlanningConsumer
0 likes · 48 min read
Kafka Backlog Mastery: Root Causes, Emergency Fixes, and Production‑Grade Governance
Random Bulletin
Random Bulletin
Jun 3, 2026 · Operations

Designing Partitions for Millions of QPS: From Default Settings to Precise Capacity Planning

The article explains why partition count is not a simple integer but the solution of a multi‑constraint capacity‑planning equation, walks through three design stages—from naïve defaults, through CPU‑core‑based heuristics, to a precise engineering model that balances throughput, ordering, scaling, fault domains and storage costs for million‑plus QPS workloads.

Capacity PlanningKafkaPartition Design
0 likes · 32 min read
Designing Partitions for Millions of QPS: From Default Settings to Precise Capacity Planning
21CTO
21CTO
May 10, 2026 · Industry Insights

Why GitHub’s Reliability Issues Are Driving Users Away

GitHub’s uptime has fallen sharply, with hundreds of incidents—including dozens of major outages—largely fueled by AI‑driven code generation, prompting high‑profile users to migrate, leadership to prioritize availability, and a costly overhaul of capacity and architecture.

AI-driven developmentCapacity PlanningGitHub
0 likes · 11 min read
Why GitHub’s Reliability Issues Are Driving Users Away
Cloud Architecture
Cloud Architecture
Apr 28, 2026 · Cloud Native

Kubernetes ‘Deadlock’ Explained: Guide to Diagnosing and Fixing Performance Issues

During a high‑traffic load test, a Kubernetes 1.28 cluster appeared to stall despite low CPU and memory usage, revealing hidden bottlenecks across container limits, conntrack saturation, CoreDNS latency, and control‑plane overload; the article walks through a systematic root‑cause analysis and step‑by‑step remediation.

Capacity PlanningKubernetesLoad Testing
0 likes · 34 min read
Kubernetes ‘Deadlock’ Explained: Guide to Diagnosing and Fixing Performance Issues
ITPUB
ITPUB
Apr 25, 2026 · Interview Experience

How to Design a Billion‑Scale URL Shortening System for an Interview

This article walks through the complete interview‑style design of a billion‑scale URL shortener, covering requirements, capacity estimation, API definitions, database schema, short‑code generation algorithms, sharding, caching, load balancing, rate limiting, and expiration handling, while illustrating each step with concrete examples and calculations.

API DesignCachingCapacity Planning
0 likes · 24 min read
How to Design a Billion‑Scale URL Shortening System for an Interview
ITPUB
ITPUB
Jan 16, 2026 · Databases

How Meituan Built a Real‑Time Database Capacity Assessment System

Meituan's database team created a sandbox‑based capacity assessment platform that replays live traffic, uses accelerated replay to discover performance bottlenecks, and closes the loop with capacity monitoring and automated operations, dramatically improving stability and resource utilization.

Capacity PlanningDatabase CapacityMySQL
0 likes · 16 min read
How Meituan Built a Real‑Time Database Capacity Assessment System
Ray's Galactic Tech
Ray's Galactic Tech
Jan 9, 2026 · Operations

Why Does Nginx Return 502 Bad Gateway? A Complete Log‑to‑FastCGI Timeout Diagnosis

This guide walks through diagnosing intermittent 502 Bad Gateway errors in Nginx by analyzing error logs, checking upstream and FastCGI timeout settings, reviewing PHP‑FPM configuration, performing performance tuning, and outlining advanced troubleshooting, monitoring, and capacity‑planning strategies to ensure stable high‑traffic deployments.

502Capacity PlanningNginx
0 likes · 9 min read
Why Does Nginx Return 502 Bad Gateway? A Complete Log‑to‑FastCGI Timeout Diagnosis
Woodpecker Software Testing
Woodpecker Software Testing
Jan 5, 2026 · Operations

Three Core Dimensions of Performance Testing: Time Behavior, Resource Utilization, and Capacity

This article breaks down performance testing into three essential dimensions—time behavior, resource utilization, and capacity—explains their key metrics, demonstrates a detailed e‑commerce flash‑sale case study, and shows how systematic testing and optimization can dramatically improve response times, throughput, and scalability.

Capacity PlanningJMeterLoad Testing
0 likes · 12 min read
Three Core Dimensions of Performance Testing: Time Behavior, Resource Utilization, and Capacity
ITFLY8 Architecture Home
ITFLY8 Architecture Home
Jan 5, 2026 · Operations

How to Define “Excellent” QPS Benchmarks for System Capacity Planning

This article provides a comprehensive framework for evaluating system support capability by defining QPS excellence thresholds across industry benchmarks, business types, response time, resource efficiency, performance metrics, architectural guidelines, optimization tactics, and real‑world case studies, culminating in a practical calculation formula.

Capacity PlanningQPSSystem Performance
0 likes · 5 min read
How to Define “Excellent” QPS Benchmarks for System Capacity Planning
ITFLY8 Architecture Home
ITFLY8 Architecture Home
Jan 3, 2026 · Operations

How to Accurately Estimate System QPS for Capacity Planning

This guide explains what QPS is, outlines three practical methods to estimate it—including business‑scenario modeling, historical data analysis, and industry benchmarking—covers key influencing factors, shows formulas linking QPS, concurrency and response time, and recommends tools and best‑practice tips for reliable capacity planning.

Capacity PlanningLoad TestingQPS
0 likes · 8 min read
How to Accurately Estimate System QPS for Capacity Planning
IT Services Circle
IT Services Circle
Dec 29, 2025 · Backend Development

Mastering Sharding: When, How, and How Much to Split Your Database

This guide walks senior backend engineers through the strategic reasoning, capacity estimation, and step‑by‑step migration techniques for sharding databases, covering when to split, choosing between partitioning, read/write splitting, or full sharding, and how to plan safe expansions.

Capacity PlanningPartitioningRead-Write Splitting
0 likes · 19 min read
Mastering Sharding: When, How, and How Much to Split Your Database
DevOps Coach
DevOps Coach
Dec 25, 2025 · Cloud Native

Real-World Kubernetes Troubleshooting Skills You Won’t Learn in Interviews

The article reveals the hidden gap between textbook Kubernetes knowledge and real production failures, offering six practical skills—from interpreting pod symptoms and debugging without logs to capacity planning and treating events as first‑class signals—essential for engineers to survive on‑call crises that interview questions never cover.

Capacity PlanningKubernetesTroubleshooting
0 likes · 7 min read
Real-World Kubernetes Troubleshooting Skills You Won’t Learn in Interviews
dbaplus Community
dbaplus Community
Nov 26, 2025 · Databases

How Meituan’s Database Capacity Assessment System Boosts Stability and Efficiency

Meituan’s Database Capacity Assessment System uses online traffic replay, accelerated load testing, and automated analysis to safely evaluate and optimize database read/write capacity, providing real‑time operation insights, flexible scaling, and reliable change‑risk mitigation for large‑scale production environments.

Capacity PlanningMeituanautomation
0 likes · 17 min read
How Meituan’s Database Capacity Assessment System Boosts Stability and Efficiency
Data Party THU
Data Party THU
Nov 2, 2025 · Operations

How to Maximize vLLM Throughput: Batch Size, Quantization, and Monitoring Tips

This guide explains how to unleash vLLM’s full potential by optimizing batch size, leveraging 4‑bit quantization, tuning concurrency parameters, planning capacity with token‑per‑second metrics, and implementing robust monitoring to balance latency, cost, and scalability in production deployments.

Capacity PlanningLLM servingbatching
0 likes · 10 min read
How to Maximize vLLM Throughput: Batch Size, Quantization, and Monitoring Tips
Meituan Technology Team
Meituan Technology Team
Oct 16, 2025 · Databases

How Meituan’s Database Capacity Evaluation System Boosts Stability and Efficiency

Meituan’s database team introduced a capacity evaluation system that uses online traffic replay in sandbox environments, accelerated replay to uncover performance bottlenecks, and a capacity‑operation loop to monitor and manage cluster resources, thereby improving database stability, safety of changes, and resource utilization.

Capacity Planningdatabasesperformance testing
0 likes · 19 min read
How Meituan’s Database Capacity Evaluation System Boosts Stability and Efficiency
MaGe Linux Operations
MaGe Linux Operations
Oct 16, 2025 · Operations

SRE Playbook: From Alert to Full Recovery of Service Avalanches

This comprehensive SRE guide walks through a real-world service avalanche incident, detailing alert triggering, root‑cause analysis, step‑by‑step recovery, capacity baseline creation, layered alert design, automated scripts, and post‑mortem best practices to help engineers prevent and resolve large‑scale outages.

Capacity PlanningSREService Avalanche
0 likes · 20 min read
SRE Playbook: From Alert to Full Recovery of Service Avalanches
Wukong Talks Architecture
Wukong Talks Architecture
Sep 22, 2025 · Databases

How AI‑Powered AIOps Transforms TiDB Database Operations

This article explores how integrating AI‑driven AIOps with the TiDB distributed database can automate monitoring, enable proactive anomaly detection, streamline root‑cause analysis, and optimize capacity planning, ultimately shifting database operations from manual firefighting to intelligent, data‑driven management.

AIOpsCapacity PlanningTiDB
0 likes · 12 min read
How AI‑Powered AIOps Transforms TiDB Database Operations
MaGe Linux Operations
MaGe Linux Operations
Sep 12, 2025 · Operations

From Alert Storms to Intelligent Ops: A Practical AIOps Journey

This article explores how AIOps transforms traditional IT operations by using AI for anomaly detection, root‑cause analysis, capacity forecasting, and self‑healing, offering a step‑by‑step roadmap, real‑world code examples, toolchain recommendations, common pitfalls, and future trends for building intelligent, automated operations.

AIOpsCapacity PlanningSelf-Healing
0 likes · 24 min read
From Alert Storms to Intelligent Ops: A Practical AIOps Journey
dbaplus Community
dbaplus Community
Aug 20, 2025 · Operations

How Qunar Automates Hotel Capacity Planning with Predictive Scaling

This article details Qunar's end‑to‑end solution for forecasting traffic spikes, estimating required CPU resources, and automatically scaling hotel services using a combined flow‑calendar, algorithmic prediction, and Ops‑driven auto‑scaling pipeline, improving stability and operational efficiency.

Algorithmic ForecastingCapacity PlanningKubernetes
0 likes · 12 min read
How Qunar Automates Hotel Capacity Planning with Predictive Scaling
Tech Freedom Circle
Tech Freedom Circle
Aug 20, 2025 · Backend Development

P0 Eureka Service Discovery Collapse Cost a Top E‑commerce $120M During Double‑11

During the Double‑11 shopping festival, a leading e‑commerce platform suffered a P0 outage when its Eureka service‑discovery cluster overloaded, triggering a full‑chain failure that lasted 2 hours 42 minutes and caused losses exceeding 1.2 billion yuan; the article dissects the timeline, root causes, capacity mis‑planning, monitoring gaps, and remediation strategies.

Capacity PlanningEurekaJava
0 likes · 34 min read
P0 Eureka Service Discovery Collapse Cost a Top E‑commerce $120M During Double‑11
Old Zhao – Management Systems Only
Old Zhao – Management Systems Only
Aug 18, 2025 · Operations

Why Fixing the Production Line Alone Won’t Solve Capacity Bottlenecks

Many managers blame the workshop when capacity falls short, but the real issue lies in misaligned production, planning, procurement, and logistics; this article explains how to diagnose bottlenecks, use data-driven methods, and implement coordinated supply‑chain strategies to boost throughput.

Capacity PlanningProduction optimizationSupply Chain
0 likes · 10 min read
Why Fixing the Production Line Alone Won’t Solve Capacity Bottlenecks
Tech Freedom Circle
Tech Freedom Circle
Aug 15, 2025 · Backend Development

Calculating a 100k QPS Rate‑Limiting Threshold: Methods and Best Practices

This article explains how to determine a 100 000‑QPS rate‑limiting threshold by covering the purpose of throttling, the three core elements of limiting, common algorithms, target dimensions, capacity estimation for single‑service and full‑link scenarios, pressure‑testing techniques, monitoring data, and adaptive configuration strategies.

Capacity PlanningQPSadaptive throttling
0 likes · 18 min read
Calculating a 100k QPS Rate‑Limiting Threshold: Methods and Best Practices
Architecture Breakthrough
Architecture Breakthrough
Jul 28, 2025 · Operations

Turn Point Fixes into Systemic Solutions: A Practical Optimization Framework

Effective technical optimization requires moving from isolated, point‑style ideas to a comprehensive, measurable framework that quantifies goals, assesses gaps, designs capacity, monitors key services and links, and establishes clear compensation and incident‑handling procedures, ensuring a complete, closed‑loop solution.

Capacity Planningincident handlingmonitoring
0 likes · 8 min read
Turn Point Fixes into Systemic Solutions: A Practical Optimization Framework
Tech Freedom Circle
Tech Freedom Circle
Jul 14, 2025 · Databases

How to Estimate Sharding Capacity: Calculating Required Databases and Tables for an Alibaba Interview

The article walks through why sharding is needed, outlines IO and CPU bottlenecks, presents two design principles, shows how to estimate capacity from existing data and growth trends, compares range, modulo, consistent‑hash and Snowflake sharding schemes, and details migration strategies for expanding nodes without downtime.

Capacity Planningconsistent hashingdata migration
0 likes · 22 min read
How to Estimate Sharding Capacity: Calculating Required Databases and Tables for an Alibaba Interview
Efficient Ops
Efficient Ops
Jul 13, 2025 · Operations

Mastering Modern System Operations: 6 Essential Strategies for Stability and Efficiency

This comprehensive guide outlines six critical areas of modern system operations—including real‑time monitoring, security safeguards, automation, fault diagnosis, collaborative teamwork, and process optimization—offering practical strategies and tools such as Zabbix, Prometheus, ELK, Redis, Ansible, and capacity planning to ensure stable, efficient enterprise services.

Capacity Planningautomationmonitoring
0 likes · 10 min read
Mastering Modern System Operations: 6 Essential Strategies for Stability and Efficiency
Old Zhao – Management Systems Only
Old Zhao – Management Systems Only
May 13, 2025 · Operations

Mastering Supply Chain Planning: Balancing Demand, Capacity, and Inventory with ERP

This article explains why many companies struggle with inaccurate plans, defines supply chain planning as the dynamic coordination of demand, capacity, and inventory, and provides a step‑by‑step ERP‑based framework—including demand forecasting, capacity analysis, inventory control, and execution—to achieve reliable, data‑driven operations.

Capacity PlanningERPSupply Chain
0 likes · 10 min read
Mastering Supply Chain Planning: Balancing Demand, Capacity, and Inventory with ERP
Qunar Tech Salon
Qunar Tech Salon
Mar 27, 2025 · Operations

Automated Capacity Planning and Auto‑Scaling for Hotel Services During Traffic Peaks

This document describes a comprehensive capacity‑planning solution that predicts traffic‑peak impacts for hotel services, automatically estimates required CPU resources, creates timed scaling tasks, and evaluates performance using detailed metrics, thereby improving operational efficiency and reducing manual effort during events such as exam‑ticket printing and holiday travel surges.

Capacity PlanningCloud Computingalgorithm
0 likes · 12 min read
Automated Capacity Planning and Auto‑Scaling for Hotel Services During Traffic Peaks
Lin is Dream
Lin is Dream
Mar 16, 2025 · Fundamentals

Mastering TPS and QPS: Simple Calculations and Real-World Examples

This article explains the key performance metrics TPS (transactions per second) and QPS (queries per second), provides formulas for calculating them, and demonstrates practical calculations for multi-node deployments, illustrating how request latency, thread pools, and instance count affect overall system concurrency and throughput.

Capacity PlanningConcurrencyQPS
0 likes · 3 min read
Mastering TPS and QPS: Simple Calculations and Real-World Examples
Architect
Architect
Jan 23, 2025 · Operations

Designing High‑Availability Systems: Architecture, Capacity Planning, and Fault‑Tolerance Guide

This article presents a comprehensive guide to building high‑availability systems, covering availability metrics, fault prevention, detection and recovery, capacity evaluation, layered architecture design, service tiering, resilience mechanisms, and operational best practices for reliable service delivery.

Capacity Planningfault tolerancehigh availability
0 likes · 34 min read
Designing High‑Availability Systems: Architecture, Capacity Planning, and Fault‑Tolerance Guide
High Availability Architecture
High Availability Architecture
Jan 13, 2025 · Operations

Comprehensive Guide to High‑Availability System Architecture and Practices

This article provides a systematic overview of high‑availability system design, covering availability metrics, fault prevention, detection, recovery, capacity planning, service tiering, data layer resilience, monitoring, and the responsibilities of architects, SREs, and developers to ensure reliable, scalable services.

Capacity Planningfault tolerancesystem architecture
0 likes · 30 min read
Comprehensive Guide to High‑Availability System Architecture and Practices
Open Source Linux
Open Source Linux
Jan 13, 2025 · Operations

Key Lessons from 2024 Major Service Outages and How to Prevent Future Downtime

The article reviews major 2024 service outages—from Alibaba Cloud to OpenAI—highlights their root causes, and offers practical operations strategies such as disaster recovery, regular backups, load balancing, monitoring, performance tuning, and capacity planning to reduce future downtime.

Capacity Planningdisaster recoverydowntime
0 likes · 5 min read
Key Lessons from 2024 Major Service Outages and How to Prevent Future Downtime
Tencent Cloud Developer
Tencent Cloud Developer
Jan 7, 2025 · Operations

Designing High‑Availability Systems: Principles, Architecture, and Operations

This comprehensive guide explains how to design, build, and operate high‑availability systems by covering availability metrics, fault‑tolerance strategies, capacity planning, code and data layer architecture, automated testing, monitoring, and clear role responsibilities to ensure services stay reliable and resilient under load.

Capacity PlanningSRESystem Design
0 likes · 32 min read
Designing High‑Availability Systems: Principles, Architecture, and Operations
Efficient Ops
Efficient Ops
Nov 19, 2024 · Operations

Mastering System Stability: Proven SRE Practices for Reliable, High‑Availability Services

This article explains how system stability depends on architecture and code details, defines SLA and the “nines” metric, outlines Google’s SRE hierarchy, and provides practical governance steps—including development and release processes, high‑availability design, capacity planning, monitoring, incident response, and team culture—to achieve reliable, high‑availability services.

Capacity PlanningSREhigh availability
0 likes · 34 min read
Mastering System Stability: Proven SRE Practices for Reliable, High‑Availability Services
Huolala Tech
Huolala Tech
Nov 14, 2024 · Operations

How Huolala Scaled Kafka: From Integrated Design to Cloud‑Native Elastic Architecture

This article chronicles the evolution of Huolala’s Kafka infrastructure—from an integrated compute‑storage design to a separated compute‑storage model with multi‑tenant deployment, and finally to a cloud‑native elastic architecture—detailing the challenges of capacity awareness, alarm configuration, and cost‑effective performance optimization.

Capacity PlanningKafkamulti-tenant
0 likes · 9 min read
How Huolala Scaled Kafka: From Integrated Design to Cloud‑Native Elastic Architecture
Bilibili Tech
Bilibili Tech
Oct 25, 2024 · Operations

Bilibili Data Center Migration: Planning, Execution, and Lessons Learned

Bilibili’s 18‑month, multi‑regional data‑center migration moved tens of thousands of servers using a high‑frequency rolling strategy, combining meticulous planning, cross‑team coordination, automated rack placement and rigorous checklists to achieve significant cost savings, higher utilization, improved stability and greener operations.

Capacity PlanningData Center Migrationautomation
0 likes · 21 min read
Bilibili Data Center Migration: Planning, Execution, and Lessons Learned
Efficient Ops
Efficient Ops
Jul 31, 2024 · Operations

How HuoLala Achieved Zero‑Fault Peaks: A Blueprint for High‑Load System Reliability

This article details HuoLala's three‑year journey of systematic business‑peak assurance, covering goal definition, project‑management practices, technical risk mitigation, cloud‑provider coordination, and post‑event reviews that together delivered zero‑fault high‑traffic periods and continuously improving system stability.

Capacity Planningpeak load managementrisk management
0 likes · 20 min read
How HuoLala Achieved Zero‑Fault Peaks: A Blueprint for High‑Load System Reliability
Architecture and Beyond
Architecture and Beyond
Jul 21, 2024 · Operations

Mastering Backend Stability: 7 Essential Practices for High Availability

This comprehensive guide outlines the seven key pillars—operations, high‑availability architecture, capacity governance, change management, risk governance, fault management, and chaos engineering—that together form a systematic approach to building and maintaining a reliable, 24‑hour backend system.

Capacity PlanningRisk Governancebackend stability
0 likes · 40 min read
Mastering Backend Stability: 7 Essential Practices for High Availability
Efficient Ops
Efficient Ops
May 21, 2024 · Operations

What Is an SRE? Roles, Skills, and Best Practices Explained

This article demystifies Site Reliability Engineering (SRE) by explaining its origins, core responsibilities, essential skill sets, and key practices such as observability, incident response, testing, capacity planning, automation, user support, on‑call duties, and the definition of SLI/SLO/SLA, providing a comprehensive guide for modern operations teams.

Capacity PlanningSREincident response
0 likes · 29 min read
What Is an SRE? Roles, Skills, and Best Practices Explained
iQIYI Technical Product Team
iQIYI Technical Product Team
May 10, 2024 · Operations

Full‑Link Load Testing of iQIYI Playback Service: Process, Tools, and Outcomes

iQIYI implemented full‑link load testing of its playback service using LoadMaker for traffic generation and Rover for link control, mapping the topology, creating weighted user scenarios, and safely pressurizing production‑like environments, which validated multi‑times historical peak capacity, uncovered bottlenecks, and enabled several performance and disaster‑recovery improvements without impacting real users.

Capacity PlanningLoad TestingiQIYI
0 likes · 10 min read
Full‑Link Load Testing of iQIYI Playback Service: Process, Tools, and Outcomes
Efficient Ops
Efficient Ops
Apr 14, 2024 · Operations

How to Ensure System Stability and High Availability: An SRE Playbook

This article explains the definitions of stability and high availability, distinguishes their relationship, outlines key performance indicators, and provides a comprehensive framework—including fault prevention, detection, and recovery, as well as design, coding, testing, monitoring, and emergency response practices—to help teams build reliable, highly available systems.

Capacity PlanningSREhigh availability
0 likes · 10 min read
How to Ensure System Stability and High Availability: An SRE Playbook
Efficient Ops
Efficient Ops
Jan 31, 2024 · Operations

How ICBC Boosted System Stability with Advanced Performance Capacity Testing

This article details ICBC Software Development Center's comprehensive approach to performance capacity testing, covering background challenges, a structured quality practice plan, enhanced test scope evaluation, result analysis, tool support, implementation outcomes, and future directions for ensuring system stability and scalability.

Capacity PlanningSoftware Engineeringperformance testing
0 likes · 9 min read
How ICBC Boosted System Stability with Advanced Performance Capacity Testing
DevOps
DevOps
Jan 18, 2024 · R&D Management

Understanding Story Points and Agile Team Capacity Planning

This article explains the concept of story points as a relative estimation unit, why agile teams use them, how they are applied across Scrum ceremonies, and answers common questions about their relationship to effort, value, and managerial decision‑making.

AgileCapacity PlanningR&D management
0 likes · 8 min read
Understanding Story Points and Agile Team Capacity Planning
Architect
Architect
Dec 13, 2023 · Industry Insights

How Bilibili Engineered a 1.2 B‑Viewer Live Stream for the LoL World Championship

This article details Bilibili's end‑to‑end technical planning, traffic‑estimation models, and concrete optimizations—including hotspot caching, traffic dispersion, long‑connection isolation, and automated fault‑injection—that enabled the S13 League of Legends finals to serve over 1.2 billion viewers with stable, low‑latency streaming.

Capacity PlanningPerformance OptimizationTraffic Engineering
0 likes · 22 min read
How Bilibili Engineered a 1.2 B‑Viewer Live Stream for the LoL World Championship
JD Tech
JD Tech
Nov 16, 2023 · Operations

Preparing JD's CDP Platform for Double 11: Challenges, Capacity Planning, and Lessons Learned

This article recounts the author's experience preparing JD's Customer Data Platform (CDP) for the Double 11 shopping festival, detailing the platform's capabilities, business scenarios, capacity planning, stability and performance challenges, disaster‑recovery measures, and personal reflections on the intensive technical effort involved.

CDPCapacity Planningbig data
0 likes · 12 min read
Preparing JD's CDP Platform for Double 11: Challenges, Capacity Planning, and Lessons Learned
AntTech
AntTech
Nov 8, 2023 · Artificial Intelligence

Kapacity V0.2 Release: AI‑Driven Traffic‑Based Replica Prediction for Cloud‑Native Autoscaling

Kapacity V0.2 introduces an AI‑powered, traffic‑driven replica prediction algorithm for cloud‑native autoscaling, featuring a Linear‑Residual model, a lightweight Swish Net time‑series forecaster, custom metric support, and open‑source tools, aiming to improve resource efficiency and reduce operational risk.

AICapacity PlanningKubernetes
0 likes · 9 min read
Kapacity V0.2 Release: AI‑Driven Traffic‑Based Replica Prediction for Cloud‑Native Autoscaling
dbaplus Community
dbaplus Community
Oct 7, 2023 · Operations

How to Build a Truly High‑Availability System: 6 Essential Design Layers

This article breaks down high‑availability system design into six critical layers—architecture, development standards, application services, storage, product safeguards, and operations—offering concrete practices such as capacity planning, fault‑tolerant patterns, monitoring, and incident‑response strategies to achieve four‑nine (99.99%) uptime.

Capacity PlanningSystem Designfault tolerance
0 likes · 26 min read
How to Build a Truly High‑Availability System: 6 Essential Design Layers
Huolala Tech
Huolala Tech
Sep 7, 2023 · Big Data

How Huolala Ensures Doris Stability: Real-World Big Data Practices

This article details Huolala's big‑data architecture and the practical measures—ranging from background analysis and stability challenges to case studies, discovery mechanisms, capacity planning, high‑availability, and automation—that the company employs to guarantee Doris's reliability and performance across its rapidly growing logistics platform.

Capacity PlanningDorisOLAP
0 likes · 15 min read
How Huolala Ensures Doris Stability: Real-World Big Data Practices
Liangxu Linux
Liangxu Linux
Sep 2, 2023 · Operations

How Many Files and TCP Connections Can a Linux Server Actually Handle?

This guide explains the Linux kernel parameters that limit the number of open files and TCP connections on a server, shows how to adjust those limits, calculates practical connection capacities for both servers and clients, and offers troubleshooting tips for the "too many open files" error.

Capacity PlanningTCP connections
0 likes · 15 min read
How Many Files and TCP Connections Can a Linux Server Actually Handle?
FunTester
FunTester
Aug 4, 2023 · Operations

How Tencent Scales Its Services for Chinese New Year: Inside Cloud Load‑Testing Strategies

This article details Tencent's cloud load‑testing approach for handling massive traffic spikes during Chinese New Year, covering background challenges, model selection, script authoring options, data construction, report analysis, and real‑world case studies that demonstrate capacity planning and performance optimization.

Capacity PlanningLoad TestingRPS
0 likes · 21 min read
How Tencent Scales Its Services for Chinese New Year: Inside Cloud Load‑Testing Strategies
Code Ape Tech Column
Code Ape Tech Column
Jul 26, 2023 · Operations

Service Governance: Monitoring, Fault Management, Release and Capacity Planning

This article explains how to achieve 24/7 service availability through comprehensive monitoring, fault handling, release management, and capacity planning, covering alarm types, batch processing, traffic and resource metrics, fault causes and mitigation, deployment strategies, scaling commands, and service degradation techniques.

Capacity PlanningService Governancefault management
0 likes · 20 min read
Service Governance: Monitoring, Fault Management, Release and Capacity Planning
FunTester
FunTester
Jul 12, 2023 · Operations

Mastering Load Testing: Practical Wrk, GoReplay, and SRE Strategies

This article explains why automation testing often lags behind product changes, outlines essential load‑testing concepts such as bottleneck analysis and capacity planning, and provides hands‑on guidance for using Wrk and GoReplay tools within an SRE‑driven operations workflow.

Automation TestingCapacity PlanningGoReplay
0 likes · 8 min read
Mastering Load Testing: Practical Wrk, GoReplay, and SRE Strategies
Tencent Cloud Developer
Tencent Cloud Developer
Mar 13, 2023 · Cloud Computing

Design Principles for High‑Availability System Architecture

The article outlines a comprehensive high‑availability architecture framework across six layers—development standards, application services, storage, product fallback, operations deployment, and emergency response—detailing design principles such as stateless services, elastic scaling, redundant storage, robust monitoring, gray releases, and chaos engineering to ensure resilient, continuously available systems.

Capacity Planningdeploymentfault tolerance
0 likes · 25 min read
Design Principles for High‑Availability System Architecture
HelloTech
HelloTech
Jan 31, 2023 · Operations

Stability Assurance Practices for Large‑Scale Promotional Events

The article outlines a comprehensive stability‑assurance framework for large‑scale promotional events—detailing planning, capacity and pressure‑test rehearsals, strict change‑freeze, internal gray releases, coordinated on‑call response, thorough link and capacity analysis, monitoring, emergency procedures, cross‑team collaboration, external partner coordination, and post‑event review to ensure resilient system performance.

Capacity PlanningLarge-Scale Eventschange control
0 likes · 17 min read
Stability Assurance Practices for Large‑Scale Promotional Events
ITPUB
ITPUB
Jan 12, 2023 · Operations

How to Build a Truly High‑Availability System: 6 Essential Design Layers

This article breaks down the essential design and operational considerations for achieving high availability across six layers—development standards, application services, storage, product strategy, operations deployment, and incident response—providing concrete practices, metrics, and safeguards to reach four‑nine (99.99%) uptime.

Capacity PlanningSystem Designdisaster recovery
0 likes · 25 min read
How to Build a Truly High‑Availability System: 6 Essential Design Layers
Alibaba Cloud Developer
Alibaba Cloud Developer
Jan 10, 2023 · Operations

How to Master System Stability: A Step‑by‑Step Guide for Reliable Operations

This article explains what stability assurance is, outlines a systematic workflow—including anomaly identification, monitoring configuration, impact assessment, and solution planning—and provides practical methods such as capacity estimation, traffic limiting, load testing, scaling, and pre‑heating to ensure services remain stable during both daily operations and high‑traffic events.

Capacity Planningincident responsemonitoring
0 likes · 25 min read
How to Master System Stability: A Step‑by‑Step Guide for Reliable Operations
Architecture Digest
Architecture Digest
Dec 21, 2022 · Operations

Designing High‑Availability Systems: Principles and Practices Across Six Layers

This article systematically explores high‑availability system design from development standards, capacity planning, application services, storage, product strategies, operations deployment, to incident response, presenting key concepts, architectural patterns, and practical guidelines for building resilient services.

Capacity PlanningSystem Designdeployment
0 likes · 27 min read
Designing High‑Availability Systems: Principles and Practices Across Six Layers
Bilibili Tech
Bilibili Tech
Nov 19, 2022 · Operations

Technical Assurance for High‑Write Live‑Streaming Gift Scenarios

The technical‑assurance team secured Bilibili’s high‑write live‑stream gift system by expanding capacity, isolating hot keys, refactoring pipelines, adding asynchronous writes, employing horizontal scaling and full‑link load testing, converting uncertain dependencies into graceful fallbacks, and deploying dual‑active, chaos‑engineered disaster‑resilience architecture aligned with business usage patterns.

Capacity PlanningDatabase ScalingSRE
0 likes · 16 min read
Technical Assurance for High‑Write Live‑Streaming Gift Scenarios
Architects' Tech Alliance
Architects' Tech Alliance
Nov 17, 2022 · Industry Insights

Mastering Compute Resource Planning and Cash Flow for IC Design Projects

This article analyzes how semiconductor design firms can balance compute capacity and cash flow by modeling monthly core‑hour demand across project phases, presenting beginner and experienced algorithms, realistic usage conversion, and strategic choices between local, cloud, and hybrid resources.

Capacity PlanningIC designcash flow
0 likes · 14 min read
Mastering Compute Resource Planning and Cash Flow for IC Design Projects
DeWu Technology
DeWu Technology
Oct 17, 2022 · Operations

High Availability: Principles and Practices for System Stability

High availability—measured in nines of uptime—requires partitioning systems, decoupling components, choosing robust technologies, deploying redundant instances with automatic failover, capacity planning, rapid scaling, traffic shaping, resource isolation, global protection, observability, and disciplined change management to achieve stable, resilient services.

Capacity Planningchange managementfault tolerance
0 likes · 10 min read
High Availability: Principles and Practices for System Stability
Efficient Ops
Efficient Ops
Jun 19, 2022 · Operations

How Bilibili SRE Guarantees Million‑User Live Events: Strategies, Tools, and Lessons

This article details Bilibili's SRE approach to large‑scale live events, covering background, activity scenarios, resource planning, performance testing, chaos‑engineering drills, technical safeguards such as DCDN, SLB, WAF, PaaS, cache and DB, pre‑plan capabilities, post‑mortem analysis, and future outlook, illustrating how systematic capacity management and automated resilience practices enable stable operation for events with tens of millions of concurrent users.

Capacity PlanningSREchaos engineering
0 likes · 22 min read
How Bilibili SRE Guarantees Million‑User Live Events: Strategies, Tools, and Lessons
Bilibili Tech
Bilibili Tech
Jun 14, 2022 · Operations

SRE Practices for Large‑Scale Event Assurance at Bilibili

Bilibili’s SRE team ensures flawless large‑scale online events by meticulously gathering activity details, provisioning DNS, CDN, networking and compute resources, conducting multi‑stage performance tests and chaos‑engineering drills, applying layered traffic controls, maintaining historical checklists, executing predefined contingency responses, and iterating post‑mortems to drive continuous automation and reliability.

Capacity PlanningEvent ReliabilitySRE
0 likes · 20 min read
SRE Practices for Large‑Scale Event Assurance at Bilibili
Alibaba Cloud Native
Alibaba Cloud Native
Jun 8, 2022 · Cloud Native

Turning 618 Sales Uncertainty into Certainty: Cloud‑Native Best‑Practice Guide

This article outlines a comprehensive, cloud‑native methodology for preparing large‑scale sales events like the 618 promotion, covering uncertainty challenges, capacity assessment, performance testing, pre‑heating strategies, flow‑control, and MSE service‑governance techniques to ensure stable, cost‑effective operation.

Capacity PlanningFlow ControlMSE
0 likes · 19 min read
Turning 618 Sales Uncertainty into Certainty: Cloud‑Native Best‑Practice Guide
dbaplus Community
dbaplus Community
May 17, 2022 · Backend Development

How to Size a Kafka Cluster for Over 1 Billion Daily Requests

This article walks through a scenario‑driven capacity assessment for a production‑grade Kafka cluster, covering QPS calculations, storage needs, physical machine count, disk choices, memory, CPU, network bandwidth, deployment steps, and a final resource summary.

Capacity PlanningCluster SizingKafka
0 likes · 13 min read
How to Size a Kafka Cluster for Over 1 Billion Daily Requests