Tagged articles

Metrics

620 articles · Page 4 of 7
Open Source Linux
Open Source Linux
Dec 8, 2022 · Operations

Master Prometheus: From Metrics Collection to Alerting and Visualization

Prometheus is an open‑source monitoring solution that covers metric exposition, scraping, storage, querying, visualization, and alerting, and this guide walks through its architecture, configuration, custom exporters, PromQL queries, Grafana integration, and alert management, providing a comprehensive introduction for developers and ops engineers.

ExporterGrafanaMetrics
0 likes · 22 min read
Master Prometheus: From Metrics Collection to Alerting and Visualization
Bilibili Tech
Bilibili Tech
Dec 2, 2022 · Big Data

Data Quality Management: Expectations, Measurement, Assurance, and Operation

The article outlines a complete data‑quality‑management framework that first captures business expectations, then translates them into basic and personalized measurement rules, defines four assurance approaches for handling violations, and scales operation with indicators, tooling, and metrics to continuously improve data quality across the lifecycle.

Metricsdata governancedata quality
0 likes · 19 min read
Data Quality Management: Expectations, Measurement, Assurance, and Operation
Efficient Ops
Efficient Ops
Nov 29, 2022 · Operations

How to Retrieve and Process Prometheus Metrics via Its API

This article explains how to use the Prometheus HTTP API to query instant and range metrics, interpret the JSON responses, and fetch data programmatically with Python, providing code examples and details on request parameters, error handling, and practical usage.

APIDevOpsMetrics
0 likes · 8 min read
How to Retrieve and Process Prometheus Metrics via Its API
FunTester
FunTester
Nov 27, 2022 · Fundamentals

Why Performance Testing Matters: Key Metrics, Types, and Best Practices

This guide explains what performance testing is, why it’s essential, the key metrics such as throughput, response time, and bandwidth, outlines a step‑by‑step testing process, compares load, stress, endurance and capacity testing types, and reviews popular tools like JMeter, LoadRunner and NeoLoad.

Metricsbest practicesload testing
0 likes · 10 min read
Why Performance Testing Matters: Key Metrics, Types, and Best Practices
macrozheng
macrozheng
Nov 19, 2022 · Operations

Unlocking Prometheus: Visual Guide to Architecture, Metrics, and Alerts

This article visually explains Prometheus’s architecture, core features, metric collection methods, exporters, PromQL query language, and alerting workflow, helping readers understand how to monitor cloud‑native systems effectively while noting its strengths and limitations.

ExportersMetricsPromQL
0 likes · 8 min read
Unlocking Prometheus: Visual Guide to Architecture, Metrics, and Alerts
Alibaba Cloud Native
Alibaba Cloud Native
Nov 17, 2022 · Cloud Native

How RocketMQ Harnesses Prometheus for Full‑Stack Observability

This article explains how RocketMQ integrates with Prometheus and Grafana to provide comprehensive metrics, tracing, and logging, detailing the exporter architecture, deployment choices, span topology, dashboard examples, and ARMS‑based alerting for cloud‑native message‑queue observability.

ARMSCloud NativeMetrics
0 likes · 14 min read
How RocketMQ Harnesses Prometheus for Full‑Stack Observability
macrozheng
macrozheng
Nov 5, 2022 · Operations

Unlock Full Observability in Spring Boot 3 with Micrometer Observation API

This article explains how Spring Boot 3.0.0‑RC1 integrates Micrometer Observation API to provide unified metrics, logging, and distributed tracing, showing the observation lifecycle, configuration steps, sample server and client code, Docker‑compose setup, and notes on native image support for comprehensive application observability.

JavaMetricsSpring Boot
0 likes · 26 min read
Unlock Full Observability in Spring Boot 3 with Micrometer Observation API
Architects Research Society
Architects Research Society
Nov 3, 2022 · Fundamentals

Programming Productivity: Definitions, Models, and Influencing Factors

Programming productivity, also known as software or development productivity, examines how output relates to input, covering definitions, measurement models such as COCOMO II and Jones’s factors, function points, value‑based engineering, and human aspects, while discussing efficiency, effectiveness, profitability, and various factors influencing individual and team efficiency.

COCOMOMetricsfunction points
0 likes · 12 min read
Programming Productivity: Definitions, Models, and Influencing Factors
Baidu MEUX
Baidu MEUX
Oct 26, 2022 · Product Management

How Baidu’s Light Design System Uses PATS Metrics to Boost Efficiency

This article explains why measuring a design system is essential, outlines how Baidu's Light Design System built a PATS metric framework through research and four practical steps, and shares real-world results that improved usability, reliability, and overall workflow efficiency.

BaiduMetricsPATS
0 likes · 10 min read
How Baidu’s Light Design System Uses PATS Metrics to Boost Efficiency
Architecture Digest
Architecture Digest
Oct 21, 2022 · Operations

Benchmarking and Sizing Your Elasticsearch Cluster for Logs and Metrics

This article explains how to assess hardware resources, calculate required Elasticsearch cluster size based on data volume, and perform indexing and search benchmark tests to ensure stable performance and optimal throughput for log and metric workloads in production environments.

Cluster SizingElasticsearchMetrics
0 likes · 10 min read
Benchmarking and Sizing Your Elasticsearch Cluster for Logs and Metrics
Efficient Ops
Efficient Ops
Oct 13, 2022 · Operations

Essential Guide to Effective Monitoring in Operations: Goals, Methods, and Tools

This article outlines the essential components of operational monitoring, covering monitoring objectives, methods, core processes, key tools, metrics for hardware, system, application, network, and business layers, as well as alerting, handling, and best practices for building a comprehensive, reliable monitoring solution.

Metricsalertingsystem reliability
0 likes · 7 min read
Essential Guide to Effective Monitoring in Operations: Goals, Methods, and Tools
dbaplus Community
dbaplus Community
Sep 26, 2022 · Backend Development

How Ctrip Replaced HBase with VictoriaMetrics & ClickHouse for Scalable Metrics Monitoring

Ctrip’s internal Dashboard monitoring platform, originally built on HBase, was redesigned by migrating its core writer and storage components to a hybrid VictoriaMetrics‑ClickHouse solution, delivering faster queries, higher write stability, and full Prometheus compatibility while keeping the user experience unchanged.

ClickHouseDashboardHBase
0 likes · 13 min read
How Ctrip Replaced HBase with VictoriaMetrics & ClickHouse for Scalable Metrics Monitoring
Practical DevOps Architecture
Practical DevOps Architecture
Sep 26, 2022 · Operations

Introduction to Prometheus Monitoring, Alertmanager, and Grafana with Course Outline

This article introduces the Prometheus monitoring platform, explains Alertmanager's grouping, inhibition and silencing features, describes Grafana's visualization and alerting capabilities, and provides a detailed course syllabus covering installation, configuration, and advanced monitoring techniques across various environments.

AlertmanagerGrafanaMetrics
0 likes · 4 min read
Introduction to Prometheus Monitoring, Alertmanager, and Grafana with Course Outline
SQB Blog
SQB Blog
Sep 15, 2022 · Frontend Development

Mastering Front-End Performance: How to Use PerformanceObserver & Metrics

This article explains how to monitor and analyze front‑end performance using the deprecated performance.timing API and the modern PerformanceObserver, detailing key web‑vital metrics such as TTFB, FCP, LCP, FID, and CLS, with code examples and practical interpretation guidelines.

FrontendMetricsperformanceobserver
0 likes · 13 min read
Mastering Front-End Performance: How to Use PerformanceObserver & Metrics
DevOpsClub
DevOpsClub
Sep 13, 2022 · R&D Management

How DevMind Transforms R&D Efficiency with Scalable Metrics

This article outlines the DevMind system—a comprehensive, data‑driven framework that turns R&D efficiency measurement into an online, low‑threshold, scalable practice, covering four best‑practice pillars, technical architectures, product modules, and real‑world impact within large organizations.

DevOpsMetricsR&D Efficiency
0 likes · 28 min read
How DevMind Transforms R&D Efficiency with Scalable Metrics
Efficient Ops
Efficient Ops
Sep 7, 2022 · Operations

How DeepFlow Automates Full‑Stack Observability for Cloud‑Native Environments

This article presents DeepFlow, an open‑source, highly automated observability platform that uses eBPF to provide zero‑code AutoMetrics and AutoTracing, integrates with Prometheus, OpenTelemetry and SkyWalking, and enables SRE, DevOps and NewOps teams to build full‑stack metrics and blind‑spot‑free tracing for cloud‑native applications.

DevOpsMetricsObservability
0 likes · 20 min read
How DeepFlow Automates Full‑Stack Observability for Cloud‑Native Environments
dbaplus Community
dbaplus Community
Sep 5, 2022 · Operations

How EyesTSDB Evolved into a Cloud‑Native, Second‑Level Monitoring Platform

This article details the evolution of NetEase's self‑built time‑series database EyesTSDB into a cloud‑native, second‑level monitoring solution, covering its architecture, core features, integration with VictoriaMetrics, custom plugin workflow, CMDB linkage, real‑world use cases, and future challenges.

CMDB integrationMetricsMonitoring
0 likes · 21 min read
How EyesTSDB Evolved into a Cloud‑Native, Second‑Level Monitoring Platform
ITPUB
ITPUB
Aug 29, 2022 · Backend Development

How Ctrip Replaced HBase with VictoriaMetrics & ClickHouse for Scalable Metrics Monitoring

This article details Ctrip's internal Dashboard monitoring platform, explains why its HBase‑based TSDB became a bottleneck, and describes the step‑by‑step migration to a hybrid VictoriaMetrics‑ClickHouse solution with upgraded writers, unified query APIs, performance gains, and future roadmap.

ClickHouseHBaseMetrics
0 likes · 13 min read
How Ctrip Replaced HBase with VictoriaMetrics & ClickHouse for Scalable Metrics Monitoring
Model Perspective
Model Perspective
Aug 25, 2022 · Artificial Intelligence

Mastering Regression: Key Assumptions, Metrics, and Model Evaluation

This article explains the fundamental assumptions of linear regression, compares linear and nonlinear models, discusses multicollinearity, outliers, regularization, heteroscedasticity, VIF, stepwise regression, and reviews essential evaluation metrics such as MAE, MSE, RMSE, R² and Adjusted R².

Linear RegressionMachine LearningMetrics
0 likes · 12 min read
Mastering Regression: Key Assumptions, Metrics, and Model Evaluation
DevOps
DevOps
Aug 17, 2022 · Operations

Measuring Success in Continuous Delivery: Four Key Metrics and Practical Tips

This article explains why measuring is essential for continuous delivery, introduces four valuable metrics—deployable package count, cycle time, mean time between failures, and mean time to recovery—and offers practical tips to improve delivery speed and reliability.

Continuous DeliveryDevOpsMTBF
0 likes · 7 min read
Measuring Success in Continuous Delivery: Four Key Metrics and Practical Tips
Programmer DD
Programmer DD
Aug 16, 2022 · Databases

Master MySQL Monitoring with Built‑in SHOW Commands: A Complete Guide

This article explains how to collect comprehensive MySQL performance metrics—including connections, buffer cache, locks, statement counts, throughput, server variables, and slow‑query analysis—using only MySQL's native SHOW commands, providing a fast, low‑overhead monitoring solution.

Database MonitoringMetricsMySQL
0 likes · 11 min read
Master MySQL Monitoring with Built‑in SHOW Commands: A Complete Guide
Bilibili Tech
Bilibili Tech
Aug 12, 2022 · Operations

SLO Implementation and Alerting Strategies – Bilibili SRE Practices

The article outlines Bilibili’s refined SLO framework—categorizing services into four business tiers, selecting availability, latency, and freshness SLIs, setting concrete SLO targets, and employing multi‑window error‑budget and consumption‑rate alerting strategies to improve stability and provide comprehensive quality dashboards.

MetricsMonitoringSLO
0 likes · 18 min read
SLO Implementation and Alerting Strategies – Bilibili SRE Practices
Snowball Engineer Team
Snowball Engineer Team
Aug 5, 2022 · Big Data

Snowball Data Warehouse Modeling and OneData System Implementation

This article outlines Snowball's data warehouse background, compares major modeling approaches such as ER, dimensional, DataVault and Anchor models, describes the current challenges of their dimensional model, and details the OneData methodology—including OneModel, OneID, and OneService—along with its practical implementation, results, and future plans.

Big DataETLMetrics
0 likes · 23 min read
Snowball Data Warehouse Modeling and OneData System Implementation
DevOps
DevOps
Jul 22, 2022 · Fundamentals

Why Measure Software Architecture and Which Metrics to Use

The article explains the importance of measuring software architecture, outlines the granularity of metrics from code to infrastructure, and provides concrete measurement indicators for code implementation, component design, architecture design, and runtime infrastructure to guide effective architecture governance.

Metricsquality measurementsoftware architecture
0 likes · 13 min read
Why Measure Software Architecture and Which Metrics to Use
DaTaobao Tech
DaTaobao Tech
Jul 21, 2022 · Frontend Development

Front‑end Performance Optimization: Testing, Analysis, and Sustainable Improvement Loop

The team implements a sustainable “discover‑analyze‑validate” loop that uses a performance blacklist, user‑centric metrics such as interactive time and second‑open rate, automated SDK data collection, and continuous trend monitoring to pinpoint front‑end bottlenecks, apply targeted fixes, and verify measurable load‑time improvements.

MetricsOptimizationtesting
0 likes · 10 min read
Front‑end Performance Optimization: Testing, Analysis, and Sustainable Improvement Loop
21CTO
21CTO
Jun 28, 2022 · Operations

Master Prometheus: From Metrics Collection to Alerts and Grafana Visualization

This comprehensive guide walks you through Prometheus fundamentals, including metric exposure, scraping, storage, querying with PromQL, custom exporter creation in Go, dynamic configuration reloading, and visualizing data with Grafana, while also covering alerting with Alertmanager and best practices for accurate histogram bucket design.

GrafanaMetricsMonitoring
0 likes · 20 min read
Master Prometheus: From Metrics Collection to Alerts and Grafana Visualization
IT Architects Alliance
IT Architects Alliance
Jun 27, 2022 · Operations

Comprehensive Guide to Prometheus: Metrics Collection, Storage, Querying, Alerting and Visualization

This article provides a detailed overview of Prometheus, covering its architecture, metric exposure, scraping models, storage format, metric types, custom exporter implementation in Go, PromQL query language, built‑in functions, Grafana integration, and alerting with Alertmanager, offering practical code examples throughout.

GoGrafanaMetrics
0 likes · 20 min read
Comprehensive Guide to Prometheus: Metrics Collection, Storage, Querying, Alerting and Visualization
Alibaba Cloud Developer
Alibaba Cloud Developer
Jun 23, 2022 · Product Management

Mastering Growth: Frameworks, Strategies, and Sustainable Scaling

This comprehensive guide defines growth, distinguishes it from development, explains how to assess and sustain growth, outlines systematic methodologies, experimentation, growth models, organizational capabilities, and strategic leverage to achieve lasting, scalable product success.

MetricsProduct Strategybusiness scaling
0 likes · 23 min read
Mastering Growth: Frameworks, Strategies, and Sustainable Scaling
Zuoyebang Tech Team
Zuoyebang Tech Team
Jun 17, 2022 · Big Data

How FlinkSQL Auto‑Tuning Saves Resources and Guarantees SLA

This article describes the design and implementation of an automated FlinkSQL tuning system that monitors metrics, evaluates task health with rule‑based logic, calculates optimal resource adjustments, and performs fast scaling to reduce cluster waste, lower operational costs, and maintain SLA compliance.

AkkaFlinkMetrics
0 likes · 15 min read
How FlinkSQL Auto‑Tuning Saves Resources and Guarantees SLA
dbaplus Community
dbaplus Community
Jun 13, 2022 · Operations

How We Built a Mini‑Program Observability Platform to Slash Incident Resolution Time

After a three‑day, ten‑person investigation into a mini‑program image‑upload failure, we designed and implemented an end‑to‑end observability platform using MDD and SRE principles, defining SLI/SLO, instrumenting client, network, gateway and backend layers, and visualizing metrics with Grafana, ClickHouse and Prometheus.

GrafanaMDDMetrics
0 likes · 18 min read
How We Built a Mini‑Program Observability Platform to Slash Incident Resolution Time
Java Baker
Java Baker
Jun 12, 2022 · Operations

System Capacity Checklist: Key Metrics Every Architect Should Track

Architects should treat system capacity like a pre‑flight checklist, using this comprehensive guide to monitor resource usage across services, databases, and queues, and to define business metrics and state‑machine indicators that reveal bottlenecks and guide scaling decisions.

MetricsMonitoringarchitecture
0 likes · 5 min read
System Capacity Checklist: Key Metrics Every Architect Should Track
Baidu Geek Talk
Baidu Geek Talk
Jun 6, 2022 · Industry Insights

Why Video Quality Matters and How Lingjing Revolutionizes Its Evaluation

This article explores the factors influencing video quality, explains why continuous improvement is essential, examines the importance and challenges of both subjective and objective quality assessments, and introduces Lingjing—a comprehensive, standards‑based video quality evaluation platform that addresses confidence issues and supports diverse testing scenarios.

LingjingMetricsassessment
0 likes · 15 min read
Why Video Quality Matters and How Lingjing Revolutionizes Its Evaluation
NetEase Yanxuan Technology Product Team
NetEase Yanxuan Technology Product Team
Jun 6, 2022 · Backend Development

How a Unified Precision Testing Platform Boosted Coverage and Efficiency Across Multiple Business Units

After a year of cross‑BU experimentation, the Tianji precision testing platform was built to centralize coverage data, automate incremental analysis, and provide actionable insights, resulting in higher test coverage, faster release gating, and measurable productivity gains for both developers and QA teams.

AutomationBackendDevOps
0 likes · 16 min read
How a Unified Precision Testing Platform Boosted Coverage and Efficiency Across Multiple Business Units
Tencent Cloud Developer
Tencent Cloud Developer
May 30, 2022 · Cloud Native

An Introduction to Prometheus: Metrics Collection, Storage, Querying, Visualization and Alerting

Prometheus is an open‑source monitoring system that scrapes metrics from services or exporters, stores them in a time‑series database, lets users query with PromQL, visualizes data via its web UI or Grafana, and sends alerts through Alertmanager, supporting custom Go metrics, various discovery methods, and four metric types.

GoGrafanaMetrics
0 likes · 21 min read
An Introduction to Prometheus: Metrics Collection, Storage, Querying, Visualization and Alerting
Meituan Technology Team
Meituan Technology Team
May 12, 2022 · Operations

Systematic Data Governance Framework and Practices at Meituan Accommodation

The Meituan Accommodation data governance team shares how they evolved from ad‑hoc, single‑point fixes to a systematic, automated governance framework—covering management, standards, capability, execution, evaluation, and vision—using standardization, digitization, and systematization to achieve measurable quality, cost and efficiency gains across thousands of data assets.

AutomationMeituanMetrics
0 likes · 33 min read
Systematic Data Governance Framework and Practices at Meituan Accommodation
IT Architects Alliance
IT Architects Alliance
May 6, 2022 · R&D Management

Optimizing IT System Performance and R&D Workflow: From Metrics to DevOps Value‑Stream

The article explains how technical leaders can apply quantitative analysis and systematic measurement to optimize both software system performance and organizational workflows, using a picture‑recognition service example and a real‑world DevOps incident to illustrate the need for end‑to‑end process mapping, bottleneck identification, and continuous improvement.

MetricsR&D ManagementWorkflow
0 likes · 11 min read
Optimizing IT System Performance and R&D Workflow: From Metrics to DevOps Value‑Stream
Bilibili Tech
Bilibili Tech
Apr 26, 2022 · Operations

Bilibili's SRE Practice for Business Stability: Theory, Metrics, and Operational Implementation

Bilibili’s SRE team combines stability theory, detailed fault‑stage and operational metrics, and a unified emergency‑response platform—including on‑call scheduling, fault‑command incident commanders, automated fault portraits, and rapid post‑mortems—to transform frequent incidents into data‑driven, collaborative recoveries and lay groundwork for AI‑assisted self‑healing.

Business StabilityMetricsOncall
0 likes · 23 min read
Bilibili's SRE Practice for Business Stability: Theory, Metrics, and Operational Implementation
dbaplus Community
dbaplus Community
Apr 25, 2022 · Operations

From Monitoring to Observability: Expert Insights on Evolving Cloud‑Native Operations

In this interview series, three industry experts explain how monitoring differs from observability, the shifts required for ops, developers, and architects, the core methodologies and technologies behind metrics, traces, and logs, and practical guidance for selecting and integrating observability tools in cloud‑native environments.

MetricsObservabilitycloud-native
0 likes · 16 min read
From Monitoring to Observability: Expert Insights on Evolving Cloud‑Native Operations
ELab Team
ELab Team
Apr 16, 2022 · Frontend Development

Master Front‑End Monitoring: From Data Collection to Performance Metrics

This article outlines the end‑to‑end workflow for front‑end monitoring in an APM platform, covering data collection, reporting, cleaning, storage, and consumption, and dives deep into environment info, exception handling, performance metrics, and efficient data upload strategies.

APMMetricsMonitoring
0 likes · 18 min read
Master Front‑End Monitoring: From Data Collection to Performance Metrics
YunZhu Net Technology Team
YunZhu Net Technology Team
Apr 15, 2022 · Operations

Design and Architecture of a Cloud‑Native Monitoring Platform for Business Systems

The document outlines the background, vision, current status, technical research, value, product and technical architecture, and functional design of a cloud‑native monitoring platform that integrates SkyWalking and Prometheus to provide comprehensive APM, resource utilization, alerting, and rapid fault localization for business and technical middle‑platform services.

APMMetricsObservability
0 likes · 10 min read
Design and Architecture of a Cloud‑Native Monitoring Platform for Business Systems
Alibaba Cloud Native
Alibaba Cloud Native
Apr 13, 2022 · Cloud Native

From Dapper to OpenTelemetry: A Practical Guide to Distributed Tracing and Observability

This article explains the challenges of long request chains in micro‑service architectures, reviews Google’s Dapper tracing requirements, introduces OpenTracing and OpenCensus standards, compares their strengths, and details how OpenTelemetry unifies tracing, metrics and logs with practical integration steps and best‑practice guidance.

Cloud NativeMetricsObservability
0 likes · 24 min read
From Dapper to OpenTelemetry: A Practical Guide to Distributed Tracing and Observability
High Availability Architecture
High Availability Architecture
Mar 28, 2022 · Cloud Native

Best Practices for Building an Integrated Monitoring Platform with Prometheus in a Microservice Architecture

This article explains the monitoring challenges introduced by microservice and container evolution, why Prometheus is the preferred observability solution in the cloud‑native era, and presents a comprehensive, multi‑tenant, high‑availability architecture with practical techniques for data collection, storage, query optimization, security, and future trends.

Cloud NativeMetricsPrometheus
0 likes · 19 min read
Best Practices for Building an Integrated Monitoring Platform with Prometheus in a Microservice Architecture
HomeTech
HomeTech
Mar 16, 2022 · Cloud Native

Understanding Kubernetes Horizontal Pod Autoscaler (HPA): Mechanism, Core Source Code, and Practical Insights

This article explains how Kubernetes Horizontal Pod Autoscaler (HPA) balances resource demand and workload by automatically scaling pod replicas, describes the different metric types it supports, walks through the core controller code (Run, worker, reconcile, and replica calculation), highlights current limitations, and shares practical observations from real‑world usage.

AutoscalingHorizontal Pod AutoscalerKubernetes
0 likes · 11 min read
Understanding Kubernetes Horizontal Pod Autoscaler (HPA): Mechanism, Core Source Code, and Practical Insights
DeWu Technology
DeWu Technology
Mar 4, 2022 · Operations

Three-Level Indicator System for Engineering Quality Management

The article outlines a three‑level indicator system that quantifies engineering quality across efficiency, quality, stability, and resource dimensions, using high‑level result metrics, detailed level‑2 breakdowns, and actionable level‑3 measures to enable drill‑down analysis, risk‑warning, and continuous, data‑driven improvement.

EngineeringIndicator SystemMetrics
0 likes · 10 min read
Three-Level Indicator System for Engineering Quality Management
Youzan Coder
Youzan Coder
Mar 3, 2022 · Operations

How Standard Deviation Uncovers Hidden Bottlenecks in Software R&D Throughput

The article introduces a new R&D efficiency metric—throughput standard deviation—explains its statistical basis, shows how it was derived from annual reports, illustrates its application across multiple teams, and discusses practical insights and limitations for software development operations.

MetricsR&D EfficiencyThroughput
0 likes · 7 min read
How Standard Deviation Uncovers Hidden Bottlenecks in Software R&D Throughput
Efficient Ops
Efficient Ops
Mar 2, 2022 · Operations

Mastering System & Application Monitoring with the USE Method and Prometheus

This article explains how to build a comprehensive monitoring system for both infrastructure and applications, introducing the USE (Utilization‑Saturation‑Errors) method, key performance metrics, and practical components such as Prometheus, Grafana, full‑link tracing, and the ELK stack to detect and diagnose performance bottlenecks.

LoggingMetricsPrometheus
0 likes · 13 min read
Mastering System & Application Monitoring with the USE Method and Prometheus
DevOps Cloud Academy
DevOps Cloud Academy
Mar 2, 2022 · Operations

Key DevOps Metrics for Effective Software Delivery

This article explains the most important DevOps metrics—such as deployment frequency, lead time, automated test pass rate, change failure rate, MTTR, and others—and how tracking them helps teams improve software delivery speed, quality, and operational efficiency.

AutomationDevOpsMetrics
0 likes · 10 min read
Key DevOps Metrics for Effective Software Delivery
DaTaobao Tech
DaTaobao Tech
Feb 21, 2022 · Frontend Development

Focused Gray Release Monitoring and Alert Configuration for Frontend Quality

To raise front‑end quality, the team implements gray‑release monitoring that triggers log analysis at a 5 % rollout, automatically generates reports within ten minutes, and uses dynamic thresholds and noise‑reduction tactics to detect errors early, enabling rapid rollback or expansion and markedly improving stability and release efficiency.

FrontendMetricsMonitoring
0 likes · 9 min read
Focused Gray Release Monitoring and Alert Configuration for Frontend Quality
Baobao Algorithm Notes
Baobao Algorithm Notes
Feb 15, 2022 · Industry Insights

Why Your Algorithm Gains May Still Drag Down Overall Business: 6 Hidden Pitfalls

Even when individual algorithm modules show higher accuracy or revenue, the overall platform can decline due to factors like competitor encroachment, macro‑economic shifts, concept drift, overlapping marginal returns, attribution errors, and coupled A/B experiments, all of which require careful analysis and mitigation.

AB testingMetricsalgorithm
0 likes · 7 min read
Why Your Algorithm Gains May Still Drag Down Overall Business: 6 Hidden Pitfalls
Ops Development Stories
Ops Development Stories
Jan 24, 2022 · Cloud Native

Deploy and Configure vmagent on Kubernetes for Efficient Metrics

This guide explains what vmagent is, its key features, and provides step‑by‑step instructions to install, configure, and verify vmagent on a Kubernetes cluster, including namespace and RBAC setup, custom scrape configs, monitoring endpoints, and troubleshooting tips.

KubernetesMetricsVictoriaMetrics
0 likes · 15 min read
Deploy and Configure vmagent on Kubernetes for Efficient Metrics
Efficient Ops
Efficient Ops
Jan 20, 2022 · Operations

Mastering Prometheus Metrics: Best Practices for Effective Monitoring

This article outlines practical guidelines for designing Prometheus metrics, covering how to define monitoring targets, choose appropriate vectors and labels, name metrics and labels correctly, select histogram buckets, and leverage Grafana features to visualize and troubleshoot data effectively.

GrafanaMetricsMonitoring
0 likes · 11 min read
Mastering Prometheus Metrics: Best Practices for Effective Monitoring
Baidu MEUX
Baidu MEUX
Jan 17, 2022 · Product Management

How the GSM Model Boosts Product Design: From Goals to Metrics

The article explains why and how to use the GSM (Goal‑Signal‑Metric) model in product design, detailing its definition, applicable scenarios, step‑by‑step implementation, and a real‑world case study that demonstrates its value for aligning business, user, and design objectives.

GSM modelMetricsgoal signal metric
0 likes · 8 min read
How the GSM Model Boosts Product Design: From Goals to Metrics

Common Pitfalls in User Churn Data Analysis

This article explains three frequent mistakes in churn analysis—misinterpreting churn rates, falling into Simpson's paradox, and incorrectly inferring causality—illustrated with game‑related examples and emphasizes the need to combine multiple metrics for accurate conclusions.

MetricsSimpson's paradoxuser churn
0 likes · 5 min read
Common Pitfalls in User Churn Data Analysis
DataFunSummit
DataFunSummit
Jan 7, 2022 · Fundamentals

Fundamentals of Data Quality Management: Rules, Metrics, Profiling, and Cleaning

This article introduces the essential concepts of data quality management, covering the six key quality dimensions, detailed rule and metric templates, data profiling techniques, a systematic quality assurance workflow, and practical data cleaning methods to improve overall data governance.

Metricsdata cleaningdata profiling
0 likes · 7 min read
Fundamentals of Data Quality Management: Rules, Metrics, Profiling, and Cleaning
Hacker Afternoon Tea
Hacker Afternoon Tea
Jan 6, 2022 · Operations

Understanding Sentry Relay Configuration Options

This article details the configuration file location, command‑line overrides, and all available Relay settings—including mode, networking, caching, size limits, logging, metrics, and internal error reporting—providing a comprehensive reference for deploying Sentry Relay in production environments.

ConfigurationDockerLogging
0 likes · 14 min read
Understanding Sentry Relay Configuration Options
DevOps
DevOps
Jan 6, 2022 · R&D Management

Self‑Organization in Agile Teams: Shifting Management Roles and Enhancing Control

The article explains how adopting self‑organization in agile teams changes the responsibilities of technical managers, makes work visible, introduces servant‑leadership and technical‑expert roles, and uses metrics and coaching to strengthen team accountability while preventing loss of control.

Metricsservant leadership
0 likes · 6 min read
Self‑Organization in Agile Teams: Shifting Management Roles and Enhancing Control
Zhuanzhuan Tech
Zhuanzhuan Tech
Jan 5, 2022 · Operations

Design and Implementation of a Multi‑Dimensional Monitoring Platform Based on Prometheus and M3DB

This article details the background, research, architecture, performance testing, and deployment of a comprehensive monitoring system that leverages Prometheus, Grafana, and M3DB to provide flexible metric collection, automatic dashboard generation, and a custom alerting service for large‑scale business services.

MetricsMonitoringalerting
0 likes · 16 min read
Design and Implementation of a Multi‑Dimensional Monitoring Platform Based on Prometheus and M3DB
DataFunTalk
DataFunTalk
Dec 28, 2021 · Artificial Intelligence

Evaluation Framework and Methodology for OPPO XiaoBu AI Assistant

This article presents a comprehensive evaluation framework for OPPO's XiaoBu AI assistant, covering evaluation concepts, objectives, five key elements, sampling methods, dimension selection, annotation scoring, report generation, and a detailed Q&A that illustrates practical metrics and processes for voice and search services.

AI evaluationMetricsOPPO
0 likes · 23 min read
Evaluation Framework and Methodology for OPPO XiaoBu AI Assistant
DataFunSummit
DataFunSummit
Dec 27, 2021 · Artificial Intelligence

Evaluation Framework and Methodology for OPPO XiaoBu AI Assistant

This article presents a comprehensive evaluation framework for OPPO's XiaoBu AI assistant, covering the concept and purpose of evaluation, the five key evaluation elements, data sampling strategies, dimension and rule selection, annotation scoring, reporting guidelines, and detailed procedures for assessing wake‑up, ASR, NLU, and TTS performance.

AI evaluationAnnotationMetrics
0 likes · 20 min read
Evaluation Framework and Methodology for OPPO XiaoBu AI Assistant
Beike Product & Technology
Beike Product & Technology
Dec 17, 2021 · Operations

Practices for Monitoring, Resource Optimization, and Containerization of Large-Scale Flink Jobs at Beike

This article describes Beike's real‑time computing team's end‑to‑end practices for collecting and storing Flink metrics, building visual monitoring dashboards, implementing multi‑level alerting, analyzing logs, estimating CPU and memory resources, and deploying Flink on Kubernetes with containerization and storage separation to improve stability, resource utilization, and operational efficiency.

FlinkKubernetesMetrics
0 likes · 25 min read
Practices for Monitoring, Resource Optimization, and Containerization of Large-Scale Flink Jobs at Beike
ByteDance SE Lab
ByteDance SE Lab
Dec 17, 2021 · Mobile Development

Douyin's Metric‑Driven Optimization: Boosting Creation Experience and Performance

This article details Douyin's systematic approach to improving creation experience by defining measurable goals, building a comprehensive metric system, performing relevance analysis, and implementing concrete Android and iOS performance optimizations—including album loading, component architecture, and small‑screen video quality—while outlining monitoring, tooling, and internal platform support that together deliver significant user‑facing gains.

AndroidMetricsiOS
0 likes · 24 min read
Douyin's Metric‑Driven Optimization: Boosting Creation Experience and Performance
DevOps
DevOps
Dec 15, 2021 · R&D Management

Using Metrics Wisely in Software Development: Avoiding Counterproductive Behaviors and Driving Real Improvement

The article explains how managers' love of metrics can unintentionally promote harmful behaviors in software teams, illustrates the problem with real-world stories, and provides practical guidelines—linking metrics to goals, tracking trends, using shorter cycles, and adapting metrics—to ensure they support, rather than hinder, the delivery of valuable software.

Metricsdouble-loop learningorganizational behavior
0 likes · 21 min read
Using Metrics Wisely in Software Development: Avoiding Counterproductive Behaviors and Driving Real Improvement
MaGe Linux Operations
MaGe Linux Operations
Nov 19, 2021 · Databases

Essential Redis Monitoring Metrics Every Engineer Should Know

This guide outlines the key Redis monitoring metrics—including performance, memory, activity, persistence, and error indicators—provides detailed descriptions, command examples, and practical tips for using tools like redis-cli, redis-benchmark, and info commands to effectively track and troubleshoot your Redis instances.

DevOpsMetricsRedis
0 likes · 7 min read
Essential Redis Monitoring Metrics Every Engineer Should Know
Java Architecture Diary
Java Architecture Diary
Nov 19, 2021 · Backend Development

What’s New in Spring Boot 2.6? Key Features and Configuration Changes

Spring Boot 2.6 introduces Cookie SameSite support, reactive session timeout, custom data‑masking rules, automatic Redis pool configuration, richer runtime Java metrics, build‑info personalization, new startup and disk metrics, enhanced Docker image building, and many deprecated properties removed or renamed, improving security and performance.

ConfigurationDockerJava
0 likes · 7 min read
What’s New in Spring Boot 2.6? Key Features and Configuration Changes
DevOps
DevOps
Nov 15, 2021 · R&D Management

Key Indicators for Evaluating Genuine Agile Practices

This article outlines six practical metrics—unified backlog, user‑centric requirement description, consistent requirement flow, short lead time, high iteration completion rate, and stable iteration velocity—to help teams distinguish superficial agile ceremonies from truly effective agile execution.

AgileBacklogMetrics
0 likes · 5 min read
Key Indicators for Evaluating Genuine Agile Practices
Open Source Linux
Open Source Linux
Nov 14, 2021 · Databases

Essential Redis Monitoring Metrics Every Engineer Should Know

This guide outlines the key Redis monitoring metrics—including performance, memory, basic activity, persistence, and error indicators—explains their meanings, shows how to retrieve them with Redis commands, and provides practical tips for effective performance and health tracking.

ErrorMetricsMonitoring
0 likes · 6 min read
Essential Redis Monitoring Metrics Every Engineer Should Know