Tagged articles

metrics

618 articles · Page 2 of 7
Qiming AI - Digital Management Talk
Qiming AI - Digital Management Talk
Jun 23, 2025 · Operations

9 Essential Supply Chain Metrics to Transform Data‑Driven Decisions

This article outlines nine crucial supply‑chain metrics across procurement, production, logistics and overall efficiency, explains their formulas and real‑world examples, and shows how each indicator can be used to identify problems, benchmark performance, and drive data‑driven decision‑making for cost reduction and customer satisfaction.

Efficiencydata-drivenlogistics
0 likes · 12 min read
9 Essential Supply Chain Metrics to Transform Data‑Driven Decisions
Qunhe Technology Quality Tech
Qunhe Technology Quality Tech
Jun 12, 2025 · Artificial Intelligence

Boosting CAD & Ad Design Algorithms with a Goldenset Review Platform

The article describes how a custom algorithm review platform, built around goldenset test cases, quantifies and visualizes CAD recognition and advertising design tool outputs, enabling rapid regression testing, objective metric tracking, and efficient manual review, ultimately improving development speed and bug detection rates.

AdvertisingCADalgorithm
0 likes · 12 min read
Boosting CAD & Ad Design Algorithms with a Goldenset Review Platform
Alibaba Cloud Observability
Alibaba Cloud Observability
Jun 3, 2025 · Cloud Native

How PromQL Copilot Turns Natural Language into Precise Monitoring Queries

PromQL Copilot leverages Alibaba Cloud's observability platform and AI techniques to convert ambiguous natural‑language monitoring requests into accurate PromQL statements, addressing challenges of ambiguity, domain knowledge, and metric coverage while providing generation, explanation, diagnosis, and recommendation features for cloud‑native environments.

AICloud NativeMonitoring
0 likes · 12 min read
How PromQL Copilot Turns Natural Language into Precise Monitoring Queries
Architecture Breakthrough
Architecture Breakthrough
May 26, 2025 · R&D Management

How One KPI Can Transform R&D Efficiency: Lessons from TDengine

The article analyzes why overly complex R&D metrics often hinder productivity, proposes aligning indicators with company strategy and culture, and illustrates the approach with TDengine’s single‑KPI model and a three‑metric framework for banking, while also detailing the “Everything as Code” practices that boost development speed and quality.

R&D Efficiencyeverything as codeindustry insight
0 likes · 9 min read
How One KPI Can Transform R&D Efficiency: Lessons from TDengine
Efficient Ops
Efficient Ops
May 7, 2025 · Operations

Why Choose SigNoz for Open‑Source Observability? A Deep Dive

This article introduces SigNoz, a self‑hosted open‑source observability platform that unifies metrics, logs, and traces, outlines its core capabilities, shows how to install it with Docker, and compares its resource efficiency to commercial solutions like DataDog and Elastic.

OpenTelemetrySigNozTracing
0 likes · 4 min read
Why Choose SigNoz for Open‑Source Observability? A Deep Dive
Raymond Ops
Raymond Ops
Apr 22, 2025 · Operations

What Is OpenTelemetry? A Complete Guide to Modern Observability

OpenTelemetry unifies tracing and metrics by merging OpenTracing and OpenCensus, offering vendor‑neutral APIs, SDKs, and a collector that standardize telemetry data collection, context propagation, and export to various back‑ends, with detailed components such as Tracer, Meter, and shared Context layers.

Tracingcloud-nativemetrics
0 likes · 12 min read
What Is OpenTelemetry? A Complete Guide to Modern Observability
21CTO
21CTO
Apr 9, 2025 · Operations

9 Must‑Have Container Monitoring Tools and Best Practices for Modern Cloud‑Native Environments

This article reviews nine practical container‑monitoring solutions—from Last9 and Prometheus to Dynatrace and Elastic Observability—detailing their key features, pricing, and why developers prefer them, and then offers comprehensive best‑practice guidance for metrics, tagging, alerts, and advanced observability strategies in Kubernetes‑driven cloud‑native deployments.

Cloud NativeKubernetesSRE
0 likes · 25 min read
9 Must‑Have Container Monitoring Tools and Best Practices for Modern Cloud‑Native Environments
Tencent Cloud Developer
Tencent Cloud Developer
Mar 19, 2025 · Cloud Native

Kubernetes Monitoring: Why It’s Needed, Core Components, and Metric Exposure

Monitoring Kubernetes is essential to detect resource contention, component failures, and network issues; it involves tracking core component metrics such as API server latency, etcd write times, scheduler delays, as well as node‑level CPU, memory, disk, and network statistics, pod health, and custom application metrics exposed via Prometheus exporters for comprehensive observability.

Cloud NativeExportersKubernetes
0 likes · 23 min read
Kubernetes Monitoring: Why It’s Needed, Core Components, and Metric Exposure
JD Tech Talk
JD Tech Talk
Feb 26, 2025 · Operations

Business Monitoring: Importance, Metric System Design, and Practical Implementation

This article explains the significance of business monitoring, distinguishes technical and business metrics, outlines a step‑by‑step process for building a business metric system, and shares practical experiences, tools, and common pitfalls to help teams improve operational reliability and decision‑making.

Incident Managementbusiness monitoringmetrics
0 likes · 13 min read
Business Monitoring: Importance, Metric System Design, and Practical Implementation
Bitu Technology
Bitu Technology
Jan 15, 2025 · Operations

Refactoring Playback Error Reporting, Metrics, and Recovery in Tubi Web/OTT Player

The article details how Tubi's Web/OTT team restructured player error reporting, statistical metrics, and unified handling, introduced precise error‑tracking enums, defined new recovery strategies for device decoding, network, and cache issues, and validated their impact through extensive experiments that improved user experience and key business KPIs.

OTTmetricsoperations
0 likes · 14 min read
Refactoring Playback Error Reporting, Metrics, and Recovery in Tubi Web/OTT Player
Alibaba Cloud Infrastructure
Alibaba Cloud Infrastructure
Jan 3, 2025 · Cloud Native

How to Enable LLM Traffic Observability with Alibaba Cloud Service Mesh (ASM)

This guide explains how to use Alibaba Cloud Service Mesh (ASM) to add infrastructure‑level observability for large language model (LLM) traffic, covering custom access‑log fields, new Prometheus metrics for token usage, and adding model dimensions to native Istio metrics, with step‑by‑step commands and configuration examples.

ASMKubernetesLLM
0 likes · 14 min read
How to Enable LLM Traffic Observability with Alibaba Cloud Service Mesh (ASM)
Architect
Architect
Dec 31, 2024 · Operations

Integrating Prometheus with Spring Boot and Visualizing Metrics Using Grafana

This guide explains how to monitor a Spring Boot application using Prometheus, configure Spring Boot Actuator, run Prometheus (including Docker deployment), set up Grafana for visualizing metrics, and create custom metrics with Micrometer, providing step‑by‑step instructions and code examples.

ActuatorDockerGrafana
0 likes · 10 min read
Integrating Prometheus with Spring Boot and Visualizing Metrics Using Grafana
Kuaishou Tech
Kuaishou Tech
Dec 11, 2024 · Frontend Development

Performance Governance and Optimization of Kuaishou Commercial Frontend Pages

This article presents a comprehensive analysis of page performance issues across Kuaishou's commercial front‑end projects, outlines the challenges of unified governance, B‑end experience measurement, and C‑end web‑native integration, and details the systematic optimization strategies and measurable results that significantly improved user experience and business metrics.

KuaishouOptimizationfrontend
0 likes · 23 min read
Performance Governance and Optimization of Kuaishou Commercial Frontend Pages
iQIYI Technical Product Team
iQIYI Technical Product Team
Nov 28, 2024 · R&D Management

Advanced Exploration and Practice of Value Delivery in Project Management

At the 12th QECon conference, iQIYI presented a systematic value‑delivery framework that tackles misaligned goals, planning‑execution gaps, and metric deficiencies by using a two‑scenario model for iterative and special projects—defining SMART goals, tight scope control, continuous monitoring, and AI‑driven automation—to accelerate rollout, quantify impact, and guide future integrated, intelligent delivery.

AIR&D Managementmetrics
0 likes · 15 min read
Advanced Exploration and Practice of Value Delivery in Project Management
Alibaba Cloud Native
Alibaba Cloud Native
Nov 27, 2024 · Cloud Native

How to Add Zero‑Code Observability to Golang Apps with Alibaba’s OpenTelemetry Agent

This guide explains how to use Alibaba’s open‑source Golang Agent to automatically instrument Go applications for tracing, metrics, and log correlation without modifying source code, covering binary download, build replacement for go build, endpoint configuration, and step‑by‑step examples with Docker‑based dependencies and Jaeger visualization.

AgentOpenTelemetrygolang
0 likes · 11 min read
How to Add Zero‑Code Observability to Golang Apps with Alibaba’s OpenTelemetry Agent
DevOps
DevOps
Nov 17, 2024 · R&D Management

Improving R&D Efficiency: Lessons from a Leading Brokerage’s DevOps Journey

The article distills a senior technology leader’s reflections on boosting R&D efficiency, covering metric design versus KPI, Conway’s law, digital‑transformation prerequisites, platform‑engineering strategies, and practical tools that together reshape collaboration, culture, and value delivery in complex financial software projects.

Platform engineeringR&D Efficiencycollaboration
0 likes · 12 min read
Improving R&D Efficiency: Lessons from a Leading Brokerage’s DevOps Journey
Linux Kernel Journey
Linux Kernel Journey
Nov 14, 2024 · Artificial Intelligence

Deep Dive: How DeepFlow Collects Business Metrics for Large‑Model Services

This article explains how China Mobile built a hybrid‑cloud production environment for its customer‑service LLM, using eBPF and WebAssembly plugins from DeepFlow to achieve zero‑intrusion observability, automatically capture full‑stack topology, application/network metrics, and key LLM business indicators such as TTFT, TPOT, and token throughput.

DeepFlowGrafanaLLM
0 likes · 19 min read
Deep Dive: How DeepFlow Collects Business Metrics for Large‑Model Services
Baobao Algorithm Notes
Baobao Algorithm Notes
Nov 4, 2024 · Artificial Intelligence

Uncovering 16 Limits of AI Search Engines and 16 Design Recommendations

A user study with 21 participants reveals sixteen critical limitations of generative AI search engines, maps them to eight quantitative metrics, proposes sixteen design recommendations, and evaluates You.com, Perplexity and BingChat against this framework to highlight current performance gaps.

AI SearchLLMdesign recommendations
0 likes · 12 min read
Uncovering 16 Limits of AI Search Engines and 16 Design Recommendations
Linux Ops Smart Journey
Linux Ops Smart Journey
Nov 3, 2024 · Cloud Native

Build a Robust Kubernetes Monitoring System with Prometheus and HAProxy

This guide walks you through setting up a comprehensive Kubernetes monitoring solution—covering component metrics collection, configuring HAProxy for network access, exposing metrics from kube-proxy, Calico, and kube-state-metrics, and integrating everything into Prometheus for reliable cluster health visibility.

CalicoHAProxyKubernetes
0 likes · 12 min read
Build a Robust Kubernetes Monitoring System with Prometheus and HAProxy
DevOps
DevOps
Oct 21, 2024 · R&D Management

Constructing an Effective R&D Efficiency Measurement System: Strategies, Models, and Implementation

This article explores how to build a comprehensive R&D efficiency measurement framework by outlining goals, principles, metric dimensions, the GQM method, the E³CI model, implementation steps, data collection, continuous improvement mechanisms, cultural integration, tool support, and common pitfalls, aiming to enhance software delivery speed and quality.

E3CIGQMR&D Efficiency
0 likes · 13 min read
Constructing an Effective R&D Efficiency Measurement System: Strategies, Models, and Implementation
Wukong Talks Architecture
Wukong Talks Architecture
Oct 17, 2024 · Operations

A Retrospective on DevOps System Design and Platform Engineering (2008‑2022)

From 2008 onward, the author chronicles the development of multiple DevOps systems, examining their origins, design choices, challenges, and evolution—including CI tools like CruiseControl, Hudson, Jenkins, custom plugins, metrics, platform engineering, and the impact of AI—offering insights for modern continuous integration and delivery practices.

AICI/CDJenkins
0 likes · 34 min read
A Retrospective on DevOps System Design and Platform Engineering (2008‑2022)
Software Development Quality
Software Development Quality
Oct 12, 2024 · R&D Management

Essential Agile Metrics for R&D Teams: Boost Delivery & Quality

This article presents a comprehensive set of agile and R&D process metrics—including delivery cycle, team productivity, sprint throughput, integration frequency, technical debt, and test coverage—detailing their definitions, calculation formulas, recommended improvement actions, and normal versus warning ranges to help engineering teams monitor and enhance performance.

R&Dmetrics
0 likes · 14 min read
Essential Agile Metrics for R&D Teams: Boost Delivery & Quality
Open Source Linux
Open Source Linux
Oct 11, 2024 · Operations

Essential IT Operations Metrics: Definitions, Formulas, and Benchmarks

This article explains why operations metrics are vital for businesses, describes how tracking availability, failure rate, MTTR, MTBF, response time, throughput, error rate, capacity utilization, latency, data integrity, backup success, recovery time, security patch time, server and network utilization can improve reliability, reduce costs, and boost competitiveness.

IT OperationsMTBFMTTR
0 likes · 7 min read
Essential IT Operations Metrics: Definitions, Formulas, and Benchmarks
ITPUB
ITPUB
Oct 6, 2024 · Operations

Mastering Prometheus Metrics: Practical Best‑Practice Guide for Effective Monitoring

This guide explains how to design and implement Prometheus metrics for application monitoring, covering the selection of monitoring targets, the four golden metrics, system‑specific metric groups, vector and label choices, naming conventions, histogram bucket design, and useful Grafana visualization tips.

GrafanaPrometheusmetrics
0 likes · 9 min read
Mastering Prometheus Metrics: Practical Best‑Practice Guide for Effective Monitoring
Sohu Tech Products
Sohu Tech Products
Sep 25, 2024 · Cloud Native

Observability Concepts and OpenTelemetry Architecture Overview

Observability turns a black‑box application into a system by gathering logs, metrics, and traces, using alerts to spot anomalies, then linking trace IDs to logs; OpenTelemetry standardizes this with instrumented client agents, a Collector (receivers, processors, exporters), and backend storage, while Java agents, span propagation, exemplars, eBPF, and bundles like SigNoz or OpenObserve let teams choose between a custom OTel stack or a solution.

Cloud NativeOpenTelemetryTracing
0 likes · 11 min read
Observability Concepts and OpenTelemetry Architecture Overview
Airbnb Technology Team
Airbnb Technology Team
Sep 19, 2024 · Mobile Development

How Airbnb Instruments Android Apps to Capture User‑Centric Performance Metrics

Airbnb’s Android Page Performance Score (PPS) framework instruments fragments to collect user‑centric metrics such as TTFL, TTIL, MTH, ALT and RCLT, using a standardized logging config, LoadableView interface, and visibility algorithms, enabling detailed performance analysis and automated alerts for mobile teams.

AndroidInstrumentationmetrics
0 likes · 10 min read
How Airbnb Instruments Android Apps to Capture User‑Centric Performance Metrics
Architect
Architect
Sep 13, 2024 · Operations

Introducing MyPerf4J: A High‑Performance Java Monitoring and Statistics Tool

The article presents MyPerf4J, a Java‑agent based, low‑overhead performance monitoring library that provides real‑time metrics such as method latency, QPS, memory usage, GC statistics, and class loading, along with quick‑start instructions, configuration details, and open‑source links for Java backend services.

JavaJavaAgentbackend
0 likes · 7 min read
Introducing MyPerf4J: A High‑Performance Java Monitoring and Statistics Tool
Architect
Architect
Sep 12, 2024 · Operations

How Bilibili Scaled Its Monitoring: From Prometheus OOMs to VictoriaMetrics & Flink Pre‑Aggregation

The article details Bilibili's evolution of its monitoring platform, describing the stability and performance challenges of a Prometheus‑Thanos stack, the redesign using VictoriaMetrics, collection‑storage separation, unit‑level disaster recovery, query‑tree auto‑replacement, Flink‑based pre‑aggregation, Grafana upgrades, and future roadmap for observability.

Cloud NativeFlinkMonitoring
0 likes · 30 min read
How Bilibili Scaled Its Monitoring: From Prometheus OOMs to VictoriaMetrics & Flink Pre‑Aggregation
Airbnb Technology Team
Airbnb Technology Team
Sep 9, 2024 · Mobile Development

Implementing Page Performance Score on iOS: PPSStateMachine, Metrics, and Instrumentation

Airbnb’s iOS Page Performance Score implementation introduces a PPSStateMachine that ties a UIViewController’s lifecycle to metric collection—tracking first layout, initial load, scroll thread hangs, additional and rich content load times—using nanosecond timestamps, state‑machine protocols, and view‑responder discovery to emit standardized performance logs.

InstrumentationPage Performance ScoreSwift
0 likes · 9 min read
Implementing Page Performance Score on iOS: PPSStateMachine, Metrics, and Instrumentation
Sohu Tech Products
Sohu Tech Products
Sep 5, 2024 · Backend Development

Instrumentation of gRPC in OpenTelemetry: Adding Request Size Metrics via Byte‑Buddy

The new OpenTelemetry Java instrumentation adds client and server request‑size metrics to gRPC by injecting a tracing interceptor via Byte‑Buddy bytecode enhancement, extracting payload sizes from protobuf messages, recording them with custom attributes and histograms, and applying analogous handler‑based logic for Go.

ByteBuddyInstrumentationJava
0 likes · 12 min read
Instrumentation of gRPC in OpenTelemetry: Adding Request Size Metrics via Byte‑Buddy
Bilibili Tech
Bilibili Tech
Aug 9, 2024 · Operations

Design and Optimization of Monitoring 2.0 Architecture with VictoriaMetrics and Flink

The new Monitoring 2.0 architecture separates collection, compute and storage, adopts VictoriaMetrics for compact time‑series storage and a zone‑based scheduler, introduces push‑based ingestion, uses Flink for real‑time pre‑aggregation and automatic PromQL rewrite, delivering ten‑fold query speedups, sub‑300 ms p90 latency, and dramatically higher write and query throughput.

FlinkMonitoringPrometheus
0 likes · 29 min read
Design and Optimization of Monitoring 2.0 Architecture with VictoriaMetrics and Flink
phodal
phodal
Aug 8, 2024 · Artificial Intelligence

How to Design an AI‑Assisted Software Engineering Framework for Any Team

This article provides a comprehensive, step‑by‑step guide to designing, prototyping, and continuously improving an AI‑assisted software engineering (AI4SE) framework, covering goal definition, pain‑point identification, technology selection, cross‑disciplinary team building, metric evaluation, and real‑world examples for teams of all sizes.

AI integrationAI4SEPrototype Development
0 likes · 19 min read
How to Design an AI‑Assisted Software Engineering Framework for Any Team
Liangxu Linux
Liangxu Linux
Aug 1, 2024 · Operations

Essential Operations Metrics Every IT Team Should Track

This guide outlines key operational metrics—availability, failure rate, MTTR, MTBF, response time, throughput, error rate, capacity utilization, latency, data integrity, and more—explaining their calculations, typical benchmark values, and practical application areas to help organizations monitor and improve IT performance.

MTTRavailabilitymetrics
0 likes · 6 min read
Essential Operations Metrics Every IT Team Should Track
Spring Full-Stack Practical Cases
Spring Full-Stack Practical Cases
Jul 25, 2024 · Backend Development

Master Spring Cloud Gateway: Routing, Metrics, Filters & Debugging Tips

This guide walks through Spring Cloud Gateway features—including marking exchanges as routed, enabling route metrics, configuring metadata, accessing Reactor Netty logs, troubleshooting with debug logging, disabling automatic route refresh, ordering global filters, using Actuator sub‑paths, and rewriting request parameters—complete with code snippets and configuration examples.

DebuggingFiltersRouting
0 likes · 8 min read
Master Spring Cloud Gateway: Routing, Metrics, Filters & Debugging Tips
Alibaba Cloud Native
Alibaba Cloud Native
Jul 24, 2024 · Cloud Native

How to Observe and Optimize LLM Applications with Alibaba Cloud ARMS

This article explains the challenges of deploying large language model (LLM) applications, outlines the need for end‑to‑end observability, and details Alibaba Cloud ARMS' LLM‑specific tracing, metrics, and Python agent solutions for monitoring, debugging, and performance optimization.

AILLMOpenTelemetry
0 likes · 20 min read
How to Observe and Optimize LLM Applications with Alibaba Cloud ARMS
Continuous Delivery 2.0
Continuous Delivery 2.0
Jul 24, 2024 · R&D Management

Understanding DORA Metrics and Their Business Implications

The article explains the four core DORA metrics—deployment frequency, change failure rate, mean time to recovery, and lead time for changes—highlighting their focus on speed and stability, their limited business relevance, and proposes using leading indicators and broader measures to align engineering performance with business outcomes.

DORAbusiness outcomesdevops
0 likes · 5 min read
Understanding DORA Metrics and Their Business Implications
Airbnb Technology Team
Airbnb Technology Team
Jul 16, 2024 · Frontend Development

Airbnb Web Performance Metrics and Their Measurement

Airbnb tracks five real‑user performance metrics—Time To First Contentful Paint, Time To First Meaningful Paint, First Input Delay, Total Blocking Time, and Cumulative Layout Shift—using a mix of browser APIs and custom polyfills, combines them into a weighted Page Performance Score, and leverages that score to guide trade‑off decisions and detect regressions.

AirbnbWeb Performancemetrics
0 likes · 11 min read
Airbnb Web Performance Metrics and Their Measurement
Airbnb Technology Team
Airbnb Technology Team
Jul 2, 2024 · Frontend Development

Airbnb Page Performance Score (PPS): Multi‑Platform Metrics, Weighting, and Evolution

Airbnb created the Page Performance Score (PPS), a unified 0‑100 metric that aggregates platform‑specific initial‑load and post‑load user‑centric measurements for Web, iOS, and Android, using weighted curves to enable cross‑page, cross‑team comparisons, track organizational weighted averages, and evolve with new metrics while preserving a stable scale.

AirbnbPage Performance ScoreWeb Performance
0 likes · 10 min read
Airbnb Page Performance Score (PPS): Multi‑Platform Metrics, Weighting, and Evolution
Efficient Ops
Efficient Ops
Jul 1, 2024 · Cloud Native

How to Monitor Business Metrics with Prometheus in Kubernetes

This article explains the concept of observability, details Prometheus metric definitions and types, and provides Go code examples for exposing, defining, generating, and scraping business‑level metrics in a Kubernetes‑based cloud‑native environment.

GoKubernetesPrometheus
0 likes · 11 min read
How to Monitor Business Metrics with Prometheus in Kubernetes
DataFunTalk
DataFunTalk
Jul 1, 2024 · Big Data

JD Retail Metric Middle Platform: Architecture, Semantic Layer, Production, Governance and Practical Cases

This article presents JD Retail’s metric middle‑platform practice, describing the background problems of legacy metric systems, the four‑step solution framework, the overall architecture, semantic‑layer construction with the 4W1H method, configurable metric production, acceleration techniques, governance mechanisms, achieved results and future plans.

Semantic Layerbig-datadata-platform
0 likes · 19 min read
JD Retail Metric Middle Platform: Architecture, Semantic Layer, Production, Governance and Practical Cases
DevOps Operations Practice
DevOps Operations Practice
Jun 17, 2024 · Operations

Key DevOps Metrics: Deployment Frequency, Lead Time, Change Failure Rate, MTTR, and Customer Satisfaction

This article explains essential DevOps metrics—including deployment frequency, lead time for changes, change failure rate, mean time to recovery, and customer satisfaction—detailing why they matter, how to measure them, and practical practices to improve each metric for more efficient and reliable software delivery.

Change Failure RateLead TimeMTTR
0 likes · 9 min read
Key DevOps Metrics: Deployment Frequency, Lead Time, Change Failure Rate, MTTR, and Customer Satisfaction
Alibaba Cloud Observability
Alibaba Cloud Observability
Jun 13, 2024 · Cloud Native

Kickstart Your Observability Journey with Alibaba Cloud Monitoring

This guide introduces new Alibaba Cloud users to the fundamentals of cloud observability, explaining the metric‑trace‑log stack, the layered monitoring pyramid, and step‑by‑step how to set up out‑of‑the‑box resource monitoring, dashboards, alerts, and advanced integration options.

Alibaba CloudCloud Nativecloud monitoring
0 likes · 7 min read
Kickstart Your Observability Journey with Alibaba Cloud Monitoring
Baidu Geek Talk
Baidu Geek Talk
Jun 12, 2024 · Big Data

Event Tracking Governance and Logging Platform Solutions

The article explains event tracking, its data‑quality challenges, and presents a logging platform that enforces quality standards, an end‑to‑end online workflow, and specialized design, testing, and validation tools—including extended field types—to govern, monitor, and improve tracking point compliance across applications.

data qualityevent trackinggovernance
0 likes · 13 min read
Event Tracking Governance and Logging Platform Solutions
Efficient Ops
Efficient Ops
Jun 4, 2024 · Operations

How Huya Unified Its Monitoring Platform with OpenTelemetry for Zero‑Cost Integration

This article details Huya's transition from fragmented, non‑standard monitoring solutions to a unified OpenTelemetry‑based platform, covering project background, pain points, design decisions, SDK architecture, data pipeline, storage, alerting, root‑cause analysis, and future plans, highlighting the benefits of standardization and zero‑cost service integration.

HuyaOpenTelemetryTracing
0 likes · 13 min read
How Huya Unified Its Monitoring Platform with OpenTelemetry for Zero‑Cost Integration
Qunhe Technology Quality Tech
Qunhe Technology Quality Tech
Jun 3, 2024 · Frontend Development

How to Diagnose and Optimize Frontend Performance in 2D Design Tools

This article outlines the challenges of front‑end performance troubleshooting for a 2D design tool, proposes systematic approaches for identifying issues, describes monitoring metrics such as load time and frame rate, and presents real‑world case studies demonstrating effective optimization and baseline management.

Frontend Performancemetricsperformance monitoring
0 likes · 11 min read
How to Diagnose and Optimize Frontend Performance in 2D Design Tools
DataFunSummit
DataFunSummit
May 22, 2024 · Operations

Building an Observability System: Practices and Solutions from Yanhuang Data

This article explains how to build a robust observability system for cloud‑native microservice architectures, detailing the three core signals—metrics, traces, and logs—common challenges such as complexity and data silos, and presents Yanhuang Data’s integrated platform with unified data collection, storage, analysis, and visualization solutions.

Kuberneteslogsmetrics
0 likes · 23 min read
Building an Observability System: Practices and Solutions from Yanhuang Data
Model Perspective
Model Perspective
May 13, 2024 · Fundamentals

How to Identify and Quantify Core Variables for Better Decision‑Making

The article explains why pinpointing core variables is crucial, outlines domain‑knowledge and technical methods such as sensitivity analysis and data mining to discover them, and describes practical ways to turn those variables into quantitative indicators like scoring systems, composite indices, and real‑world examples.

core variablesdata miningdecision making
0 likes · 10 min read
How to Identify and Quantify Core Variables for Better Decision‑Making
iKang Technology Team
iKang Technology Team
May 11, 2024 · Operations

How to Conduct Full‑Stack Load Testing for Reliable Production Systems

Full‑link load testing evaluates the performance of an entire application stack—from user interface to databases—by simulating real‑world traffic, isolating test data, verifying security and SLA thresholds, measuring key metrics such as throughput and response time, and comparing tools like tcpcopy and goreplay to ensure system stability and scalability.

Full-Stackload testingmetrics
0 likes · 7 min read
How to Conduct Full‑Stack Load Testing for Reliable Production Systems
Data Thinking Notes
Data Thinking Notes
May 9, 2024 · Big Data

How to Build an Effective Indicator System: From Concept to Productization

This article explores the complete lifecycle of an indicator system—from defining metrics and addressing common ambiguities, through designing concept consensus, semantic layers, mechanisms, and governance, to productizing platforms, optimizing development, and envisioning future AI‑driven enhancements.

Indicator Systembig datadata modeling
0 likes · 22 min read
How to Build an Effective Indicator System: From Concept to Productization
Sohu Tech Products
Sohu Tech Products
Apr 17, 2024 · Operations

Developing an OpenTelemetry Extension for Pulsar Java Client Metrics

The article walks through building a custom OpenTelemetry Java‑agent extension for Pulsar client metrics—migrating from SkyWalking, setting up a Gradle project, using ByteBuddy to instrument methods with advice, registering gauge metrics, packaging the jar, handling common class‑loader pitfalls, and configuring deployment via the OpenTelemetry operator.

ExtensionInstrumentationJava
0 likes · 14 min read
Developing an OpenTelemetry Extension for Pulsar Java Client Metrics
Tencent Cloud Developer
Tencent Cloud Developer
Apr 2, 2024 · Backend Development

tRPC Scaffolding Tooling and Observability Best Practices for Tencent Docs Backend

By introducing the unified tRPC scaffolding tool trpcx and embedding OpenTelemetry‑generated observability configurations, the Tencent Docs backend team streamlined service creation, standardized directory structures, migrated metrics and logs to ClickHouse for cost‑effective performance, and established best‑practice workflows that dramatically improve development speed and fault‑diagnosis efficiency.

ClickHouseOpenTelemetrybackend development
0 likes · 18 min read
tRPC Scaffolding Tooling and Observability Best Practices for Tencent Docs Backend
DeWu Technology
DeWu Technology
Apr 1, 2024 · R&D Management

Scaling Agile at DeWu: The Type‑P Framework and PMO Evolution

The article details how DeWu’s technology organization scaled from a few hundred to over a thousand engineers by adopting the custom Type‑P framework—emphasizing value‑orientation, small‑step rapid iteration, bi‑weekly sprints, unified domain‑level agile processes, metric‑driven governance, and an evolving PMO that shifted from throughput‑first to value‑first objectives.

Agile ScalingPMOProject Management
0 likes · 16 min read
Scaling Agile at DeWu: The Type‑P Framework and PMO Evolution
DataFunSummit
DataFunSummit
Apr 1, 2024 · Big Data

DataOps at ByteDance: Challenges, Implementation, and Future Outlook

This article examines ByteDance's DataOps journey, detailing the data‑engineering challenges faced, the concrete solutions and productization through the DataLeap platform, the metrics and best‑practice framework adopted, and the future directions involving AI‑assisted development and open‑source collaboration.

big datadata platformmetrics
0 likes · 20 min read
DataOps at ByteDance: Challenges, Implementation, and Future Outlook
DevOps Operations Practice
DevOps Operations Practice
Mar 25, 2024 · Operations

How to Monitor MySQL with Prometheus and Grafana

This tutorial explains how to install the MySQL Exporter, configure Prometheus to scrape MySQL metrics, set up Grafana dashboards for visualization, and define alerting rules for common MySQL performance indicators, providing a complete end‑to‑end monitoring solution.

ExporterGrafanaMonitoring
0 likes · 5 min read
How to Monitor MySQL with Prometheus and Grafana
Architect's Alchemy Furnace
Architect's Alchemy Furnace
Mar 16, 2024 · R&D Management

How to Boost R&D Efficiency: Strategies, Pitfalls, and a Golden Triangle Framework

This article explores the concept of R&D efficiency, outlines its goals, debunks common misconceptions, and presents a practical framework—including practice, platform, and measurement components—supported by visual models to help technology organizations improve delivery speed, quality, reliability, and sustainability.

R&D Efficiencydevopsmetrics
0 likes · 25 min read
How to Boost R&D Efficiency: Strategies, Pitfalls, and a Golden Triangle Framework
58UXD
58UXD
Mar 15, 2024 · Product Management

When Data Beats UX: Balancing B2B Design Metrics and User Experience

This article examines a real‑world case where a B2B product team prioritized video‑quality metrics over user experience, discusses the resulting trade‑offs, and offers a step‑by‑step framework for aligning business goals with optimal UX design.

B2BUX trade‑offdata-driven
0 likes · 8 min read
When Data Beats UX: Balancing B2B Design Metrics and User Experience
Didi Tech
Didi Tech
Mar 12, 2024 · Big Data

Understanding Flink Metrics System: Core Concepts, Elastic Design, and Practical Usage

The article explains Flink’s metrics architecture—core concepts, reporter interfaces, built‑in and custom metric types, elastic plugin design, and scheduled reporting—illustrated with a consumption‑latency example, and shows how Didi uses these metrics for real‑time UI curves, alerts, and intelligent task diagnosis.

FlinkStreamingbig data
0 likes · 11 min read
Understanding Flink Metrics System: Core Concepts, Elastic Design, and Practical Usage
Efficient Ops
Efficient Ops
Mar 3, 2024 · Operations

Mastering Prometheus: From Metrics Collection to Alerting and Visualization

This comprehensive guide explains Prometheus' architecture, metric collection models, storage format, query language (PromQL), alerting workflow, configuration reload methods, metric types, custom exporters, and how to visualise data with Grafana, providing a complete end‑to‑end monitoring solution.

GrafanaPromQLPrometheus
0 likes · 21 min read
Mastering Prometheus: From Metrics Collection to Alerting and Visualization
Efficient Ops
Efficient Ops
Feb 19, 2024 · Operations

Mastering Prometheus: Practical Tips for Effective Application Monitoring

This article explains how to design and implement Prometheus metrics for application monitoring, covering the selection of monitoring targets, golden metrics, label conventions, naming rules, histogram bucket choices, and Grafana visualization tricks to help engineers build reliable observability pipelines.

GrafanaPrometheusmetrics
0 likes · 10 min read
Mastering Prometheus: Practical Tips for Effective Application Monitoring
DataFunTalk
DataFunTalk
Feb 8, 2024 · Big Data

Design and Practice of Ant Group's Metric System

This talk by Ant Group’s senior technical expert Wang Gaohang details the definition, design, mechanism, productization, and future outlook of the company’s metric system, covering concept consensus, semantic layers, workflow, AI assistance, performance optimization, and practical case studies.

AIbig datadata modeling
0 likes · 28 min read
Design and Practice of Ant Group's Metric System
DaTaobao Tech
DaTaobao Tech
Jan 29, 2024 · Cloud Native

Observability: Logging, Metrics, and Tracing in Distributed Systems

Observability in distributed systems combines event logging, aggregated metrics, and request tracing—each offering distinct trade‑offs in detail, storage, and overhead—and while the ELK stack dominates log and metric handling, tracing solutions such as EagleEye and SkyWalking differ by protocol and language, prompting many teams to adopt unified, cloud‑native platforms like Alibaba Cloud’s Log Service for lower cost, real‑time analysis and simplified management.

ELKLoggingSLS
0 likes · 32 min read
Observability: Logging, Metrics, and Tracing in Distributed Systems
MaGe Linux Operations
MaGe Linux Operations
Jan 25, 2024 · Operations

Mastering Monitoring: From Concepts to Prometheus in Operations

This article explains monitoring fundamentals, distinguishes black‑box and white‑box approaches, outlines key metrics and their aggregation, and provides a comprehensive guide to Prometheus architecture, data model, query language, and practical examples for CPU, memory, and disk usage monitoring.

Prometheusmetricsobservability
0 likes · 18 min read
Mastering Monitoring: From Concepts to Prometheus in Operations
DataFunTalk
DataFunTalk
Jan 21, 2024 · Cloud Native

Building a System Observability Framework with YHP: Practices, Challenges, and Integrated Solutions

This article explains how YHP enables cloud‑native systems to achieve comprehensive observability by defining the three core signals—metrics, traces, and logs—addressing common enterprise pain points, and presenting an integrated platform that unifies data collection, storage, analysis, and visualization for efficient fault diagnosis and performance monitoring.

Cloud Nativedata platformlogs
0 likes · 22 min read
Building a System Observability Framework with YHP: Practices, Challenges, and Integrated Solutions
dbaplus Community
dbaplus Community
Jan 2, 2024 · Operations

How Xiaohongshu Scaled Its Metrics System Tenfold with Cloud‑Native Architecture

Facing exploding metric volumes, high resource consumption, and fragile operations, Xiaohongshu's observability team completely rebuilt its metrics pipeline using Victoriametrics, achieving ten‑fold performance gains, minute‑level scaling, high‑availability, cost reduction, and robust multi‑cloud active‑active deployment while preserving data safety and query speed.

Prometheuscloud-nativehigh-availability
0 likes · 34 min read
How Xiaohongshu Scaled Its Metrics System Tenfold with Cloud‑Native Architecture
Weimob Technology Center
Weimob Technology Center
Dec 26, 2023 · Operations

Rebuilding Our APM: Scalable Metrics & Alerts with VictoriaMetrics & VMAlert

This article details the complete redesign of our internal APM system, covering the motivations, architecture choices, metric collection pipeline, integration of VictoriaMetrics and VMAlert, metric and alert design principles, implementation steps, visualizations, performance gains, and future plans for scaling and SaaS‑ification.

APMVictoriaMetricsalerting
0 likes · 17 min read
Rebuilding Our APM: Scalable Metrics & Alerts with VictoriaMetrics & VMAlert
Architecture and Beyond
Architecture and Beyond
Dec 23, 2023 · R&D Management

What Is R&D Efficiency and How to Systematically Improve It

The article defines R&D efficiency as the effective use of human and time resources to deliver high‑quality software quickly, and outlines a systematic, multi‑dimensional approach—including culture, structure, architecture, process design, engineering systems, and measurement—to enhance it.

Continuous DeliveryR&D Efficiencymetrics
0 likes · 11 min read
What Is R&D Efficiency and How to Systematically Improve It
Data Thinking Notes
Data Thinking Notes
Dec 21, 2023 · Product Management

Mastering Growth Metrics: Methodologies, Frameworks, and Real‑World Cases

This article explains Douyin’s growth‑analysis methodology, how to construct a comprehensive growth‑metric system with North‑Star indicators and hierarchical metric layers, the end‑to‑end analysis loop, new scenario‑driven metric applications, and a detailed case study on improving video‑submission rates.

AB testingUser Acquisitiondata analysis
0 likes · 24 min read
Mastering Growth Metrics: Methodologies, Frameworks, and Real‑World Cases
Data Thinking Notes
Data Thinking Notes
Dec 14, 2023 · Fundamentals

Why Designing Metrics Matters: From Definition to Good Indicator Practices

This article explains why metrics are essential, defines what a metric is, describes the four essential elements of metric design, outlines the three‑step design process, discusses measurement scales and time characteristics, and provides criteria for evaluating good metrics.

data analysisindicator designmeasurement scales
0 likes · 15 min read
Why Designing Metrics Matters: From Definition to Good Indicator Practices
Xiaohongshu Tech REDtech
Xiaohongshu Tech REDtech
Dec 14, 2023 · Cloud Native

Evolution of Xiaohongshu Metrics System: Cloud‑Native Observability, High Availability, and Performance Optimizations

Xiaohongshu’s observability team rebuilt its Prometheus‑based metrics platform using vmagent, dual‑active HA clusters, query push‑down, high‑cardinality governance and multi‑cloud active‑active design, delivering ten‑fold collection speed, up to 70× query capacity, massive CPU‑memory‑storage savings and fully automated scaling.

VictoriaMetricscloud-nativehigh-availability
0 likes · 35 min read
Evolution of Xiaohongshu Metrics System: Cloud‑Native Observability, High Availability, and Performance Optimizations
DataFunTalk
DataFunTalk
Dec 14, 2023 · Fundamentals

Evaluating Long-Term vs Short-Term Effects in A/B Experiments

While A/B testing is widely used for data-driven decisions, short-term experimental results often diverge from long-term impacts, leading to misguided strategies; this article examines why such inconsistencies arise and reviews major methods—including extended experiments, holdout groups, post‑analysis, CCD, and surrogate‑metric modeling—to reliably estimate long‑term effects.

A/B testingLong-term impactdata science
0 likes · 13 min read
Evaluating Long-Term vs Short-Term Effects in A/B Experiments
FunTester
FunTester
Nov 28, 2023 · Operations

How to Adopt a DevOps Culture: Custom Strategies, CI/CD, Automation & Metrics

This article outlines the essential steps for embracing DevOps culture, emphasizing tailored strategies, deep understanding of CI/CD, clear role assignments, extensive automation, key performance metrics, and the critical role of quality assurance to achieve faster, reliable software delivery.

CI/CDCultureautomation
0 likes · 9 min read
How to Adopt a DevOps Culture: Custom Strategies, CI/CD, Automation & Metrics
Data Thinking Notes
Data Thinking Notes
Nov 23, 2023 · Big Data

How Data-Driven Metrics Transform Product Analytics and Decision-Making

This article explains how to build a data‑driven metric system—from defining end‑to‑start metrics and combining business and data drivers, to applying statistical analysis, machine‑learning, causal inference, and practical case studies for alerting, diagnosing, and strategizing product performance.

causal inferencedata-drivenmetrics
0 likes · 22 min read
How Data-Driven Metrics Transform Product Analytics and Decision-Making
Python Programming Learning Circle
Python Programming Learning Circle
Nov 22, 2023 · Big Data

E‑commerce User Behavior Analysis and KPI Modeling with Python and SQL

This study analyzes JD e‑commerce operational data from February to April 2018, employing Python and SQL to compute key metrics such as PV, UV, conversion rates, attrition, purchase frequency, time‑based behavior, funnel analysis, retention, product sales, and RFM segmentation, and provides actionable recommendations for improving user engagement and sales performance.

RFMSQLUser Behavior
0 likes · 30 min read
E‑commerce User Behavior Analysis and KPI Modeling with Python and SQL
ZhongAn Tech Team
ZhongAn Tech Team
Nov 17, 2023 · Frontend Development

Understanding Interaction to Next Paint (INP) Metric and How to Measure It

This article explains the INP (Interaction to Next Paint) performance metric, its calculation method, satisfaction thresholds, differences from FID, and provides practical guidance on measuring INP using Chrome's CrUX, PageSpeed Insights, the web‑vitals library, Chrome extensions, and custom console scripts.

ChromeINPWeb Performance
0 likes · 11 min read
Understanding Interaction to Next Paint (INP) Metric and How to Measure It