Tagged articles

Kaldi

7 articles · Page 1 of 1
Xiaomi Tech
Xiaomi Tech
Jul 16, 2026 · Artificial Intelligence

Xiaomi’s Voice AI Chief Daniel Povey Named ISCA Fellow for Pioneering Open‑Source Speech Tools

Daniel Povey, Xiaomi’s chief scientist for speech, was elected a 2026 ISCA Fellow in recognition of his groundbreaking work on acoustic modeling, sequence‑training methods such as Minimum Phone Error, and the creation of the Kaldi toolkit and its next‑generation extensions that power modern multilingual ASR and TTS systems.

ASRDaniel PoveyISCA Fellow
0 likes · 8 min read
Xiaomi’s Voice AI Chief Daniel Povey Named ISCA Fellow for Pioneering Open‑Source Speech Tools
58 Tech
58 Tech
Jul 6, 2023 · Artificial Intelligence

Design and Optimization of a Kaldi‑Based Speech Recognition Backend at 58.com

This article details the evolution from the initial Kaldi‑based speech recognition architecture (version 1.0) to a re‑engineered version 2.0, describing business background, service components, identified shortcomings, and a series of performance, concurrency, GPU, I/O, GC, and dispatch optimizations that dramatically improve resource utilization, latency, and reliability for large‑scale voice processing at 58.com.

AIBackend ArchitectureGPU
0 likes · 15 min read
Design and Optimization of a Kaldi‑Based Speech Recognition Backend at 58.com
58 Tech
58 Tech
Nov 27, 2020 · Artificial Intelligence

An Overview of Kaldi Chain Model Speech Recognition and Its Relationship with HMM‑DNN and Discriminative Training

This article explains the Kaldi chain model speech‑recognition system, covering HMM‑DNN fundamentals, discriminative (MMI) training, the special single‑state HMM topology, TDNN architecture, training pipelines, and experimental results that demonstrate its performance advantages over traditional GMM‑based approaches.

HMM-DNNKaldiTDNN
0 likes · 19 min read
An Overview of Kaldi Chain Model Speech Recognition and Its Relationship with HMM‑DNN and Discriminative Training
58 Tech
58 Tech
Aug 19, 2020 · Artificial Intelligence

Speech Recognition in 58.com: Application Scenarios, Data Collection, Kaldi Chain Model Practice, and End‑to‑End Exploration

This article presents a comprehensive overview of how 58.com leverages large‑scale voice data from call‑center, private phone, and micro‑chat platforms, detailing data collection, annotation, Kaldi‑based chain model training, lattice‑free techniques, and end‑to‑end Transformer‑CTC models to improve Chinese speech recognition performance.

ASRChineseEnd-to-End
0 likes · 16 min read
Speech Recognition in 58.com: Application Scenarios, Data Collection, Kaldi Chain Model Practice, and End‑to‑End Exploration