Tagged articles

Multilingual TTS

5 articles · Page 1 of 1
Machine Heart
Machine Heart
Aug 20, 2026 · Artificial Intelligence

FireRedTTS3: Zero‑Shot Multilingual Voice Cloning, Design, and Editing in One Model

FireRedTTS3 unifies 24‑language, 21‑dialect zero‑shot voice cloning, natural‑language voice design, and precise local editing in a single model by injecting semantic information into a continuous speech representation (RedAE) and leveraging a lightweight LLM‑DiT generation framework, achieving state‑of‑the‑art results on four public benchmarks.

LLM-DiTMultilingual TTSRedAE
0 likes · 13 min read
FireRedTTS3: Zero‑Shot Multilingual Voice Cloning, Design, and Editing in One Model
Bilibili Tech
Bilibili Tech
Aug 17, 2026 · Artificial Intelligence

IndexTTS 2.5 Enables Cross‑Language Voice Synthesis with Zero‑Sample Multilingual Support

IndexTTS 2.5 adds zero‑sample voice cloning for Chinese, English, Japanese, Spanish and Arabic, doubles inference speed, introduces flexible speech‑rate control, and improves emotion and timbre fidelity, with detailed benchmarks and a systematic multilingual modeling study supporting its design choices.

Emotion TransferMultilingual TTSSpeech Synthesis
0 likes · 10 min read
IndexTTS 2.5 Enables Cross‑Language Voice Synthesis with Zero‑Sample Multilingual Support
Alibaba Cloud Developer
Alibaba Cloud Developer
Jul 21, 2026 · Artificial Intelligence

Qwen-Audio-3.0-TTS: From Speaking to Expressive Voice Synthesis

Qwen-Audio-3.0-TTS launches two variants—Flash with ~300 ms latency and Plus with higher naturalness—offering multilingual support for 16 languages, superior WER/CER and speaker similarity scores, free‑style natural‑language control, fine‑grained tag editing, and robust performance in noisy environments, all backed by benchmark results that crown Plus as the top performer on the Artificial Analysis leaderboard.

AI modelMultilingual TTSQwen-Audio-3.0-TTS
0 likes · 7 min read
Qwen-Audio-3.0-TTS: From Speaking to Expressive Voice Synthesis
Xiaomi Tech
Xiaomi Tech
Mar 18, 2026 · Artificial Intelligence

Xiaomi Unveils MiMo-V2-TTS: Giving Agents a Voice with Soul

Xiaomi introduces MiMo-V2-TTS, a self‑developed speech‑synthesis large model that combines a custom audio tokenizer, multi‑codebook architecture, massive pre‑training on over a hundred million hours of data and multi‑dimensional reinforcement learning to deliver fine‑grained style control, dialect support, role‑play and high‑quality singing, aiming to give AI agents expressive, human‑like voices.

Multilingual TTSReinforcement LearningSpeech Synthesis
0 likes · 6 min read
Xiaomi Unveils MiMo-V2-TTS: Giving Agents a Voice with Soul
Ubuntu
Ubuntu
Jan 24, 2026 · Artificial Intelligence

Deploy Alibaba’s Qwen3‑TTS on Ubuntu and Clone Your Voice in 3 Seconds

This guide walks through installing the open‑source Qwen3‑TTS model on Ubuntu, covering environment setup, GPU requirements, package installation, model variants, and hands‑on Python scripts for ultra‑low‑latency voice cloning and text‑driven voice design.

AI speech synthesisMultilingual TTSPyTorch
0 likes · 9 min read
Deploy Alibaba’s Qwen3‑TTS on Ubuntu and Clone Your Voice in 3 Seconds