🎙️ Uzbek Voice AI

Real-time Uzbek-language voice assistant — TTS research, model fine-tuning & a streaming voice agent.

Text-to-Speech VITS / MMS Speech Recognition LLM dialog FastAPI · WebSocket PyTorch Kaggle GPU Low-resource NLP

I built a live, streaming voice assistant that lets Uzbek speakers ask questions and get spoken answers — then ran a full research track to find (or build) the best Uzbek text-to-speech voice, since Uzbek is a low-resource language with very few options.

5
TTS models benchmarked
60 h
studio corpus mined
7,080
fine-tune steps trained
<2 s
target voice latency

🔊 Listen — Uzbek TTS demos

Same sentences synthesized by the best off-the-shelf model vs. my fine-tuned voice. All audio is generated from text — no human recording.

Greeting

«Ассалому алайкум! Сизга қандай ёрдам бера оламан?»

Best quality · MMS
My fine-tune · FeruzaSpeech

Financing

«Омонат ҳисобингизга ҳар ойда беш фоиз фойда қўшилади.»

MMS Fine-tune

Numbers & units

«Кредит муддати ўн икки ой, ойлик тўлов бир миллион сўм.»

MMS Fine-tune

🧭 The approach

📊 Models evaluated

ModelApproachResult
Meta MMS (Uzbek, Cyrillic)Off-the-shelf VITS✅ Best quality
MMS + FeruzaSpeechMy VITS fine-tune◑ Adapted voice, slightly rougher
Chatterbox v3LoRA fine-tune✗ Poor (no Uzbek base)
Community Latin VITSOff-the-shelf✗ Garbled
Yandex SpeechKit «nigora»Commercial API✅ Production choice

🛠️ Tech stack

Python · PyTorch · HuggingFace Transformers · VITS / Meta MMS · Chatterbox · FastAPI + WebSockets · gRPC (Yandex SpeechKit STT/TTS v3) · Silero/energy VAD · Kaggle GPU automation (Kaggle API) · soundfile / datasets.

💡 Key takeaways

⚠️ Research/educational project. Open Uzbek datasets & models used here are non-commercial (CC-BY-NC / academic) licensed; the audio demos are for evaluation only.