MHTHANG.

OmniVoice: TTS 600+ ngôn ngữ chạy local, miễn phí

Test thật OmniVoice (Xiaomi + k2-fsa): clone giọng tiếng Việt 24kHz chạy GPU 8GB, RTF 0.025. Verdict cho người làm video cần TTS local.

8 phút đọcĐộ khó: Trung bìnhNên dùng

OmniVoice: TTS 600+ ngôn ngữ chạy local, miễn phí

Cần giọng đọc tiếng Việt tự nhiên cho video nhưng không muốn trả phí theo tháng kiểu ElevenLabs? Tôi dùng OmniVoice (Xiaomi Research + k2-fsa) lồng tiếng 2 bộ visual novel thật, chạy local ngay trên GPU 8GB. Bài này là test thật, số liệu từ máy tôi.

Vấn đề

TTS tiếng Việt trên thị trường rơi vào 2 cực:

  • Online (ElevenLabs, Google): giọng tốt nhưng trả phí theo ký tự, text bắt buộc upload lên cloud.
  • Local (Coqui, Piper...): miễn phí nhưng tiếng Việt nhiều bản là tái đóng gói, giọng máy móc, không clone được giọng gốc.

Tôi cần thứ ở giữa: local, miễn phí, tiếng Việt tự nhiên, có clone giọng.

Setup

| Thành phần | Giá trị | |---|---| | Model | k2-fsa/OmniVoice (v0.2.1, Apache 2.0) | | Hardware | RTX 2060 8GB, CUDA 13.3 | | Dependencies | torch 2.8, torchaudio 2.8, transformers 5.3+ | | Output | WAV 24,000 Hz | | ASR phụ trợ | openai/whisper-large-v3-turbo (tự transcribe ref audio) |

Cài nhanh:

python -m venv .venv && .venv/Scripts/activate
pip install "torch==2.8.0" "torchaudio==2.8.0"
pip install omnivoice

Kết quả test

Tốc độ

Thông số nhà phát hành: RTF 0.025 trên H100 (40x realtime), có FlashInfer là 0.0115. Trên RTX 2060 (không FlashInfer) chậm hơn nhưng vẫn nhanh — render 10 phút đối thoại chỉ mất vài phút.

Config tôi đang dùng (từ pipeline):

| Config | Giá trị | |---|---| | Device | cuda:0, dtype float16 | | Speed | 0.9 | | Sample rate | 24,000 Hz | | Đã render thật | 2 series visual novel, 5-7 giọng/series |

651 ngôn ngữ — đếm thật trong source

File lang_map.py của dự án có 651 entry ánh xạ ISO 639-3. Nhà phát hành ghi 600+, đếm lại đúng thật.

3 chế độ sinh giọng

  1. Voice cloning — đưa ref audio 5-15 giây + text (hoặc để Whisper tự transcribe), nó clone giọng. Tôi dùng nhiều nhất.
  2. Voice design — mô tả "nữ, trẻ, nhẹ nhàng", không cần ref audio.
  3. Auto voice — model tự chọn giọng theo text.

Chất lượng tiếng Việt

Clone giọng để lồng tiếng visual novel — tự nhiên hơn hẳn Piper tiếng Việt. Có nhãn cảm xúc [laughter], [sigh], [question-ah]..., chỉnh được tốc độ. Giọng nam trầm + speed 0.9 ra chất đọc kể chuyện khá ổn.

Chi phí

  • Phần mềm: 0 VND. Apache 2.0, chạy local, không giới hạn ký tự, không gửi dữ liệu lên cloud.
  • GPU: RTX 2060 8GB đủ. Không có GPU thì Apple Silicon (MPS) / Intel Arc (XPU) dùng được — chậm hơn.
  • So sánh: ElevenLabs trả theo gói + theo ký tự; tự host OmniVoice coi như 0đ nếu đã có GPU — đổi lại tự setup, tự bảo trì.

Giới hạn

  • Setup có ngưỡng: cài đúng CUDA, model nhiều GB, cần máy đủ VRAM — không phải bấm nút là xong.
  • Ref audio bẩn (nhiều tạp âm) → giọng clone kém. Cần chỉnh ref trước.
  • Tiếng Việt là 1 trong 651 ngôn ngữ chung, không có pipeline riêng "chuyên VN" như TTS thương mại — nhưng đủ tốt cho video, kể chuyện.
  • Chưa test kỹ đọc dài liên tục (1 giờ); mới dùng cho đối thoại ngắt quãng.
  • RTF 0.025 là số của H100, đừng kỳ vọng trên máy 8GB.

Verdict

Nên dùng nếu bạn làm video/có GPU ≥ 8GB, muốn TTS tiếng Việt + clone giọng free không lệ thuộc cloud. Đây là lựa chọn duy nhất mình thấy cân bằng đủ 3 trục: tự nhiên / miễn phí / có clone giọng.

Không nên dùng nếu bạn không có GPU và ngại cài CUDA — lúc đó TTS online đỡ đau hơn.

Cài thử bản HF Space trước khi nhảy vào setup nặng: search k2-fsa/OmniVoice trên HuggingFace Spaces.

Cùng hạ tầng GPU, anh em mình có ComfyUI MiniMax H3 chạy trên 8GB — xem bài bên cạnh nếu chưa. `