• Giọng nói Việt
  • Hạ tầng Việt
  • Dữ liệu ở lại Việt Nam

SotaSpeech: nghe đúng tiếng Việt, như người Việt.

SotaSpeech được tinh chỉnh cho tiếng Việt, hướng tới nhận dạng tốt hơn các sắc thái phát âm và giọng vùng miền Bắc – Trung – Nam. Tích hợp nhận dạng lời nói, phân tách người nói và căn chỉnh thời gian, SotaSpeech hỗ trợ NoteX, RoomX và Saydi, với dịch vụ vận hành trên hạ tầng tại Việt Nam, tăng cường khả năng kiểm soát dữ liệu và bảo mật.

Điểm nổi bật

Nhận dạng và tách người nói trong một lượt

Nhãn người nói, mốc thời gian từng đoạn và dấu câu ra cùng một lượt giải mã. Không ghép hậu kỳ, nên transcript không mất mạch khi cuộc nói chuyện đổi người.

Ngữ cảnh 128k token, hàng giờ audio

File dài được chia nhỏ, nhận dạng rồi ghép lại tự động; cửa sổ ngữ cảnh đủ rộng để giữ mạch hội thoại xung quanh — một transcript liền mạch thay vì một đống đoạn rời.

Tối ưu cho tiếng Việt, hỗ trợ 50+ ngôn ngữ

Tinh chỉnh trên audio tiếng Việt thực tế, hỗ trợ 50+ ngôn ngữ. Hotword, endpoint tương thích OpenAI và xuất SRT / VTT đều có sẵn trong dịch vụ.

Benchmark

Kết quả trên 3 ca thực tế (sạch / cuộc họp / vùng miền), do nhóm đánh giá của dự án chạy và chấm — thấp hơn là tốt hơn.

  • SotaSpeech8.37
  • Amazon Transcribe10.44
  • Gipformer 1.514.00
  • VietASR / Zipformer17.64
  • PhoWhisper21.20
  • ChunkFormer RNN-T Large Vie22.40
  • Qwen3-ASR 1.7b23.99
  • Parakeet-ctc-0.6b-Vietnamese24.97
  • BuzzASR Vietnamese27.99
  • Qwen3-ASR 0.6b30.15
  • Whisper Large v333.40
  • Cohere Transcribe33.98
  • Whisper Large Turbo41.33
  • Voxtral Small 24B 2507 STT77.60
Thấp hơn là tốt hơn. Cột được chuẩn hoá theo điểm tốt nhất ở metric đang chọn.

Bảng số liệu

#ModelSạchNWERCuộc họpNWERVùng miềnNWER
1SotaSpeech4.468.377.52
2Amazon Transcribe5.2010.448.35
3Gipformer 1.58.5014.009.52
4Qwen3-ASR 1.7b15.0423.9910.33
5PhoWhisper12.1621.2013.37
6Parakeet-ctc-0.6b-Vietnamese13.9624.9716.48
7ChunkFormer RNN-T Large Vie12.1722.4014.51
8Qwen3-ASR 0.6b18.7130.1513.71
9Whisper Large v322.8533.4016.58
10BuzzASR Vietnamese19.9327.9923.53
11Whisper Large Turbo31.4141.3324.35
12Cohere Transcribe29.0633.9827.65
13Voxtral Small 24B 2507 STT21.1877.6078.96
14VietASR / Zipformer10.4117.6422.06

Phạm vi sử dụng & trạng thái công bố

Mô hình thực hiện đồng thời việc chuyển văn bản, gán người nói và dự đoán mốc thời gian, tạo ra các đoạn văn bản căn theo thời gian kèm mốc tuyệt đối trên toàn bản ghi. Mô hình được xây dựng cho biên bản họp, phân tích cuộc gọi và xử lý media dạng dài.

  • Không dùng để ghi âm hay giám sát người khác mà không có sự đồng ý, và không dùng làm căn cứ duy nhất cho quyết định pháp lý, y tế hay nhân sự mà không có người kiểm tra. Mốc thời gian theo đoạn, không theo từng từ.
  • Trọng số adapter chưa được phát hành vì tập dữ liệu fine-tune có các nguồn phi thương mại. Giấy phép & ghi công

Kiến trúc

SotaSpeech ASR architectureThe serving path runs across the top: ffmpeg decode, voice activity detection, a request gate and the sgl-omni server, which takes the whole clip. Below it the model runs left to right: a 24-layer Whisper-Medium audio encoder, which emits one hidden state per frame; a VQAdaptor that merges four frames in time and projects them into the language model hidden size; masked_scatter, which writes those frames into the text embeddings; and a Qwen3-0.6B decoder that carries the Vietnamese LoRA and emits one stream of timestamps, speaker tags and words. The service then parses that stream, collapses repeats and segments it.SotaSpeech ASRVietnamese ASR · timestamped · speaker-awareuploadffmpeg decode16 kHz · mono · f32VADFireRedVAD | RMSRequest gate4 concurrentsgl-omniT=0 · 8192 tokwhole clip · no chunkingWhisper–Medium audio encoder80 mel bins · 24 layers · d_model 102416 heads · FFN 4096 · log-mel in · GELU24× Self-Attention Layer30 s window · 1500 positions · 50 frames/sencoder hidden states (B,T,1024)…VQAdaptor4× Time Merge(B,T,1024) reshape to (B,T/4,4096)ProjectionLinear 4096→1024 · SiLU · Linear 1024→1024LayerNorm · ε 1e−650 → 12.5 tokens/smaps encoder dim to LM hidden 1024masked_scatterinto text embeddingsaudio placeholder token 151671Qwen3–0.6B decoder28 layers · d 1024 · GQA 16/8head_dim 128 · SiLUDecoder Self-AttentionRoPE θ 1e6 · RMSNorm · 131072 contextVietnamese LoRArank 256 · checkpoint 108ktied embeddings · lm_head to 151936 vocabjointly: words + speaker + timeone autoregressive token stream[0.11][S01]Goodmorning![1.03][1.11][S02]Morning,guys![1.34]Parse[t] ([Sxx])? text [t]Collapse repeatsSegment[ ]timestampspeakerwordsspeaker tag: base only · VI adapter emits noneno CAPU · model emits cased text

Mô hình nền đang phục vụ: một mô hình của bên thứ ba (Apache-2.0), kết hợp bộ mã hoá Whisper với bộ giải mã Qwen3 và thiết kế ngữ cảnh dài. Adapter tiếng Việt và toàn bộ dịch vụ xung quanh là của riêng dự án này.

Demo

Transcript dưới mỗi clip được tô màu theo người nói — bấm vào một dòng để tua tới. Mọi bản ghi đều do chủ sở hữu công bố theo giấy phép ghi trên thẻ.

Hậu trường phim — nhiều người nóiTiếng Việt · Hậu trường
phụ đề sẽ hiện ở đây khi phát
Bản ghi51 đoạn

Diễn viên và đoàn phim nói chuyện tự nhiên, luân phiên nhanh, có tiếng ồn hiện trường — ca khó nhất cho phân tách người nói.

Nguồn: Galaxy Studio · CC BY 4.0 · bản ghi: SotaSpeech V2.5

Phỏng vấn diễn viên — 2–3 ngườiTiếng Việt · Phỏng vấn
phụ đề sẽ hiện ở đây khi phát
Bản ghi23 đoạn

Phỏng vấn ngắn, thu gọn gàng, ít người nói — dễ đọc kết quả diarization hơn bản hậu trường.

Nguồn: Galaxy Studio · CC BY 3.0 · bản ghi: SotaSpeech V2.5

Bản tin dịch vụ công — phóng viên + người dânTiếng Việt · Bản tin
phụ đề sẽ hiện ở đây khi phát
Bản ghi28 đoạn

Phóng sự truyền hình về thủ tục hành chính: lời dẫn xen phỏng vấn người dân và cán bộ. Nhiều từ vựng nghiệp vụ, sát với transcription thực tế.

Nguồn: Đài PTTH Thanh Hoá · CC BY 3.0 · bản ghi: SotaSpeech V2.5

Phóng sự hành chính — thu hiện trườngTiếng Việt · Bản tin
phụ đề sẽ hiện ở đây khi phát
Bản ghi35 đoạn

Giọng miền Trung, thu tại quầy giao dịch nên có tiếng nền — kiểm tra độ bền với nhiễu.

Nguồn: Đài PTTH Thanh Hoá · CC BY 3.0 · bản ghi: SotaSpeech V2.5

Thuyết minh khoa học — 30 giâyTiếng Việt · Khoa học
phụ đề sẽ hiện ở đây khi phát
Bản ghi7 đoạn

Thuyết minh một giọng, đọc rõ, chỉ 30 giây — mẫu chạy nhanh khi cần thử lại đường ống.

Nguồn: ZDF/Terra X (R. Marel, I. Gesang, SpiegelTV, Jochen Schmidt) · CC BY 4.0 · bản ghi: SotaSpeech V2.5

Hướng dẫn y tế — giọng đọc studioTiếng Việt · Studio
phụ đề sẽ hiện ở đây khi phát
Bản ghi30 đoạn

Thu trong studio, một người nói rõ ràng — mốc so sánh sạch với các phóng sự thu ngoài hiện trường.

Nguồn: San Francisco Government Television (SFGovTV) · CC BY 3.0 · bản ghi: SotaSpeech V2.5

Interview — 2 speakersEnglish · Interview
phụ đề sẽ hiện ở đây khi phát
Bản ghi17 đoạn

Question-and-answer exchange between an interviewer and a guest.

Nguồn: Kara Fern (ZimtHaus) · CC BY 3.0 · bản ghi: SotaSpeech V2.5

Media day Q&A — multi-speakerEnglish · Press
phụ đề sẽ hiện ở đây khi phát
Bản ghi62 đoạn

Press scrum: several reporters questioning one subject, with crosstalk.

Nguồn: MMA Fight - Official · CC BY 3.0 · bản ghi: SotaSpeech V2.5