Nhận dạng và tách người nói trong một lượt
Nhãn người nói, mốc thời gian từng đoạn và dấu câu ra cùng một lượt giải mã. Không ghép hậu kỳ, nên transcript không mất mạch khi cuộc nói chuyện đổi người.

SotaSpeech được tinh chỉnh cho tiếng Việt, hướng tới nhận dạng tốt hơn các sắc thái phát âm và giọng vùng miền Bắc – Trung – Nam. Tích hợp nhận dạng lời nói, phân tách người nói và căn chỉnh thời gian, SotaSpeech hỗ trợ NoteX, RoomX và Saydi, với dịch vụ vận hành trên hạ tầng tại Việt Nam, tăng cường khả năng kiểm soát dữ liệu và bảo mật.
Nhãn người nói, mốc thời gian từng đoạn và dấu câu ra cùng một lượt giải mã. Không ghép hậu kỳ, nên transcript không mất mạch khi cuộc nói chuyện đổi người.
File dài được chia nhỏ, nhận dạng rồi ghép lại tự động; cửa sổ ngữ cảnh đủ rộng để giữ mạch hội thoại xung quanh — một transcript liền mạch thay vì một đống đoạn rời.
Tinh chỉnh trên audio tiếng Việt thực tế, hỗ trợ 50+ ngôn ngữ. Hotword, endpoint tương thích OpenAI và xuất SRT / VTT đều có sẵn trong dịch vụ.
Kết quả trên 3 ca thực tế (sạch / cuộc họp / vùng miền), do nhóm đánh giá của dự án chạy và chấm — thấp hơn là tốt hơn.
| # | Model | SạchNWER | Cuộc họpNWER | Vùng miềnNWER |
|---|---|---|---|---|
| 1 | SotaSpeech | 4.46 | 8.37 | 7.52 |
| 2 | Amazon Transcribe | 5.20 | 10.44 | 8.35 |
| 3 | Gipformer 1.5 | 8.50 | 14.00 | 9.52 |
| 4 | Qwen3-ASR 1.7b | 15.04 | 23.99 | 10.33 |
| 5 | PhoWhisper | 12.16 | 21.20 | 13.37 |
| 6 | Parakeet-ctc-0.6b-Vietnamese | 13.96 | 24.97 | 16.48 |
| 7 | ChunkFormer RNN-T Large Vie | 12.17 | 22.40 | 14.51 |
| 8 | Qwen3-ASR 0.6b | 18.71 | 30.15 | 13.71 |
| 9 | Whisper Large v3 | 22.85 | 33.40 | 16.58 |
| 10 | BuzzASR Vietnamese | 19.93 | 27.99 | 23.53 |
| 11 | Whisper Large Turbo | 31.41 | 41.33 | 24.35 |
| 12 | Cohere Transcribe | 29.06 | 33.98 | 27.65 |
| 13 | Voxtral Small 24B 2507 STT | 21.18 | 77.60 | 78.96 |
| 14 | VietASR / Zipformer | 10.41 | 17.64 | 22.06 |
Mô hình thực hiện đồng thời việc chuyển văn bản, gán người nói và dự đoán mốc thời gian, tạo ra các đoạn văn bản căn theo thời gian kèm mốc tuyệt đối trên toàn bản ghi. Mô hình được xây dựng cho biên bản họp, phân tích cuộc gọi và xử lý media dạng dài.
Mô hình nền đang phục vụ: một mô hình của bên thứ ba (Apache-2.0), kết hợp bộ mã hoá Whisper với bộ giải mã Qwen3 và thiết kế ngữ cảnh dài. Adapter tiếng Việt và toàn bộ dịch vụ xung quanh là của riêng dự án này.
Transcript dưới mỗi clip được tô màu theo người nói — bấm vào một dòng để tua tới. Mọi bản ghi đều do chủ sở hữu công bố theo giấy phép ghi trên thẻ.
Diễn viên và đoàn phim nói chuyện tự nhiên, luân phiên nhanh, có tiếng ồn hiện trường — ca khó nhất cho phân tách người nói.
Nguồn: Galaxy Studio · CC BY 4.0 · bản ghi: SotaSpeech V2.5
Phỏng vấn ngắn, thu gọn gàng, ít người nói — dễ đọc kết quả diarization hơn bản hậu trường.
Nguồn: Galaxy Studio · CC BY 3.0 · bản ghi: SotaSpeech V2.5
Phóng sự truyền hình về thủ tục hành chính: lời dẫn xen phỏng vấn người dân và cán bộ. Nhiều từ vựng nghiệp vụ, sát với transcription thực tế.
Nguồn: Đài PTTH Thanh Hoá · CC BY 3.0 · bản ghi: SotaSpeech V2.5
Giọng miền Trung, thu tại quầy giao dịch nên có tiếng nền — kiểm tra độ bền với nhiễu.
Nguồn: Đài PTTH Thanh Hoá · CC BY 3.0 · bản ghi: SotaSpeech V2.5
Thuyết minh một giọng, đọc rõ, chỉ 30 giây — mẫu chạy nhanh khi cần thử lại đường ống.
Nguồn: ZDF/Terra X (R. Marel, I. Gesang, SpiegelTV, Jochen Schmidt) · CC BY 4.0 · bản ghi: SotaSpeech V2.5
Thu trong studio, một người nói rõ ràng — mốc so sánh sạch với các phóng sự thu ngoài hiện trường.
Nguồn: San Francisco Government Television (SFGovTV) · CC BY 3.0 · bản ghi: SotaSpeech V2.5
Question-and-answer exchange between an interviewer and a guest.
Nguồn: Kara Fern (ZimtHaus) · CC BY 3.0 · bản ghi: SotaSpeech V2.5
Press scrum: several reporters questioning one subject, with crosstalk.
Nguồn: MMA Fight - Official · CC BY 3.0 · bản ghi: SotaSpeech V2.5