Giọng nói sang Văn bản là gì
Chuyển đổi giọng nói thành văn bản
Giọng nói sang Văn bản (Speech-to-Text, STT) là công nghệ tự động chuyển đổi lời nói thành văn bản bằng thuật toán học máy.
Cách hoạt động
- Mô hình âm học — phân tích sóng âm
- Mô hình ngôn ngữ — dự đoán các từ có khả năng
- Bộ giải mã — chọn chuỗi có khả năng nhất
Công nghệ
- Whisper (OpenAI) — mô hình đa ngôn ngữ
- Google Speech-to-Text — dịch vụ đám mây
- Azure Speech Services — của Microsoft
- Vosk — giải pháp offline mã nguồn mở
Ứng dụng kinh doanh
- Chép lại cuộc gọi và cuộc họp
- Trợ lý giọng nói và hệ thống IVR
- Phụ đề cho nội dung video
- Nhập liệu bằng giọng nói trong ứng dụng
- Phân tích hội thoại khách hàng