Alibaba Ra Mắt Qwen Audio 3.1, Giảm Giá Model Giọng Nói
1 phút đọc
Qwen-Audio-3.1 có năm model cho ASR, TTS và tương tác thời gian thực. Model ASR cải thiện nhận dạng đa ngôn ngữ và phương ngữ, đồng thời tự động bỏ từ đệm và chỗ lặp.
ASR-Next thêm nhận diện nhiều người nói cùng dấu thời gian. Nó cũng phát hiện cảm xúc, âm thanh môi trường và tiếng máy.
TTS tổng hợp đa ngôn ngữ với chuyển giọng tự nhiên giữa các ngôn ngữ. Người dùng có thể điều khiển cảm xúc, tốc độ và kiểu nói bằng câu lệnh văn bản đơn giản.
TTS-Next ghép model ngôn ngữ với phương pháp khuếch tán để tạo giọng nói, hiệu ứng âm thanh và âm thanh nền trong một lần. Model thời gian thực cho phép nói và nghe cùng lúc, với ngắt lời ngay.
Khi phát hiện tâm trạng thấp, model này phản hồi chậm hơn và đồng cảm hơn, theo Qwen. Alibaba cũng giảm giá: TTS giảm khoảng 70%, Realtime khoảng 85%, còn ASR tới 95%.
Trọng số có trên Hugging Face, và model được phát hành theo giấy phép Apache 2.0.
Nguồn
- Alibaba launches Qwen Audio 3.1 with new models and slashes AI audio prices by up to 95 percent— The Decoder, 23 tháng 9, 2026