Làm Chủ AI
Tin AI

Google Ra 2 Model Flash TTS Tạo Giọng Nói Từ Mô Tả

2 phút đọc

Google ra 2 model Flash TTS tạo giọng nói từ mô tả

Flash TTS được Google nhắm cho các dự án sáng tạo như nhân vật trong trò chơi, sách nói và chương trình âm thanh. Flash-Lite TTS tập trung vào tạo giọng nói chi phí thấp ở quy mô lớn cho lồng tiếng, nội dung âm thanh và agent giọng nói.

Với Gemini 3.8 Flash TTS, người dùng có thể tạo giọng từ đầu. Một câu lệnh văn bản có thể định nghĩa vai trò, giọng địa phương và đặc điểm giọng trên nhiều ngôn ngữ và phương ngữ.

Với người không muốn bắt đầu từ số 0, Google đưa ra thư viện hơn 2.000 giọng có sẵn, gồm các biến thể vùng miền như Tây Ban Nha Mexico, Pháp Quebec và Anh Scotland.

Tính năng sao chép giọng có thể tạo hồ sơ giọng từ một mẫu âm thanh dài 30 giây. Để dùng, người bị sao chép phải ghi một câu nói đồng ý, và giọng trong bản ghi đó phải khớp với mẫu.

Mỗi đoạn âm thanh do các model này tạo ra đều có SynthID dấu chìm không nghe thấy để giúp nhận ra giọng do AI tạo. Google cũng nói Voice Remixing sẽ cho phép chỉnh âm sắc, cao độ, nhịp và giọng địa phương của các giọng có sẵn, nhưng tính năng này chưa có.

Cả 2 model cho phép viết chỉ dẫn cho từng dòng hoặc để model tự hiểu tín hiệu kịch bản. Google nói chúng có thể tạo nhiều giờ âm thanh với độ lệch giọng rất nhỏ.

Chế độ 2 giọng tạo đối thoại từ một kịch bản duy nhất mà vẫn giữ 2 giọng tách biệt. Người dùng cũng có thể ghi trong kịch bản tiếng cười, tiếng thở dài và âm thanh như "mhm" để đặt phản ứng và khoảng dừng đúng chỗ.

Nguồn

Đọc tiếp trong Tin AI