Meta Phát Hành Model Âm Thanh Thời Gian Thực Đầu Tiên
3 phút đọc

Dòng Spark chia âm thanh đầu vào thành các đoạn 80 mili giây. Sau mỗi đoạn, nó quyết định tiếp tục nghe hay xuất ra từ tiếp theo dưới dạng văn bản, để kiểm soát lượng ngữ cảnh trước khi chốt bản chép lời.
Meta nói chờ lâu hơn thì chính xác hơn nhưng cũng chậm hơn. Muse Voice Transcribe tự điều chỉnh thời gian chờ cho từng từ theo độ khó, nên từ dễ ra nhanh hơn còn từ khó được nghe thêm. Meta huấn luyện cách này bằng học tăng cường, vừa thưởng cho tỷ lệ lỗi thấp vừa thưởng cho độ trễ ngắn.
Các tính năng còn lại được Meta đưa vào cùng một model, không tách thành hệ thống riêng. Với phân biệt người nói, model đánh dấu khi người nói đổi và gắn cho mỗi đoạn một mã từ A đến Z. Với ranh giới câu, nó đánh dấu nơi mỗi phát ngôn bắt đầu và kết thúc, và cả hai nhiệm vụ được huấn luyện chung với nhận dạng giọng nói.
Model có thể phân biệt hơn 20 người nói cùng lúc và xử lý bản ghi dài hơn 1 giờ mà không cần xử lý sau. Trong một buổi trình diễn với 8 người trong phòng, hệ thống gán từ cho từng người nói theo thời gian thực.
Meta nói Muse Voice Transcribe được huấn luyện trên hơn 70 ngôn ngữ, trong đó 25 ngôn ngữ được kiểm tra kỹ. Model cũng xử lý đổi mã, khi người nói chuyển giữa 2 ngôn ngữ ngay trong một câu. Gợi ý về ngôn ngữ, từ khóa và ngữ cảnh có thể tăng độ chính xác, nhất là với danh từ riêng như Meta, Muse, hoặc Menlo Park.
Artificial Analysis xác nhận các số liệu này trong một đánh giá độc lập. Muse Voice Transcribe đạt tỷ lệ lỗi từ 3.1% trên tiếng Anh, với độ trễ 0.16 giây sau khi người nói dừng. ElevenLabs Scribe v2 Realtime là 3.6% và 0.14 giây, AssemblyAI Universal-3.5 Pro Realtime là 4.0%, còn Cartesia Ink-2 là 3.4% hoặc 4.0% tùy cách nhận ra ranh giới phát ngôn.
Meta gắn việc phát hành với tầm nhìn "siêu trí tuệ cá nhân" của CEO Mark Zuckerberg. Trong một buổi trình diễn, nhân viên Meta nói nhận dạng giọng nói đáng tin là nền cho các agent AI cá nhân lắng nghe cuộc trò chuyện thật qua kính AI. Ở Đức, một lệnh cấm với kính camera của Meta gần đây đã được bàn tới, nhưng cơ quan quản lý mạng liên bang của nước này không theo đuổi. Muse Voice Transcribe đang dùng cho gõ bằng giọng nói trong Meta AI và Muse Code, có qua Meta Model API, và người dùng có thể thử bằng cách giữ phím "Fn" trong bất kỳ app nào.
Nguồn
- Meta's new real-time audio model is the foundation for AI assistants that never stop listening— The Decoder, 6 tháng 9, 2026