Xiaomi đã ra mắt phiên bản mới của các mô hình AI MiMo V2.5, cho phép chuyển đổi văn bản thành giọng nói và ngược lại
Xiaomi ra mắt các mô hình trí tuệ nhân tạo giọng nói mới
Công ty Xiaomi đã giới thiệu hai phiên bản của mô hình AI giọng nói của mình, hoạt động với văn bản và âm thanh:
Mô hình | Tính năng | Đặc điểm chính
MiMo‑V2.5‑TTS | Văn bản → lời nói | 3 biến thể, miễn phí trong thời gian hạn chế trên MiMo Studio; điều chỉnh tốc độ, giọng điệu và cảm xúc; khả năng tạo giọng mới từ một câu ngắn (VoiceDesign) và sao chép giọng từ một bộ mẫu nhỏ (VoiceClone).
MiMo‑V2.5‑ASR | Lời nói → văn bản | Nhận dạng lời nói trong điều kiện khó khăn, hỗ trợ các giọng miền Trung, Nam và Bắc của tiếng Trung + tiếng Anh; hội thoại song ngữ và lời bài hát (vocal trên nền nhạc); hoạt động khi có tiếng ồn lớn; tự động đặt dấu câu theo intonation.
Cách sử dụng MiMo‑V2.5‑TTS
1. Phiên bản cơ bản – chọn một trong các giọng điển hình đã được cài sẵn và cho phép thay đổi tốc độ, giọng điệu và sắc thái cảm xúc.
2. VoiceDesign – nhập một câu ngắn, sau đó hệ thống tạo ra một tông giọng mới.
3. VoiceClone – tải lên vài mẫu của giọng muốn sao chép; mô hình sẽ tái hiện nó với phong cách và hướng dẫn đã lưu.
Để đạt được âm thanh mong muốn người dùng có thể:
- Thêm thẻ đặc biệt vào văn bản;
- Mô tả giọng bằng ngôn ngữ tự nhiên (trong tiếng Trung hoặc tiếng Anh);
- Tạo kịch bản cho các buổi trình diễn ảo, nơi nhiều giọng nói tương tác đồng thời.
Đặc điểm của MiMo‑V2.5‑ASR
- Đa ngôn ngữ – hỗ trợ nhiều miền tiếng Trung và tiếng Anh.
- Giải mã bài hát – mô hình tách vocal ngay cả khi có nhạc nền.
- Kháng nhiễu – nhận dạng chính xác trong điều kiện ồn lớn.
- Dấu câu theo intonation – tự động chèn dấu câu, giảm nhu cầu chỉnh sửa thủ công.
Như vậy, Xiaomi mở rộng khả năng của mình trong lĩnh vực công nghệ giọng nói, cung cấp các công cụ linh hoạt cho cả việc tạo ra lời nói tổng hợp và nhận dạng chính xác thông tin bằng miệng.
Bình luận (0)
Chia sẻ ý kiến của bạn — vui lòng lịch sự và đúng chủ đề.
Đăng nhập để bình luận