OpenAI đã giới thiệu GPT‑Realtime‑2 và hai phiên bản giọng nói mới, chỉ có sẵn qua API

OpenAI đã giới thiệu GPT‑Realtime‑2 và hai phiên bản giọng nói mới, chỉ có sẵn qua API

10 hardware

OpenAI mở rộng khả năng của API giọng nói

Công ty công bố ra mắt các tính năng mới cho API của mình, giúp nhà phát triển tạo những ứng dụng giọng nói “sống động” hơn: họ có thể trò chuyện với người dùng, chuyển lời thành văn bản và dịch cuộc hội thoại ngay lập tức.

Mô hình Realtime mới
Thông qua giao diện Realtime hiện có ba mô hình:

ModelTên Ứng dụng Tính năng chínhGPT‑Realtime‑2Tương tác giọng nói thời gian thực Phân tích yêu cầu, gọi công cụ, xử lý sửa lỗi và tiếp tục hội thoại mượt mà. Dựa trên logic GPT‑5, cho phép xử lý các nhiệm vụ phức tạp hơn so với GPT‑Realtime‑1.5.GPT‑Realtime‑TranslateDịch thời gian thực Hỗ trợ 70+ ngôn ngữ đầu vào và 13 ngôn ngữ xuất ra. Giữ ý nghĩa ngay cả khi thay đổi ngữ cảnh, giọng vùng miền hoặc thuật ngữ chuyên ngành.GPT‑Realtime‑WhisperChuyển văn bản lời nói Mô hình luồng với độ trễ thấp, chuyển âm thanh thành văn bản gần như ngay lập tức.

> “Mô hình mới của chúng tôi dịch âm thanh thời gian thực từ cuộc trò chuyện đơn giản sang giao diện giọng nói có thể thực sự hoạt động: lắng nghe, suy nghĩ, dịch, ghi chép và thực hiện hành động khi cuộc hội thoại phát triển,” công ty cho biết.

Chi phí
ModelGiáGPT‑Realtime‑2$32 cho 1 triệu token âm thanh đầu vào, $0.40 cho 1 triệu token lưu trữ và $64 cho 1 triệu token âm thanh xuất raGPT‑Realtime‑Translate$0.034 mỗi phútGPT‑Realtime‑Whisper$0.017 mỗi phút

Cách thử
Nhà phát triển có thể kiểm tra các mô hình mới trên nền tảng trực tuyến OpenAI Playground và ngay lập tức thấy chúng hoạt động trong thời gian thực.

Bình luận (0)

Chia sẻ ý kiến của bạn — vui lòng lịch sự và đúng chủ đề.

Chưa có bình luận nào. Hãy để lại bình luận và chia sẻ ý kiến của bạn!

Để bình luận, vui lòng đăng nhập.

Đăng nhập để bình luận