ZCRM

Chuyển đổi giọng nói tiếng Việt & tiếng Anh

Khám phá tính năngVONIA

Từ chuyển văn bản thành giọng nói đến phiên âm và tích hợp API, dưới đây là các nhóm tính năng chính của VONIA.

Chuyển văn bản thành giọng nói (TTS)

30 giọng preset sẵn dùng, không cần thu âm mẫu.

Nhập văn bản, chọn một trong 30 giọng preset dựng sẵn (đặt tên theo các ngôi sao), nhận về file audio. Có thể chèn ký hiệu phi ngôn từ trong văn bản (tiếng cười, thở dài...) và sửa cách phát âm cho từ chuyên ngành, cùng tính năng chuẩn hoá văn bản để đọc đúng số điện thoại, giá tiền, ký hiệu thay vì đọc sai. Xuất ra nhiều định dạng: WAV, MP3, PCM.

Xem chi phí
Màn hình nhập văn bản và chọn giọng đọc trong VONIA
30giọng preset dựng sẵn

Nhân bản giọng nói (Voice Cloning)

Giọng đã nhân bản được lưu lại để dùng cho các dự án sau.

Cung cấp một mẫu audio tham chiếu dài 3–10 giây, VONIA tự nhân bản giọng để đọc bất kỳ văn bản mới nào — có thể tự động phiên âm mẫu audio nếu không cung cấp sẵn văn bản gốc. Giọng đã nhân bản được lưu vào Thư viện giọng để xem lại hoặc xoá, dùng lại cho nhiều dự án sau này thay vì phải cung cấp mẫu audio mỗi lần.

Xem chi phí
Nhân bản giọng nói từ mẫu audio 3-10 giây trong VONIA
3–10 giâymẫu audio để nhân bản giọng

Thiết kế giọng theo thuộc tính (Voice Design)

Không có sẵn mẫu audio? Chọn trực tiếp giới tính, tuổi, cao độ, giọng vùng miền để tạo một giọng đọc mới cho nội dung thử nghiệm mà không cần tìm người ghi âm mẫu.

Xem chi phí

Hội thoại nhiều giọng (Dialogue)

Nhiều nhân vật, một file audio hoàn chỉnh.

Dựng một đoạn hội thoại có nhiều nhân vật, mỗi nhân vật gán một giọng riêng (preset, nhân bản hoặc thiết kế), rồi ghép toàn bộ thành một file audio hoàn chỉnh — phù hợp cho kịch bản podcast hoặc quảng cáo có đối thoại mà không cần thu âm nhiều người.

Xem chi phí
Dựng hội thoại nhiều nhân vật, mỗi người một giọng trong VONIA

Chuyển giọng nói thành văn bản (STT)

Tải audio hoặc video lên, nhận văn bản có mốc thời gian.

Tải audio/video lên để phiên âm thành văn bản có mốc thời gian theo từng đoạn, chạy trên mô hình Whisper cục bộ trên máy chủ VONIA — không gọi API trả phí ra ngoài. Xuất trực tiếp file phụ đề SRT chuẩn cho video, không cần công cụ phụ đề riêng.

Xem chi phí
Giao diện phiên âm giọng nói thành văn bản (STT) trong VONIA

Định dạng đầu vào/đầu ra linh hoạt

VONIA nhận nhiều định dạng audio/video đầu vào khi nhân bản giọng hoặc phiên âm (mp3, wav, m4a, aac, ogg, flac, mp4, mov, webm...), người dùng không cần tự chuyển đổi định dạng trước khi tải lên. Đầu ra TTS hỗ trợ WAV, MP3, PCM tuỳ nhu cầu tích hợp.

Xem chi phí

API cho nhà phát triển

Tích hợp VONIA vào hệ thống nội bộ qua API và webhook.

VONIA có endpoint tương thích chuẩn OpenAI (`/v1/audio/speech`), giúp doanh nghiệp đã tích hợp OpenAI TTS chuyển sang gần như không cần viết lại code — chỉ cần đổi địa chỉ máy chủ và khoá API. Ngoài ra còn có API riêng hỗ trợ `voice_id` và `seed` để cố định danh tính giọng ở mọi lần gọi, quan trọng khi cần tạo nội dung hàng loạt với cùng một giọng. Xác thực bằng API key qua header cho mọi tích hợp server-to-server.

Xem chi phí
Cấu hình webhook tích hợp trong VONIA

Tự chủ hạ tầng

Hạ tầng GPU riêng, chủ động về chi phí vận hành.

Model chuyển đổi giọng nói chạy trên GPU riêng của VONIA, không gọi API trả phí theo lượt từ OpenAI/Google — giúp kiểm soát chi phí vận hành khi dùng ở khối lượng lớn.

Xem chi phí
Cài đặt môi trường chạy hệ thống VONIA

Đăng nhập & quản lý tài khoản

Quản lý tài khoản và giấy phép sử dụng ngay trong ứng dụng.

Đăng nhập qua SSO Google, phiên đăng nhập được lưu trong 7 ngày. Giao diện web tự chuyển bố cục cho di động (Clone, TTS, STT, Cài đặt ở dạng thanh điều hướng dưới), dùng được ngay trên điện thoại mà không cần cài ứng dụng riêng.

Xem chi phí
Màn hình cài đặt tài khoản trong VONIA

Xem chi phí sử dụng VONIA

Liên hệ để nhận báo giá phù hợp với khối lượng nội dung của bạn.