Inworld TTS tạo ra giọng nói tự nhiên, biểu cảm cho lời dẫn chuyện. Tạo video có lời bình AI với quy trình chuyển đổi kịch bản thành video của VideoGen.
Bởi Inworld AI · TTS 1.5 được phát hành vào tháng 5 năm 2026 · Elo của Artificial Analysis Speech Arena ~1.236 (Tháng 7 năm 2026)
Lời nhắc thực, kết quả thực, được tạo bằng Inworld TTS trong VideoGen.
“Malcolm: Người dẫn chuyện có giọng điệu mượt mà, uy quyền với âm sắc sâu và vang.”
Được tạo bằng Inworld TTS trong VideoGen
“Celeste: Giọng nữ trau chuốt, tinh tế dành cho việc giới thiệu các sản phẩm cao cấp.”
Được tạo bằng Inworld TTS trong VideoGen
“Rupert: Giọng Anh sắc sảo, tinh tế cho các quảng cáo doanh nghiệp.”
Được tạo bằng Inworld TTS trong VideoGen
“Deborah: Giọng nữ tươi sáng, diễn đạt rõ ràng cho các video giải thích và video hướng dẫn.”
Được tạo bằng Inworld TTS trong VideoGen
“Hades: Giọng nhân vật trầm, đầy uy lực cho lối kể chuyện kịch tính.”
Được tạo bằng Inworld TTS trong VideoGen
“Hélène: Giọng nữ Pháp ấm áp với âm điệu mượt mà, đầy giai điệu.”
Được tạo bằng Inworld TTS trong VideoGen
“Asuka: Giọng nữ Nhật Bản tươi sáng, tràn đầy năng lượng dành cho nội dung mạng xã hội.”
Được tạo bằng Inworld TTS trong VideoGen
| Ngôn ngữ | 15, bao gồm tiếng Anh, tiếng Tây Ban Nha, tiếng Nhật và tiếng Ả Rập |
|---|---|
| Các mô hình | TTS 1.5 Max, Standard và Mini |
| Nhân bản giọng nói | Sao chép giọng nói tức thì từ một mẫu ngắn |
| Độ trễ | Dưới 250ms cho âm thanh đầu tiên (tối đa 1.5) |
| Đầu ra | Lời nói tự nhiên, biểu cảm với phạm vi cảm xúc đa dạng |
Cấp độ nhanh nhất và giá cả phải chăng nhất, được xây dựng cho các bản nháp và lặp lại nhanh chóng.
Mặc định cân bằng: lồng tiếng chất lượng tốt với chi phí hàng ngày.
lồng tiếng chất lượng cao cấp cho nội dung bạn xuất bản.
MAX luôn tích hợp công nghệ tiên tiến nhất. Inworld TTS là một phần trong đó.
Mỗi cấp độ chất lượng sẽ điều phối mọi yêu cầu đến mô hình tối ưu nhất dựa trên các đánh giá nội bộ, yêu cầu tuân thủ và mục đích của bạn. Các yêu cầu luôn tuân thủ nghiêm ngặt ở mọi cấp độ: dữ liệu nhạy cảm không bao giờ bị chuyển đến các mô hình được lưu trữ bởi các thế lực nước ngoài như Trung Quốc.
Đăng ký VideoGen để mở sân chơi AI và trình chỉnh sửa.
Dán hoặc viết kịch bản của bạn và VideoGen sẽ tạo ra một video được dẫn chuyện hoàn chỉnh từ đó.
Chọn người kể chuyện từ danh mục giọng nói hoặc tự sao chép giọng nói của chính bạn.
VideoGen xây dựng video hoàn chỉnh với phần tường thuật, hình ảnh, âm nhạc và phụ đề, sẵn sàng để xuất.
Các nhà phát triển có thể tạo lồng tiếng thông qua VideoGen API với cùng định tuyến phân cấp chất lượng như trên ứng dụng, nhờ đó các yêu cầu sẽ đến được với các mô hình như Inworld TTS mà không cần quản lý khóa nhà cung cấp.
curl -X POST "https://api.videogen.io/v1/tools/text-to-speech" \
-H "Authorization: Bearer $VIDEOGEN_API_KEY" \
-H "Content-Type: application/json" \
-d '{"ttsText": "Welcome to the future of video.", "voiceId": "<voice id>"}'
Biến bất kỳ kịch bản nào thành lời kể tự nhiên, biểu cảm với mô hình chuyển văn bản thành giọng nói được xếp hạng hàng đầu.
“VideoGen thật tuyệt vời cho việc mở rộng sản xuất video và cải thiện thời gian hoàn thành... Quá trình chỉnh sửa video phức tạp, vốn có thể mất vài ngày hoặc thậm chí vài tháng, giờ chỉ mất vài phút!”


“VideoGen giải quyết những điểm đau lớn nhất của sản xuất video—sự phức tạp, chi phí và thời gian. Chỉ với vài cú nhấp chuột, bất kỳ ai cũng có thể tạo ra video chuyên nghiệp, không vi phạm bản quyền.”

“VideoGen là công cụ ít được đánh giá cao nhất cho những người sáng tạo nội dung muốn phát hành nội dung chất lượng cao nhất trong thời gian ngắn nhất.”

Mọi quy trình làm việc của VideoGen đều tự động sử dụng các mô hình như Inworld TTS để xây dựng video hoàn chỉnh với hình ảnh, lời dẫn, âm nhạc và phụ đề.
Đăng nhập để tạo ra hình ảnh, clip video và hơn thế nữa với các mô hình bạn chọn.