Gemini 3.1 Flash TTS
Gemini 3.1 Flash TTS đã có điều khoản xác nhận về hội thoại nhiều người nói và điều khiển giọng nói, nhưng lượng âm thanh đầu ra trong trường hợp xấu nhất chưa thể được chứng minh trước khi tạo, nên hiện chỉ duy trì trang chi tiết có thể lập chỉ mục.
Hiện chưa hỗ trợ sử dụng trực tuyến
Trang này chỉ cung cấp thông tin về khả năng, tình huống sử dụng và nguồn công khai của mô hình. Mô hình sẽ không xuất hiện trong khu vực làm việc trên trang chủ và không thể gửi tác vụ tạo nội dung.
Hiểu nhanh trong một câu
Mô hình này thế nào?
Đây không phải trạng thái Coming Soon và cũng không phải mô hình đã ngừng hoạt động. Hạn chế hiện tại xuất phát từ ranh giới an toàn của bước ủy quyền trước trên trang: các mảng người nói và hội thoại không có giới hạn tổng, đồng thời chưa có giới hạn trường hợp xấu nhất có thể chứng minh khi chuyển văn bản thành token âm thanh đầu ra. Vì vậy, mô hình không xuất hiện trong bộ chọn và mọi yêu cầu đều bị từ chối trước khi khấu trừ điểm.
Thông số chính
Giúp bạn nhanh chóng đánh giá mô hình có phù hợp với nhu cầu thực tế hay không.
Tên gọi khác
Cùng một mô hình có thể được gọi bằng nhiều tên trong các tài liệu khác nhau. Chúng tôi tổng hợp tại đây để bạn dễ tìm kiếm và so sánh.
Câu hỏi thường gặp của người dùng
Các câu hỏi thực tế này tập trung vào nhiệm vụ, điều kiện đầu vào và kết quả cần xác nhận trước khi chọn.
Hướng dẫn lựa chọn
Vẫn chưa biết nên dùng mô hình nào? Hãy xem trước các tiêu chí quyết định quan trọng này.
Hãy dùng ElevenLabs Dialogue V3 trước và kiểm tra độ phân biệt nhân vật bằng một kịch bản ngắn.
Hãy so sánh ElevenLabs Turbo 2.5 với Multilingual V2 trước.
Lưu ba nhóm kịch bản không nhạy cảm: lời dẫn, phỏng vấn hai người và tiểu phẩm ngắn có nhân vật.
Các so sánh được tìm kiếm nhiều
So sánh các lựa chọn phổ biến trên cùng một nhiệm vụ để làm rõ khác biệt về đầu vào, kiểm soát và chi phí.
Bảng so sánh mô hình
Chưa biết nên chọn mô hình nào? Bảng này giúp bạn nhìn rõ khác biệt cốt lõi giữa mô hình hiện tại và các lựa chọn thay thế.
Trải nghiệm sử dụng thực tế
Hướng dẫn thực tế dựa trên nguồn công khai, giới hạn hiện tại của trang và những nhiệm vụ tiêu biểu.
Định vị độ trễ thấp không thay thế được giới hạn chi phí
Đầu vào nhiều nhân vật làm tăng mức sử dụng trong trường hợp xấu nhất
Chi tiết khả năng
Cấu hình nhiều người nói
Hội thoại theo thứ tự
Điều khiển giọng nói
Phù hợp để làm gì
Lập kế hoạch hội thoại podcast
Chuẩn bị tiểu phẩm có nhân vật
Đánh giá cùng đề bài trong tương lai
Mẹo viết câu lệnh
Giữ mã định danh người nói nhất quán
Kiểm tra bằng kịch bản ngắn trước
Không ước tính thời lượng đầu ra
Vì sao nên chọn
Điều cần biết trước khi dùng
Hiện không khả dụng
Trang này chỉ cung cấp thông tin về khả năng, tình huống sử dụng và nguồn công khai của mô hình. Mô hình sẽ không xuất hiện trong khu vực làm việc trên trang chủ và không thể gửi tác vụ tạo nội dung. Một ứng viên Gemini TTS hướng đến khả năng tạo giọng nói nhanh hơn và điều khiển hội thoại nhiều nhân vật.
Câu hỏi thường gặp
Mô hình tương tự nên xem
Vẫn chưa quyết định? Hãy tiện thể so sánh các lựa chọn tương tự này.
ElevenLabs Dialogue V3
ElevenLabs Dialogue V3 hiện tạo hội thoại theo từng dòng: nhập lời thoại và chọn giọng cho mỗi dòng, Kyeo AI tính phí theo tổng số ký tự lời thoại. Đây không phải tác nhân giọng nói thời gian thực; tài liệu chính thức cũng lưu ý có thể cần tạo nhiều lần mới chọn được kết quả dùng được. Bạn nên thử bằng mẫu trước để xác nhận việc đổi nhân vật, nhãn cảm xúc, mã ngôn ngữ, định dạng đầu ra hoặc tính đầy đủ của kịch bản dài.
ElevenLabs Turbo 2.5
ElevenLabs Turbo 2.5 là quy trình chuyển văn bản thành giọng nói một người hiện vẫn được Kyeo duy trì. Bạn có thể chọn giọng trên nền tảng và điều chỉnh stability, similarity_boost, style, speed, timestamps, ngữ cảnh trước sau và language_code. Tác vụ vẫn có thể được gửi, nhưng ElevenLabs hiện khuyến nghị thay thế bằng Flash v2.5; trang không coi độ trễ thấp, hỗ trợ ngôn ngữ, độ chính xác dấu thời gian, quyền sử dụng giọng hoặc chất lượng đầu ra là bảo đảm của Kyeo.
ElevenLabs Multilingual V2
ElevenLabs Multilingual V2 là trang lồng tiếng một người có độ tự nhiên cao hiện được tích hợp trên Kyeo AI. Mô hình dùng biểu mẫu gần giống Turbo 2.5 nhưng ranh giới tác vụ thực tế khác nhau: Turbo giống một chuẩn đối chiếu lồng tiếng nhanh hơn, còn Multilingual V2 là tuyến chính cho thuyết minh văn bản dài, nội dung xuyên ngôn ngữ và âm sắc thương hiệu lâu dài. Trên nền tảng hiện tại, mô hình cũng chỉ dùng danh sách vai trò giọng cố định và điểm truy cập 5.000 ký tự, nhưng trọng tâm lựa chọn đã chuyển từ tốc độ sang độ ổn định khi nghe và liệu có đáng trả chi phí ký tự gấp đôi hay không.
Nguồn thông tin
Nội dung trang được tổng hợp từ tài liệu mô hình, mô tả tính năng và các thiết lập hiện có trên Kyeo AI.
Đã xác nhận các điều khoản về người nói, hội thoại, điều khiển giọng nói và mức phí theo token của Gemini 3.1 Flash TTS; tuy nhiên, trước khi tạo yêu cầu vẫn chưa thể chứng minh giới hạn tối đa của token âm thanh đầu ra, nên trang hiện chưa mở tính năng tạo.