Chuyển đến nội dung chính
Mô hình âm thanh AI
ElevenLabs
ElevenLabs Dialogue

ElevenLabs Dialogue V3

ElevenLabs Dialogue V3 hiện tạo hội thoại theo từng dòng: nhập lời thoại và chọn giọng cho mỗi dòng, Kyeo AI tính phí theo tổng số ký tự lời thoại. Đây không phải tác nhân giọng nói thời gian thực; tài liệu chính thức cũng lưu ý có thể cần tạo nhiều lần mới chọn được kết quả dùng được. Bạn nên thử bằng mẫu trước để xác nhận việc đổi nhân vật, nhãn cảm xúc, mã ngôn ngữ, định dạng đầu ra hoặc tính đầy đủ của kịch bản dài.

Nhãn khả năng
Hội thoại thành âm thanh
Mức tiêu hao điểm
14 điểm / 1.000 ký tự
Giới hạn câu lệnh
5.000 ký tự
Giới hạn tải lên
Không cần tải tệp lên
Hiện chỉ hỗ trợ `dialogue-to-audio`, không phải dịch vụ hội thoại thời gian thực
Cốt lõi của kịch bản hiện là `dialogue[]`, mỗi dòng phải có `text + voice`.
Tổng độ dài lời thoại được tính `14` điểm cho mỗi 1.000 ký tự JavaScript và làm tròn lên
Tài liệu chính thức khuyến nghị tổng văn bản không quá 2.000 ký tự, trong khi trang trên nền tảng hiển thị giới hạn 5.000 ký tự
Tổng quan trong 30 giây
ElevenLabs Dialogue
14 điểm / 1000 ký tự
Mô hình làm tốt điều gì
Trên nền tảng hiện tại, Dialogue V3 là trang tạo hội thoại với giọng được phân cho từng dòng, không phải TTS một người thông thường hay dịch vụ hội thoại thời gian thực.
Phù hợp với ai
Phù hợp cho hội thoại podcast, kịch bản phim ngắn, âm thanh tương tác giữa nhân vật, chương trình kể chuyện nhiều người và tác vụ hội thoại cần phân giọng theo từng câu.
Mọi người đang tìm kiếm
cách dùng ElevenLabs Dialogue V3giá ElevenLabs Dialogue V3ElevenLabs Dialogue V3 hỗ trợ hội thoại nhiều nhân vật ra sao?

Hiểu nhanh trong một câu

Mô hình này thế nào?

Trang cung cấp 20 giọng có thể chọn, áp dụng giới hạn tổng cộng 5.000 ký tự cho mọi dòng hội thoại và tối đa 10 giọng khác nhau trong mỗi yêu cầu. Tùy chọn định dạng đầu ra, seed, chuẩn hóa văn bản và từ điển phát âm hiện chưa được mở; hãy kiểm tra bằng kịch bản ngắn trước khi dùng chính thức.

Mô hình làm tốt điều gì
Trên nền tảng hiện tại, Dialogue V3 là trang tạo hội thoại với giọng được phân cho từng dòng, không phải TTS một người thông thường hay dịch vụ hội thoại thời gian thực.
Phù hợp với ai
Phù hợp cho hội thoại podcast, kịch bản phim ngắn, âm thanh tương tác giữa nhân vật, chương trình kể chuyện nhiều người và tác vụ hội thoại cần phân giọng theo từng câu.
Vì sao nên dùng trên Kyeo AI
Khu vực làm việc tách riêng lời thoại và lựa chọn giọng của từng dòng, đồng thời hiển thị cách tính phí theo tổng số ký tự để dễ kiểm tra cấu trúc kịch bản và ngân sách. Điều này không chứng minh sự phân biệt nhân vật hoặc nhịp tiếp lời chắc chắn đúng kỳ vọng.

Thông số chính

Giúp bạn nhanh chóng đánh giá mô hình có phù hợp với nhu cầu thực tế hay không.

Danh mục mô hình
Mô hình âm thanh AI
Nhà phát triển
ElevenLabs
Dòng mô hình
ElevenLabs Dialogue
Nhãn khả năng
Tác vụ bất đồng bộ
Mức tiêu hao điểm
ElevenLabs Dialogue — Tác vụ bất đồng bộ
Cách vận hành
Tác vụ bất đồng bộ
Giới hạn câu lệnh
5.000 ký tự
Giới hạn tải lên
Không cần tải tệp lên

Tên gọi khác

Cùng một mô hình có thể được gọi bằng nhiều tên trong các tài liệu khác nhau. Chúng tôi tổng hợp tại đây để bạn dễ tìm kiếm và so sánh.

ElevenLabs Dialogue — ElevenLabs Dialogue V3 có phù hợp cho hội thoại podcast không
Eleven v3
Dialogue Mode

Câu hỏi thường gặp của người dùng

Các câu hỏi thực tế này tập trung vào nhiệm vụ, điều kiện đầu vào và kết quả cần xác nhận trước khi chọn.

cách dùng ElevenLabs Dialogue V3
giá ElevenLabs Dialogue V3
ElevenLabs Dialogue V3 hỗ trợ hội thoại nhiều nhân vật ra sao?
ElevenLabs Dialogue V3 dùng mảng dialogue thế nào?
ElevenLabs Dialogue V3 default_voice
ElevenLabs Dialogue V3 và Turbo 2.5 khác nhau thế nào?
ElevenLabs Dialogue V3 khác Multilingual V2 thế nào
ElevenLabs Dialogue V3 có phù hợp cho hội thoại podcast không
ElevenLabs Dialogue V3 có phù hợp để lồng tiếng phim ngắn không
ElevenLabs Dialogue V3 14 điểm cho 1.000 ký tự

Hướng dẫn lựa chọn

Vẫn chưa biết nên dùng mô hình nào? Hãy xem trước các tiêu chí quyết định quan trọng này.

1
Khi nào nên ưu tiên lựa chọn

Nếu kịch bản gồm nhiều lượt nói và cần chỉ định giọng theo từng dòng, hãy đưa Dialogue V3 vào thử nghiệm mẫu ngắn. Xác minh việc đổi giọng và đầu ra đầy đủ trước rồi mới quyết định tăng độ dài.

2
Khi nào nên so sánh mô hình khác trước

Với phần thuyết minh liên tục của một người, nên so sánh các tuyến TTS một người trước. Tác nhân giọng nói cần tương tác thời gian thực cũng không phù hợp vì tài liệu chính thức nêu rõ Text to Dialogue không dành cho ứng dụng thời gian thực.

3
Quy trình kiểm tra tối thiểu

Trước tiên, dùng 2 giọng và một vài lượt thoại để kiểm tra phát âm, chuyển giọng, cắt cụt, định dạng âm thanh và số điểm thực tế bị trừ.

Các so sánh được tìm kiếm nhiều

So sánh các lựa chọn phổ biến trên cùng một nhiệm vụ để làm rõ khác biệt về đầu vào, kiểm soát và chi phí.

ElevenLabs Dialogue V3 khác ElevenLabs Multilingual V2 thế nào và nên chọn mô hình nào?
ElevenLabs Dialogue V3 vs ElevenLabs Multilingual V2
ElevenLabs Dialogue V3 khác ElevenLabs Turbo 2.5 thế nào
ElevenLabs Dialogue V3 vs ElevenLabs Turbo 2.5

Bảng so sánh mô hình

Chưa biết nên chọn mô hình nào? Bảng này giúp bạn nhìn rõ khác biệt cốt lõi giữa mô hình hiện tại và các lựa chọn thay thế.

Vai trò hiện tại trên nền tảng
ElevenLabs Dialogue V3
Trang hội thoại nhiều nhân vật theo kịch bản
ElevenLabs Multilingual V2
Trang thử TTS đa ngôn ngữ cho một người nói
ElevenLabs Turbo 2.5
Trang đối chiếu TTS một người nói với mức phí thấp hơn
Đầu vào cốt lõi hiện tại
ElevenLabs Dialogue V3
Mỗi dòng trong `dialogue[]` có `text + voice`
ElevenLabs Multilingual V2
Một đoạn văn bản + voice một người nói
ElevenLabs Turbo 2.5
Một đoạn văn bản + voice một người nói + dấu thời gian / ngữ cảnh trước sau
Mức giá hiện tại
ElevenLabs Dialogue V3
14 điểm / 1.000 ký tự
ElevenLabs Multilingual V2
12 điểm / 1.000 ký tự
ElevenLabs Turbo 2.5
6 điểm / 1.000 ký tự
Tác vụ phù hợp hơn
ElevenLabs Dialogue V3
Hội thoại podcast, phim ngắn và đoạn tương tác nhiều người
ElevenLabs Multilingual V2
Thuyết minh một người và thử phát âm đa ngôn ngữ
ElevenLabs Turbo 2.5
Bản mẫu TTS một người với mức phí thấp hơn

Trải nghiệm sử dụng thực tế

Hướng dẫn thực tế dựa trên nguồn công khai, giới hạn hiện tại của trang và những nhiệm vụ tiêu biểu.

Trang này dễ bị mô tả nhầm là “TTS mạnh hơn”, nhưng thực tế không phải vậy

Nếu tiếp tục dùng khuôn mô tả “tự nhiên, đa ngôn ngữ, độ trễ thấp”, định vị chắc chắn sẽ sai lệch.

Hội thoại nhiều người nên được đánh giá theo nhịp tổng thể và mức độ phân biệt nhân vật

Nhiều người sẽ nghe một câu trước để xem có giống người thật hay không, nhưng với Dialogue V3, điều thực sự cần so sánh là nhịp hội thoại qua lại giữa nhiều người, mức độ phân biệt và cảm giác kịch tổng thể. Chỉ số này gần với khả năng sử dụng thực tế hơn âm sắc của một câu riêng lẻ.

Chi tiết khả năng

ElevenLabs Dialogue: phương thức đầu vào rõ ràng

ElevenLabs Dialogue: phương thức đầu vào rõ ràng — Tìm hiểu hội thoại theo từng dòng, lựa chọn giọng nói và giới hạn 5.000 ký tự của ElevenLabs Dialogue V3 trên Kyeo AI, cùng giới hạn tính phí thực tế 14 điểm cho mỗi 1.000 ký tự.

Số lượng giọng và mã ngôn ngữ có giới hạn riêng

Trang hiển thị 20 giọng, nhưng mỗi yêu cầu theo quy định chính thức chỉ được dùng tối đa 10 `voice_id` duy nhất.

Cách tính phí trên nền tảng chỉ đếm ký tự lời thoại

Trang cộng JavaScript `length` của văn bản trong từng dòng `dialogue[]`, rồi tính `14 / 1.000 ký tự` và làm tròn lên. Số lượng giọng, mã ngôn ngữ và thiết lập không được tính vào mức giá ước tính.

Phù hợp để làm gì

Mẫu phim ngắn và tương tác nhân vật

Phù hợp để dùng một đoạn hội thoại 15 đến 30 giây kiểm tra sự phân biệt nhân vật và nhịp tiếp lời trước, thay vì bắt đầu ngay bằng cốt truyện dài.

Người dẫn / khách mời podcast đối thoại qua lại

Phù hợp cho đoạn chương trình giữa hai hoặc nhiều người cần phân vai rõ, âm sắc khác nhau và quan hệ tiếp lời mạch lạc.

Trình diễn sản phẩm nhiều nhân vật hoặc nội dung nhân cách hóa thương hiệu

Phù hợp cho nội dung âm thanh cần cảm giác nhân vật, tính tương tác và ranh giới vai trò rõ hơn.

Mẹo viết câu lệnh

Mỗi dòng một câu, xác định rõ vai trò trước

Điều quan trọng nhất trên trang này không phải cách tu từ mà là cấu trúc kịch bản. Cần viết rõ ai nói từng câu, dừng ở đâu và ai tiếp lời.

Dùng mẫu ngắn để kiểm tra mức độ phân biệt trước

Với Dialogue V3, cách ổn định hơn thường là tạo trước một mẫu hội thoại thực tế dài 15 đến 30 giây, thay vì đưa toàn bộ cốt truyện dài vào ngay.

voice mặc định chỉ là phương án dự phòng, không phải tùy chọn chính

Điều thực sự quyết định kết quả vẫn là voice của từng dòng trong `dialogue[]`. `default_voice` giống một giá trị dự phòng hơn, không phải tham số cốt lõi thay thế việc phân giọng theo từng dòng.

Vì sao nên chọn

Nền tảng hiện cung cấp quy trình hội thoại nhiều nhân vật bằng `dialogue[]` rõ ràng.
Mỗi dòng lời thoại có thể được phân voice riêng, phù hợp hơn cho nội dung tương tác theo kịch bản.
Có thể dùng kịch bản ngắn để kiểm tra chuyển giọng, phát âm và cấu trúc lượt nói.
Cấu trúc đầu vào khác TTS một người nên ranh giới tác vụ tương đối dễ nhận biết.

Điều cần biết trước khi dùng

Hiện đây không phải trang thuyết minh một người thông thường, cũng không phải tác nhân giọng nói thời gian thực.
Tài liệu chính thức khuyến nghị tổng văn bản không quá 2.000 ký tự; Kyeo nhận tối đa 5.000 ký tự, nhưng hội thoại dài vẫn nên bắt đầu với độ dài thận trọng hơn.
Mỗi yêu cầu chính thức có tối đa 10 giọng khác nhau; Kyeo sẽ từ chối yêu cầu vượt quá số lượng này trước khi tạo tác vụ.
Trước khi sử dụng chính thức, hãy dùng kịch bản đại diện để kiểm tra sự phân biệt nhân vật, nhịp điệu, phát âm và quyền sử dụng giọng.

Tham số có thể điều chỉnh

Giúp bạn nhanh chóng đánh giá mô hình có phù hợp với nhu cầu thực tế hay không.

Giọng nhân vật mặc định
default_voice
Không bắt buộc
Loại tham số: select
Mặc định: pNInz6obpgDQGcFmaJgB
Adam
Alice
Bill
Brian
Callum
Charlie
20 lựa chọn
Độ ổn định
stability
Không bắt buộc
Loại tham số: select
Mặc định: 0.5
0.0
0.5
1.0
Mã ngôn ngữ
language_code
Không bắt buộc
Loại tham số: text

Mức tiêu hao điểm

14 điểm / 1000 ký tự

Giá gốc 14 điểm cho 1000 ký tự; khấu trừ cục bộ Math.ceil(tổng ký tự dialogue[] × 14 / 1000), min=1 điểm.

Mẹo tiết kiệm điểm

Trước khi tạo hàng loạt hình ảnh hoặc video, bạn nên dùng cùng một bộ tư liệu để thử nghiệm A/B giữa mô hình hiện tại và các lựa chọn tương tự. Hãy xác nhận kết quả trước khi chạy hàng loạt để tránh lãng phí điểm.

Câu hỏi thường gặp

Mô hình tương tự nên xem

Vẫn chưa quyết định? Hãy tiện thể so sánh các lựa chọn tương tự này.

ElevenLabs Multilingual V2

ElevenLabs Multilingual V2 là trang lồng tiếng một người có độ tự nhiên cao hiện được tích hợp trên Kyeo AI. Mô hình dùng biểu mẫu gần giống Turbo 2.5 nhưng ranh giới tác vụ thực tế khác nhau: Turbo giống một chuẩn đối chiếu lồng tiếng nhanh hơn, còn Multilingual V2 là tuyến chính cho thuyết minh văn bản dài, nội dung xuyên ngôn ngữ và âm sắc thương hiệu lâu dài. Trên nền tảng hiện tại, mô hình cũng chỉ dùng danh sách vai trò giọng cố định và điểm truy cập 5.000 ký tự, nhưng trọng tâm lựa chọn đã chuyển từ tốc độ sang độ ổn định khi nghe và liệu có đáng trả chi phí ký tự gấp đôi hay không.

Mô hình âm thanh AI
12 điểm / 1000 ký tự

ElevenLabs Turbo 2.5

ElevenLabs Turbo 2.5 là quy trình chuyển văn bản thành giọng nói một người hiện vẫn được Kyeo duy trì. Bạn có thể chọn giọng trên nền tảng và điều chỉnh stability, similarity_boost, style, speed, timestamps, ngữ cảnh trước sau và language_code. Tác vụ vẫn có thể được gửi, nhưng ElevenLabs hiện khuyến nghị thay thế bằng Flash v2.5; trang không coi độ trễ thấp, hỗ trợ ngôn ngữ, độ chính xác dấu thời gian, quyền sử dụng giọng hoặc chất lượng đầu ra là bảo đảm của Kyeo.

Mô hình âm thanh AI
6 điểm / 1000 ký tự

Suno Music

Suno Music là điểm truy cập tạo nhạc từ văn bản trên Kyeo AI. Biểu mẫu hiện chỉ cung cấp câu lệnh, phiên bản và công tắc nhạc không lời; sau khi tạo thành công, những kết quả đủ điều kiện có thể được kéo dài, chuyển sang WAV hoặc tách giọng hát. Trang không cung cấp các tùy chọn trong sản phẩm chính thức như lời bài hát, tiêu đề, trọng số phong cách, Persona, Voices, Custom Models hay My Taste.

Mô hình âm thanh AI
Tạo / kéo dài: 12 điểm / lần

Nguồn thông tin

Nội dung trang được tổng hợp từ tài liệu mô hình, mô tả tính năng và các thiết lập hiện có trên Kyeo AI.

Ghi chú nguồn

Tìm hiểu hội thoại theo từng dòng, lựa chọn giọng nói và giới hạn 5.000 ký tự của ElevenLabs Dialogue V3 trên Kyeo AI, cùng giới hạn tính phí thực tế 14 điểm cho mỗi 1.000 ký tự. Giá gốc 14 điểm cho 1000 ký tự; khấu trừ cục bộ Math.ceil(tổng ký tự dialogue[] × 14 / 1000), min=1 điểm.

Cập nhật lần cuối: 2026-07-20
Trợ giúp ElevenLabs: Eleven v3 là gì?
Chính thức
Xem nguồn gốc
Trợ giúp ElevenLabs: Chế độ Dialogue là gì?
Chính thức
Xem nguồn gốc
Tài liệu ElevenLabs: Mô hình
Chính thức
Xem nguồn gốc
Tài liệu ElevenLabs: Text to Dialogue
Chính thức
Xem nguồn gốc
API ElevenLabs: Tạo hội thoại
Chính thức
Xem nguồn gốc