跳到主要内容
AI 视频模型
Volcengine
Video Lip Sync

Volcengine Video Lip Sync

Video Lip Sync 用一段已有视频和一段目标人声音频重做口型。轻量模式面向正面单人视频,基础模式面向更复杂的单人场景并可开启场景检测。

工作流
视频+音频口型同步
模式
轻量/基础
视频
360p–1080p;24–60 FPS
计费
8/音频秒
已有视频加目标音频的明确工作流
轻量与基础两种单人模式
视频分辨率、FPS、码率和文件大小前置校验
按签名音频秒数完成预授权
30 秒了解
Video Lip Sync
每个音频秒 8 积分
它擅长什么
面向已有视频的目标音频口型重定向,而不是从静态图生成角色视频。
适合谁用
适合配音替换、多语言口播、单人讲解视频和需要保留原动作与镜头的内容。
大家都在搜
Video Lip Sync 怎么用AI 视频口型同步多少钱视频配音后怎么对口型

一句话了解

这个模型怎么样?

视频必须满足 360p–1080p、24–60 FPS 与 1–30 Mbps;本站还采用 95 MB 文件上限。文件大小、时长、分辨率和 FPS 由上传签名证明,音频时长直接进入创建前预授权。

它擅长什么
面向已有视频的目标音频口型重定向,而不是从静态图生成角色视频。
适合谁用
适合配音替换、多语言口播、单人讲解视频和需要保留原动作与镜头的内容。
为什么在 Kyeo AI 用
本站在扣点前验证视频真实元数据与音频时长,并按模式严格限制互斥参数。

关键参数一览

帮你快速评估这个模型和你的业务场景是否匹配。

视频格式
MP4/MOV
视频码率
1–30 Mbps
音频
目标纯人声,10 MB
输出时长
跟随音频
输出
25 FPS 的 MP4;时长跟随目标音频

它还叫什么

同一个模型在不同资料里可能有不同叫法,这里统一整理,方便搜索和比较。

火山引擎视频口型同步
AI 视频对口型
视频配音口型同步

用户常见问题

从实际任务、输入条件和结果要求出发,整理选择模型时最需要确认的问题。

Video Lip Sync 怎么用
AI 视频口型同步多少钱
视频配音后怎么对口型
Video Lip Sync 轻量和基础区别
Video Lip Sync 支持什么视频

选型指南

还在纠结用哪个模型?先看这几个关键决策点。

1
正面单人优先轻量模式

镜头简单、人物正面且只需循环对齐时,轻量模式字段更适合。

2
复杂单人场景选择基础模式

需要场景切分和说话人识别方向时使用基础模式。

3
只有图片时换驱动模型

本模型必须上传视频;只有静态图时可比较 OmniHuman 1.5。

用户常搜的对比

把常见候选放在同一任务下比较,帮助你确认输入方式、控制项和成本差异。

Video Lip Sync 与 OmniHuman 1.5 的源素材有什么差异?
轻量模式与基础模式分别适合哪些视频?

模型横向对比表

正在纠结选哪个?这张表帮你一眼看清当前模型和替代方案的核心差异。

源视觉
Volcengine Video Lip Sync
已有视频+目标音频
OmniHuman 1.5
静态图片+目标音频
Kling AI Avatar Standard
静态图片+目标音频

实际使用体验

结合公开资料、当前站内边界和典型任务,说明模型适合与不适合的情况。

口型同步不等于完整配音制作

仍需先准备清晰、合法使用的目标音频,并人工检查语义、节奏和画面同步。

可信媒体元数据同时服务安全与计费

视频合同靠签名元数据校验,音频合同靠签名时长计费,均不能由客户端自报。

能力详解

视频口型重定向

保留原视频视觉并用目标音频驱动嘴部动作。

轻量循环对齐

音频较长时可循环视频,并可选择反向循环。

复杂场景处理

基础模式可开启场景检测与说话人识别。

适合做什么

多语言口播

为已有讲解视频替换另一语言音频并同步口型。

课程配音更新

保留讲师动作与画面,更新讲解音轨。

营销视频改稿

在不重拍主要画面的前提下替换短段口播。

提示词技巧

准备纯净人声

减少背景音乐、混响和多人重叠,提高驱动信号清晰度。

选择正面清晰画面

轻量模式更适合单人正面、嘴部可见且遮挡少的视频。

先检查音画长度

根据模式决定循环、反向循环或模板起点,避免不自然重复。

为什么选它

保留已有视频的镜头和动作。
每秒费率低且创建前可精确预授权。
两种模式覆盖简单与复杂单人场景。
视频关键元数据由签名证据校验。

使用前要知道

只支持单人场景方向。
必须同时提供视频和目标音频。
本站视频文件上限为 95 MB。
自动口型仍需人工检查错位、表情和语义自然度。

可调参数

帮你快速评估这个模型和你的业务场景是否匹配。

服务模式
mode
必填
参数类型: 下拉选择
默认:轻量
轻量
基础
人声分离
separate_vocal
可选
参数类型: 开关
默认:关闭
关闭
开启
场景检测与说话人识别
open_scenedet
仅基础模式
参数类型: 开关
默认:关闭
关闭
开启
音频较长时循环视频
align_audio
仅轻量模式
参数类型: 开关
默认:开启
开启
关闭
反向循环
align_audio_reverse
仅轻量模式
参数类型: 开关
默认:关闭
关闭
开启
模板开始时间
templ_start_seconds
仅轻量模式
参数类型: 数字
默认:0 秒

积分消耗

每个音频秒 8 积分

按已验证目标音频时长每秒 8 credits 计算创建前预授权并向上取整;输出时长跟随音频,任务完成后再按实际消耗结算。

省钱小技巧

批量出图或出视频前,建议先用同一组素材在当前模型和同类候选之间做 AB 测试,确认效果后再批量跑,避免浪费积分。

常见问题

同类模型推荐

还没决定用哪个?顺手对比一下这几个同类候选。

OmniHuman 1.5

OmniHuman 1.5 当前核心路径用一张人物、宠物或动漫主体图片和一段音频生成驱动视频。音频时长由上传签名验证,并直接决定创建前预授权。

AI 视频模型
每个音频秒 27 积分

Kling AI Avatar Standard

能力标签: 前台要求恰好 1 张 JPEG 或 PNG 图片和 1 段 MPEG、WAV、X-WAV、AAC、MP4 或 OGG 音频。图片最大 10 MB;音频最大 100 MB、最长 5 分钟。 按已验签的音频时长,以 8 积分/秒计算并向上取整;时长缺失、无效或超过 5 分钟时不能提交。

AI 视频模型
8 积分 / 音频秒

Infinitalk

Infinitalk 在 Kyeo 使用 1 张图片、1 个不超过 15 秒的音频文件和必填提示词生成口播视频。可选 480p 或 720p,也可填写 `seed`;费用按音频秒数与分辨率计算,不是固定单次价。

AI 视频模型
480p 3 积分 / 秒;720p 12 积分 / 秒

信息来源

页面内容结合模型资料、功能说明和 Kyeo AI 当前可用设置整理。

来源说明

了解 Video Lip Sync 的视频加音频输入、轻量/基础模式、360p–1080p、24–60 FPS、每个音频秒 8 积分及参数边界。 按已验证目标音频时长每秒 8 credits 计算创建前预授权并向上取整;输出时长跟随音频,任务完成后再按实际消耗结算。

最后更新: 2026-08-28
火山引擎视频口型同步 当前接口资料
平台

用于核对本站当前接入版本的输入模式、可见参数、素材限制与可用状态;实际选项以页面和工作台为准。