跳到主要内容
AI 视频模型
ByteDance
OmniHuman

OmniHuman 1.5

OmniHuman 1.5 当前核心路径用一张人物、宠物或动漫主体图片和一段音频生成驱动视频。音频时长由上传签名验证,并直接决定创建前预授权。

开放状态
核心能力受限开放
输入
1 图+1 音频
输出
720P/1080P
计费
27/音频秒
一张图片加一段音频的明确输入合同
720P/1080P 与快速模式
音频时长签名直接参与预授权
遮罩辅助流程暂不开放且字段硬拒绝
30 秒了解
OmniHuman
每个音频秒 27 积分
它擅长什么
面向单主体图片的音频驱动视频核心工作流。
适合谁用
适合人物讲解、虚拟角色对白、宠物或动漫主体的口播短片。
大家都在搜
OmniHuman 1.5 怎么用OmniHuman 1.5 多少钱OmniHuman 1.5 音频最长多少秒

一句话了解

这个模型怎么样?

图片可采用任意画幅,但仍需通过真实格式与签名尺寸校验;音频必须是支持格式、10 MB 内且小于 60 秒。可选提示词按更严格的 300 字符上限执行,不使用相互冲突的更宽描述。

它擅长什么
面向单主体图片的音频驱动视频核心工作流。
适合谁用
适合人物讲解、虚拟角色对白、宠物或动漫主体的口播短片。
为什么在 Kyeo AI 用
本站在扣点前验证图片与音频绑定,按可信音频秒数预授权,并明确关闭未接入的遮罩能力。

关键参数一览

帮你快速评估这个模型和你的业务场景是否匹配。

图片格式
JPEG/PNG/WebP
音频时长
小于 60 秒
提示词
可选,最多 300 字符
暂未开放
主体遮罩流程

它还叫什么

同一个模型在不同资料里可能有不同叫法,这里统一整理,方便搜索和比较。

OmniHuman V1.5
OmniHuman 1.5 图片说话
OmniHuman 1.5 音频驱动视频

用户常见问题

从实际任务、输入条件和结果要求出发,整理选择模型时最需要确认的问题。

OmniHuman 1.5 怎么用
OmniHuman 1.5 多少钱
OmniHuman 1.5 音频最长多少秒
OmniHuman 1.5 支持什么图片
OmniHuman 1.5 快速模式是什么

选型指南

还在纠结用哪个模型?先看这几个关键决策点。

1
只有图片时选择 OmniHuman

当源素材是静态人物或角色图,需要由音频驱动时使用本模型。

2
已有真人视频时比较口型同步

如果需要保留原视频动作与镜头,可比较 Video Lip Sync。

3
短音频先验证效果

先用推荐的短音频测试主体识别与口型,再扩展到更长内容。

用户常搜的对比

把常见候选放在同一任务下比较,帮助你确认输入方式、控制项和成本差异。

OmniHuman 1.5 与 Kling AI Avatar 的输入和计费有什么差异?
OmniHuman 1.5 与视频口型同步模型适合哪些素材?

模型横向对比表

正在纠结选哪个?这张表帮你一眼看清当前模型和替代方案的核心差异。

核心输入
OmniHuman 1.5
1 张图片+1 段音频
Kling AI Avatar Standard
1 张图片+1 段音频
Video Lip Sync
1 段视频+1 段音频

实际使用体验

结合公开资料、当前站内边界和典型任务,说明模型适合与不适合的情况。

受限开放不等于完整辅助套件

核心生成可调用,但依赖遮罩检测的多主体选择能力仍未进入本站运行合同。

按音频秒数预授权可验证

可信时长在任务创建前已知,因此不需要用估算时长或固定价猜测。

能力详解

图片音频驱动

用一张图片和一段声音生成主体说话视频。

双分辨率输出

可选择 720P 或 1080P。

快速模式

允许用一定质量取舍换取更快处理方向。

适合做什么

虚拟讲解员

用角色正面图和清晰旁白制作讲解短片。

动漫角色对白

用动漫主体图片和对白音频生成角色发言。

宠物拟人短片

用宠物照片配合短音频尝试拟人表达。

提示词技巧

保持主体清晰

选择主体明显、遮挡少、面部或头部可辨识的图片。

音频使用纯净人声

减少背景音乐和噪声,便于口型与节奏对齐。

提示词保持简短

最多 300 字符,聚焦表情、动作幅度与镜头风格。

为什么选它

图片加音频输入简单明确。
音频时长可在创建前精确计费。
支持多类主体和任意图片画幅。
未开放遮罩能力有清晰边界。

使用前要知道

当前不开放遮罩或指定多主体流程。
只能提交一张图片与一段音频。
音频必须小于 60 秒。
提示词采用严格 300 字符上限。

可调参数

帮你快速评估这个模型和你的业务场景是否匹配。

输出分辨率
output_resolution
可选
参数类型: 下拉选择
默认:1080P
720P
1080P
快速模式
pe_fast_mode
可选
参数类型: 开关
默认:关闭
关闭
开启
随机种子
seed
可选
参数类型: 整数
默认:-1(随机)

积分消耗

每个音频秒 27 积分

按已验证音频时长每秒 27 credits 计算创建前预授权并向上取整;音频必须小于 60 秒,因此合法请求预授权低于 1,620 积分。任务完成后按实际消耗结算。

省钱小技巧

批量出图或出视频前,建议先用同一组素材在当前模型和同类候选之间做 AB 测试,确认效果后再批量跑,避免浪费积分。

常见问题

同类模型推荐

还没决定用哪个?顺手对比一下这几个同类候选。

Kling AI Avatar Standard

能力标签: 前台要求恰好 1 张 JPEG 或 PNG 图片和 1 段 MPEG、WAV、X-WAV、AAC、MP4 或 OGG 音频。图片最大 10 MB;音频最大 100 MB、最长 5 分钟。 按已验签的音频时长,以 8 积分/秒计算并向上取整;时长缺失、无效或超过 5 分钟时不能提交。

AI 视频模型
8 积分 / 音频秒

Infinitalk

Infinitalk 在 Kyeo 使用 1 张图片、1 个不超过 15 秒的音频文件和必填提示词生成口播视频。可选 480p 或 720p,也可填写 `seed`;费用按音频秒数与分辨率计算,不是固定单次价。

AI 视频模型
480p 3 积分 / 秒;720p 12 积分 / 秒

Volcengine Video Lip Sync

Video Lip Sync 用一段已有视频和一段目标人声音频重做口型。轻量模式面向正面单人视频,基础模式面向更复杂的单人场景并可开启场景检测。

AI 视频模型
每个音频秒 8 积分

信息来源

页面内容结合模型资料、功能说明和 Kyeo AI 当前可用设置整理。

来源说明

了解 OmniHuman 1.5 当前开放的一张图片加一段音频驱动视频、720P/1080P、音频小于 60 秒、按秒计费及受限能力边界。 按已验证音频时长每秒 27 credits 计算创建前预授权并向上取整;音频必须小于 60 秒,因此合法请求预授权低于 1,620 积分。任务完成后按实际消耗结算。

最后更新: 2026-08-28
OmniHuman V1.5 当前接口资料
平台

用于核对本站当前接入版本的输入模式、可见参数、素材限制与可用状态;实际选项以页面和工作台为准。