OmniHuman 1.5
OmniHuman 1.5 当前核心路径用一张人物、宠物或动漫主体图片和一段音频生成驱动视频。音频时长由上传签名验证,并直接决定创建前预授权。
一句话了解
这个模型怎么样?
图片可采用任意画幅,但仍需通过真实格式与签名尺寸校验;音频必须是支持格式、10 MB 内且小于 60 秒。可选提示词按更严格的 300 字符上限执行,不使用相互冲突的更宽描述。
关键参数一览
帮你快速评估这个模型和你的业务场景是否匹配。
它还叫什么
同一个模型在不同资料里可能有不同叫法,这里统一整理,方便搜索和比较。
用户常见问题
从实际任务、输入条件和结果要求出发,整理选择模型时最需要确认的问题。
选型指南
还在纠结用哪个模型?先看这几个关键决策点。
当源素材是静态人物或角色图,需要由音频驱动时使用本模型。
如果需要保留原视频动作与镜头,可比较 Video Lip Sync。
先用推荐的短音频测试主体识别与口型,再扩展到更长内容。
用户常搜的对比
把常见候选放在同一任务下比较,帮助你确认输入方式、控制项和成本差异。
模型横向对比表
正在纠结选哪个?这张表帮你一眼看清当前模型和替代方案的核心差异。
实际使用体验
结合公开资料、当前站内边界和典型任务,说明模型适合与不适合的情况。
受限开放不等于完整辅助套件
按音频秒数预授权可验证
能力详解
图片音频驱动
双分辨率输出
快速模式
适合做什么
虚拟讲解员
动漫角色对白
宠物拟人短片
提示词技巧
保持主体清晰
音频使用纯净人声
提示词保持简短
为什么选它
使用前要知道
可调参数
帮你快速评估这个模型和你的业务场景是否匹配。
积分消耗
按已验证音频时长每秒 27 credits 计算创建前预授权并向上取整;音频必须小于 60 秒,因此合法请求预授权低于 1,620 积分。任务完成后按实际消耗结算。
批量出图或出视频前,建议先用同一组素材在当前模型和同类候选之间做 AB 测试,确认效果后再批量跑,避免浪费积分。
常见问题
同类模型推荐
还没决定用哪个?顺手对比一下这几个同类候选。
Kling AI Avatar Standard
能力标签: 前台要求恰好 1 张 JPEG 或 PNG 图片和 1 段 MPEG、WAV、X-WAV、AAC、MP4 或 OGG 音频。图片最大 10 MB;音频最大 100 MB、最长 5 分钟。 按已验签的音频时长,以 8 积分/秒计算并向上取整;时长缺失、无效或超过 5 分钟时不能提交。
Infinitalk
Infinitalk 在 Kyeo 使用 1 张图片、1 个不超过 15 秒的音频文件和必填提示词生成口播视频。可选 480p 或 720p,也可填写 `seed`;费用按音频秒数与分辨率计算,不是固定单次价。
信息来源
页面内容结合模型资料、功能说明和 Kyeo AI 当前可用设置整理。
了解 OmniHuman 1.5 当前开放的一张图片加一段音频驱动视频、720P/1080P、音频小于 60 秒、按秒计费及受限能力边界。 按已验证音频时长每秒 27 credits 计算创建前预授权并向上取整;音频必须小于 60 秒,因此合法请求预授权低于 1,620 积分。任务完成后按实际消耗结算。
用于核对本站当前接入版本的输入模式、可见参数、素材限制与可用状态;实际选项以页面和工作台为准。