1. 资源包相关#
购买了低权益资源包后,又购买了高权益资源包,权益如何生效?
高权益资源包优先生效,叠加购买高权益资源包时,已购低权益资源包有效期会冻结,待高权益资源包消耗完毕后,会继续消耗低权益资源包;
公共并发数具体指什么?
指单模块(极速数字人、专业数字人、声音克隆、视频合成)同时间段内最多可同时提交处理的任务数;
超过并发的任务如何处理?
超并发任务会失败返回,建议自行做排队机制
2. 结果保存#
视频/音频结果和素材不存储,只单次临时使用,视频合成的结果文件24小时有效;需客户自有服务器自行转存视频结果保存多久?
生成的视频结果仅保留 24小时,生成视频后需要尽快保存;
音频结果保存多久?
生成的视频结果仅保留 24小时,生成视频后需要尽快保存;
3. 算力扣除相关#
生成的结果视频扣除算力小于1算力时,按照1算力计算,保留两位小数;
4. 数字人审核相关#
数字人定制为何需要授权视频?
因合规部门要求,使用用户形象训练数字人需要明确得到用户的授权;
5. 数字人克隆时长#
数字人训练视频时长 30~120秒,对应训练时间1~6小时;
数字人训练视频时间越长、文件越大,对应训练时间越长
极速数字人首次制作视频时间比第二次制作视频时间长3-5分钟;
6. 授权视频#
如下方视频中,用户在闪剪应用做视频,则授权对象是“闪剪”,接口中的品牌名 authText 则传“闪剪” 。若您的应 用名称是【AI助手】,则authText的值为【AI助手】。授权话术可以是:我是xxx(真实姓名),我授权【AI助手】使用视频中的肖像、声音,为我生成定制数字人及声音,并在本人【AI助手】账号中创作使用
案例:我是xxx(真实姓名),我授权【闪剪】使用视频中的肖像、声音,为我生成定制数字人及声音,并在本人【闪剪】账号中创作使用。7. 数字人克隆视频要求/数字人训练失败原因#
为了获得更理想的效果,请在光线充足、安静的环境下录制。拍摄视频时,请注意不要遮挡面部。8. 声音克隆要求#
录制过程,请保持环境安静,没有杂音、噪音、回声和混响
录制一段单人说话的音频,建议录制时麦克风离嘴巴大约10厘米的距离
录音时,要保持情绪稳定,语速均匀,就像平时聊天一样自然
录音建议#
环境选择:
录音环境的选择主要考虑降低噪音和混响,建议使用 10 平方米以内的小型房间进行录音,特别是配置吸音装置的房间,录音效果更佳。
如条件允许,可以使用价格较低的吸音棉对房间进行改造,改变声波的平面反射为漫反射,从而降低混响,提高录音质量。室内噪音:室内噪音主要来自空调、风扇(含电脑风扇)、日光灯镇流器、人声等。
可以利用手机录制环境声音,放大音量倾听录音,识别并关闭噪音源。
混响是指声音在空间中反射、折射、扩散并逐渐衰减的过程所产生的听觉效果。声波在墙壁、玻璃上等光滑平面上反射时,会导致声音浑浊。
录制声音时,建议不要选择空旷的房间,尽量选用配有吸音设施的场所,或摆放不规则的环境,降低混响影响。日常办公区域和会议室通常存在较高混响,不建议使用其作为录音环境。
普通的卧室是相对常见的理想录音环境,录音时需注意:与手机保持约 10 厘米距离,避免太近/太远造成喷麦和电流问题。
打开柜门、使用衣物、床单等覆盖柜面/桌面,降低光滑平面的声音反射,提高录音质量。
在录音前熟悉文案,确定好人设及演绎风格,避免“读稿”,以免复刻的效果与您的心理预期不符。
发音清晰,吐字清楚,句与句之间断句清晰,每句之间停顿。
9. 何为身份栏#
“身份栏”是视频画面上用来介绍“这个人是谁”的标签或字幕。它是一个非常重要的制作元素,用于提升视频的信息量和观看体验,如图所示
10. 制作视频失败常见原因:#
4.
素材资源不可访问,素材包含:真人口播的视频、插入的素材、音频地址、背景音乐地址等
11. 相关资源审核不通过,文案、素材则涉及政治、色情、暴力等归为行为#
按照合规部门要求,制作视频的内容需要进行合规审查,当接口返回【相关资源审核不通过】时,请检查素材、文案、音频、音乐等相关资源时否有涉及黄、赌、毒、涉政之类的内容。产品提示词参考:
文案、素材可能包含违规内容,如涉及政
治、色情、暴力等违法、不良或不实信
息,请清除违规内容后重试。当前闪剪API开放平台内容审核合作平台为树美(无法开放给合作方自审),对于用户上传中插素材涉政、色情等,树美只能返回一级大类给闪剪,闪剪反馈给API合作方也为大类:涉政、色情,但不会详细指出用户内容问题具体在哪,合作客户的内容审核路径如下:12, 接口回调,接口收不到怎么办#
制作任务成功或失败出结果才会触发回调通知调用方,中间态不会调,回调失败的情况下重试三次。三次回调失败,可调用【查询任务详情】接口,查询最终结果13. 【元数据】具体指的是什么:#
14.没有传音乐,为什么视频会有音乐#
部分模板为了效果更佳,会自带音乐。
"audioSwitch": false会完全关闭背景音乐(内置+传递的audioUrl都不生效)
"audioSwitch": true + 传audioUrl(使用audioUrl作为背景音乐)
"audioSwitch": true + 不传audioUrl(使用内置背景音乐,但取决于模版有没有配置)15. 新闻体视频,视频和所选的模板效果不一致#
行数限制,新闻体行数建议小于、等于模板封面的行数,超出行数,会显示默认模板,默认模板如下:16.调用服务器的白名单:#
阿里云:
39.106.193.217
47.95.193.5
39.106.20.56
腾讯云:
101.42.27.104
140.143.211.22517.域名白名单:#
18. 关于多 音字问题#
多音字,目前用相同读音替代字读,文本还是显示正确文本;若用拼音标注读取,四声抑扬顿挫AI识别容易有问题;建议使用同音字替代,可参考我们C端产品的交互设计19. 关于用户上传素材编码和尺寸处理问题#
用户上传的训练素材,以及产品素材,API技术文档都有明确标注尺寸,大小限制,以及编码参数h264/h265,用户端上传不会处理相关问题,所以需合作方加工处理,可采用ffprobe处理一下格式问题:
https://ffmpeg.p2hp.com/