数字人讲解视频
一张照片 + 一份文案,生成对口型的讲解视频。选一个渠道、填自己的 Key,生成直接打到对应服务商,钱花在你自己账户上——这一页只负责编排,不经手你的账户。
① 账号信息
选一个渠道,价格摆在一起方便比。渠道之间互不影响,切换不会丢已经填的东西。
② 人物照片
清晰正脸,400–7000 像素,jpg/png/bmp/webp。会先上传到一个一小时后自动清空的临时存储,供所选渠道读取。
③ 文案
按标点自动切成多段分别生成再拼接——wan2.7-i2v 单次视频调用只收 15 秒以内的音频。
④ 授权确认
完成
这一页背后是什么
三个渠道用的模型和流程都不一样。阿里云百炼是 wan2.7-i2v(音频驱动 + 文本 prompt 引导表情动作),
配音单独用 CosyVoice,因为它单次只收 15 秒音频,文案得先切段、每段单独生成,再用 ffmpeg.wasm
在浏览器本地拼接、烧字幕。百度曦灵是「照片数字人视频合成接口」,文案和配音(它内置 TTS)一次提交,
一整段直接出片。可灵 AI 是「数字人」接口,音频上限 300 秒,整篇一次合成不用切段,而且支持用文字
描述动作、情绪和运镜——这三家里只有它把「表情和手势」做成了正经参数。
ai-presenter-relay 是 milo.asia 自己那台服务器上一个几十行代码的小服务
(零依赖,纯 Node 内置模块),做的事:把你的照片和配音存一小时换成公网链接(这几家接口都只收链接、
不收直传文件,躲不开);阿里云的配音和视频生成按 Workspace 分子域名,CORS 支不支持因账号而异,
直连不通时兜底转发一次。可灵是个例外:它的接口完全没开 CORS(实测预检直接被拒),浏览器没法直连,
所以选可灵时每一次调用都必须经过这台中转,Key 每次都会过一遍——不落盘不写日志、转完立刻丢弃,
但这跟另外两家「大多数时候不经过」不是一回事,得说清楚。百度的视频生成接口验证过能被浏览器直接跨域调用,
不用经过中转。这个页面本身不收集数据,没有统计代码。