milo.asia

数字人讲解视频

一张照片 + 一份文案,生成对口型的讲解视频。选一个渠道、填自己的 Key,生成直接打到对应服务商,钱花在你自己账户上——这一页只负责编排,不经手你的账户。

视频生成走你浏览器直连所选渠道的服务商,Key 只留在这台设备的内存里,不发到 milo.asia 的服务器。 一个例外:照片(阿里云渠道下还有配音音频)要先存成一个公网链接对方服务器才能读, 这一步在 milo.asia 自己的小型中转上完成;阿里云渠道的配音和视频生成接口都按 Workspace 分域名, 浏览器直连不通时会自动走同一个中转兜底(说明见页面底部),这条路径上 Key 会经过它,不落盘不写日志,转发完立刻丢弃,但既然经过就得说清楚。

① 账号信息

选一个渠道,价格摆在一起方便比。渠道之间互不影响,切换不会丢已经填的东西。

② 人物照片

清晰正脸,400–7000 像素,jpg/png/bmp/webp。会先上传到一个一小时后自动清空的临时存储,供所选渠道读取。

挑照片会实打实影响生成效果自然不自然(这条是经验建议,不是官方文档写的,官方没发过选图指南): 正脸、五官清楚不被头发/口罩/墨镜挡住,光线均匀别有强逆光或阴阳脸,表情自然放松、嘴巴自然闭合别是大笑或张嘴的瞬间, 背景干净单人入镜,照片本身别模糊、别是截图二次压缩过的。

③ 文案

按标点自动切成多段分别生成再拼接——wan2.7-i2v 单次视频调用只收 15 秒以内的音频。

这 14 个是官方精品音色列表 里的,选了哪个会自动配对应该配的 model(「旗舰音色」灵心/鲁风配 tts-plus,其余配 tts-flash, 不用你操心),试听样音也是官方原版(拿自阿里云自己的文档站,不经过我们、不花钱); 选"自定义"能手打其他音色 ID(官方还有 500 多个基础音色,没在这个下拉里,也没有试听样音), 但没验证过配对关系,不对的组合会报 418
wan2.7-i2v 这个模式官方文档只写了支持 720P/1080P,没有 480P
预计时长 / 分段数
— 秒 · —段
预计花费(不含配音,配音很便宜通常几毛)
¥ —

④ 授权确认

完成

这次实际花费(视频生成部分,已经花出去了,不管下面拼没拼成功)¥ 0.00

这一页背后是什么

三个渠道用的模型和流程都不一样。阿里云百炼wan2.7-i2v(音频驱动 + 文本 prompt 引导表情动作), 配音单独用 CosyVoice,因为它单次只收 15 秒音频,文案得先切段、每段单独生成,再用 ffmpeg.wasm 在浏览器本地拼接、烧字幕。百度曦灵是「照片数字人视频合成接口」,文案和配音(它内置 TTS)一次提交, 一整段直接出片。可灵 AI 是「数字人」接口,音频上限 300 秒,整篇一次合成不用切段,而且支持用文字 描述动作、情绪和运镜——这三家里只有它把「表情和手势」做成了正经参数。 ai-presenter-relay 是 milo.asia 自己那台服务器上一个几十行代码的小服务 (零依赖,纯 Node 内置模块),做的事:把你的照片和配音存一小时换成公网链接(这几家接口都只收链接、 不收直传文件,躲不开);阿里云的配音和视频生成按 Workspace 分子域名,CORS 支不支持因账号而异, 直连不通时兜底转发一次。可灵是个例外:它的接口完全没开 CORS(实测预检直接被拒),浏览器没法直连, 所以选可灵时每一次调用都必须经过这台中转,Key 每次都会过一遍——不落盘不写日志、转完立刻丢弃, 但这跟另外两家「大多数时候不经过」不是一回事,得说清楚。百度的视频生成接口验证过能被浏览器直接跨域调用, 不用经过中转。这个页面本身不收集数据,没有统计代码。