全部技能 / 内容创作 / ai-avatar-video
内容创作 · 101-skills/superpowers

ai-avatar-video

Create AI avatar and talking head videos via inference.sh CLI. Recommended: P-Video-Avatar (fastest, cheapest, built-in TTS). Also: OmniHuman, Fabric, PixVerse. Audio: Inworld TTS-2 (100+ languages, emotion steering for characters), ElevenLabs, Kokoro. Capabilities: audio-driven avatars, text-to-avatar, lipsync videos, talking head generation, virtual presenters, UGC content. Use for: AI presenters, explainer videos, virtual influencers, dubbing, marketing videos, UGC ads, gaming avatars, NPC dialogue. Triggers: ai avatar, talking head, lipsync, avatar video, virtual presenter, ai spokesperson, audio driven video, heygen alternative, synthesia alternative, talking avatar, lip sync, video avatar, ai presenter, digital human, ugc, ugc video, ugc ad, avatar ugc

风险提醒:橙色 · 评估后使用AI 侦查报告
作者 101-skillsGitHub 101-skills/superpowers ↗许可 MIT(仓库 README 徽标 'License: MIT' 与 .claude-plugin/plugin.json 中 "license": "MIT" 声明;但 pin 树内无 LICENSE 文件,GitHub API 对两 fork 亦报无 license —— 授权只出现在元数据/徽标,无正式许可文本)commit becc256497
agent 宿主通常会约束 skill 执行权限;风险提醒为 AI 侦查观点,不构成质量或安全保证。第三方 skill 仅作拆解与展示,安装使用风险自负,版权归原作者。

1实现原理 · 为什么它能做到

与同仓工具 skill 同构:belt CLI 白名单 + 目录表;但本 skill 额外内嵌『强推荐决策』——把 pruna/p-video-avatar 标为首选并给出速度/成本对比表(~1.83s/s、$0.025/秒 vs OmniHuman ~28s/s/$0.16),引导 agent 默认走最便宜路径。

tools/video/ai-avatar-video/SKILL.md
| **P-Video-Avatar** | `pruna/p-video-avatar` | **Best overall: speed, cost, quality, control** | **Yes (30 voices, 10 languages)** |
注:Start with P-Video-Avatar 段 + Cost & Speed Comparison 表把『选型』编译成经济性数字,模型不必自己比价。

两条技术路径取决于模型是否内置 TTS:内置模型(p-video-avatar/fabric)直接给 image+voice_script;无 TTS 模型(OmniHuman/PixVerse)先跑 inworld/text-to-speech-2 拿 audio_url 再拼 image_url+audio_url——skill 用『Full Workflow』把链路串成可复制命令。

tools/video/ai-avatar-video/SKILL.md
belt app run inworld/text-to-speech-2 --input '{
注:第 1 步 `> speech.json` 重定向把 TTS 输出落盘取 audio-url,第 2 步再喂给头像模型——两步拼接是示例即管线的体现。

配音/多语言流水线是四段式:fast-whisper-large-v3 转写 → LLM/人工翻译 → kokoro-tts 生成新语言语音 → latentsync-1-6 做唇形同步,全部是 infsh/* app 的 belt 调用。

tools/video/ai-avatar-video/SKILL.md
belt app run infsh/fast-whisper-large-v3 --input '{"audio_url": "https://video.mp4"}' > transcript.json
注:『本地化一条视频』被拆成 4 个可独立替换的 app 步骤,每步产物都是 URL/JSON,天然可插入人工审核。

UGC 批产被显式示范:用 shell for 循环对同一肖像批量跑 3 个不同 voice 的 p-video-avatar,说明本 skill 定位含『规模化生产』(也因此直接关联费用与肖像使用边界)。

tools/video/ai-avatar-video/SKILL.md
for voice in "Zephyr (Female)" "Puck (Male)" "Aoede (Female)"; do
注:批产示例把 voice_script/voice_prompt/video_prompt 作为循环变量模板——agent 可以直接照抄成多行 Bash。

输入素材链与图像 skill 拼接:用 pruna/p-image 先出 9:16 肖像再生成头像(Generate Portrait + Avatar 工作流),竖版比例贯穿(Tips: output aspect ratio matches the input image)。

tools/video/ai-avatar-video/SKILL.md
"prompt": "professional headshot portrait of a young woman, neutral background, looking at camera, studio lighting, photorealistic",
注:头像质量强依赖输入肖像(front-facing、good lighting 等 Tips),skill 把素材规范也写了进去。

2核心能力

01文本驱动口播头像(p-video-avatar 内置 TTS,30 声线/10 语言,voice_script+voice 即可出片)
02音频驱动唇形同步(image_url+audio_url 喂 OmniHuman/Fabric/PixVerse)
03多角色头像(OmniHuman 1.5 多人图中指定驱动角色)
04配音/多语言本地化流水线(whisper→翻译→kokoro→latentsync)
05UGC 风格内容批量生成(同一产品多 presenter 的 for 循环示例)
06风格控制:voice_prompt 控语气情绪、video_prompt 控肢体/背景

3外部依赖

类型依赖
clibelt(inference.sh CLI)
packagebelt-sh/cli(npx skills add 安装)
api平台头像/TTS/音频 app:pruna/p-video-avatar、pruna/p-image、bytedance/omnihuman-1-5、falai/fabric-1-0、falai/pixverse-lipsync、inworld/text-to-speech-2、infsh/kokoro-tts、infsh/fast-whisper-large-v3、infsh/latentsync-1-6
network平台文档
network安装说明托管

4风险提醒 风险提醒:橙色 · 评估后使用

风险提醒:橙色 · 评估后使用
  • 真人肖像/声音的数字替身风险 — 核心产物是『让一张脸按脚本说话』的视频。用未授权真人肖像/声音做 UGC 广告可踩肖像权/声音权与平台深度伪造红线;skill 未要求任何授权确认或 AI 披露机制,责任全在调用方。
  • 费用随批量线性放大 — 按秒计费 + 官方示范 for 循环批产,一次『多 presenter』批量就是多份账单;无预算闸门。
  • 第三方平台持有素材 — 肖像与音频上传至 inference.sh 及其模型厂商,敏感素材存在留存/再使用不确定性(skill 未声明删除策略)。
  • 数值声明部分不可在本源核实 — '100+ languages'、成本/速度数字来自平台方宣称,SKILL.md 只是转述,用户应到平台侧核对最新价目。
风险提醒:橙色,评估后使用。结构同仓内工具 skill:无脚本文件、无凭证读取、无直连网络,动作收敛为 belt CLI,外发对象可预期。额外留意点:① 加工对象是真人肖像/声音,批量生成 UGC 代言内容涉及肖像权、声音权与 deepfake 滥用边界,建议仅用自有授权素材并披露 AI 生成性质;② 每次生成按秒计费($0.025/s 起),for 循环批产直接放大费用;③ 供应链同前(npx 无 pin、inference-sh 镜像、无 LICENSE 文件)。按统一分档准则:本 skill 调用的 `belt` 是第三方 npm/npx 分发的 CLI(`npx skills add belt-sh/cli` 安装),以 `belt login` 登录态运行并消耗 inference.sh 账号配额/计费——属『调第三方 CLI 且触配额/登录态』,故取橙色(评估后使用);skill 源码本身不含任何 token/密钥读取。

5第二遍独立确认

  • [discrepancy] description 声称 Inworld TTS-2 支持 100+ languages、emotion steering — 正文有 inworld/text-to-speech-2 调用示例且含 [friendly]/[excited] 情绪标记(emotion steering 有据);但 '100+ languages' 这一具体数字在 SKILL.md 内无出处——数值来自平台宣称,本源码无法定位。
  • [ok] 成本对比表自洽性 — 表内 ~28s/s ≈ 1.83s/s×15('15x slower' 一致)、$0.16≈$0.025×6.4('6.4x more' 一致);数字为平台方宣称,作为选型参考存在。
  • [ok] P-Video-Avatar 30 voices/10 languages 声明 — 表内 Built-in TTS 列与正文 UGC 章节('30 voices, 10 languages — match your target audience')两处一致。
  • [ok] 四条工作流(TTS+Avatar / 配音流水线 / 画像→头像 / UGC 批产)可执行性 — 每条均含完整 belt 命令与重定向;调用的 app-id(inworld/text-to-speech-2、infsh/fast-whisper-large-v3、infsh/kokoro-tts、infsh/latentsync-1-6、pruna/p-image)均在示例内成对出现。
  • [ok] 无脚本文件/无凭证/无直连网络 — 目录仅 SKILL.md;执行面为 allowed-tools 白名单 belt;多行 shell 仅以示例文本存在,由宿主执行。
  • [ok] 本地文件写入面 — 仅示例重定向 > speech.json / > transcript.json / > new_speech.json,属执行示例时的落盘行为。
  • [ok] 肖像/音频为远程 URL 输入 — 全部示例输入 image/audio/image_url/audio_url 值为 https://…,无本地路径。
  • [unlocatable] installs 安装量 — 无公开安装量数据源,置 null。

6结论

  • 决策前置到极致:推荐模型 + 成本/速度对比表 + 何时用替代路径的 Tip,量产用户可直接照单执行。
  • 多语言本地化流水线现成:whisper→kokoro→latentsync 四步即可把已有视频配音成新语言。
  • 风格双轨控制(voice_prompt 语气 + video_prompt 肢体/背景)在示例中拆得很清楚,出片可调性好。
  • 同一生态内可拼整链:画像(p-image)→头像(p-video-avatar)→视频/发布等下游(Related Skills 互链完整)。
  • 适合:适合有授权素材(自有/已购肖像权)的营销团队做 AI 代言、UGC 风格广告、课程口播、多语言本地化的量产;也适合先用 p-video-avatar 低成本试片再决定是否上 OmniHuman/PixVerse 的用户。
    不适合:不适合没有肖像/声音授权、需要处理真实人物形象的场景;不适合对素材出网与留存零容忍的场景;不适合追求深度定制单模型效果(应改用专精 skill,如 OmniHuman 相关独立包);不适合无费用预算的批量自动化。
    安装 agent 直装可复制
    ① 本站镜像 更新 2026-09-09
    方式 A · 人下载镜像包下载 ai-avatar-video.tar.gz
    sha256: 28ad95bf92e9736e…
    方式 B · JSON 格式安装指南,复制给 agent
    安装指南
    agent 读 JSON 指南后会自动从本站下载安装,无需更多说明。
    ② 上游 GitHub · 原始来源
    能访问 GitHub?直接去上游安装(实时版,可能已更新)GitHub 原始 ↗
    本页镜像锁定 commit becc256497;上游为实时仓库。
    来源信息 GitHub 原始
    作者 / 仓库101-skills / 101-skills/superpowers
    Stars0
    最近推送2026-08-31
    本 skill commitbecc256497
    许可MIT(仓库 README 徽标 'License: MIT' 与 .claude-plugin/plugin.json 中 "license": "MIT" 声明;但 pin 树内无 LICENSE 文件,GitHub API 对两 fork 亦报无 license —— 授权只出现在元数据/徽标,无正式许可文本)
    本站信息
    收录日期2026-09-06
    分类内容创作
    侦查报告2026-09-06 · 2 遍
    本站镜像与 GitHub 原始是不同来源:本站锁定 commit 快照经 /r2 分发;GitHub 为实时上游,内容可能已更新。