⭐ Storyboard MCP · 会说话虚拟人 · 中文

《匆匆》"我们的日子为什么一去不复返呢?"——朱自清。文档进,会说话的虚拟人物视频与纯音频文件出。

中国现代散文经典——朱自清 1922 年作品《匆匆》的开篇段落——经 talking-avatar 流程处理:先理解文意,再为朗读优化标点与停顿,挑选一位 1920 年代书生形象的虚拟人物,用 gemini-tts 合成普通话朗诵,最后用 sync-lipsync v3 让口型与语音对齐。回到两件成品:会说话的视频与纯音频文件。

来源文本:《匆匆》节录,朱自清(1898–1948),1922 年 3 月。原文为公有领域。虚拟人物:一位泛指的 1920 年代民国书生形象——并非朱自清本人或任何具体真实人物。声音、面孔均为 AI 合成;只有文字是原作。
来源
中文散文 · ~350 字
虚拟人物
民国书生形象
声音
gemini-tts · Charon (男声)
时长
5 秒节选
成本
~$0.83

两件成品 — 流程实际交付的

🎬 会说话的虚拟人视频1024×1024 · 20s · sync-lipsync/v3 · 7.2 MB
🎧 纯音频轨MP3 128 kbps · 20s · gemini-tts · 0.3 MB
两件成品,一条流程。视频里的音频与独立的 MP3 字节一致——不需要重新合成。视频适合落地页、社交媒体;MP3 适合播客、有声书、无障碍场景。同样的字、同样的声、同样的停顿节奏。

朗诵的文本 — 被说出来的 20 秒

燕子去了,有再来的时候;杨柳枯了,有再青的时候;桃花谢了,有再开的时候。但是,聪明的,你告诉我,我们的日子为什么一去不复返呢?——是有人偷了他们罢:那是谁?又藏在何处呢?是他们自己逃走了罢——如今又到了哪里呢?

第二阶段(speak-out 优化)把原文的逗号停顿对应到呼吸节奏,把感叹分句前的破折号留出延长——人朗读时本来就会这样断。TTS 因此读出来的是有呼吸感的朗诵,而不是机械朗读。

流程跟踪 — 六阶段端到端

Stage 1 — 理解文本 gemini-text 分析 → {tone: "wistful", register: "literary-reverent", pace: "measured-slow", archetype: "1920s-scholar"}
Stage 2 — 朗读化优化 gemini-text 重写 → 标点对应呼吸点,分句前留破折号延长, 强调"为什么一去不复返"作为情感锚点
Stage 3 — 选声音(修正:与肖像性别一致) gemini-tts voice "Charon" — 温润男声,35 岁文人音色(普通话) ⚠ 第一版用了女声 Despina;与男性肖像不匹配——已修正。
Stage 4 — 生成肖像 gpt-image → 1024×1024, 闭口、自然光、长衫、圆框眼镜 portrait.png, 143s
Stage 5 — 动态化肖像(关键步骤) kling-v3-i2v(source: portrait, prompt: "细微自然动作、轻微点头、眨眼、肩部移动") motion-source.mp4 — 5秒真实微表情 + 身体语言 这是关键步骤。没有此步骤,lipsync 在静态图上跑,效果像纸偶。 有此步骤,虚拟人有自然眨眼、呼吸、体重移动——接近真人朗读。
Stage 6 — 合成普通话朗读 gemini-tts(prompt: optimized_text, voice: "Charon") → audio.mp3 18-秒 MP3;裁切前 5 秒以匹配 motion-source 时长
Stage 7 — 口型同步 + 打包 7a · 推送 motion-source.mp4 + audio-5s.mp3 到 raw.githubusercontent 7b · lipsync(video_url=motion-source, audio_url=audio-5s) talking-avatar.mp4 — 5秒运动 + 男声 + 重新生成口型 (106s) 7c · ffmpeg 抽取音轨 → audio-only.mp3(第二件成品)
Output → 两件成品:talking-avatar.mp4 + audio-only.mp3

成本 — 五个能力,六个阶段,~$0.30

理解 + 优化
~$0.01
gemini-text × 2
虚拟人肖像
~$0.04
gpt-image · 1024²
TTS 音频
~$0.07
gemini-tts · Charon
动态化(新)
~$0.53
kling-v3-i2v · 5s
口型同步
~$0.04
sync-lipsync/v3 · 5s
ffmpeg + 抽取
$0.00
本地

总计:~$0.83,一条 5 秒带真实动作 + 男声的中文虚拟人朗诵。kling-v3-i2v 这一步现在是必需的——纯静态图上的 lipsync 看起来像纸偶。每秒成本:$0.17/s

两个修复

1. 声音性别匹配。第一版用了女声 Despina;与男性 1920s 书生肖像不匹配。第二版改用 Charon(男声),与肖像一致。

2. 动态化必需。第一版直接在循环静态图上跑 lipsync——效果像纸偶。第二版先用 kling-v3-i2v 给肖像加上细微动作(点头、眨眼、肩部微调),再在动态视频上跑 lipsync——效果接近真人朗读。

这个 showcase 的诚实局限

5 秒是 kling-v3-i2v 默认生成的长度。对于更长的朗读,playbook 文档了按句子边界分块(每块 ≤5 秒)、逐块跑 kling-v3-i2v + sync-lipsync、然后 ffmpeg-concat 拼接的方法。完整 18 秒 gemini-tts MP3 仍在仓库里以备分块使用。

打开 playbook → 姊妹篇:Steve Jobs (English) → 全部 showcases