📚 离职知识库

AI 科普长视频(横屏 / 10-30 分钟)制作全景调研

调研日期:2026-07-30 方法:8 个并行子 agent 多方调研(4×Haiku 检索 + 3×Sonnet 分析 + 1×Opus 架构),逐条交叉核对 交叉核对说明:报告中凡厂商自测数据、无法验证的数字、子 agent 之间互相矛盾的说法,均已就地标注。第 12 章列出本轮实际抓到的错误。


#目录


#0. 先读这段:整轮调研的六个核心结论

① 没有一键生成。 真正能讲清楚 AI 概念的长视频,全部是「分环节专业化 + 人工卡点把关」的混合流水线。纯端到端 AI 生成 10 分钟长视频,2026 年质量仍不稳定;主流做法是拆成场景(每段 5-15 秒)分别生成再拼接。

② 音频先行,时间戳倒推画面。 这是本轮调研中被最多独立来源验证的一条铁律:先出完整旁白音频 → 拿到词级时间戳 → 再按时间戳排画面。绝不能反过来(先定画面时长,再让 TTS 变速去凑)。

③ 讲 AI 这个题材,PPT / 屏录口播的性价比压倒性最高。 证据链高度一致:跟李沐学AI 每期约 5 小时录制、10 天一期;ZOMI酱一个人做、熟悉主题一个周末出片;李自然说 20 分钟视频只准备 10 分钟。反面证据:Kurzgesagt 单集 1200 小时,回形针 20 人团队仍要 3-4 周/期——这种重制作套到「这周的论文下周就过时」的 AI 题材上,等动画做完内容已经凉了。

④ 钱不在 API 上,在人工上。 一条 20 分钟视频的 API 总成本只有 ¥100-500(甚至更低);而 AE 动效外包是 ¥6,000-12,000/分钟。所以「用 AI 降本」的收益全部来自替代人工环节,省 API 钱毫无意义。

⑤ 两条政策红线是硬约束,不是注意事项。 国内《AI 生成合成内容标识办法》2025-09-01 已施行,不标注最高罚 100 万;YouTube 2025-07-15 把「重复内容」政策改名为 inauthentic content,明确覆盖 AI/模板批量生产内容,判定标准是有没有「独特的人类附加价值」。批量同质化 AI 科普号会被断变现。

⑥ 讲 AI 有一批现成可视化工具可以白嫖。 BertViz(注意力热力图)、Netron(模型结构图)、Transformer Explainer(Token 流动交互演示)——直接录屏比自己做动效省一个数量级的工。Two Minute Papers 整个频道就是靠「画面全部来自论文作者自己发布的官方 demo」把素材成本压到接近零。


#1. 生产逻辑:2026 年的行业共识

#1.1 标准链路

选题与调研
   ↓
脚本(母稿 → 口播稿)        ← 决定成败的 80%
   ↓
分镜 / shot list
   ↓
TTS 配音(音频先行)          ← 此处产出「权威时钟」
   ↓
词级时间戳(TTS 原生 / 反向对齐)
   ↓
画面生成(按时间戳排布)
   ↓
字幕 + BGM + 音效
   ↓
合成渲染 → 响度归一化 → 合规标识注入
   ↓
封面 / 标题 / 章节 / 简介 → 投稿
   ↓
(可选)切竖屏短视频引流 + 文字稿二次利用

为什么必须音频先行:画面的存在意义是服务讲解。旁白时长是唯一不可压缩的量(语速改变会直接损伤听感),而画面时长可以任意伸缩。因此把音频时长设为权威时钟、画面去适配它,是唯一不会互相打架的顺序。

一个值得抄的工程约束(来自实践):合成后校验音画时长差,超过 0.12 秒直接硬失败,不允许静默容忍。音画不同步是这类视频最容易被观众察觉、也最容易在自动化流水线里被静默引入的缺陷。

#1.2 三种路径对比

路径 工具组合 单条 10-20 分钟耗时 优势 劣势 适合谁
A. 剪映生态混合 DeepSeek/豆包写稿 + CosyVoice/豆包 TTS + 即梦/可灵 + 剪映专业版 3-8 小时(估算) 门槛最低、生态完整、出片快、AI 卡点和自动字幕成熟 复杂动效和精确控制力弱;风格一致性靠人盯 大多数中文创作者
B. 程序化(代码即视频) Claude Code + Remotion/Manim + TTS + ffmpeg 首次搭模板较重,后续单条显著下降 风格极度统一、可版本管理、改脚本即重渲染、可 CI 自动化 需要代码能力;模板搭建期投入大 技术向、系列化内容
C. 全自动 Agent Coze / n8n / 自定义 skill + 文生视频 + TTS 最快 可规模化 质量上限低,且直接撞平台 inauthentic content 红线,有断变现风险 批量测试内容(不建议做主号)

对路径 C 的重要修正:市面上多数介绍把它的缺点写成「质量一般」。实际风险等级更高——是账号失去变现资格。见第 10 章。

建议:AI 科普长视频选 A 起步、逐步长成 B。A 用来验证选题和表达方式(这是真正的不确定性所在),B 用来在选题验证之后把机械劳动压到接近零。不要一开始就搭 B 的完整基建,那是在为还没验证的内容形式提前付账。


#2. 标杆逆向:他们实际是怎么做的

说明:以下信息来自公开访谈、幕后视频、媒体报道。查不到的一律标注「未找到公开信息」,未做推断填充。

#2.1 总览

创作者 形式 画面工具 单集时长 团队 工时/周期
3Blue1Brown 纯代码动画 自研 Manim 10-20 分钟 个人为主 脚本 2-3 周起(选题构思可达数月)
Welch Labs 手绘 + Manim Manim + 手绘 约 20 分钟 个人为主 未找到
Two Minute Papers 论文官方 demo 剪辑 论文原始素材 2-5 分钟 个人 素材成本近零
Fireship 快剪 + 代码演示 AE + Premiere 3-10 分钟 一人全包 1-2 周/条
Andrej Karpathy 纯屏录 + Jupyter 几乎无剪辑 1-4 小时 个人 未找到
Branch Education 3D 工程动画 Blender 4.2.3 LTS + Premiere + Reaper 10-20 分钟 创始人 + 自由动画师 未找到
Real Engineering 3D + 实景 未确认 15-20 分钟 小团队 3-6 周/条
Kurzgesagt 矢量插画动画 After Effects + Cinema 4D 约 10 分钟 51-100 人 约 1200 小时/期
跟李沐学AI 屏录 + PPT/论文截图 自研 AutoCut(基于 Whisper) 数十分钟-数小时 个人 约 5 小时录制/期,约 10 天一期
ZOMI酱 PPT + 口播 PPT 本人明确说"只有我一个人" 熟悉主题一个周末;陌生主题 1-2 周
李自然说 真人口播一镜到底 极简,几乎不剪 约 20 分钟 个人 约 10 分钟准备
回形针(已停更) 3D + 信息可视化 未确认 巅峰 20 人 3-4 周/期
影视飓风 多形式综合 全套专业摄制 不定 100-160 人 年产 130-150 条

#2.2 三个最值得抄的细节

① 李沐的 AutoCut。 他自研了一个开源剪辑工具,基于 Whisper 语音转文字,自动识别并剪掉静音段和口误重复片段,粗剪后再人工精修。这是「个人产能天花板」被顶高的关键工程手段——口播类视频的剪辑工时大头就是找口误。

② 李沐的投入分配是反直觉的。 他买了两支 300 美元以上的专业麦克风,理由是「长视频音质至关重要」;但后期极简、画面就是 PPT 加论文截图。音频优先于画面精度——这是这类内容的正确资源分配。他还坚持给中文内容加字幕,方便无声观看。

③ Two Minute Papers 的素材策略。 讲论文时,画面几乎全部使用论文作者自己公开发布的 demo 视频和图表。这既零成本又自带权威感。中文对应做法就是「论文原图直接贴」——不要重画。

#2.3 性价比排序(针对「讲 AI」这个具体题材)

  1. PPT / 屏录口播 —— 最高。AI 科普的核心价值是信息密度和专家可信度,不是视觉奇观。且 AI 领域更新极快,高频输出本身就是竞争优势。
  2. Manim 代码动画 —— 中高,但有门槛。只在讲「数学结构 / 算法机制」(注意力机制、扩散去噪、梯度下降)时收益远超静态图。讲「这篇论文说了什么」用 Manim 是过度投入。
  3. 3D 建模动画 —— 中等,题材受限。只在内容涉及物理结构(芯片内部、硬件装机)时划算。讲抽象算法逻辑,3D 的边际视觉收益反而不如 Manim 的符号化动画直观。
  4. 手绘 / 矢量插画大制作 —— 在 AI 题材上性价比最低。适合半年一部、面向全年龄泛科普的选题。

#2.4 中文 AI 科普的「低配但有效」通行模板

拆解下来是五个要件:

  1. Keynote/PPT 大字标题 + 关键词卡片:每页一个核心概念,压缩认知负荷,讲者有视觉提示词、降低 NG 率。
  2. 论文截图 / 架构图直接贴入:不重绘,直接截论文原图(模型架构图、实验结果表、公式),省时间且借论文原图的权威感。
  3. 口播为主线,不做提词器式朗读:夹杂「我觉得」「这里有意思的是」「大家应该注意」等主观评述,强化专家人设真实感。
  4. 少量动态字幕 / 关键词高亮:自动语音转文字批量生成,满足无声观看场景。
  5. 极简后期 + 自动化降本:用 Whisper 类工具自动去口误做粗剪,人工只做少量精修。

该模板的成立前提:观众本身有专业背景或学习动机,愿意为信息密度容忍视觉粗糙。要「破圈」传播的内容不能照搬。

#2.5 长视频留存结构

  • 前 15 秒必须给出价值主张(这个视频讲什么、为什么值得看下去)——可带来 1 分钟处 18% 更高留存
  • 第 5 秒留存率目标 70-85%;前 3 秒直接影响算法是否加大分发。
  • 健康曲线形态是「陡降后趋缓」:前 15-30 秒是筛选期,非目标受众快速跳出属正常;若前段流失超 40%,说明开场设计有问题。
  • 结构上是「钩子 → 兑现 → 下一个钩子」循环。这也是章节化(YouTube chapters)的底层逻辑:每个章节本质是一次新的钩子。
  • 节奏:Fireship 用每分钟 10-15 个剪辑点维持注意力。长视频可在开场 30 秒用高频视觉刺激完成留人,中段放缓回归内容。

留存数字来自公开的创作者运营指南,非平台官方逐字披露的内部数据,作为参考基准而非精确指标。


#3. TTS 配音

#3.1 商业 API 对照

方案 价格 中文自然度 声音克隆样本 词级时间戳 备注
火山引擎豆包 TTS 2.0 ¥3/百万字符(0.003 元/千字符) 极佳 5 秒 ✅ segment + word 国内最便宜;支持 SSML + 指令式情感标记(如 [急切而发颤]);克隆需身份认证
Fish Audio S2 $15/百万字符 极佳 15 秒 ✅ word-level ⚠️ 其「盲测 65.7% 胜率」是厂商自测,见第 12 章
MiniMax speech-2.6/2.8 约 $50/百万字符 极佳 自适应 原生 word 级毫秒时间戳subtitle_enable + subtitle_type=word 时间戳能力是本轮实测确认最可靠的
阿里 CosyVoice2 按字符 极佳(中文韵律最优) 零样本 完全开源,可本地部署,支持方言
Azure TTS $16/百万字符 不支持零样本 ✅ word + phoneme 每月 500 万字符免费额度;首包延迟最低(约 120ms)
ElevenLabs 约 $103/百万字符起 60 秒 英文标杆,中文性价比明显不划算
OpenAI TTS / gpt-4o-mini-tts $0.60/百万 text token + $12/百万 audio token 无 SSML、无时间戳;中文有「外国人说中文」口音
Google Gemini TTS 未公开 较弱 中文不推荐

#3.2 开源本地方案

方案 显存 推理速度 RTF 中文自然度 克隆
IndexTTS2(B站开源) 8GB 0.12-0.18(开源最快) 极佳 内置,同语种 + 跨语种
CosyVoice2(阿里) 10GB+ 0.2-0.3 极佳(韵律第一) 内置零样本
GPT-SoVITS 4GB 起 0.3-0.8 需 1 分钟数据微调
F5-TTS 8-12GB ~0.2 仅需 2 秒音频
Kokoro-TTS 轻量 中文较弱
Spark-TTS(LLM 原生架构) 零样本

#3.3 三档推荐

  • 零成本起步:Azure TTS 免费额度(500 万字符/月,足够个人用量);或 edge-tts(免费但非 SLA,必须串行调用否则限流)。
  • 中文质量优先:火山引擎豆包 TTS 2.0(¥3/百万字符 + 5 秒克隆 + 指令式情感),这是本轮调研里综合性价比最高的选择。
  • 需要精确词级时间戳:MiniMax 官方 t2a_v2subtitle_enable: true + subtitle_type: "word",返回毫秒级 JSON。
  • 全本地 / 隐私优先:IndexTTS2(8GB 显存门槛最低、速度最快)。

#3.4 长视频配音的六个工程要点

① 分句。 3000 字以上直接喂 TTS 会出现五类退化:停顿漂移、语速递增、情绪偏移、韵律坍缩、多音字读音错误增多。按自然段切分,每段 300-500 字

② 并发控制。 API 并发设 5-10,过高触发限流。edge-tts 必须串行。

③ 句间停顿用 SSML 显式插入,不要靠 TTS 自己判断:

<speak>
  <s>这是第一句话。<break time="500ms"/></s>
  <s>这是第二句话。<break time="800ms"/></s>
</speak>

④ 响度归一化到 -16 LUFS(对话/讲解类标准)。平台参考值:YouTube -14 LUFS,播客 -16 LUFS,EBU R128 广播 -23 LUFS。

⑤ 读音修正。 建立领域读音词典处理:英文缩写(AI → A I)、数字(2024 → 二〇二四)、多音字(用 SSML phoneme 标注拼音)、外国人名(Schrödinger → 薛定谔)、希腊字母(λ → lambda)。

⑥ 权威时长以 ffprobe 实测为准,不要相信 TTS 返回的 duration 字段。

#3.5 声音克隆的合规

  • 只克隆本人声音;克隆他人用于商业目的不可行。
  • 公众人物仅限非营利用途。
  • 国内:需明示同意;火山引擎的声音克隆需身份认证。
  • 平台 ToS 普遍明确禁止诈骗、模仿政治人物、冒充知名人士。
  • 采集标准:30-60 秒(越多越好)、安静室内、≥44.1kHz、覆盖多种情感语气。

#4. 画面与动效

#4.1 三条路线

路线 代表工具 上手 价格 自动化
传统剪辑/动效 After Effects、Premiere、DaVinci Resolve、剪映/CapCut、Final Cut AE 陡 / 剪映极低 AE $22.99/月;DaVinci 免费版够用,Studio $295 永久;剪映免费 需手工关键帧;剪映有 AI 卡点和自动字幕
代码化动画 Manim、Motion Canvas、Remotion、p5.js、Blender 需编程 开源免费(Remotion 例外,见下 最高,可 CI 渲染
AI 生成 文生图、文生视频、数字人、一键成片 极低 按次/订阅 完全 AI,但可控性最低

#4.2 代码化三选一:怎么选

引擎 语言 强项 弱项 什么时候用
Manim Python 数学公式、几何变换、符号化推导表达力最强;MIT 许可 「场景脚本」范式而非时间轴范式,精确绑定旁白节拍需大量胶水;无法浏览器预览;LLM 生成的 Manim 脚本语义错误率高且难自动修复 公式推导、向量空间、梯度下降这类 shot
Motion Canvas TypeScript 自带可视化时间轴编辑器、热重载 DX 好;MIT generator API 范式对 LLM 生成不够稳定;服务端批量渲染生态弱于 Remotion 程序化演示动画
Remotion React/TSX 时间轴范式(useCurrentFrame())、数据驱动、同一套组件可在浏览器 <Player> 预览也可服务端渲染、CI 友好 商业许可,非开源许可(见下) 标题卡、要点卡、图表、Ken Burns、B-roll 叠字、代码演示——即长视频的绝大多数 shot

⚠️ Remotion 许可证(本轮重点核实,多数二手介绍都写错了)

Remotion 不是 MIT/Apache,GitHub license 字段是 NOASSERTION(自定义商业许可)。

  • 免费适用:个人;非营利组织;员工数 ≤ 3 人的营利组织;评估期未商业化者。
  • 免费包含商业用途:官方明确允许——只要你不是把 Remotion 本身当产品卖,用它做视频去接商单、走平台激励、卖课都在免费许可内。
  • 付费档:Creator $25/seat/月;Automator $0.01/render + $100/月最低消费
  • 最容易踩的一条:人头跨实体叠加——如果雇了外包/顾问一起操作同一套 Remotion 系统,他们的人数会累加进 4 人阈值。

来源:https://www.remotion.dev/docs/license/faqhttps://www.remotion.pro/license

推荐组合Remotion 做唯一合成层,Manim 降级为 shot 级插件。即 Manim 只负责渲染公式/数学可视化那几个 shot,输出带 alpha 的透明 MOV 或 PNG 序列,由 Remotion 用 <OffthreadVideo> 内嵌。这样保留 Manim 的表达力,但不让它承担整片时间轴,也不必维护两套渲染器和两套预览。

#4.3 AI 生成画面的实际可用性

工具 失败率(估算) 适合 不适合
Runway Gen-4 ~16% 风格一致性最强,多镜头
Veo 3 ~12% 高保真、光影
Sora 2 ~15% 通用 B-roll,分辨率高
可灵 ~20% 数字人、中文理解
即梦 ~18% 快速迭代、CapCut 集成
Pika ~22% 概念验证

通用失败场景:精细手部动作(打字、弹奏)、复杂人脸表情同步、清晰文字显示、高精度物理模拟、连贯多镜头叙事。 通用成功场景:自然风景、通用办公场景、广角人物、转场效果。

结论:文生视频只当 B-roll 补充,不撑主体,不用于精确的科学演示(会失真)。预留 20% 的额外生成和挑选成本。

数字人(HeyGen 140+ 语言 / Synthesia / 腾讯智影 / 剪映数字人)虚拟感仍明显,适合企业内训和多语言批量,不适合建立个人权威。

#4.4 讲 AI 的特有画面:直接白嫖现成工具

这是本轮调研里最省力的一条发现。不要自己从零做动效

需求 现成工具 做法
注意力矩阵热力图 BertViz https://github.com/jessevig/bertviz Python 直接出图/交互视图,录屏
Token 流动 / Transformer 全流程 Transformer Explainer https://poloclub.github.io/transformer-explainer/ 交互式网页,直接录屏
模型结构图 Netron https://github.com/lutzroeder/netron 加载 ONNX/TF 模型自动出结构图
Loss 曲线动画 matplotlib FuncAnimation 直接存 mp4 / TensorBoard 录屏 20 行 Python
神经网络结构动画 Manim(精确)或 Excalidraw(快速手绘感)
论文截图高亮标注 PIL 脚本批量画高亮框 + 箭头,或 macOS Preview 手动
代码逐行演示 Carbon / Chalk.ist 出图;Asciinema 录终端;Screen Studio 录屏
流程图/示意图 Mermaid、Excalidraw、tldraw(都是 diagrams-as-code 或可导出 SVG)

屏幕录制一定用专业工具:Screen Studio($149/年,自动跟踪鼠标智能缩放)效率比手工关键帧高一个量级;替代品 Camtasia($249 永久)、ScreenFlow($129,Mac)。

#4.5 科普视频的八个通行画面套路

  1. 动态字幕 / 关键词弹出(打字机、滑入、缩放、模糊聚焦)
  2. 屏幕录制 + 缩放跟随
  3. 白板手绘(VideoScribe/Doodly,或 Blender Grease Pencil)
  4. Ken Burns 静图运镜(缩放 + 平移关键帧,Remotion 里就是 interpolate
  5. 数据图表动画(柱状增长、折线绘制、饼图分割、热力图渐变)
  6. 代码高亮逐行演示
  7. 分屏与画中画(代码 + 结果对比、原理 + 应用)
  8. 转场节奏与音乐卡点(导入概念 2-3 秒、深化讲解 5-8 秒、转场间隔 0.5-1 秒)

#5. 时间轴对齐:整套流水线的技术地基

#5.1 三种方案的实测精度

方案 精度 难度 中文支持 推荐度
TTS 原生 word timestamp ±80ms 最低 取决于厂商 ⭐⭐⭐⭐⭐ 科普视频首选
whisper.cpp token-level 略低于 WhisperX 低(官方包封装好) ✅ 开箱可用 ⭐⭐⭐⭐ 最佳兜底
WhisperX ±45-50ms ⚠️ 默认对齐模型不含中文 ⭐⭐ 见下方警告
Aeneas(DTW) ±300ms 低,无需 GPU ⭐⭐⭐ 轻量场景
MFA(Montreal Forced Aligner) ±12-15ms 高,需训练词表 ⭐⭐ 学术级,过度工程

⚠️ WhisperX 的中文坑(重要):WhisperX 的 word-level 时间戳靠 wav2vec2 强制对齐实现,其 README 明确说明默认对齐模型只覆盖 {en, fr, de, es, it}中文不在其中,需要自己去 HuggingFace 找 phoneme-based ASR 模型并自测。 对一个要求稳定的自动化流水线,引入「得自己调对齐模型」的组件是净负债。中文场景优先用 TTS 原生时间戳,兜底用 whisper.cpp(token-level 时间戳精度略低但开箱支持中文,且 @remotion/install-whisper-cpp 直接封装了 toCaptions())。

#5.2 推荐链路

主链路:
口播稿 → MiniMax t2a_v2(subtitle_enable, subtitle_type=word)
       → wav + subtitle_file(JSON, 毫秒级)
       → ffprobe 量 wav 真实时长(权威时钟,与 TTS 声明值比对)
       → 烘焙成绝对时间轴

兜底链路(零成本):
口播稿 → edge-tts(串行!)→ wav
       → ffmpeg 转 16kHz 单声道 wav
       → whisper.cpp large-v3, tokenLevelTimestamps: true
       → 与原稿做相似度比对,<0.85 报警(防 ASR 漏字)

#5.3 画面切换点绑到「词」上

这是科普视频「专业感」的技术来源:说到「注意力」那一刻,公式才出现

实现方式是分镜里不写绝对毫秒,只写相对锚点:

anchor: { type: "sceneStart", offsetMs?: number }
      | { type: "word", wordIndex: number }
      | { type: "phrase", matchText: "注意力机制" }   // 烘焙期在词流上匹配

然后由确定性代码(不是 LLM)在拿到词时间戳后烘焙成绝对 startMs / durationMs

两条必须硬失败的校验

  1. phrase 锚点匹配不到 → 抛错,不允许 fallback 到 0(这是反幻觉最后一道闸)。
  2. 同场景内 shot 的锚点必须严格递增 → 否则说明分镜排序错了,抛错,不允许静默重排

#5.4 字幕

  • 优先在合成层用代码渲字幕(可控、可做卡拉 OK 词级高亮、不依赖 libass)。
  • 需要「可关闭字幕」时才走外挂 SRT。
  • 中文每行建议 约 18 字
  • 如果非要用 ffmpeg 烧 ASS 字幕,务必带 fontsdir——否则 libass 会静默 fallback 成英文字体,中文全变豆腐块且不报错(见附录 A)。
  • 中文字体必须按整片文案子集化pyftsubset),否则 Noto Sans SC 全量 woff2 有 8-10MB,会拖慢渲染甚至触发超时;子集化后通常 200-400KB。

#6. 素材来源与版权

#6.1 视频 B-roll

站点 免费/付费 价格 API 备注
Pexels Videos 免费商用 $0 必须显示 Pexels 显著链接并署名摄影师;限流 200/h、20000/月;禁止复刻其核心功能
Pixabay 免费商用 $0 兜底
Mixkit 免费 $0 模板每周更新
Videvo / Coverr 免费+付费混合 部分
Storyblocks 付费 约 $30/月 一站式(视频+音频+图片)
Envato Elements 付费 约 $16.5/月 量大但需自己筛
Motion Array 付费 约 $19.99/月 动效模板强
摄图网 / 包图网 会员制 国内本土素材丰富

#6.2 图片 / 图标 / 插画

  • 免费商用:Unsplash、Pexels、iconfont、Lucideundraw(后两个对代码集成最友好)
  • 付费:Freepik、Flaticon、Streamline、IconScout、Noun Project

#6.3 音乐与音效 ——「最容易踩雷的环节」

来源 风险 说明
YouTube Audio Library ✅ 最安全 完全免费、零版权风险
Epidemic Sound ⚠️ 需操作 必须先在后台关联你的频道,否则照样吃 Content ID claim;B 站可通过
Artlist / Musicbed / Soundstripe / Uppbeat 付费,较安全
Free Music Archive ⚠️ 高风险 授权混杂,B 站可能被 flag
爱给网 / 耳聆网 / Freesound / Zapsplat 音效为主 逐条看授权
AI 生成音乐(Suno / Udio / Stable Audio) ⚠️ 法律灰区 商用需谨慎,尽量避免作为主 BGM

平台差异

  • 抖音:自动音频指纹检测,未授权音乐可直接封号 → 用官方曲库
  • B 站:站内曲库安全;外来音乐通常需被举报才处理
  • 视频号:建议用官方库
  • YouTube:Content ID 全自动,Epidemic Sound 的白名单机制是靠「频道关联」运作的

#6.4 二次创作引用的实践尺度

  • 相对安全:≤20% 时长 + 明确标注来源 + 有实质解说
  • 模糊区:20-50%
  • 禁区:≥50% 属直接侵权

学术素材:arXiv 论文图的 license 按篇不同(CC BY / CC BY-NC / arXiv perpetual license 混杂),不要一律当 CC BY。抓图时把该篇 license 一起记录下来。

#6.5 素材组合推荐

  • 零成本档:Pexels + Mixkit + YouTube Audio Library + undraw/Lucide + 剪映
  • 专业档(约 $30-50/月):Storyblocks + Epidemic Sound
  • 工作室档($100+/月):多库并用 + Getty/Adobe Stock

#7. 脚本层

说明:本章的补充调研过程中 firecrawl 服务持续 502、WebSearch 配额已用满,改用 WebFetch 抓 DuckDuckGo 结果页 + 逐页抓正文完成。部分知乎/百度文库页因反爬 403,已用同主题转载版替代。凡为推导而非直接引用的,就地标注。

#7.1 结构模板

通用骨架(短视频口播的三段式)

结构块 功能 写法要点 占比
钩子 Hook 让人不划走 第一句直接说人话、无铺垫,抛痛点/结论/悬念 约 1 句(3 秒规则)
价值 Body 交付可带走的内容 一个点讲深,「问题→方法→例子」递进,每 5 秒一个信息点 约 70%
行动 CTA 引导后续动作 一句话,只选一个动作,不要贪多 约 1 句

黄金三秒的四种钩子模板

类型 句式
提问式 「你是不是也遇到过……?」
痛点式 「别再……了,那样只会……」
反差式 「你以为……,其实……」
利益预告 「看完这条,你就知道怎么……」

科普长视频六段骨架

段落 占比 8 分钟 15 分钟 25 分钟
① Hook 开场钩子 3-5% 15-25 秒 30-45 秒 45-75 秒
② 问题铺垫(为什么值得花这几分钟) 8-10% 40-50 秒 1.5-2 分钟 2-2.5 分钟
③ 前置知识(术语首次出现要解释) 12-15% 1-1.2 分钟 2-2.5 分钟 3-3.5 分钟
④ 核心内容(拆 2-4 子点,每点「论点→机制→类比」) 50-55% 4-4.5 分钟 7.5-8.5 分钟 12.5-14 分钟
⑤ 回扣 Hook(呼应开场,给出「所以呢」) 8-10% 40-50 秒 1.5-2 分钟 2-2.5 分钟
⑥ CTA(单一动作) 3-5% 15-25 秒 30-45 秒 45-75 秒

⚠️ 这张分钟级占比表是从短视频口播框架外推推算的,未找到专门针对「8/15/25 分钟横屏科普长视频」的公开分钟级模板。作为起点用,不是行业标准。

10 种可直接套用的口播结构(适合选题时挑一个套):① 问题+反常识+三步拆解 ② 对比+案例+核心套路 ③ 自我挑战+过程记录+结果 ④ 误区+真相+解决方案 ⑤ 故事+感悟+行动建议 ⑥ 数据+结论+操作指南 ⑦ 身份+揭秘+避坑 ⑧ 场景+痛点+方案 ⑨ 提问+回答+延伸 ⑩ 观点+反驳+我的看法。

关键是每个章节都是一次新的钩子-兑现循环,而不是平铺直叙。

#7.2 中文口播语速(已核实)

播音专业标准:250-260 字/分钟。 依据是人耳辨析率——每秒 4-5 个字,即每分钟 240-250 字;超过这个区间会造成理解压力。

播音语速的历史演变(说明为什么坊间数字差异这么大):

年代 字/分钟
1950-60 年代 160-180
1980 年代 220-240
1990 年代后 280
当代 约 300

央视播音员实测:张宏民 350、邢质斌 329、罗京 280 字/分钟。短视频口播的自媒体经验值约 300 字/分钟

坊间 180-220 / 200-260 / 220-280 三种说法的差异来源:① 是否计入换气停顿(播音训练常按「净说话时间」算,去掉停顿会显著推高数值);② 内容类型(新闻快、专题讲解慢);③ 年代变化。

科普长视频建议取 220-250 字/分钟(比新闻播音松弛、需给听众消化时间,但比日常聊天紧凑):

视频时长 按 220 按 250 建议脚本字数
8 分钟 1,760 2,000 约 1,750-2,050 字
15 分钟 3,300 3,750 约 3,300-3,800 字
25 分钟 5,500 6,250 约 5,500-6,300 字

这是工程估算值(从 250-260 播音标准向下调整到讲解型区间推算),不是某个来源直接给出的「科普口播专用数字」。正式排期前用你的实际配音引擎跑一段 30 秒-1 分钟样本反推真实语速再校准。

一条播音规则对科普特别重要:同一篇稿件中,人名、数字、核心结论要比通篇稍微放慢。这直接对应到 TTS 的 prosody rate 分段控制。

英文对照(LingoChampion 基于 YouTube 字幕分析 23 个频道 63 条视频,采集于 2026-01,不含中文数据):

类别 含停顿 WPM
Tech(最接近科普讲解) 200.2
Podcasts 172.7
News 169.5
Entertainment 154.4
整体平均 171.1

中英文信息密度不同,字数不能直接类比,但「Tech 类目 200 WPM」可作为讲解型内容的语速特征参考。

#7.3 母稿 → 口播稿的改写规则

核心认知:「文章是给眼睛看的,口播是给耳朵听的」——这是感知路径的重新设计,不是文体转换。

五条可执行规则

  1. 钩子重设计:钩子要回答「观众凭什么此刻停下来听你说话」。结构 = 利益或威胁 + 立刻发生感。
  2. 信息颗粒度拆细:把每个需要解析的地方拆开,确保每一小块能被即时消化。不是加语气词,而是重新切分信息单元。
  3. 情绪密度适配:调整的是情绪浓度,不只是语气词。
  4. 一句话删减测试:对每句自问「这个信息拿掉,观众会不会听不懂后面的内容?」——背景信息和延伸解释在口播里是噪音,能删就删。
  5. 结尾从情绪里生长:CTA 要跟观众听完后的情绪状态对齐,不能生硬拼接。

零基础改写三步法

  • 读出声改稿——读一遍,拗口的长句直接拆短(判定标准就是「读的时候会不会喘不上气」)
  • 名词换动作——抽象名词换成具体动作/画面(「提升效率」→「少走三步路」)
  • 加「你」和场景——把「用户」改成「你」,给出具体场景

改写映射表

书面语(母稿) 口播稿
「如下图所示」「见下表」 「你现在看到的这张图」「屏幕上这个东西」——不能用阅读时才有意义的指代
长从句、多重定语 拆成 2-3 个短句,一句只讲一个信息点
数字「42.3%」 「大概四成,准确说是 42.3%」——先给整数概念再补精确值
专业术语首次出现 术语 + 一句大白话解释 + 生活化类比
「因此」「综上所述」「值得注意的是」 删除,或换成「所以」「说白了」「提醒一下」
被动语态(「被发现」「被证实」) 改主动(「科学家发现」「实验证实」)
抽象总结句(「这具有重要意义」) 具体化为「这意味着你以后……」
「用户」「受众」 「你」

表中「如下图所示」「数字怎么念」「术语首次出现」三条为综合推导的工程规则,未找到专门列出这三条的单篇权威文章。

一个可执行的约束:每个场景(对应一段 TTS 音频)的旁白控制在 25-60 字(约 8-20 秒)。超过就拆——一个场景对应一段音频,太长会让重配音的粒度变粗。

#7.4 「AI 味」的识别与去除

这一节有三个独立信源交叉验证,是本章来源最扎实的部分。

AI 文本的 6 个可检测维度

  1. 困惑度(Perplexity)低——AI 总选概率最高的词,人类用词更跳跃
  2. 突发性(Burstiness)低——人类文本长短句交替,AI 句长更均匀(可用句长标准差量化
  3. 结构指纹——过渡词滥用、段落开头模式化、对称结构癖好(「不仅…而且…」)、总以总结性结尾收尾
  4. 词汇分布偏差——高频 AI 词
  5. 标点格式模式——倾向使用「完整」的标点组合
  6. 语义一致性过高——连贯性「过于完美」,不会像人类一样跑题、插入个人轶事

中文高频词替换表(可直接用)

AI 高频词 替换为
深入探讨 聊聊 / 拆解一下
全面解析 具体说 / 实操讲一遍
至关重要 很关键 / 这步不能省
综上所述 所以 / 总结一下
值得注意的是 提醒一下 / 注意了

其他要警惕的:「旨在」「不可或缺」「显著提升」「体现着」「彰显了」「预示着」。

六大改写策略

策略 做法
打破句长均匀性 长句中间插入 5-10 字的极短句
注入口语化 「说实话」「讲真」「翻车」替换书面语
具体数字场景 「性能有提升」→「QPS 从 1200 涨到 3400,延迟降 60%」
破坏结构指纹 不要每段都做总结,偶尔用反问句开头;去掉「首先…其次…最后」
替换 AI 偏好词 见上表
段落结尾去标点 列表最后一条可以不加句号,更像手写笔记

英文场景的硬约束(来自 Stop Slop 规则指南,对中文写作也有参考价值):

  • 删掉清嗓式开场("Here's the thing:" / "It turns out" / "Let me be clear")
  • 删掉空转强调("Full stop." / "Let that sink in." / "This matters because")
  • 删掉 16 个虚词副词(really / just / literally / genuinely / honestly / simply / actually…)
  • 不用 Wh- 疑问句做修辞性「假提问」
  • 不用破折号(em dash)
  • 不用被动语态
  • 避免极端词(every / always / never / nobody / everybody)
  • 二元对比句「Not because X. Because Y.」→ 直接说 Y
  • 5 维自评评分卡:Directness / Rhythm / Trust / Authenticity / Density,总分 ≥ 35/50

科普口播稿的自查清单

□ 过渡词是否只剩「然而/此外/值得注意的是/综上所述」?(出现超 2 次即需替换)
□ 是否每段都用「总结性金句」收尾?(超 60% 段落如此即为 AI 味信号)
□ 句长方差是否过低?(读一遍,若每句字数都接近,故意插几句 5-10 字短句打断)
□ 是否出现「深入探讨/全面解析/至关重要/不可或缺/显著提升」?
□ 「不仅…更是…」这类对称排比是否超过 2 次?
□ 数据结论是否够具体?(「性能有提升」必须换成具体数字)
□ 结尾是否是「这提醒我们……」式空洞升华?(应改为回扣开场悬念)

一个容易忽略的坑:AI 偏爱制造工整的排比金句,因为「人类信任对称性,它感觉像是可见的智能」。连续短句强调本身不是问题,问题是每段都用。科普脚本收尾最容易踩的就是「富有哲理但略显刻意的结论」。

本地有 humanizer-zh skill 可以做这一步的自动化过滤。

#7.5 分镜(shot list)的工具化

国内轻量版 6 栏表(短视频行业最常见):镜号 / 景别 / 画面内容 / 台词 / 运镜 / 时长

专业级字段(StudioBinder 标准,适合多机位实拍):Scene Number / Shot Number / Shot Description / Shot Size / Camera Angle / Camera Movement,进阶还有 VFX / Lens / Frame Rate / Sound / Lighting / Location / Prep & Shoot Time / Reference Image 等约 25 项。

纯图形化科普长视频的精简版(没有实拍,把实拍字段换成素材来源):

镜号 | 对应口播句 | 时长(秒) | 画面类型(图表/动画/素材/文字卡) | 素材来源或 Prompt | 运镜或转场 | 备注

工具选项:Notion 有现成 Shot List 数据库模板;Boords 支持「故事板一键转分镜表」并导出 Google Sheets,也有 AI Storyboard Generator(脚本→故事板)。

但对代码化流水线,最实用的落地形式就是一个 JSON/CSV 数组——每个元素对应一个 Remotion <Sequence>,直接被脚本读取驱动渲染参数,不需要额外的分镜软件。这与第 11 章的 IR 设计是同一件事。

分镜密度基准

  • 平均 每 6-12 秒换一个 shot;10 分钟片约 50-100 个 shot
  • 连续 3 个以上同类型 shot 要警惕——那是节奏死板的信号
  • 每 90 秒至少插一个「呼吸镜」(B-roll 或小节标题卡),否则观众会累

#7.6 封面与元数据(已核实)

YouTube 封面规格1280×720 px,16:9,最小宽 640px,文件 <2MB,JPG/PNG/GIF(PNG 因文字更锐利被推荐)。

封面设计规则(有数据支撑的部分)

  • 文字控制在 3-5 个词以内;避免放右下角(会被时长标签遮挡)
  • 粗黑无衬线字体 + 描边/阴影/色块背景保证可读性
  • 69% 的爆款视频用了人脸,头部创作者中高达 80%;但只有约 5% 的头部视频用夸张表情——表情要真实自然
  • 人脸占画面 1/4 到 1/3
  • 保持单一视觉焦点
  • 配色用高对比、互相「打架」而非融合的颜色;避免红/白/黑(会和 YouTube 界面配色融合),偏好橙/青/黄/紫
  • 移动端优先:人脸和关键文字避开画面边缘防裁切

YouTube 章节(Chapters)的硬性格式要求(官方文档,不合规会直接不生效):

  • 第一个时间戳必须是 00:00
  • 至少 3 个时间戳,按升序排列
  • 每个章节最短 10 秒
  • 格式 MM:SS(超 1 小时用 HH:MM:SS),写在视频描述里
  • 手动章节会覆盖 YouTube 自动生成的章节
00:00 为什么 RNN 不够用
02:15 注意力机制到底在算什么
07:40 QKV 的字典类比

其他元数据:标题 70 字符以内、关键词前置;描述前两行要有钩子,附时间戳/链接/CTA;标签 5-15 个,主关键词优先。

常被漏掉的步骤:文件命名优化、等 HD 处理完成再设为公开、置顶首条评论、片尾卡与口播里的语音 CTA 时间对齐。

B 站

  • 分 P:把系列/多集打包在同一投稿下,PC 网页投稿页可添加多个分 P
  • 「看点」:B 站官方对标 YouTube Chapters 的进度条分段导航功能,用于标注视频分段方便观众跳转

    「看点」的官方操作步骤和字段限制未抓到创作学院原文,正式使用前到 https://member.bilibili.com/academy/ 核实交互路径。

#7.7 横屏切竖屏引流 & 一稿多用

自动切片工具价格(已核实,但价格变动频繁,付款前上官网核对)

工具 价格 备注
Clipsai 免费(开源 Python 库,自部署) 基于 WhisperX 转录 + Pyannote 说话人识别,自动切片 + 16:9→9:16 智能重构图跟随说话人
Opus Clip Free 60 分钟/月(带水印,3 天过期);Starter $15/150 分钟;Pro $29/300 分钟 入门档性价比最高
Vizard Creator $29/月(600 分钟上传,4K 无水印);年付约 $16.90/月
Riverside Pro 年付 $24/月含 Magic Clips Magic Clips 具体额度官网未拆分披露
2Short Pro $19.90/15 小时分析
Klap $14/月起(年付),10 条/45 分钟
Submagic $39/月

如果你已经在用 WhisperX 或 whisper.cpp 做时间轴对齐,Clipsai 是最省钱的路线——同样基于 WhisperX,自部署零边际成本。

一稿多用的正确路径口播稿本身就是最好的文章底稿,不要再从视频转录一遍。

写口播稿 → 渲染视频
        ↘ 口播稿去掉画面指代词(「你看这张图」)+ 补回图片图表 → 公众号/博客

这比「转录视频再改写」省一道 ASR 误差。转录方案只在「临场发挥、没有逐字稿」时才有必要(这种场景可用「提词匠」类小程序,支持 100+ 平台链接直接提取,单文件上限 120 分钟/500MB)。

#7.8 成片前质检清单

内容与合规

□ AI 生成标识:片头显式标识 + 常驻角标 + 片尾说明 + 文件元数据隐式标识
□ 投稿时勾选平台的「AI 生成内容」声明(不能只靠自己烧的角标)
□ 素材授权:所有配图/音乐/素材有可商用授权
□ 署名义务已履行(Pexels 摄影师、论文作者)
□ BGM 无 Content ID 风险(Epidemic Sound 已关联频道)
□ 关键数据和结论可追溯到来源(描述区列参考文献)

音画质量

□ 音画同步:时长差 < 0.12 秒;关键词高亮/图表出现时机无肉眼可见错位
□ 响度归一化到 -16 LUFS(ffmpeg loudnorm 验证)
□ 字幕逐条过错别字(ASR 生成的字幕必查同音字);术语/人名拼写一致
□ 字幕无中文豆腐块(尤其烧字幕路径,检查 fontsdir)
□ TTS 拼接处/剪辑点无不自然停顿

结构与脚本

□ Hook 在开场 3-5 秒内出现
□ 结尾回扣了开场悬念,CTA 只有一个明确动作
□ 无 AI 味残留(过渡词滥用、每段总结式收尾、高频 AI 词——见 7.4 清单)

编码与规格

□ 1080p H.264 yuv420p,CRF 18-20,AAC 128k+
□ 文件命名规范(常被漏掉)

封面与元数据

 封面 1280×720、<2MB、文字 3-5 词、避开右下角、人脸占 1/4-1/3、高对比配色
 标题 70 字符以内,核心关键词前置
 描述前两行有钩子,附章节时间戳和参考链接
 章节:首条必须 00:00,至少 3 条,每条 ≥10 
 标签 5-15 个,主关键词优先
 B 站:分 P / 看点已设置(系列或长视频拆条场景)

发布前最后一遍

□ 等 HD 处理完成再设为公开
□ 置顶首条评论
□ 片尾卡与口播语音 CTA 时间对齐

#8. 开源项目 / Claude Code skills / MCP

#8.1 项目清单(含定位修正)

项目 Stars 做什么 横屏长视频可用性 中文 值不值得抄
MoneyPrinterTurbo 100.4k(已核实) 短视频全自动生成 ❌ 不适合——README 示例全是 14-59 秒;参数支持 1920×1080 但整条 pipeline 是短视频逻辑 可参考其素材调度和 TTS 集成,不要拿来做长视频
TheoremExplainAgent 1.5k 自动生成 Manim 长篇讲解视频;两阶段 Planner→Coder 正对口 部分 最值得抄(ACL 2025 Oral)
Paper2Video 2.3k LaTeX 论文 → 幻灯片+字幕+光标动画+语音+虚拟讲者 ⭐ 值得抄多 Agent 架构
Code2Video 代码 → 教学视频;Planner/Coder/Critic 三 Agent 值得抄 Critic 环节
ManimCommunity/manim 39.8k(已核实,非 89k) 数学动画引擎,MIT 主流选择
Remotion React 写视频 主流选择(注意许可证)
MoneyPrinterV2 28k+ Ollama-first 短视频 ❌ 短视频 参考
ShortGPT 6k+ Shorts/TikTok ❌ 短视频 参考字幕节奏
AutoShorts (alamshafil) 316 已归档(2025-01),不要用
Wan2GP 低 VRAM 视频生成(Wan/Hunyuan/LTX/Flux) 补充 B-roll 关注

#8.2 Claude Code 生态

名称 做什么
Claude-Code-Video-Toolkit 集成 Remotion / Manim / 屏录 / YouTube 截取 / FFmpeg
elevenlabs-remotion-skill Remotion + ElevenLabs TTS 的完整 skill;有 3.5 小时做出 35 秒 1080p 落地页视频的实战记录
math-animation-mcp Manim + Claude MCP
promo-video-skill 预告片生成(30/60/90 秒,横竖屏)

#8.3 MCP 服务器

MCP 功能
video-audio-mcp FFmpeg 全能封装:格式转换、缩放、编码、字幕烧制、B-roll 插入、淡入淡出、xfade、拼接、变速、去静音
capcut-mcp 剪映草稿自动化:素材、转场、滤镜、遮罩、动画
davinci-resolve-mcp 色彩分级、媒体编辑、Fusion
fcp-mcp Final Cut Pro,88 个工具,FCPXML 引擎
blender-mcp 3D 动画、VFX
After Effects 暂无成熟开源 MCP

#8.4 编排平台

  • n8n:模板最丰富(VEO3/Fal.ai + 多平台自动发布 + Google Sheets 控制中心),开箱即用
  • Coze:字节官方,抖音原生集成,可直接生成剪映草稿
  • Dify:LLM 工作流 GUI,视频合成需自己扩展
  • ComfyUI:需 NVIDIA GPU,适合本地精细控制而非工业生产

#9. 成本、效率杠杆与商业回报

#9.1 单集成本(20 分钟精致动画科普)

模式 团队 工时 成本
一人全包(精致动画) 1 人 100-300 小时(估算) ¥1.5万-4.5万(按机会成本折算,估算)——长期不可持续
一人全包(口播+素材剪辑) 1 人 显著更低 ¥2,000-8,000(估算)
2-3 人小团队 3 人 200-400 人时 ¥1.5万-3万/集(估算)
工业化(Kurzgesagt 级) 51-100 人 1200 小时/集(官方披露) 数万至更高

#9.2 分环节工时

环节 工时
选题调研 15-40 小时(估算);Kurzgesagt 称脚本可耗数周到数年
写稿(5000-6000 字对应 20 分钟) 人工 10-30 小时;LLM 辅助后人工精修 2-5 小时(估算)
配音 真人录制 3-8 小时(含 NG);TTS + 校对 1-2 小时(估算)
动效/AE 包装 最耗时——精细包装 1 分钟至少一周(抠图、K 帧、调色);可吃掉总工时 50%+
精剪(20 分钟) 20-40 小时(按外包时薪估算)
封面 + 上传运营 5-15 小时(估算)

#9.3 外包报价行情

环节 报价
AE 动效包装 ¥6,000/分钟(能干活)~ ¥8,000/分钟(不错)~ ¥12,000+/分钟(行业高手)
中文配音(专业棚录) 普通 ¥30-100/分钟;优秀 ¥150-200/分钟;资深纪录片级 ¥300-500/分钟
中文配音(淘宝低价) ¥30-60/百字
视频剪辑(Fiverr) $10-100/分钟成片;60 秒 explainer $200-400;2 分钟商业动画 $600-1,200
视频剪辑(Upwork 时薪) 中位数 $35/h;入门 $15-30;中级 $30-60;专家 $60-150+
2D 动画解说(Fiverr) 均价约 $210/项目

#9.4 API 成本(一条 20 分钟视频)

环节 单价 用量 成本
LLM 写稿(DeepSeek) 输入 ¥2/百万 token,输出 ¥8/百万 token 5-15 万 token ¥3-20
TTS 火山 ¥1/万字;阿里 ¥2.2-3/万字;腾讯 ¥1.9/万字 约 6000 字 ¥1-5
AI 生图 约 ¥0.02-2/张(视渠道) 50-150 张 ¥50-300
AI 生视频(补充镜头) 可灵 ¥0.084/秒(标清)-¥0.113/秒(4K) 300-600 秒 ¥25-70(重生成常翻 2-5 倍)
合计 约 ¥100-500/集

结论:API 成本低到可以忽略。瓶颈永远是人工时间,不是钱。

#9.5 效率杠杆排序(决定先自动化哪一步)

排名 环节 自动化收益 掉质量风险
1 封面/缩略图生成 极高
2 选题调研信息检索 中(必须人工核查事实)
3 文案初稿 中(AI 稿有「正确的废话」问题)
4 TTS 配音 中高 中(情感张力仍有差距)
5 字幕/踩点/粗剪
6 精剪叙事节奏
7 AE 动效/角色动画 最低 最高
8 选题方向/内容策略 不应自动化 极高

规律:越靠近观众直接感知的环节(画面质感、叙事节奏、情感表达),自动化越掉质量;越靠近信息处理与素材生成的环节,自动化收益越大。最优策略是「AI 打底稿,人工做灵魂」。

#9.6 平台经济

平台 分成 头部商单 时长建议
B站 创作激励约 ¥2-3/千播放;充电创作者分 70% 科技区头部 ¥30-40万/条;知识区定制约 ¥40万 5 分钟以上长视频播放量增长迅速;用户日均停留 112 分钟
YouTube AdSense 创作者约 55% 科技/财经类 RPM 可达 $16-20(头部案例) 8 分钟以上解锁中贴片广告,官方建议 8-10 分钟
视频号 原创声明后评论区广告分成 无可靠公开数字
抖音 CPM/CPC 广告分成 无可靠公开数字

注意:YouTube 只有约 40-60% 播放会产生广告曝光,实际到手远低于理论 CPM。RPM 是到手数字,CPM 是广告主出价。

跨平台最优时长:8-15 分钟——够长以覆盖 YouTube 广告位,够深以匹配 B 站完播率权重,又不至于弃看率飙升。

#9.7 赛道现状与空位

B 站 2025 数据:AI 相关内容每月近 10 万活跃 UP 主,日均投稿同比 +83%,日均播放时长同比 +100%;知识/科普/科技领域占 2025 百大近三成;科技区带货 GMV 占比 72%。

供给和需求同步暴涨——赛道热,但也更挤。 相对空位:

  1. 垂直深挖而非泛 AI 资讯(泛「每日 AI 播报」已严重过剩)
  2. 强人格化 + 敢下判断(信息搬运最容易被判「AI 味重」)
  3. 一手实测而非复述论文(科技区 GMV 占 72% 说明实测类商业价值高)
  4. 长内容的确定性红利(B 站「知识长视频逆势生长」)

#9.8 可持续性

  • 行业经验:约 90% 的自媒体停更源于选题枯竭,而非制作能力。建议「批量调研 + 排期发布」而非硬更。
  • 回形针停更真相(纠正常见误传):不是商业不可持续或产能问题,而是 2021 年 6 月团队成员境外言论风波导致主动停更、7 月大陆全平台封禁。这是合规红线案例,不是产能案例——但对科普号仍是警示:事实核查和言论合规不能交给 AI
  • 引入 AI 辅助后,单集工时可压到原来的 30-50%(估算),但叙事把控和事实核查无法脱手。「高频剧场式生产」和「个人深度科普」本质是两条不同的路。

#10. 合规红线(这一章不要跳过)

#10.1 中国大陆:AI 生成内容标识(强制,已生效)

《人工智能生成合成内容标识办法》2025-03-07 公布,2025-09-01 施行(网信办、工信部、公安部、广电总局联合发布)。

要求

  1. 显式标识(视频):在「起始画面和视频播放周边的适当位置添加显著的提示标识」,可在视频末尾和中间适当位置添加。办法未规定具体时长与文案,实践从严:
    • 片头 2-3 秒显示「本视频含 AI 生成内容」
    • 右上角常驻半透明小字
    • 片尾单独一屏说明(旁白由 AI 语音合成 / 部分插画由 AI 生成 / 事实内容经人工核校)
  2. 隐式标识:文件元数据中包含生成合成属性信息、服务提供者名称或编码、内容编号
  3. 平台义务:核验隐式标识、周边加提示、提供用户主动声明功能 → 投稿时必须勾选「AI 生成内容」声明,不能只靠自己烧的角标
  4. 禁止恶意删除、篡改、伪造、隐匿标识
  5. 鼓励采用数字水印
  6. 一个存在的豁免情形(办法第九条):用户申请、且通过协议明确责任、服务提供者留存相关日志不少于 6 个月的,可提供不含显式标识的内容。

    注意这是给「服务提供者」(即 AI 工具方)的条款,不是给内容发布者的免标理由。作为创作者发布视频,仍应按 1-3 项处理。

罚则:不标注最高可处 10 万-100 万元罚款。

适用判断:只要视频用了 AI 配音(TTS)或 AI 生成画面,就落在需要显式 + 隐式标识的范围内。

执行现状:2025-09-01 当天六大主流平台(含 B 站、抖音、视频号)同步上线「AI 生成」角标和隐式元数据功能。抖音已下架超 53.8 万条 AI 侵权/低质视频,处罚超 4,000 个账号。

来源:https://www.cac.gov.cn/2025-03/14/c_1743654685899683.htm

#10.2 YouTube:Inauthentic Content 政策(2025-07-15 生效)

YouTube 将原「repetitious content」政策更名为「inauthentic content」,明确扩大到 AI/CGI/模板批量生产的内容

关键点不是禁 AI,是禁「无独特人类附加价值」。被断变现的是「近乎相同的幻灯片/克隆片段」这类重复模板内容;只要最终视频有 unique human-added value,用 AI 工具制作仍可正常变现。

对 AI 科普的含义:批量 AI 科普号是高危区——套用统一模板/统一脚本结构大量出片,极易被判定为 inauthentic content 而失去变现资格。有明确人格化叙事、独立观点、原创视觉的 AI 辅助号风险较低。

#10.3 B 站态度

B 站 2025 版《AI 生成内容创作规范》明确欢迎用 AI 辅助创作提升效率,唯一硬性要求是清晰标注、不误导用户,全文未提及禁止 AI 配音。但实际执行中 AI 内容审核耗时更长,批量上传有频次限制;被处罚的案例集中在「用 AI 批量生成同质化低质内容」。

#10.4 字体版权(大坑)

原则:只用 SIL OFL 1.1 的字体。绝不用系统自带字体。 macOS 上最容易犯的错是 CSS 里写 font-family: "PingFang SC",本地看着好好的——但苹方不能用于商业视频分发。方正、汉仪等商业字体全部禁止。

详见附录 B。

#10.5 素材署名义务

  • Pexels API 的署名是硬要求:「whenever you are doing an API request make sure to show a prominent link to Pexels」+「Always credit our photographers」→ 片尾 attribution 屏不是可选项
  • arXiv 论文图 license 按篇不同,逐篇记录

#11. 定制方案:基于现有资产的自动化流水线

本章由 Opus 子 agent 结合已有资产(Claude Code skill 生态、云雾中转、tky 东京 VPS、scribe-studio 白板渲染引擎、media-studio 写稿流水线、Next/Vercel 栈、Firecrawl 自建)设计,并做了 8 次真实 API 探测验证。

#11.1 结论先行

环节 主推 跑在哪
选题/调研 media-studio 四素材源 + ai-daily 热点池 + Firecrawl 自建 本地 Claude Code
脚本/分镜 Claude Code skill 产出 VideoSpec IR(JSON) 本地
配音 MiniMax 官方直连 speech-2.6-turbo + subtitle_type=word;MVP 期 edge-tts + whisper.cpp 兜底 本地/tky
时间轴 TTS 原生词时间戳为主,whisper.cpp 为备(不用 WhisperX tky
画面引擎 Remotion 为唯一合成层;scribe 白板引擎与 Manim 降级为「素材生产器」,输出透明 WebM / PNG 序列供 Remotion 内嵌 tky
渲染 tky 自建 @remotion/renderer;Vercel Sandbox 作突发与灾备 tky
控制台 Next.js on Vercel(审片 + 逐镜重渲),套现有密码门 Vercel
数据 Supabase Leo-hub 新增 vs_* Supabase

一句话:scribe-studio 的骨架 + Remotion 的画面 + MiniMax 的时间戳。

#11.2 实测结论(含坏消息)

用真实凭据打了 8 次探测:

路径 结果 能拿词时间戳?
云雾 /v1/t2a_v2(MiniMax 原生) 404 Invalid URL ❌ 端点不存在
云雾 /v1/audio/speech + speech-2.6-turbo 500 this channel is designed for task-based operations, not audio processing ❌ 渠道配错
云雾 /v1/audio/speech + qwen3-tts-flash 500 not implemented
云雾 /v1/audio/speech + gpt-4o-mini-tts 200,返回真 MP3 ❌ 无时间戳
云雾 /v1/audio/transcriptions + whisper-1 两次均失败(上游饱和 / 返回 HTML 首页) ⚠️ 实测不可靠
MiniMax 官方 api.minimaxi.com/v1/t2a_v2 鉴权通过,但 1008 insufficient balance ✅ 充值后可用
阶跃 api.stepfun.com/v1/audio/speech + step-tts-2 402 quota_exceeded
阶跃订阅端点 step_plan/v1 + step-tts-2 404 no access ❌ 订阅额度不含 TTS

核心结论:走云雾拿不到词级时间戳,这条路是死的。 唯一硬阻塞是给 MiniMax 官方账号充值。

#11.3 中间表示(IR)设计要点

这是整套自动化的地基:

  1. 两段式时间轴:LLM 只写相对时序anchor 锚点),绝不写绝对毫秒。TTS 出音频后由确定性代码烘焙成绝对 startMs/durationMs
  2. 画面切换点绑到旁白的词anchor: { type: "word" | "phrase" }——这是「专业感」的技术来源。
  3. 素材池化 + 内容寻址:asset 用 sha256 命名,跨项目复用与缓存。
  4. shot 与 renderer 解耦renderer: "remotion" | "scribe" | "manim" | "wemark"
  5. 合规字段内置,不是事后补丁。

核心类型(TypeScript):

export interface Shot {
  id: string;
  renderer: "remotion" | "scribe" | "manim" | "wemark";
  anchor:
    | { type: "sceneStart"; offsetMs?: number }
    | { type: "word"; wordIndex: number }
    | { type: "phrase"; matchText: string };   // 说到"注意力机制"时切入
  holdUntil?: { type: "nextShot" } | { type: "word"; wordIndex: number } | { type: "sceneEnd" };
  template: ShotTemplate;
  animations?: Animation[];
  subtitle?: boolean;
}

export type ShotTemplate =
  | { kind: "titleCard"; title: string; subtitle?: string; kicker?: string }
  | { kind: "bulletCard"; heading: string; bullets: string[]; revealPerBullet: boolean }
  | { kind: "kenBurns"; asset: AssetRef; from: Rect; to: Rect; caption?: string }
  | { kind: "bRoll"; asset: AssetRef; fit: "cover" | "contain"; overlayText?: string; muteSource: true }
  | { kind: "compareTable"; headers: string[]; rows: string[][]; highlightRow?: number }
  | { kind: "chart"; chartType: "bar" | "line" | "pie"; data: Array<{ label: string; value: number }> }
  | { kind: "codeBlock"; lang: string; code: string; highlightLines?: number[][] }
  | { kind: "quote"; text: string; author?: string; sourceUrl?: string }
  | { kind: "diagram"; nodes: Array<{id: string; label: string; x: number; y: number}>; edges: Array<{from: string; to: string}> }
  | { kind: "formula"; latex: string; explainParts?: Array<{ part: string; note: string }> }
  | { kind: "scribeDraw"; lineArtAsset: AssetRef; drawDurationMs: number }
  | { kind: "manimScene"; sceneName: string; pythonSrc: string };

烘焙算法(确定性代码,LLM 不许参与)

export function bakeScene(scene: Scene, words: Word[], audioDurationMs: number) {
  const resolveAnchor = (a: Shot["anchor"]): number => {
    if (a.type === "sceneStart") return a.offsetMs ?? 0;
    if (a.type === "word") return words[Math.min(a.wordIndex, words.length - 1)].startMs;
    const idx = findPhraseStart(words, a.matchText);
    if (idx < 0) throw new Error(`[bake] 场景 ${scene.id} 找不到锚点短语「${a.matchText}」`);
    return words[idx].startMs;
  };

  const starts = scene.shots.map((s) => resolveAnchor(s.anchor));
  // 单调性校验:anchor 必须严格递增,否则是分镜排序错了 —— 硬失败,不要静默排序
  for (let i = 1; i < starts.length; i++) {
    if (starts[i] <= starts[i - 1]) {
      throw new Error(`[bake] ${scene.shots[i].id} 的 anchor 未晚于前一镜`);
    }
  }
  return scene.shots.map((s, i) => ({
    id: s.id,
    startMs: starts[i],
    durationMs: (i + 1 < starts.length ? starts[i + 1] : audioDurationMs) - starts[i],
  }));
}

findPhraseStart 要做中文归一化(去标点、全半角、数字中文互换),匹配失败必须抛错,不能 fallback 到 0

#11.4 建议的 skill 划分

skill 触发 输入 → 输出 复用
/vid-brief 「找个科普选题」 主题/素材 id → 选题卡 + 5 个候选角度 复用 /broadcast 的选题→回溯调研两阶段
/vid-script 「写口播稿」「出分镜」 选题卡 → 母稿 + 口播稿 + spec.draft.json 复用 /broadcast 扩写;humanizer-zh 去 AI 味
/vid-assets 「配素材」 spec 占位 → 填满 assets + 素材清单(含 license) 复用 /imggpt-image-2)+ Pexels 链路 + Firecrawl
/vid-voice 「配音」「烘焙时间轴」 spec + 口播稿 → wav + words JSON + spec.baked.json 新增
/vid-render 「渲染」「重渲 s03」 baked spec → mp4 + 封面 + srt 复用 scribe 的 RQ 队列与音画差硬校验
/vid-publish 「出投稿物料」 成片 → 标题×3、简介、tag、章节目录、封面 3 版 复用 /email、封面 skill;biliup 投稿

两条边界要划死

  1. /vid-script 绝不产出绝对时间,只填 anchor。这条要写在 SKILL.md 醒目位置,否则模型一定会自己猜毫秒。
  2. /vid-render 绝不修改 spec。渲染失败就报错回上一步改,不允许「自动降级换成纯色卡」——那会产出看起来成功但内容错误的片子。

#11.5 MVP 路线图

阶段一:周末闭环(目标:一条 60-90 秒可看的片子)

  1. 建 monorepo 骨架:web(Next/Vercel) / render(Remotion) / packages/ir(共享类型)
  2. IR 只实现 3 个模板:titleCardbulletCardkenBurns
  3. 配音走 edge-tts(零成本),先不做词级时间戳——scene 内 shots 按字数比例分配时长
  4. 手写第一份 baked spec,别急着让 LLM 生成(先验证渲染器,不是验证 LLM)
  5. 本地 mac 渲染出 1080p30 mp4
  6. 写 15 行 check.ts:比对视频与音频时长,差 > 0.12s 退出码非 0
  7. 字体落地:得意黑 + Noto Sans SC + 霞鹜文楷,pyftsubset 子集化

验证:中文不豆腐、音画差 <0.12s、一条命令从 spec 到 mp4。 明确不做:控制台、队列、Supabase、tky 部署、词级时间戳、Manim、scribe 集成、LLM 生成 IR。

阶段一唯一目的:证明「JSON 进,mp4 出」这条管子是通的。 所有智能都是后面往管子里灌的东西。

阶段二:能稳定出片(2-4 周,每周 1-2 条 10 分钟)

  1. MiniMax 官方充值,切 t2a_v2 + subtitle_type: "word",anchor 走真实词时间戳
  2. 上 tky:vs-api + vs-worker@{1,2},形状照抄 scribe(注意:改 worker 代码必须重启 worker,只重启 api 没用
  3. 写全 6 个 skill,zod 校验 + anchor 单调性 + phrase 可匹配性做成硬闸门
  4. 模板补到 8-10 个(formula 先用 KaTeX 渲,不上 Manim)
  5. Vercel 控制台 + Remotion <Player> 审片 + 逐 shot 重渲按钮(把人工介入成本压到最低的关键)
  6. Supabase 建表 + 合规标识注入 + 成片自动发邮件

验证:全流程人工介入 <40 分钟/条;逐 shot 重渲 <60 秒;10 分钟片在 tky 渲染 <25 分钟;连续 5 条不出现「渲染成功但内容错」。

阶段三:工业化(1-3 个月)

scribe 白板 shot 插件(注意要改 scribe 写死的 1280×720/25fps)→ Manim shot 插件 → 增量渲染缓存(shot 级内容寻址,改一句话不该重渲 10 分钟)→ Vercel Sandbox 灾备 → biliup 半自动投稿 + 数据回流反哺选题打分。

#11.6 关键风险

① tky 渲染会触发 kworker 风暴(重点)。 Remotion 渲染会为每帧写一个临时 JPEG(10 分钟 30fps = 18000 个小文件),正是 inode_switch_wbs writeback 风暴的高危工作负载。防范:

# /etc/fstab —— 渲染临时目录放 tmpfs,直接消掉绝大部分小文件 writeback 压力
tmpfs /var/tmp/remotion tmpfs rw,size=16G,mode=1777,noatime,nodev,nosuid 0 0

并且:concurrency 压到 4(8 核机器留 4 核给 ffmpeg/TTS)、worker 只起 2 个、绝不用「每帧一次 ssh」的调度(任务提交走 HTTP API)、成片入对象存储后删本地中间产物。

② ffmpeg 在 Vercel Functions 上跑不了(永久封死)。 Hobby 最大 300 秒、2GB 内存/1vCPU、bundle 250MB、请求体 4.5MB、无持久文件系统——任何一条都足以致命。唯一能跑 ffmpeg/Chrome 的是 Vercel Sandbox(预装 Chrome 和 FFmpeg,Hobby 45 分钟/4vCPU/8GB,每月免费 5 CPU-hours + 420 GB-hours,约够 3-4 条片灾备)。注意 Sandbox 只在 iad1,跨区拉素材慢,别当主路径。

③ Remotion Lambda 被否:需接 AWS(唯一新增云厂商);Lambda 的价值是分布式并行切片渲染,而每天 1-3 条的产量并行度需求为零。

④ 渲染性能预期(未实测,需校准):8 核、concurrency 4、纯 Remotion 1080p30 大约 8-20 fps,10 分钟片(18000 帧)约 15-40 分钟。大量 B-roll 视频解码时明显变慢。阶段一务必自己跑一条 60 秒片测出真实吞吐。

⑤ 其他:Vercel Framework Preset 不会跟着框架自动变(Vite→Next 会静默 404);云雾两把 key 别混(文本 key ≠ 生图 key);edge-tts 必须串行;Remotion 不支持 Alpine(Docker 化时 base image 别选 alpine)。

#11.7 这套方案的天花板(诚实评估)

能稳定做到:一条 8-15 分钟的「旁白 + 信息卡 + 图解 + B-roll」型讲解视频,视觉水准约等于「制作认真的 PPT 讲解 + 专业字幕 + 有节奏的镜头切换」。字幕、音画同步、视觉一致性、合规标识这些「手工做很烦但机器做很稳」的部分,机器会做得比人好。稳定期每天 1-3 条,人工介入 20-40 分钟/条,边际成本 ¥1-3/条。

必须人工介入

  1. 选题判断——LLM 能列 20 个选题,但排序质量取决于对受众的直觉。这是唯一真正影响成败的环节。
  2. 事实核查——最危险的是「似是而非的技术解释」:听起来通顺、术语正确、但因果关系是错的。LLM 自查不出来。这是不可省的 10-15 分钟。
  3. 类比的设计——「注意力就是查字典」这种好类比是整条视频的价值核心,也是 LLM 最容易给出平庸版本的地方。
  4. 节奏与情绪——TTS 给的是「标准朗读」不是「讲解」。这是自动化视频和人类视频最明显的质感差距。
  5. 标题与封面——点击率是玄学,判断权在人。
  6. 争议性内容的表述分寸

明确做不到

  • 3Blue1Brown 级别的信息设计——那是数学直觉的创作,不是渲染技术问题。上了 Manim 只是「有能力渲染出来」,想不出来还是想不出来。
  • 有说服力的人声演绎——想要真正的听感只能自己配音(此时流水线依然有用:把配音塞进 IR 的 audio 字段,时间轴照样自动烘焙)。
  • Manim 脚本的正确性——LLM 写的 Manim 场景「动画是不是在讲对的东西」必须人验,这个环节的人工成本可能比它省下的时间更多。

一句实话:这套系统的真实价值不是「AI 自动做视频」,而是把视频制作里 80% 的机械劳动(配音、对齐、排版、切镜、字幕、合规、导出)压缩到接近零,把全部时间花在选题、事实核查和类比设计这三件只有人能做的事上

如果期待「输入一个主题、第二天自动涨粉」,会失望。如果期待「把做一条视频的时间从 8 小时压到 40 分钟」,能做到。

#11.8 立即可执行的三件事

  1. 给 MiniMax 官方账号充值(最小额度)——整套方案唯一的硬阻塞。词级时间戳只有 MiniMax 原生 t2a_v2 给得了,云雾这条路已实测为死路。
  2. 在云雾后台建一把新项目的 key(按「一项目一把 key」约定)。确认云雾只有 gpt-4o-mini-tts/tts-1 系可用于 TTS。
  3. tky 上加 tmpfs 挂载点/var/tmp/remotion,16GB)——在写第一行渲染代码之前就做掉,比事后排查 kworker 风暴便宜得多。

#12. 交叉核对:本轮抓到的错误与存疑项

#12.1 已核实的错误(已在正文修正)

说法 来源 核实结果
ManimCommunity/manim 有 89k stars 子 agent 报告 ❌ 实际 39.8k(已抓 GitHub 页面核实)
MoneyPrinterTurbo「横屏长视频 ✓ 可用」 子 agent 报告 误导。100.4k stars 是真的,但 README 示例视频全是 14-59 秒;参数支持 1080p 横屏 ≠ 整条 pipeline 适合长视频
Remotion「本地完全免费」 子 agent 报告 不准确。是自定义商业许可(GitHub license 字段 NOASSERTION):个人/≤3 人组织免费,4 人及以上需买 Company License;人头跨实体叠加
WhisperX 是中文词级对齐的推荐方案 常见说法 ❌ 其默认对齐模型不含中文,需自行找 phoneme-based 模型。中文应优先 TTS 原生时间戳,兜底 whisper.cpp
回形针停更是因为产能/商业不可持续 常见误传 ❌ 实为 2021 年 6 月团队成员境外言论风波 → 主动停更 → 7 月全平台封禁。是合规案例
云雾中转可以调 MiniMax TTS 拿词时间戳 合理推测 ❌ 实测 8 次:t2a_v2 404,MiniMax 渠道是 task-based 不支持语音,qwen3-tts-flash not implemented。只有 gpt-4o-mini-tts 可用且无时间戳

#12.2 需要打问号的说法

说法 问题
Fish Audio「盲测 65.7% 胜率 vs ElevenLabs」「S2 Pro 评分 8.11 vs ElevenLabs V3 的 2.36」 这是厂商自测数据(来源是 fish.audio 自己的 blog),且同一份报告里 60% / 65.7% 两个数字自相矛盾,8.11 vs 2.36 的差距离谱得不可信。不要作为选型依据,自己跑一段中文实测
「即梦 Seedance 2.0 / 2.5」 版本号无法确认(本轮 WebSearch 配额已用满 200 次)。已知字节的 Seedance 到 1.0(2025)。用前自己去即梦官网核
「Gemini Omni」模型 高度怀疑是把 Google Gemini 和 OpenAI GPT-4o 的 "omni" 命名嫁接了。未找到该模型存在的证据
「Vox 风格已有专门的 agent skill 流水线」 扫了 GitHub topic 和 MCP 市场未发现。存疑
中文口播语速的坊间三个区间 ✅ 已查明差异来源:播音专业标准是 250-260 字/分钟(依据人耳辨析率 4-5 字/秒);坊间 180-220 / 200-260 / 220-280 的差异来自「是否计入换气停顿」「内容类型」「年代变化」。没有找到专门针对中文科普/知识区口播的官方语速统计——B 站和 YouTube 创作者学院均未公开发布过。本文给的 220-250 是工程估算值,务必自己实测
科普长视频的分钟级结构占比表 ⚠️ 是从短视频口播三段式外推推算的,未找到专门针对 8/15/25 分钟横屏科普长视频的公开分钟级模板
「程序化路径后续 1-3 小时出 10 分钟视频」 偏乐观。模板搭好后重渲染很快,但每期分镜设计、素材准备、卡点校对仍是主要工时,这块省不掉
文生视频失败率 12-22% 的具体数字 各工具的具体百分比为估算/口碑汇总,非严格实测。量级(15-20%)可信,精确值不可信
各类工时与成本估算 正文已逐项标注「估算」。凡标估算的均为经验值折算,非权威统计
渲染性能 8-20fps / 10 分钟片 15-40 分钟 未实测,必须自己跑一条测出真实吞吐
AIGC 隐式标识元数据的具体字段结构 办法要求「包含服务提供者名称/编码、内容编号」,但配套国标的精确字段名未核实到原文。上线前查一次现行国标条文

#12.3 调研过程说明

  • 8 个 agent 中 1 个(端到端工程手册)首次运行因 API 连接中断失败。重跑时 firecrawl 服务持续返回 502(重试 5 次以上),WebSearch 配额也已耗尽,最终改用 WebFetch 抓 DuckDuckGo HTML 结果页 + 逐页抓正文完成,部分知乎/百度文库页因反爬 403 已用同主题转载版替代。第 7 章的来源强度因此低于其他章节,凡推导内容已就地标注。
  • 本轮 WebSearch 配额(200 次)在核对阶段用满,末段的两个存疑项(Seedance 版本号、Gemini Omni)无法当场验证,已如实标注而非略过。
  • 各子 agent 明确写出「未找到可靠来源」的项目(如 Notion 官方 Shot List 字段、Riverside Magic Clips 额度、B 站「看点」官方操作步骤、部分创作者的工时数据)均未做推断填充。

#附录 A:可直接用的 ffmpeg 配方

# ── 响度归一化(讲解类 -16 LUFS)────────────────────────
# 单遍(够用)
ffmpeg -y -i raw.wav -af "loudnorm=I=-16:TP=-1.5:LRA=11,aresample=48000" \
       -ac 1 -c:a pcm_s16le out.wav

# 双遍(更准):第一遍测量
ffmpeg -i input.wav -af loudnorm=I=-16:TP=-1.5:LRA=11:print_format=json -f null - 2>&1 | grep -A 10 Loudness
# 第二遍代入 measured_* 参数

# ── 权威时长(不要信 TTS 返回的 duration 字段)──────────
ffprobe -v error -show_entries format=duration -of csv=p=0 scene.wav

# ── whisper.cpp 兜底前的转码(必须 16kHz 单声道)─────────
ffmpeg -y -i scene.wav -ar 16000 -ac 1 -c:a pcm_s16le scene.16k.wav

# ── 烧 ASS 字幕(必须带 fontsdir,否则中文静默变豆腐块)──
ffmpeg -y -i video.mp4 \
  -vf "subtitles=sub.ass:fontsdir=/path/to/fonts" \
  -c:v libx264 -crf 18 -preset medium -pix_fmt yuv420p -c:a copy out.mp4

# ── 带转场拼接(1 秒交叉淡化,音频同步淡化)──────────────
ffmpeg -i a.mp4 -i b.mp4 \
  -filter_complex "[0:v][1:v]xfade=transition=fade:duration=1:offset=4[v];[0:a][1:a]acrossfade=d=1[a]" \
  -map "[v]" -map "[a]" out.mp4
# 可选转场:fade wipeleft/right/up/down slideleft/right/up/down
#           circlecrop rectcrop fadeblack fadewhite radial
#           smoothleft/right/up/down circleopen/close dissolve pixelize
#           diagtl diagtr diagbl diagbr

# ── 直接拼接(格式完全一致时最快)─────────────────────
# concat.txt 内容:file 'a.mp4' / file 'b.mp4'
ffmpeg -f concat -safe 0 -i concat.txt -c copy out.mp4

# ── 混 BGM(旁白 1.0,BGM 0.2)─────────────────────────
ffmpeg -i narration.wav -i bgm.mp3 \
  -filter_complex "[0]volume=1.0[a];[1]volume=0.2[b];[a][b]amix=inputs=2:duration=first[out]" \
  -map "[out]" mixed.wav

# ── 成片编码:YouTube/B站 1080p ──────────────────────
ffmpeg -i input.mov -c:v libx264 -preset slow -crf 18 \
  -c:a aac -b:a 128k -pix_fmt yuv420p out_1080p.mp4

# ── 4K ─────────────────────────────────────────────
ffmpeg -i input.mov -c:v libx264 -preset slow -crf 20 \
  -s 3840x2160 -r 30 -b:v 15M -c:a aac -b:a 192k out_4k.mp4
# 码率参考:1080p60 6-8Mbps / 1440p60 10-15 / 4K30 15-25 / 4K60 40-60

# ── AIGC 隐式标识注入(字段结构待按现行国标核实)─────────
ffmpeg -y -i final_raw.mp4 -c copy -movflags use_metadata_tags \
  -metadata "AIGC={\"Label\":\"1\",\"ContentProducer\":\"<你的标识>\",\"ProduceID\":\"<内容编号>\"}" \
  -metadata comment="本视频含 AI 生成内容(AI 语音合成旁白 / 部分 AI 生成插画)" \
  final.mp4

# 验证元数据写进去了
ffprobe -v error -show_entries format_tags -of json final.mp4

:合规标识注入应放在最后的 mux 阶段统一做,不要放进渲染引擎——这样法规变了只改一处。


#附录 B:可商用中文字体白名单

#已核实为 SIL OFL 1.1(放心用)

字体 用途 核实
得意黑 Smiley Sans 标题 / 封面大字(斜切设计感强) LICENSE 明文 + GitHub license 字段均为 OFL-1.1
霞鹜文楷 LXGW WenKai 引文 / 旁注(楷体,长句阅读友好) GitHub license 字段 OFL-1.1
思源黑体 / Noto Sans SC 正文 / 字幕(字重齐全、覆盖最全) LICENSE 文件为 OFL 1.1(注意:GitHub 探测器对这两个仓库识别为 NOASSERTION/null,需人工开 LICENSE.txt 确认)
JetBrains Mono 代码 / 数字(配 Noto Sans SC fallback) OFL

保守推荐组合(全 OFL,零法律风险):

标题     → 得意黑 Smiley Sans
正文/字幕 → Noto Sans SC
引文     → 霞鹜文楷 LXGW WenKai
代码/数字 → JetBrains Mono + Noto Sans SC fallback

#声称免费商用但许可原文未核实(用前必须自己下协议看)

MiSans(小米)、HarmonyOS Sans(华为)、阿里巴巴普惠体、OPPO Sans、字节跳动系字体——官方均宣称免费商用,但都不是 OFL,通常附带「不得单独再售、不得改名分发」等条件。要用就把授权协议 PDF 下载存档。

#绝对禁止

苹方 PingFang SC、微软雅黑、方正系、汉仪系等系统自带或商业字体——不能用于商业视频分发。macOS 上开发最容易犯的错就是 CSS 里写了 font-family: "PingFang SC",本地看着好好的。

工程建议:把字体族名做成白名单枚举,在 schema 校验阶段就挡住 LLM 随手写 "PingFang SC"


#附录 C:完整报告索引

本文档是 8 份子调研的交叉核对汇总。原始详版报告(含更多代码示例和来源链接):

报告 内容
AI科普长视频TTS配音方案深度调研.md 15 个 TTS 方案详表、6 个开源方案硬件对比、生产级 Python 脚本
AI科普视频制作工具深度指南.md 34 个工具对照表、Manim/Motion Canvas/Remotion 代码示例、AI 特有画面工具链
AI_科普长视频素材指南.md 16+ 素材站参数对比、Epidemic Sound Content ID 机制、中国 fair use 边界
视频生成项目调研报告.md 40+ GitHub 项目表、学术项目、MCP 清单、ffmpeg 配方
端到端工程补充.md 脚本模板、语速核实、AI 味去除、封面元数据、切片工具、质检清单

这 5 份原始报告已一并拷到 ~/Desktop/AI科普长视频-原始调研报告/(scratchpad 会话结束后会被清理,所以做了备份)。本文档是它们交叉核对后的结论层,原始报告里的个别数据已在本文档第 12 章被驳回或修正,两者冲突时以本文档为准。


调研完成:2026-07-30

来源:沉淀/02-AI与API/AI科普长视频制作全景调研.md(整理于 2026-08-18)