AI 科普视频:工具与项目盘点
本篇合并「工具深度指南」与「视频生成开源项目调研」两份报告,作为工具/项目盘点参考。
#一、制作工具深度指南
#AI 科普类横屏长视频的画面和动效制作工具深度指南
#目录
#工具对照总表
| 工具 | 类型 | 上手难度 | 价格 | 适合的画面类型 | 自动化能力 |
|---|---|---|---|---|---|
| After Effects | 传统动效 | ⭐⭐⭐⭐ | $22.99/月(订阅) | 文字动画、粒子、发光、过渡 | ⚠️ 需手工关键帧 |
| Premier Pro | 视频剪辑 | ⭐⭐⭐ | $22.99/月 | 基础过渡、标题、色彩分级 | ⚠️ 中等 |
| DaVinci Resolve | 剪辑+合成 | ⭐⭐⭐ | $295(永久) | Fusion 节点合成、VFX、字幕 | ✅ 开源免费版可用 |
| 剪映专业版 | 快速剪辑 | ⭐⭐ | 免费(VIP 部分功能) | 转场、文字、滤镜、字幕 | ✅ AI 文字识别、自动卡点 |
| CapCut | 短视频编辑 | ⭐⭐ | 免费 | 效果库、模板、音乐踩点 | ✅ AI 驱动高 |
| Manim/ManimCE | 代码动画 | ⭐⭐⭐⭐⭐ | 免费(开源) | 数学公式、几何动画、图表 | ✅ 完全程序化 |
| Motion Canvas | TypeScript 动画 | ⭐⭐⭐⭐ | 免费(开源) | 可视化、数据展示、教学 | ✅ 代码驱动 + 实时预览 |
| Remotion | React 视频 | ⭐⭐⭐⭐ | 免费(开源) | 数据驱动、批量生成、CI/CD | ✅ 最高自动化 |
| p5.js + p5.capture | 交互动画 | ⭐⭐⭐ | 免费 | 创意可视化、交互演示 | ✅ 完全代码 |
| Rive | 骨骼动画 | ⭐⭐⭐ | $50+/月 | 角色动画、交互动画 | ✅ 实时交互 |
| Lottie | JSON 动画 | ⭐⭐ | 免费 | AE 导出动画、轻量级效果 | ✅ 完全导出 |
| Blender | 3D + 2D | ⭐⭐⭐⭐⭐ | 免费(开源) | 3D 示意图、Grease Pencil 手绘 | ✅ 程序化(Geometry Nodes) |
| Screen Studio | 屏幕录制 | ⭐⭐ | $149/年 | 缩放跟随、代码演示、过渡 | ✅ 自动跟踪鼠标 |
| Camtasia | 屏幕录制+编辑 | ⭐⭐⭐ | $249(永久) | 屏幕录制、标注、缩放 | ✅ 编辑工具齐全 |
| ScreenFlow | 屏幕录制(Mac) | ⭐⭐ | $129(一次性) | 高质量录制、多轨道音频 | ✅ Mac 原生性能好 |
| VideoScribe | 白板手绘 | ⭐⭐ | 订阅制 | 手绘动画、讲解视频 | ✅ 一键手绘 |
| Doodly | 白板手绘 | ⭐ | 订阅制 | 极简手绘、快速出片 | ✅ 最简单 |
| Carbon/CodeSnap | 代码截图 | ⭐ | 免费 | 代码片段展示、高亮 | ⚠️ 静态 |
| Asciinema | 终端录制 | ⭐⭐ | 免费 | 命令行演示、可导出 GIF | ✅ 可程序化 |
| Excalidraw | 手绘图表 | ⭐⭐ | 免费(开源) | 系统设计图、流程图 | ⚠️ 手动绘制 |
| Mermaid | Diagrams-as-code | ⭐⭐⭐ | 免费(开源) | 流程图、序列图、Gantt | ✅ 完全代码 |
| tldraw | 无限白板 | ⭐⭐ | 免费(开源) | 头脑风暴、实时协作图 | ✅ 可集成 |
| Sora 2 | 文生视频 | ⭐ | API 计费 | B-roll、场景转换 | ✅ 完全 AI |
| 可灵(Kling) | 文生视频 | ⭐ | 按次计费 | 真人讲解、自然场景 | ✅ 支持数字人 |
| 即梦 4.0 | 文生视频 | ⭐ | 按次计费 | 多场景、快速迭代 | ✅ 与 CapCut 集成 |
| Veo 3 | 文生视频 | ⭐ | API 计费 | 高保真、动态分辨率 | ✅ 动态调整 |
| Runway Gen-4 | 文生视频 | ⭐ | 订阅制 | 风格一致、多镜头 | ✅ 强大控制 |
| Pika 3.0 | 文生视频 | ⭐ | 按次计费 | 概念验证、快速生成 | ✅ 实时预览 |
| HeyGen | 数字人讲解 | ⭐⭐ | 订阅制 | AI 虚拟主播、多语言 | ✅ 自动唇形同步 |
| Synthesia | 数字人讲解 | ⭐⭐ | 订阅制 | 企业培训、多语言讲解 | ✅ 自动生成 |
| 腾讯智影 | 数字人讲解 | ⭐⭐ | 按次计费 | 中文讲解、本地化 | ✅ 快速生成 |
| Invideo | 一键成片 | ⭐ | 订阅制 | 脚本→视频、模板库 | ✅ 完全自动 |
| Pictory | 一键成片 | ⭐ | 订阅制 | 文章→视频、字幕自动 | ✅ 完全自动 |
| Fliki | 一键成片 | ⭐ | 订阅制 | 长文本转视频、多 AI 模型 | ✅ 集成 Kling/Veo |
| Midjourney | 文生图 | ⭐⭐ | $20/月起 | 概念图、背景板、插图 | ✅ 批量生成 |
| FLUX.2 | 文生图 | ⭐⭐ | 付费 API | 逼真背景、光影细节 | ✅ 可编程调用 |
| 即梦 AI | 文生图 | ⭐⭐ | 按次计费 | 中文理解、社交媒体素材 | ✅ 快速出图 |
| GPT-Image | 文生图 | ⭐ | 付费 API | 多轮迭代、精细控制 | ✅ 程序化集成 |
#一、传统剪辑/动效路线
#1. Adobe After Effects
最适合:专业级科普动画制作、复杂动效、插件生态强
核心优势:
- 插件生态庞大(Deep Glow 发光、Motion Bro 转场库、Flow Universe 流体、Animation Composer 预设库)
- 和 Premiere Pro 无缝协作
- Motion Graphics 模板丰富
学习曲线:⭐⭐⭐⭐(陡峭,需学习关键帧、表达式、Layer Styles)
价格:
- 订阅:$22.99/月(单应用)或 $54.99/月(全套 Creative Cloud)
- 学生:$19.99/月(首年)
- 无永久版
推荐插件:
- Deep Glow 2 - 专业辉光效果
- Motion Bro - 转场和动画库
- Animation Composer - 预设和工具库
不适合:预算有限、快速出稿、需要代码驱动的自动化
#2. Premiere Pro
最适合:视频主编辑、快速迭代、与 AE 配合使用
学习曲线:⭐⭐⭐(相对平缓,专注于编辑而非动效)
价格:同 After Effects($22.99/月)
特色功能:
- Lumetri 色彩分级
- Essential Graphics 快速字幕和图形
- 和 After Effects 合成嵌入无缝
不适合:复杂的粒子和 3D 动画
#3. DaVinci Resolve 及 Fusion
最适合:预算受限、需要 Fusion 节点合成的科普视频、开源友好
学习曲线:⭐⭐⭐(Resolve 编辑友好,Fusion 较陡)
价格:
- Studio 版本:$295(永久一次性购买)
- 免费版(DaVinci Resolve Community)功能已经很全,足以做科普
- 支持学生免费升级
核心优势:
- Fusion 是专业级合成引擎(节点流程)
- 集剪辑、特效、调色于一体
- 免费版非常强大(仅限制分辨率和部分编码)
- Krokodove 工具集 100+ 运动图形效果
Fusion 适合画面:粒子系统、3D 场景、复杂蒙版、矩阵动画
不适合:预订阅的工作流(必须离线)
#4. 剪映专业版 / CapCut
最适合:快速出稿、AI 驱动、中文用户、社交媒体
学习曲线:⭐(极低,开箱即用)
价格:
- 完全免费(部分高级功能 VIP)
- CapCut 国际版亦免费
核心优势:
- AI 自动卡点、字幕识别、背景移除
- 海量转场和特效模板库(千万级)
- 支持关键帧和精细调节
- 集成数字人讲解
不适合:专业级混音、节点合成、复杂 3D
#5. Final Cut Pro
最适合:Mac 用户、4K/8K 工作流、苹果生态深度集成
价格:$300(一次性购买,包含 Motion 和 Compressor)
学习曲线:⭐⭐⭐⭐
vs Premiere Pro:FCP 偏向于高帧率编辑,Premiere 更有插件生态
#二、代码化动画路线(重点)
#1. Manim / ManimCE
最适合:数学科普、公式推导、结构性知识
是什么:Grant Sanderson(3Blue1Brown)创建的开源 Python 框架,专为数学视频动画设计
学习曲线:⭐⭐⭐⭐(需要 Python 基础)
价格:完全免费、开源
核心特性:
- 直观的数学对象 API(圆形、矩形、箭头、LaTeX 公式)
- 关键帧和曲线插值
- 摄像机系统(缩放、平移、旋转)
- 支持 SVG、图片、视频嵌入
适合的画面:
- 数学公式推导
- 几何图形变换
- 函数动画
- 神经网络结构展示(配合自定义)
- 数据可视化
GitHub 仓库:
示例代码框架:
from manim import *
class NeuralNetworkAnimation(Scene):
def construct(self):
# 创建三层神经网络
layer1 = VGroup(*[Circle(radius=0.3) for _ in range(3)])
layer2 = VGroup(*[Circle(radius=0.3) for _ in range(4)])
layer3 = VGroup(*[Circle(radius=0.3) for _ in range(2)])
# 排列
layer1.arrange(DOWN, buff=0.5)
layer2.arrange(DOWN, buff=0.5).shift(RIGHT * 3)
layer3.arrange(DOWN, buff=0.5).shift(RIGHT * 6)
# 动画
self.play(Create(layer1), Create(layer2), Create(layer3))
# ... 绘制连接线、激活函数等渲染耗时:
- 短片(30-60 秒):5-30 分钟(取决于复杂度和 CPU)
- 可配置分辨率(1080p 推荐;4K 需更强 CPU)
社区资源:
- ManimGL - 3D 加速版
- Manim docs
- 社区模板库(GitHub Topics: manim)
#2. Motion Canvas
最适合:TypeScript 程序员、实时预览、精细动画控制
是什么:现代 TypeScript 库,集代码编写与可视化编辑器于一身
学习曲线:⭐⭐⭐(React 背景更容易上手)
价格:完全免费、开源
核心特性:
- TypeScript 强类型语言编写
- 内置可视化时间轴编辑器(Vite 驱动)
- 实时热重载和预览
- 支持 canvas 和 SVG 渲染
- 内置缓动函数和关键帧系统
适合的画面:
- 数据可视化动画
- 教学演示
- UI/UX 展示
- 信息图表动画
GitHub 仓库:
示例代码框架:
import { makeScene2D, Circle, Rect } from '@motion-canvas/2d';
import { all, sequence } from '@motion-canvas/core';
export default makeScene2D(function* (view) {
const circle = new Circle({
size: 100,
fill: '#FF0000',
});
const rect = new Rect({
width: 200,
height: 100,
fill: '#00FF00',
x: 300,
});
view.add(circle, rect);
yield* sequence(
circle.scale(2, 1),
all(
circle.position.x(300, 1),
rect.opacity(0.5, 1),
),
);
});优势对比:
- vs Manim:更现代化的 DX,热重载快
- vs Remotion:更专注于动画本身,而非数据驱动
#3. Remotion
最适合:React 开发者、数据驱动视频、批量自动化生成、CI/CD 集成
是什么:用 React 组件编写视频、完全代码驱动、可通过 Lambda 云渲染
学习曲线:⭐⭐⭐(React 和 Node.js 基础必需)
价格:
- 本地:完全免费
- 云渲染(Remotion Lambda):按计算时间付费
核心特性:
- 每一帧作为 React 组件
- 支持动态数据绑定(JSON、CSV、API)
- Lambda 云渲染(CI/CD 友好)
- 支持字幕、音频同步
- Vercel 和 GitHub 集成
适合的画面:
- 数据报表视频(自动生成)
- 个性化祝福视频(批量生成)
- 动态 UI 展示
- 科学数据动画
GitHub 仓库:
- remotion-dev/remotion
- 官方模板库
- 社区示例丰富
示例代码框架:
import React from 'react';
import { Composition } from 'remotion';
const MyVideo: React.FC<{ data: number[] }> = ({ data }) => (
<div style={{ width: '100%', height: '100%', background: '#fff' }}>
{data.map((value, i) => (
<div
key={i}
style={{
height: `${value * 10}px`,
width: `${100 / data.length}%`,
background: '#0066cc',
}}
/>
))}
</div>
);
export const RemotionRoot: React.FC = () => {
return (
<Composition
id="MyComposition"
component={MyVideo}
durationInFrames={300}
fps={30}
width={1920}
height={1080}
defaultProps={{ data: [10, 20, 15, 30, 25] }}
/>
);
};优势对比:
- vs Manim:天然支持数据绑定和批量生成
- vs Motion Canvas:云渲染和 CI 集成能力更强
#4. p5.js + p5.capture
最适合:创意编程、交互式演示、网页内嵌动画
学习曲线:⭐⭐(JavaScript 基础足够)
价格:完全免费、开源
核心特性:
- 易上手的 JavaScript 库
- Canvas 绘图 API 封装
- 丰富的变换和缓动函数
- p5.capture 支持录制为 WebM、MP4、GIF
适合的画面:
- 粒子系统
- 数据散点图动画
- 交互式演示
- 创意可视化
GitHub 仓库:
不适合:复杂的 3D(p5.js 3D 性能有限)和数学公式绘制(Manim 更适合)
#5. Rive + Lottie
最适合:轻量级动画导出、跨平台使用
Lottie 工作流:
- 在 After Effects 中设计动画
- 用 Bodymovin 或 Lottie 插件导出 JSON
- 在网页、移动应用或视频中嵌入
Rive 优势:
- 比 Lottie 文件更小
- 支持骨骼动画
- 可导入 Lottie 动画再编辑
- Rive 生成的 .flr2d 格式比 JSON 更高效
在视频中使用:
- 配合 Remotion 或 Motion Canvas 嵌入
- 或在 Blender 中导入再渲染
- 或在 After Effects 中以预合成形式引入
GitHub 仓库:
- airbnb/lottie-web - web 播放器
- rive-app/rive-wasm - WebAssembly 版本
#6. Blender(3D 科普画面)
最适合:3D 示意图、分子结构、器官演示、Grease Pencil 手绘
学习曲线:⭐⭐⭐⭐⭐(陡峭,但社区资源丰富)
价格:完全免费、开源
核心特性(Blender 4.3+):
- Grease Pencil 2D 动画与 Geometry Nodes 集成
- Geometry Nodes 程序化生成几何
- 物理模拟(粒子、流体、烟雾)
- Shader 材质系统
- Motion Tracking 追踪
科普应用:
- DNA 螺旋结构动画
- 化学分子模型
- 解剖学 3D 演示
- 物理场景模拟(重力、碰撞)
- Grease Pencil 手绘标注 3D 物体
示例工作流:
- 导入或建模 3D 物体(分子、器官)
- 用 Geometry Nodes 参数化生成变体
- 设置摄像机路径和关键帧
- 在 Grease Pencil 中手绘标注或动画
- 渲染为视频(支持 OpenGL、Eevee、Cycles)
Grease Pencil + Geometry Nodes(Blender 4.3):
- 创建程序化的 2D 描边效果
- 动态生成线条和形状
- 组合 3D 和 2D 美学
GitHub 仓库:
- blender/blender
- Geometry Nodes 社区资源库(Sketchfab)
- Grease Pencil 教程(BlenderStudio)
渲染耗时:
- 简单场景:5-30 分钟
- 复杂光照/特效:1-4 小时(取决于采样和分辨率)
- 可配置 GPU 加速(CUDA/HIP/OptiX)
#三、AI 生成画面
#1. 文生视频(B-roll 生成)
核心工具对比(2026):
| 工具 | 分辨率 | 适合场景 | 失败率 | 价格 | 最强点 |
|---|---|---|---|---|---|
| Sora 2 | 4K@60fps | 通用 B-roll | ~15% | API 按次 | 分辨率和真实感 |
| 可灵 3.0 | 1080p@30fps | 数字人讲解、转场 | ~20% | ¥0.3-0.5/次 | 支持数字人、中文理解 |
| 即梦 4.0 | 1080p@30fps | 快速社交媒体 | ~18% | 按次计费 | CapCut 原生集成 |
| Veo 3 | 可变分辨率 | 高保真场景 | ~12% | API 按次 | 动态分辨率、光影细节 |
| Runway Gen-4 | 1080p | 风格一致、多镜头 | ~16% | 订阅 $40+/月 | 风格一致性最强 |
| Pika 3.0 | 1080p | 概念验证 | ~22% | 按次计费 | 实时预览、快速迭代 |
失败场景(通用):
- 细致手部动作(特别是打字、弹奏)
- 复杂人脸表情同步
- 文字清晰显示
- 高精度物理模拟
- 连贯的多镜头叙事
成功场景:
- 自然风景转换
- 通用办公场景(会议、工作)
- 广泛镜头(人物讲解、走动)
- 转场和效果叠加
- 动物和自然动作
科普视频中的应用:
- 过场 B-roll(环境、天空、转场)
- 数字演示的背景
- 不需要精确细节的概念视频
- 不适合:精确的科学实验演示(会失真)
推荐流程:
写脚本 → 关键帧设计 → 用文生视频生成 B-roll
→ 在剪映/Premiere 中组合 → 配音和字幕#2. 文生图(科普插图和背景)
核心工具对比(2026):
| 工具 | 风格多样性 | 中文理解 | 文字渲染 | 价格 |
|---|---|---|---|---|
| Midjourney V8 | ⭐⭐⭐⭐⭐ | 一般 | 一般 | $20/月起 |
| FLUX.2 | ⭐⭐⭐⭐ | 一般 | ⭐⭐ | API 按次 |
| 即梦 AI | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐ | 按次计费 |
| Ideogram 4.0 | ⭐⭐⭐⭐ | 一般 | ⭐⭐⭐⭐⭐ | API 按次 |
| GPT-Image 2 | ⭐⭐⭐⭐ | ⭐⭐⭐ | ⭐ | API 按次 |
科普应用:
- 概念插图(抽象概念的视觉化)
- 背景板
- 角色设定
- 示意图的美化
提示词示例:
"diagram showing neural network architecture,
minimalist style, educational illustration,
network nodes connected by lines, clean lines,
no text, scientific diagram, scientific illustration style"不适合:
- 精确的科学数据可视化(用代码工具)
- 复杂的流程图(用 Mermaid/Excalidraw)
- 需要频繁修改的核心图表
#3. AI 数字人讲解
核心工具对比:
| 工具 | 语言支持 | 唇形同步 | 表情丰富度 | 价格 | 最强点 |
|---|---|---|---|---|---|
| HeyGen | 140+ 语言 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | $25-100/月 | 多语言真人感 |
| Synthesia | 160+ 语言 | ⭐⭐⭐⭐ | ⭐⭐⭐ | 企业定价 | 企业级安全 |
| 腾讯智影 | 主要中文 | ⭐⭐⭐ | ⭐⭐⭐ | 按次计费 | 中文本地化优化 |
| 剪映数字人 | 中英日韩 | ⭐⭐⭐ | ⭐⭐ | 免费(VIP) | 与 CapCut 无缝集成 |
科普视频应用:
- 虚拟讲师讲解概念
- 多语言科普内容
- 降低人工讲解成本
- 24/7 自动生成讲解视频
工作流:
准备脚本 (纯文本)
→ 选择虚拟讲师和语言
→ AI 自动生成唇形同步视频
→ 导出用于编辑限制:
- 虚拟感明显(非真人)
- 复杂肢体语言受限
- 表情库预设
#4. 一键成片工具
适用场景:长文本博客→视频、脚本→自动成片
核心工具对比:
| 工具 | 脚本输入 | 字幕自动 | 配音选项 | 模板库 | 价格 |
|---|---|---|---|---|---|
| Invideo | 文本/URL | ⭐⭐⭐⭐ | 150+ 声音 | 3000+ | $25+/月 |
| Pictory | 文章/脚本 | ⭐⭐⭐⭐⭐ | 自然语言 | 1000+ | $25+/月 |
| Fliki | 文本 | ⭐⭐⭐⭐ | 2000+ 声音 | 丰富 | $25+/月 |
| Descript | 视频/音频 | ⭐⭐⭐⭐⭐ | 文本转语音 | 中等 | $24+/月 |
工作流:
粘贴文章或脚本
→ AI 自动识别场景和匹配素材
→ 自动加字幕和配音
→ 调整后导出科普视频适用性:
- ⭐⭐⭐⭐ 快速原型(初稿验证)
- ⭐⭐ 精细学术讲解(因为自动化可能损失细节)
- ⭐⭐⭐⭐⭐ 新闻型科普(快速迭代、热点)
限制:
- 自动化可能选错素材
- 色调一致性一般
- 不适合特色品牌风格
#四、科普视频常见画面套路
#1. 动态字幕/关键词弹出
工具选择:
- After Effects:完全手工控制,插件 Motion Bro 有预设
- 剪映/CapCut:现成模板库,一拖即用
- Premiere Pro:Essential Graphics 面板快速生成
- Motion Canvas/Remotion:代码驱动,精确控制
效果类型:
- 弹出(Pop In)+ 缩放
- 打字效果(Typewriter)
- 滑入(Slide In)+ 旋转
- 模糊聚焦(Focus + Blur)
代码示例(Motion Canvas):
import { Text, slideInLeft, fadeIn } from '@motion-canvas/2d';
const keyword = new Text('Neural Network', {
fontSize: 48,
fill: '#FF0000',
});
view.add(keyword);
yield* sequence(
keyword.opacity(0, 0),
slideInLeft(keyword, 0.5),
keyword.fontSize(36, 0.3),
);#2. 屏幕录制 + 缩放跟随
最佳工具排序:
- Screen Studio($149/年)- 自动跟踪鼠标,智能缩放
- Camtasia($249 一次性)- 手工标注和缩放
- ScreenFlow($129,仅 Mac)- 高性能录制,无自动追踪
工作流:
录制屏幕操作
→ 自动追踪或手工关键帧缩放
→ 添加光标强调和转场
→ 导出为视频科普应用:
- 代码演示
- 软件教程
- 数据分析过程
- API 调试演示
#3. 白板手绘动画
最佳工具:
- VideoScribe(订阅)- 库存丰富,专业
- Doodly(订阅)- 极简易用,快速
工作流:
导入图片或元素
→ 设置画笔顺序
→ 自动生成手绘动画
→ 配置速度和样式
→ 导出Blender Grease Pencil 替代方案:
手工在 Grease Pencil 中画或导入 SVG
→ 设置描边顺序 → 录制科普应用:
- 讲解示意图
- 流程图演示
- 故事板讲述
#4. Ken Burns 静图运镜
实现方式:
- Premiere Pro:Position 和 Scale 关键帧
- After Effects:Transform Properties
- DaVinci Resolve:Inspector 中设置缩放和位置
- Remotion:spring 动画
代码示例(Remotion):
const StaticImagePan: React.FC = () => {
const frame = useCurrentFrame();
const fps = useVideoConfig().fps;
const duration = 5 * fps; // 5 秒运镜
const zoomLevel = interpolate(frame, [0, duration], [1, 1.5], {
extrapolateRight: 'clamp',
});
const panX = interpolate(frame, [0, duration], [0, -100], {
extrapolateRight: 'clamp',
});
return (
<img
src="landscape.jpg"
style={{
transform: `scale(${zoomLevel}) translateX(${panX}px)`,
width: '100%',
}}
/>
);
};#5. 数据图表动画
工具选择:
- D3.js + 屏幕录制:高度自定义
- Motion Canvas:内置图表库
- Remotion:Recharts 集成
- After Effects:Graph Editor 插件
- Python(matplotlib/plotly) + 屏幕录制
常见图表动画:
- 柱状图增长
- 折线图绘制
- 饼图分割
- 热力图渐变
#6. 代码高亮逐行演示
工具链:
- 代码截图:Carbon、CodeSnap、Chalk.ist 生成漂亮代码图片
- 逐行动画:
- After Effects 中手工关键帧高亮
- Motion Canvas 中用代码逐行显示
- Remotion 中循环遍历代码行
- 终端录制:Asciinema 录制命令行执行过程
Asciinema 工作流:
# 录制
asciinema rec demo.cast
# 导出为 SVG 动画
asciinema-player export demo.cast demo.svg
# 或转 GIF(需要 ffmpeg)
asciinema convert demo.cast demo.gif代码逐行演示(Motion Canvas 示例):
const codeLines = [
'function fibonacci(n) {',
' if (n <= 1) return n;',
' return fibonacci(n-1) + fibonacci(n-2);',
'}',
];
const texts = codeLines.map(
(line, i) =>
new Text(line, {
fontSize: 24,
y: i * 40,
opacity: 0,
}),
);
for (const text of texts) {
view.add(text);
yield* text.opacity(1, 0.5);
}#7. 分屏与画中画
实现方式:
- Premiere Pro / DaVinci:创建多个视频轨道,调整 Position 和 Scale
- After Effects:Precompose 和 Adjustment Layers
- Remotion:嵌套 Composition
科普应用:
- 代码+结果对比
- 原理讲解 + 应用演示
- 多语言字幕并行显示
#8. 转场节奏与音乐卡点
工具:
- 剪映:AI 自动卡点(最快)
- CapCut:同上
- Premiere Pro/After Effects:手工调节
- DaVinci:音频分析和可视化
科普视频节奏建议:
- 导入知识:2-3 秒/概念
- 深化讲解:5-8 秒/例子
- 转场间隔:0.5-1 秒
- 背景音乐节奏与视觉节奏同步
#五、AI 技术特有画面需求
#1. 神经网络结构图
工具选择排序:
最优:Manim
from manim import *
class NeuralNetworkVisualization(Scene):
def construct(self):
layers = VGroup()
# 输入层 (784 个神经元,但只显示部分)
input_neurons = VGroup(
*[Circle(radius=0.1) for _ in range(10)]
).arrange(DOWN, buff=0.1)
# 隐藏层 1 (128 个)
hidden1 = VGroup(
*[Circle(radius=0.08) for _ in range(8)]
).arrange(DOWN, buff=0.08).shift(RIGHT * 2)
# 输出层 (10 个)
output = VGroup(
*[Circle(radius=0.08) for _ in range(10)]
).arrange(DOWN, buff=0.1).shift(RIGHT * 4)
layers.add(input_neurons, hidden1, output)
# 绘制连接(采样)
connections = VGroup()
for neuron_in in input_neurons[:5]:
for neuron_hidden in hidden1[:3]:
line = Line(neuron_in, neuron_hidden, stroke_width=0.5)
connections.add(line)
self.add(layers, connections)
# 激活动画
self.play(LaggedStart(
*[Circle(radius=0.15, color=YELLOW).move_to(n.get_center())
for n in input_neurons],
lag_ratio=0.1
))次优:Blender 3D
- 可视化 3D 网络球体和连接线
- 支持光照和材质
- 可导出为视频
代替方案:
- Excalidraw(快速手绘)
- TikZ/PGF(LaTeX 精确绘制)
- Graphviz(自动布局)
开源库:
- netron - 神经网络模型可视化(ONNX、TensorFlow 等)
- tensornetwork - Google 张量网络库
#2. 注意力矩阵热力图
最优工具:Python matplotlib + Seaborn
import numpy as np
import matplotlib.pyplot as plt
import seaborn as sns
from matplotlib.animation import FuncAnimation
# 模拟注意力权重(seq_len x seq_len)
attention_weights = np.random.rand(12, 12) # 12 个 token
fig, ax = plt.subplots(figsize=(8, 8))
sns.heatmap(attention_weights, cmap='YlOrRd', ax=ax,
cbar_kws={'label': 'Attention Weight'})
ax.set_title('Transformer Attention Weights (Head 1)')
ax.set_xlabel('Key Token Position')
ax.set_ylabel('Query Token Position')
plt.savefig('attention.png', dpi=150, bbox_inches='tight')
plt.close()
# 然后用 p5.capture 或 Screen Studio 录制为视频工具对比:
- Python Matplotlib/Plotly(灵活,可编程)
- Tableau/Power BI(交互式,慢)
- After Effects(手工麻烦)
对应可视化工具:
- BertViz - Transformer 注意力可视化库
- Transformer Explainer(web) - 交互式演示(可截图导出)
#3. Loss 曲线动画
最简单:Python 动画脚本
import matplotlib.pyplot as plt
import matplotlib.animation as animation
import numpy as np
# 模拟 loss 数据
epochs = 100
losses = np.exp(-np.arange(epochs) / 20) + np.random.normal(0, 0.05, epochs)
fig, ax = plt.subplots(figsize=(10, 6))
line, = ax.plot([], [], lw=2, color='#FF6B6B')
ax.set_xlim(0, epochs)
ax.set_ylim(0, max(losses) * 1.1)
ax.set_xlabel('Epoch')
ax.set_ylabel('Loss')
ax.set_title('Training Loss Curve')
ax.grid(True, alpha=0.3)
def animate(frame):
x_data = np.arange(frame + 1)
y_data = losses[:frame + 1]
line.set_data(x_data, y_data)
return line,
ani = animation.FuncAnimation(fig, animate, frames=epochs,
blit=True, interval=50)
ani.save('loss_curve.mp4', fps=20)
plt.close()工具推荐:
- TensorBoard(实时监控)→ 屏幕录制
- Python + MoviePy(可编程)
- Plotly(交互式)
#4. Token 流动演示
最优方案:
Transformer Explainer 网页:
- 网址:https://poloclub.github.io/transformer-explainer/
- 交互式展示 Token 嵌入、位置编码、QKV 查询过程
- 截屏或录制为视频
代码动画(Motion Canvas):
import { makeScene2D, Text, Circle, Line } from '@motion-canvas/2d';
import { all, sequence } from '@motion-canvas/core';
export default makeScene2D(function* (view) {
const tokens = ['The', 'quick', 'brown', 'fox'];
// 创建 token 节点
const tokenNodes = tokens.map((text, i) => {
const circle = new Circle({
size: 60,
fill: '#4A90E2',
x: i * 150 - 200,
});
const label = new Text(text, {
fontSize: 20,
fill: 'white',
y: i * 150 - 200,
});
view.add(circle, label);
return { circle, label };
});
// Token 流动动画
for (let i = 0; i < tokenNodes.length; i++) {
yield* tokenNodes[i].circle.fill('#FF6B6B', 0.3);
yield* tokenNodes[i].circle.scale(1.2, 0.2);
yield* tokenNodes[i].circle.scale(1, 0.2);
}
});- BertViz(Python):
from transformers import AutoTokenizer, AutoModel
from bertviz import head_view
import torch
model_name = "bert-base-uncased"
model = AutoModel.from_pretrained(model_name, output_attentions=True)
tokenizer = AutoTokenizer.from_pretrained(model_name)
text = "The model generated a very detailed explanation"
inputs = tokenizer.encode(text, return_tensors='pt')
outputs = model(inputs)
attention = outputs[-1] # 所有头的注意力
# 可视化
head_view(attention, tokenizer.convert_ids_to_tokens(inputs[0]))#5. 论文截图高亮标注
工具链:
PDF 标注:
- macOS:Preview(自带)
- 跨平台:PDF.js + fabric.js
- 专业:Adobe Acrobat
截图后后处理:
- After Effects 或 Premiere:添加箭头和文字标注
- Motion Canvas:代码驱动的高亮和动画
开源方案:
from PIL import Image, ImageDraw, ImageFont
# 加载截图
img = Image.open('paper_page.png')
draw = ImageDraw.Draw(img)
# 绘制高亮框(黄色透明矩形)
highlight_box = (100, 200, 400, 250) # (x1, y1, x2, y2)
draw.rectangle(highlight_box, outline='yellow', width=3)
# 添加箭头指向关键部分
arrow_start = (450, 225)
arrow_end = (500, 225)
draw.line([arrow_start, arrow_end], fill='red', width=4)
# 添加文字注释
font = ImageFont.load_default()
draw.text((510, 210), "Key Finding", fill='red', font=font)
img.save('annotated_paper.png')科普视频应用:
- 逐帧动画展示论文核心发现
- 配合音频讲解
- 高亮重要公式和图表
#6. 完整科普视频工具栈示例
场景:讲解 Transformer 注意力机制
最优工具组合:
- 动画主体:Manim(神经网络结构)+ Motion Canvas(动态演示)
- 注意力热力图:Python Matplotlib + Seaborn
- 论文截图:PDF 标注 + After Effects 动画
- 屏幕录制:代码演示用 Asciinema 或 Screen Studio
- 视频合成:Premiere Pro 或 DaVinci Resolve
- 字幕/配音:剪映或 Descript
工作流:
(1) 用 Manim 生成核心动画 → 输出视频片段
(2) Python 脚本生成热力图动画 → 导入 Premiere
(3) 屏幕录制代码示例 → 编辑缩放关键帧
(4) 收集论文截图 → After Effects 标注 → 输出
(5) 所有素材在 Premiere 中组合
(6) 加字幕(Descript 自动生成)
(7) 导出最终视频总耗时:
- 脚本编写:2-4 小时
- 视频生成(Manim 渲染):1-2 小时
- 编辑合成:2-3 小时
- 总计:5-9 小时(不含修改迭代)
#科普视频工具速查表
#快速选择流程图
┌─ 预算充足(>$500/年)
│ ├─ 需要传统 UI 编辑 → After Effects + Premiere Pro
│ └─ 需要 3D 科学图 → Blender + After Effects
│
├─ 有编程基础(Python/JS/TS)
│ ├─ 数学/算法科普 → Manim
│ ├─ 实时交互演示 → Motion Canvas
│ ├─ 数据驱动视频 → Remotion
│ └─ 创意可视化 → p5.js
│
├─ 快速出稿(+24 小时)
│ ├─ 中文用户 → 剪映/CapCut
│ ├─ 脚本→视频 → Fliki/Pictory
│ └─ 屏幕录制 → Screen Studio
│
└─ 完全开源/免费
├─ 剪辑主体 → DaVinci Resolve
├─ 代码动画 → Manim + Motion Canvas
├─ 3D 示意图 → Blender
└─ 字幕生成 → Descript (付费) 或手工#开源仓库精选
#代码动画框架
- 3b1b/manim - 原始版本(3Blue1Brown)
- ManimCommunity/manim - 社区维护版
- motion-canvas/motion-canvas - TypeScript 动画
- remotion-dev/remotion - React 视频
#数据可视化
- d3/d3 - 数据驱动文档
- processing/p5.js - 创意编程
- tapioca24/p5.capture - p5.js 录制
#屏幕录制/代码展示
- mermaid-js/mermaid - 文本图表
- excalidraw/excalidraw - 手绘白板
- asciinema/asciinema - 终端录制
#AI/ML 可视化
- lutzroeder/netron - 模型可视化
- jessevig/bertviz - Transformer 注意力
- google/tensornetwork - 张量网络
#教育动画
- SanthiNani/Educational_Videos - Python 教学视频生成
- bcefghj/math-animation-mcp - Manim + Claude MCP
#编辑和合成
- blender/blender - 3D/2D 合成
#成本对比(年度预算)
| 预算等级 | 推荐工具组合 | 总成本 | 优缺点 |
|---|---|---|---|
| 完全免费 | Manim + DaVinci Resolve + p5.js + Blender | $0 | 学习曲线陡,功能完整,需编程 |
| 学生级 | 剪映/CapCut + Blender + Manim | $0-20 | 快速迭代,库存丰富,自动化高 |
| 入门级 | DaVinci Resolve($295) + 剪映 + 屏幕录制工具 | $150-300 | 平衡易用性和功能性 |
| 中等级 | After Effects($275/年) + Premiere($275/年) + 屏幕录制 | $550-800 | 业界标准,插件多,学习资源丰富 |
| 专业级 | 上述全套 + Blender Pro + Cloud 渲染 | $1000+ | 完整工作流,高度自定义 |
#总体建议
#对于 AI 科普创作者:
第一阶段(快速验证想法):
- 剪映 + CapCut(快速出稿)
- Excalidraw/Mermaid(示意图)
- Asciinema(代码演示)
- 零成本 ✅
第二阶段(提升专业度):
- Manim 或 Motion Canvas(代码动画)
- DaVinci Resolve(编辑合成)
- Blender(3D 图示)
- <$500/年 ✅
第三阶段(完整工作流):
- After Effects + Premiere Pro(快速迭代)
- Remotion(批量自动化)
- Screen Studio(屏幕录制)
- $500-1000/年
关键建议:
- 优先用代码工具(Manim、Motion Canvas)做科学数据可视化——更精确、更易维护
- 优先用开源方案(DaVinci、Blender、剪映)——长期省钱、社区支持好
- 屏幕录制一定要用专业工具(Screen Studio/Camtasia)——效率差 10 倍
- AI 工具用于 B-roll 和背景,不用于精确数据展示
- 文生视频失败率 15-20%——预留 20% 的额外生成和选择成本
#快速参考 URL 列表
#工具官网
- After Effects: https://www.adobe.com/products/aftereffects.html
- Premiere Pro: https://www.adobe.com/products/premiere.html
- DaVinci Resolve: https://www.blackmagicdesign.com/products/davinciresolve
- Manim Docs: https://docs.manim.community
- Motion Canvas: https://motion-canvas.io
- Remotion: https://remotion.dev
- Blender: https://www.blender.org
- Screen Studio: https://www.screenstudio.com
#在线工具
- Transformer Explainer: https://poloclub.github.io/transformer-explainer/
- Excalidraw: https://excalidraw.com
- Mermaid Live: https://mermaid.live
- OpenAI Tokenizer: https://platform.openai.com/tokenizer
#二、视频生成开源项目调研
#自动化生产科普视频:开源项目与工具调研报告
调研时间:2026年7月30日
调研范围:GitHub 项目 / Claude Code Skills / MCP / 工作流平台 / ffmpeg 配方
目的:找出可用于自动化科普视频生产的现成工具和解决方案
#目录
#GitHub 项目清单
#主流短视频生成项目
| 项目名 | Stars | 语言 | 维护状态 | 横屏长视频 | 中文支持 | 备注 |
|---|---|---|---|---|---|---|
| MoneyPrinterTurbo | 100.4k | Python | 活跃 | ✓ 支持 16:9 1920x1080 | ✓ 完全中文 | 评价:真能用。677 commits,6 open issues。支持竖屏 9:16 和横屏 16:9。集成 OpenAI/Claude/本地 LLM,TTS 多源(ElevenLabs/Google/本地),Pexels/Pixabay/Coverr 素材库。是目前最成熟的开源解决方案。 |
| MoneyPrinterV2 | 28k+ | Python | 活跃 | ✓ 支持 16:9 | ✓ | 评价:真能用。Ollama-first 架构,本地 LLM 脚本生成 + MoviePy 合成。轻量级,依赖少。最近周 +560 stars。 |
| ShortGPT | 6k+ | Python | 中等 | ✓ 支持 | ✓ | 评价:可用。字幕和节奏感比 MoneyPrinterTurbo 更精细。YouTube Shorts/TikTok 友好。 |
| AutoShorts (alamshafil/auto-shorts) | 316 | Python | 已归档(2025年1月) | ✓ | ✓ | 评价:玩具。支持 OpenAI/Gemini/Claude/Ollama,功能齐全但项目已停更。不推荐新项目。 |
| AutoShorts (MinightDev/Autoshorts) | 未知 | Python | 活跃 | ✓ 转换长视频→短视频 | - | 评价:可用。从长视频自动截取精彩片段生成短视频,AI 场景分析。 |
| AutoShorts (divyaprakash0426/autoshorts) | 未知 | Python | 活跃 | ✓ GPU 加速 | - | 评价:可用。从游戏录像生成竖屏短视频,支持 AI 配音。 |
| Faceless Video Generator (jacky-xbb) | 85 | Python | 活跃 | - | ✓ | 评价:可用。故事→图片→视频流水线。12 种故事类型(恐怖、神秘、动机、哲学等),支持多种图像美学风格(逼真、电影感、动漫、漫画、皮克斯)。 |
| AI-Faceless-Video-Generator (SamurAIGPT) | 2.3k | Python | 中等 | - | - | 评价:可用。生成会说话的虚拟人物视频(avatar 动画),支持 Colab。 |
| AI-Youtube-Shorts-Generator (SaarD00) | 未知 | Python | 活跃 | ✓ 竖屏 9:16 | - | 评价:可用。Gemini AI + Edge-TTS + FFmpeg,完全自动化,无需素材库。 |
| Wan2GP | 未知 | Python | 活跃 | ✓ 支持 | - | 评价:新兴。支持 Wan 2.1/2.2、Hunyuan Video、LTX Video、Flux。低 VRAM 优化版本。 |
| ManimCommunity/manim | 89k | Python | 活跃 | ✓ 支持(用途:数学动画) | - | 评价:科研级。数学/物理/化学动画引擎,支持 LaTeX,是教育视频的首选。 |
#无脸视频生成项目
| 项目名 | Stars | 描述 | 价值 |
|---|---|---|---|
| faceless-video-generator | 85 | 故事→图像→视频,12 种故事类型 | 中等 |
| AI-Faceless-Video-Generator | 2.3k | 虚拟人物说话视频(talking head) | 中等 |
#学术/前沿项目(论文转讲解视频)
#重点项目
#1. TheoremExplainAgent
- GitHub: https://github.com/TIGER-AI-Lab/TheoremExplainAgent
- Stars: 1.5k
- 论文: ACL 2025 Oral(前 3%)— "TheoremExplainAgent: Towards Video-based Multimodal Explanations for LLM Theorem Understanding"
- 核心功能:
- 自动生成长篇 Manim 视频讲解定理
- 两阶段架构:Planner Agent(创建故事板+旁白)→ Coder Agent(生成 Manim Python 代码)
- 集成 Manim 扩展:physics、chemistry、machine learning、data structures、circuit
- TTS(Kokoro)+ VLM 评估
- 批量处理 + RAG 支持
- 数据集: TheoremExplainBench(240 个训练示例)在 HuggingFace
- 价值评估:⭐⭐⭐⭐⭐ 最值得抄。专做教育/科普视频,Manim 集成深度,论文方法具有可复现性。
#2. Paper2Video (showlab/Paper2Video)
- GitHub: https://github.com/showlab/Paper2Video
- Stars: 2.3k
- 核心功能:
- 输入:LaTeX 论文源文件
- 输出:幻灯片+字幕+光标动画+语音合成+虚拟讲者(可选 Hallo2)
- 多 Agent 框架:Slide Generation → Layout Refinement → Cursor Grounding → Speech Synthesis → Talking-head Rendering
- 支持格式:接受 LaTeX 源、参考图像(方形人像)、参考音频(10 秒)
- 评估指标:内容保真度、易读性、作者身份表示、学术影响力
- 价值评估:⭐⭐⭐⭐⭐ 最值得抄。学术论文转演讲视频的完整方案。
#3. Code2Video
- 核心:从代码生成教学视频
- 架构:三 Agent 协作
- Planner:将讲座内容分解成时间流
- Coder:转换为可执行 Python(Manim/matplotlib)
- Critic:VLM 反馈优化布局
- 价值:编程教育视频自动生成
#4. Preacher(Paper-to-Video Agentic System)
- arXiv: https://arxiv.org/html/2508.09632v2
- GitHub(预发布):https://github.com/Gen-Verse/Paper2Video
- 方法:
- 自上而下:分解、总结、改述论文
- 自下而上:生成多种视频片段
- 综合成连贯的视频摘要
- 价值:论文转视频的摘要式方案
#5. Manim 生态的 AI 增强
- manim-video-generator: GPT + Manim,自然语言→数学动画
- Manim Math Visualization Generator: Gemini + Manim,文本→专业数学可视化
- 自动教学视频生成:Gemini + 多 Agent,主题字符串→完整 sketch 动画视频
#Claude Code 生态
#Skills(Skill 是 Claude Code 的功能扩展包)
| Skill 名称 | 链接 | 功能 | 价值 |
|---|---|---|---|
| elevenlabs-remotion-skill | https://github.com/Maartenlouis/elevenlabs-remotion-skill | Remotion 视频 + ElevenLabs TTS | 核心 |
| promo-video-skill | https://github.com/AKCodez/promo-video-skill | SaaS/项目预告片生成(30/60/90 秒,横竖屏) | 实用 |
| Claude-Code-Video-Toolkit | https://github.com/wilwaldon/Claude-Code-Video-Toolkit | 集成 Remotion/Manim/屏幕录制/YouTube 截取/FFmpeg | 完整生态 |
#推荐工作流
Remotion + ElevenLabs 工作流:
- Claude 生成 React 动画组件(Remotion)
- Claude 生成配音脚本 → ElevenLabs 生成 MP3
- Whisper 验证音频时长,自动修复重叠
- Remotion 最终渲染 MP4
- 支持场景预设、字符定义、发音字典
实战案例:3.5 小时完成 35 秒 1920x1080 落地页视频(Claude Sonnet + Remotion + ElevenLabs)
#MCP 服务器
#FFmpeg 类(核心工具)
| MCP 服务器 | 链接 | 功能 | 支持的操作 |
|---|---|---|---|
| video-audio-mcp | https://github.com/misbahsy/video-audio-mcp | FFmpeg 编辑服务 | 格式转换、分辨率缩放、编码切换(H.264/H.265/VP9)、帧率/码率调整、宽高比修改、音频提取、文本/图像叠加、字幕烧制、B roll 插入、淡入淡出、交叉淡化、多片段拼接、速度调整、沉默移除 |
| bitscorp-mcp/mcp-ffmpeg | https://smithery.ai/server/@bitscorp-mcp/mcp-ffmpeg | FFmpeg Video Processor | 视频操作、多分辨率缩放、音频提取 |
| kinocut (KyaniteLabs/mcp-video) | https://github.com/KyaniteLabs/kinocut | 视频编辑 MCP(带防护) | FFmpeg 包装、Hyperframes、内容重用工具、Python 客户端 CLI |
#专业视频编辑 MCP
| 编辑软件 | MCP 实现 | 功能 |
|---|---|---|
| DaVinci Resolve | davinci-resolve-mcp (samuelgursky/barckley75/apvlv) | 色彩分级、媒体编辑、Fusion 合成 |
| CapCut | capcut-mcp | 草稿管理、素材处理、转场/滤镜/遮罩/动画/效果 |
| Final Cut Pro | fcp-mcp (dreliq9) | 88 个工具:FCPXML 引擎、FCP 实时控制、媒体分析、参数傀儡 |
| After Effects | - | 暂无开源 MCP(可通过 Blender + Python 替代) |
| Blender | ahujasid/blender-mcp | 3D 动画、VFX |
#部署建议
- 轻量级方案:video-audio-mcp(FFmpeg 直接集成,最灵活)
- 专业级方案:davinci-resolve-mcp(色彩分级、高级编辑)
- 完整生态:结合 ffmpeg + Manim + Remotion
#工作流平台
#n8n(推荐度:⭐⭐⭐⭐⭐)
现成模板:
| 模板 | 功能 | 目标平台 |
|---|---|---|
| VEO 3 + TikTok Auto-Upload | 创意→VEO 3 生成→自动上传 | TikTok/YouTube/Instagram 多平台 |
| Viral Video Creator (Fal.ai) | Fal.ai AI videos + 多平台发布 | TikTok/YouTube/Instagram |
| Seedance + 社交媒体自动化 | Seedance 生成→自动发布 | 多平台 |
| 完整自动化视频生成和发布 | 端到端 AI 视频生产 | 视频库 |
| VEO3 Fast + YouTube/TikTok | 低成本高速生成 + Google Sheets 中心控制 | YouTube/TikTok |
| Faceless Video (无脸视频) | 文本转无脸短视频(TTS/图像生成/视频合成) | YouTube/Instagram/TikTok |
工作流特点:
- 从 Google Sheets 或 Airtable 读取创意清单
- 触发 AI 视频生成(VEO3、Fal.ai 等)
- 自动发布到多个社交平台(Zapier 集成)
- 支持定时任务(Cron)
评价:n8n 是最成熟的工作流平台,模板丰富,开箱即用。
#Dify(推荐度:⭐⭐⭐⭐)
- 优势:LLM 工作流 GUI,AI Agent 集成
- 视频应用:脚本生成→素材搜索→视频合成编排
- 缺陷:需要自定义扩展实现视频合成
#Coze(推荐度:⭐⭐⭐⭐)
ByteDance 官方方案:
- 多 Agent 协作模式
- 工作流可视化拖拽
- 与 TikTok/抖音 API 原生集成
- 模板库:视频生成工作流现成
推荐指数:尤其适合针对抖音短视频的自动化生产。
#Comfy UI(推荐度:⭐⭐⭐(用途有限))
视频生成工作流:
- Video Generation Nodes:将图像序列→视频
- Manim 动画节点(第三方)
- Comic 相关节点:StoryDiffusion Comic_Type
- 官方模板库:https://github.com/Comfy-Org/workflow_templates
缺陷:
- 需要 NVIDIA GPU(CUDA 优化)
- 学习曲线陡峭
- 更适合精细化控制而非工业级生产
最适用场景:
- 本地动画生成(Manim → 数学教学视频)
- 漫画/艺术风格化视频
- 自研 pipeline 集成
#ffmpeg 自动化配方
#1. 字幕烧制(重要)
#方案 A:SRT 字幕(简单)
# SRT 格式字幕直接烧制
ffmpeg -i input.mp4 -vf subtitles=subs.srt output.mp4
# 支持样式:字体、大小、颜色、位置(但有限)#方案 B:ASS 字幕(推荐 - 完全控制)
# ASS 格式支持高级样式:字体、颜色、边框、阴影、缩放、倾斜、对齐
ffmpeg -i input.mp4 -vf ass=subs.ass output.mp4
# 格式转换:SRT → ASS
ffmpeg -i subs.srt subs.ass
# 使用 Subtitle Edit CLI 批量转换
# SRT 支持的是最基础的时间码格式:HH:MM:SS,ms
# 高级样式示例(ASS 格式):
# [Script Info]
# Title: My Subtitles
#
# [V4+ Styles]
# Format: Name, Fontname, Fontsize, PrimaryColour, SecondaryColour, ...
# Style: Default,Arial,20,&H00FFFFFF,&H000000FF,0,0,0,100,100,0,0,0,0,0,0
#
# [Events]
# Format: Layer, Start, End, Style, Name, MarginL, MarginR, MarginV, Effect, Text
# Dialogue: 0,0:00:00.00,0:00:05.00,Default,,0,0,0,,字幕内容#方案 C:使用 libass 渲染器(最专业)
# libass 自动渲染 ASS/SSA 格式,支持所有高级特性
ffmpeg -vf "ass=subs.ass" input.mp4 output.mp4
# Batch 烧字幕脚本
for file in *.mp4; do
ffmpeg -i "$file" -vf "ass=subs.ass" -c:v libx264 -crf 23 "burned_$file"
done#2. 音视频拼接与同步
#方案 A:直接 Concat(要求格式相同)
# 创建 concat.txt
# file 'segment1.mp4'
# file 'segment2.mp4'
# file 'segment3.mp4'
ffmpeg -f concat -safe 0 -i concat.txt -c copy output.mp4#方案 B:带转场的拼接(推荐)
# 使用 xfade 实现 1 秒交叉淡化
# 支持 30+ 转场类型:fade, wipeleft, slidedown, dissolve, pixelize 等
ffmpeg -i segment1.mp4 -i segment2.mp4 \
-filter_complex "[0:v][1:v]xfade=transition=fade:duration=1:offset=4[v]; [0:a][1:a]acrossfade=d=1[a]" \
-map "[v]:v" -map "[a]:a" output.mp4
# 转场类型列表(可选替换 fade):
# fade, wipeleft, wiperight, wipeup, wipedown
# slideleft, slideright, slideup, slidedown
# circlecrop, rectcrop, distance
# fadeblack, fadewhite, radial
# smoothleft, smoothright, smoothup, smoothdown
# circleopen, circleclose
# vertopen, vertclose, horzopen, horzclose
# dissolve, pixelize
# diagtl, diagtr, diagbl, diagbr(对角线)#3. 音频响度归一化(重要)
#EBU R128 标准(广播级)
# 单文件归一化到 -16 LUFS
ffmpeg -i input.mp4 -af "loudnorm=I=-16:TP=-1.5:LRA=11" output.mp4
# 参数说明:
# I=-16 目标集成响度(Integrated Loudness)
# TP=-1.5 真峰值上限(True Peak Ceiling),防止削波
# LRA=11 响度范围(Loudness Range),音量动态范围
# 批量归一化脚本
for file in *.mp4; do
ffmpeg -i "$file" -af "loudnorm=I=-16:TP=-1.5:LRA=11" "normalized_$file"
done
# 使用专用工具(更精细)
pip install ffmpeg-normalize
ffmpeg-normalize *.mp3 --target-level -16 --loudness-range-target 11#4. 编码参数(B 站 / YouTube 推荐)
#方案 A:YouTube 官方推荐(H.264 标准)
# 1080p60 最高质量
ffmpeg -i input.mov \
-c:v libx264 \
-preset slow \
-crf 18 \
-c:a aac -b:a 128k \
-pix_fmt yuv420p \
output_1080p60.mp4
# 参数说明:
# preset slow 编码速度(fast/medium/slow,影响时间)
# crf 18 质量等级(0-51,低=高质量,18-23 是理想范围)
# aac -b:a 128k 音频编码 AAC 128kbps
# pix_fmt yuv420p 色彩空间(广泛兼容)#方案 B:4K 编码(B 站推荐)
# 4K 30fps H.264(B 站可接受)
ffmpeg -i input.mov \
-c:v libx264 \
-preset slow \
-crf 20 \
-s 3840x2160 \
-r 30 \
-b:v 15M \
-c:a aac -b:a 192k \
output_4k.mp4
# 4K 编码码率建议:
# 1080p60: 6-8 Mbps
# 1440p60: 10-15 Mbps
# 4K30: 15-25 Mbps
# 4K60: 40-60 Mbps(YouTube)#方案 C:AV1 编码(B 站/YouTube 都支持,更节省空间)
# AV1 比 H.264 节省 50% 带宽,比 VP9 节省 30%
ffmpeg -i input.mov \
-c:v libaom-av1 \
-cpu-used 4 \
-crf 24 \
-b:v 0 \
output_av1.mkv
# 参数说明:
# cpu-used 4 编码速度(0-8,值越低越慢但更小)
# crf 24 质量(AV1 的 CRF 18-24 相当于 H.264 的 22-28)
# -b:v 0 自适应码率(AV1 特有,不需要手动指定)
# 注意:AV1 编码时间长,不适合实时应用,但最终体积小#5. 完整视频生产 Pipeline
#!/bin/bash
# 完整科普视频制作脚本
INPUT="raw_video.mp4"
SUBS="captions.ass"
OUTPUT_NAME="science_video_final"
# Step 1: 字幕烧制 + 分辨率标准化
ffmpeg -i "$INPUT" \
-vf "ass=$SUBS,scale=1920:1080:force_original_aspect_ratio=decrease,pad=1920:1080:(ow-iw)/2:(oh-ih)/2" \
-c:v libx264 -preset medium -crf 22 \
temp_subtitled.mp4
# Step 2: 音频响度归一化
ffmpeg -i temp_subtitled.mp4 \
-af "loudnorm=I=-16:TP=-1.5:LRA=11" \
-c:v copy \
temp_normalized.mp4
# Step 3: 最终编码 (1080p)
ffmpeg -i temp_normalized.mp4 \
-c:v libx264 -preset slow -crf 20 \
-c:a aac -b:a 128k \
-pix_fmt yuv420p \
"$OUTPUT_NAME.mp4"
# 清理临时文件
rm temp_subtitled.mp4 temp_normalized.mp4
echo "✓ 生产完成: $OUTPUT_NAME.mp4"#6. Batch 处理示例
# 批量烧字幕 + 编码 100 个视频
mkdir -p output
for video in input/*.mp4; do
name=$(basename "$video" .mp4)
echo "处理: $name"
ffmpeg -i "$video" \
-vf "ass=subtitles/$name.ass" \
-af "loudnorm=I=-16:TP=-1.5:LRA=11" \
-c:v libx264 -preset slow -crf 22 \
-c:a aac -b:a 128k \
-y \
"output/$name.mp4"
done
echo "✓ 批处理完成"#核心评估与选型建议
#场景分析
#场景 1:快速生成短视频(TikTok/YouTube Shorts)
推荐方案:MoneyPrinterTurbo + n8n
| 组件 | 选型 | 原因 |
|---|---|---|
| 脚本生成 | Claude/GPT + MoneyPrinterTurbo | 已集成,开箱即用 |
| 配音 | ElevenLabs (n8n 原生集成) | 质量好,支持多语言 |
| 素材 | Pexels/Pixabay/Coverr(MoneyPrinterTurbo 内置) | 免费、规模大 |
| 字幕 | 自动生成 (MoviePy) | 效率最高 |
| 编排 | n8n 工作流 + Google Sheets 控制中心 | 无需代码,可视化 |
| 发布 | n8n 直连 TikTok/YouTube API | 全自动上传 |
实施时间:1-2 天(改配置文件)
成本:ElevenLabs $10/月 起
质量:中等(素材库限制,脚本需微调)
#场景 2:自动化论文转讲解视频(科研/教育)
推荐方案:TheoremExplainAgent + Claude Code + FFmpeg
| 组件 | 选型 | 原因 |
|---|---|---|
| 论文解析 | Claude API(用 /goal 指令自主研究) | 理解复杂数学/物理概念 |
| Manim 代码生成 | Claude Code + Manim Community | TheoremExplainAgent 的核心 |
| 视频渲染 | Manim(本地 NVIDIA GPU) | 数学动画专业度最高 |
| 字幕 | 手工/Claude 生成 ASS 格式 | Manim 视频支持 libass 烧制 |
| 编码 | ffmpeg H.264 或 AV1 | YouTube/B 站标准 |
| 自动化 | Claude Code + MCP (video-audio-mcp) | 环节串联 |
实施时间:2-3 周(需微调 Manim 风格)
成本:0(全开源,需要 GPU)
质量:极高(Manim 是学术标准)
工作流:
论文 PDF → Claude 提炼关键概念 → Claude 生成 Manim Python
→ 本地渲染视频 → video-audio-mcp 字幕烧制/规范化
→ FFmpeg 编码输出#场景 3:企业级教学视频生产(内训/在线课程)
推荐方案:Paper2Video + Coze + DaVinci Resolve MCP
| 组件 | 选型 | 原因 |
|---|---|---|
| 内容源 | LaTeX 文档或 Google Slides | 学术/企业标准 |
| 视频生成 | Paper2Video(多 Agent 框架) | 幻灯片+语音+虚拟讲者 |
| 工作流编排 | Coze(ByteDance 官方) | 企业级稳定性 |
| 后期编辑 | davinci-resolve-mcp (Claude MCP) | 色彩分级、音频混音 |
| 多语言配音 | ElevenLabs | 支持 30+ 语言 |
实施时间:3-4 周(定制虚拟讲者)
成本:ElevenLabs + Coze API 约 $100-500/月
质量:专业(虚拟讲者、多语言)
#场景 4:本地快速迭代(研发/原型)
推荐方案:Claude Code + Remotion + Manim + ffmpeg
工作流:
概念 → Claude Code 生成 React/Manim 组件
→ 本地浏览器预览
→ CLI 渲染 MP4
→ video-audio-mcp 编辑微调
→ ffmpeg 最终编码优势:
- 迭代速度快(秒级反馈)
- 完全本地(无 API 成本)
- 支持版本控制(代码即视频)
#项目价值矩阵
| 项目 | 易用度 | 功能深度 | 维护度 | 中文友好 | 推荐指数 |
|---|---|---|---|---|---|
| MoneyPrinterTurbo | ⭐⭐⭐⭐⭐ | ⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | 🔴 首选(快速短视频) |
| TheoremExplainAgent | ⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐ | 🟢 首选(数学科普) |
| Paper2Video | ⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐ | 🟡 次选(论文转视频) |
| Claude Code Toolkit | ⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐ | 🟡 次选(自研方案) |
| n8n 工作流 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐ | 🔴 首选(自动化编排) |
| Manim | ⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐ | 🟢 首选(数学动画) |
| AutoShorts (已停更) | ⭐⭐⭐⭐ | ⭐⭐⭐ | ❌ 归档 | ⭐⭐⭐ | ⚫ 不推荐 |
| Wan2GP | ⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐ | - | 🟡 关注(新兴) |
#快速上手三步走
#Step 1:验证基础方案(1 小时)
# 安装 MoneyPrinterTurbo
git clone https://github.com/harry0703/MoneyPrinterTurbo
cd MoneyPrinterTurbo
pip install -r requirements.txt
# 生成第一个视频
python main.py --topic "量子纠缠原理" --duration 60#Step 2:集成工作流(4 小时)
- n8n 免费账户创建
- 导入现成模板:https://n8n.io/workflows/8642-generate-ai-viral-videos-with-veo-3-and-upload-to-tiktok/
- 配置 OpenAI/Claude API key
- 测试 Google Sheets → 视频 → TikTok 完整流
#Step 3:微调质量(1-2 天)
- 调整字幕样式(ASS 格式)
- 音频响度归一化(loudnorm)
- 选定目标平台编码参数
- A/B 测试不同脚本风格
#资源汇总
#GitHub 核心项目链接
短视频生成:
- https://github.com/harry0703/MoneyPrinterTurbo
- https://github.com/FujiwaraChoki/MoneyPrinter
- https://github.com/jacky-xbb/faceless-video-generator
学术项目:
- https://github.com/TIGER-AI-Lab/TheoremExplainAgent
- https://github.com/showlab/Paper2Video
- https://github.com/3b1b/manim
Claude Code 扩展:
MCP 服务器:
- https://github.com/misbahsy/video-audio-mcp
- https://github.com/barckley75/resolve-claude-mcp
- https://github.com/fancyboi999/capcut-mcp
工作流平台:
- n8n:https://n8n.io/workflows (1000+ 模板)
- Coze:https://www.coze.com
- Comfy UI:https://comfy.org
#论文与文档
- TheoremExplainAgent (ACL 2025): https://arxiv.org/abs/2502.19400
- Paper2Video: https://arxiv.org/abs/2510.05096
- Code2Video: https://arxiv.org/abs/2510.01174
- Preacher: https://arxiv.org/html/2508.09632v2
#教程与最佳实践
- How to Create Remotion Videos Using Claude Code
- Building a Production Landing Page Video
- FFmpeg Engineering Handbook (字幕)
#结论
#最值得投资的方向
短视频快速生产(TikTok/YouTube Shorts)
- 方案:MoneyPrinterTurbo + n8n
- 投入:最低(开箱即用)
- 产出:最快(按模板批量化)
科普/数学教育视频(中长篇)
- 方案:TheoremExplainAgent + Manim
- 投入:中等(需 GPU)
- 产出:最优(专业度高)
企业级内训视频
- 方案:Paper2Video + Coze
- 投入:高(API 成本)
- 产出:精准(多语言、虚拟讲者)
#避坑清单
- ❌ 不要用已停更项目(AutoShorts 2025 年 1 月归档)
- ❌ 不要只依赖单个 LLM(多源配置,降低 API 风险)
- ❌ 不要忽视音频处理(响度归一化是专业化的必做项)
- ❌ 不要用公开方案处理涉密内容(自部署关键模型)
- ✅ 要用 MCP 做编排(FFmpeg 直连 Claude,减少转换步骤)
- ✅ 要预留后期编辑空间(Remotion/Manim 代码版本化,支持快速迭代)
调研完成时间:2026年7月30日
数据来源:GitHub API、HuggingFace、Smithery MCP 市场、n8n 模板库、arXiv 论文库
后续更新:建议每季度扫一遍 GitHub Trending(video 标签)和 arXiv(cs.CV + cs.LG)新论文
来源:沉淀/AI科普长视频-原始调研报告/AI科普视频制作工具深度指南.md;沉淀/AI科普长视频-原始调研报告/视频生成项目调研报告.md(整理于 2026-08-18)