📚 离职知识库

AI 科普横屏长视频「脚本层」与「收尾层」工程补充

说明:本次调研全程用 firecrawl 搜索工具因服务端持续 502 无法使用(已重试 5 次以上),改用 WebFetch 抓取 DuckDuckGo HTML 结果页 + 逐页抓取正文的方式完成调研。部分页面(知乎多篇、百度文库部分页)因反爬返回 403 未能抓到原文,已用同主题的镜像/转载文章替代,并在对应条目标注。查不到可靠数字来源的地方,已明确写「未找到可靠来源」,不编造。


#1. 口播脚本的结构模板

#1.1 通用骨架:Hook → 价值 → 行动(三段式)

来源:海螺社博客《口播稿怎么写?一套能直接套用的短视频脚本结构:钩子+价值+行动》 https://www.hailuoshe.com/blog/oral-broadcast-script-structure

结构块 功能 写法要点 建议占比/时长
钩子(Hook) 让人不划走 第一句直接说人话、无铺垫,抛痛点/结论/悬念 约 1 句,占极短(3 秒规则)
价值(Body) 交付可带走的内容 一个点讲深,"问题→方法→例子"递进,每 5 秒一个信息点 约 70%
行动(CTA) 引导后续动作 一句话,只选一个动作(关注/评论/跳转),不要贪多 约 1 句

原文给出的经验值:一分钟口播控制在 300 字左右(对应下文第 2 节的语速数据可互相印证)。

#1.2 黄金三秒的 4 种钩子模板(同上来源)

类型 逻辑 句式模板 示例
提问式 勾起好奇 "你是不是也遇到过……?" "你是不是一到夏天头发就塌?"
痛点式 戳中烦恼 "别再……了,那样只会……" "别再自己在家剪刘海了,剪一次毁一个月"
反差式 制造信息差 "你以为……,其实……" "你以为烫发伤发,其实伤发的是回家不做护理"
利益预告 亮出收获 "看完这条,你就知道怎么……" "看完这条,你就知道圆脸怎么选发型显脸小"

#1.3 科普长视频专用的完整六段模板(综合多个模板,可直接套用于 8-25 分钟横屏科普视频)

综合第 1.1/1.2 及下方 1.4 的 10 种结构,针对科普长视频(区别于短视频口播)整理出一个可执行的六段骨架:

段落 作用 占总时长比例 8 分钟视频时长 15 分钟视频时长 25 分钟视频时长
① Hook 开场钩子 3 秒内给出悬念/反常识结论/痛点,阻止划走 3%-5% 15-25 秒 30-45 秒 45-75 秒
② 问题铺垫 交代"为什么这事值得花这几分钟",建立好奇心缺口 8%-10% 40-50 秒 1.5-2 分钟 2-2.5 分钟
③ 背景/铺垫知识 补齐理解核心内容所需的前置知识,术语第一次出现要解释 12%-15% 1-1.2 分钟 2-2.5 分钟 3-3.5 分钟
④ 核心内容(可拆 2-4 个子点) 主体,每个子点遵循"论点→证据/机制→类比/例子" 50%-55% 4-4.5 分钟 7.5-8.5 分钟 12.5-14 分钟
⑤ 回扣 Hook / 总结升华 呼应开场悬念,给出"所以呢"的一句话总结,避免空洞总结句 8%-10% 40-50 秒 1.5-2 分钟 2-2.5 分钟
⑥ CTA 收尾 单一动作引导(订阅/评论/下一集预告),控制在一句话 3%-5% 15-25 秒 30-45 秒 45-75 秒

该六段模板是基于 1.1-1.4 中查到的多个短视频/口播脚本框架,按用户题目要求的"Hook→问题→铺垫→核心→回扣→CTA"结构外推整理,未查到专门针对"8/15/25 分钟横屏科普长视频"的公开分钟级模板,此处的占比是从口播三段式(钩子 1 句/价值 70%/行动 1 句)和下方 10 种结构的通用规律推算得出,供参考,非行业标准数字。

#1.4 10 种可直接套用的口播结构模板(完整清单)

来源(同一篇文章的两个转载版本,互相印证):

# 结构名 组成 适用场景 示例开头
1 问题+反常识+三步拆解 抛问题→反常识答案→三步拆解→互动 干货/教程/认知类 "你是不是拍了视频没人看?不是你剪得不好,是你开头没留住人。"
2 对比+案例+核心套路 强对比→案例拆解→核心套路→互动 教学/方法对比/避坑 "同样是拍日常,为什么他拍得像电影,我拍得像监控?"
3 自我挑战+过程记录+结果吸睛 立flag→过程记录→阶段成果+钩子 人设号/起号/成长类 "我决定用【时间】,【挑战一件事】"
4 误区+真相+解决方案 误区→真相→解决方案→互动 辟谣/认知纠偏/揭秘 "很多人以为拍视频一定要用专业相机……其实90%爆款都是用手机拍的。"
5 故事+感悟+行动建议 讲故事→提炼道理→给行动建议 情感/成长/个人经历 "讲一个我自己的故事【经历了什么】"
6 数据+结论+操作指南 数据→结论→操作指南→互动 干货/研究/趋势分析 "我研究了100条爆款口播……90%的爆款前3秒都在说:用户的痛点。"
7 身份+揭秘+避坑指南 身份→揭秘→避坑指南→互动 行业揭秘/职场/经验 "作为拍了3年口播的人……那些看起来随便说就爆的视频,其实都是设计过的。"
8 场景+痛点+解决方案 还原场景→戳中痛点→简单方法 生活/实用/问题解决 "你有没有过这样的经历——【具体场景】"
9 提问+回答+延伸 用户问题→直接答案→延伸重点 答疑/Q&A/互动类 "有人问我:……我的回答是:……"
10 观点+反驳+我的看法 普遍观点→反驳→个人观点 观点/争议/认知类 "很多人说做口播要长得好看……但真实比好看重要一万倍。"

#1.5 科普专用四段结构

来源:海螺社博客《短视频脚本与文案怎么写》 https://www.hailuoshe.com/blog/script 原文提到有一套"科普脚本 4 段结构,把专业内容讲到小白能听懂",包含"术语转大白话的手法",但页面未展开具体每段名称(只给了结论性描述,未抓到分段细节)。可与本节 1.3 的六段模板配合使用。


#2. 中文口播语速的真实数字

#2.1 结论先行

不同来源给出的数字差异,本质是统计口径不同

  1. 播音专业"标准播音速度"(新闻联播式播音,字正腔圆、单位时间信息密度高):250-260 字/分钟为公认基准,个别主播可达 280-350 字/分钟。
  2. 短视频口播/自媒体经验值:约 300 字/分钟(海螺社博客给出的口播脚本经验值,见第 1 节)。
  3. 口语聊天/科普讲解的"自然语速"(更松弛、有停顿):通常低于播音标准,约 200-220 字/分钟区间(此区间未找到统一的权威单一来源,是多篇播音教学文章交叉印证的经验范围,见下)。

差异来源主要是:①是否算标点停顿(播音训练常以"净说话时间"计算,去除换气停顿会显著推高字/分钟数值);②内容类型(新闻类快、专题片/讲解类慢,同一篇稿子里人名数字核心内容也要求放慢);③时代变化(下表可见播音语速逐年代显著提升)。

#2.2 播音语速的历史变化与专业标准

来源:知乎《广播新闻类主持人的语速为何越来越快?》转载版 https://www.sohu.com/a/394017884_120411509

年代 语速(字/分钟)
1950-60 年代 160-180
1980 年代 220-240
1990 年代后 280
当代(该文发布时) 约 300

央视播音员实例(同一来源):张宏民 350 字/分钟、邢质斌 329 字/分钟、罗京 280 字/分钟。

建议标准:文章引用的研究认为,"人耳的接受程度(辨析率)是每秒 4-5 个字,即每分钟 240-250 字",因此每分钟 250-260 字比较适宜,语速过快会造成理解压力。

来源二(同主题另一篇):知乎《播音的语速到底多少合适?》转载版,同样给出 250-260 字/分钟为核心标准,并补充灵活调整规则:

  • 特稿类稿件比消息类播得慢
  • 重大声明/突发事件播得慢;通知类通稿可播快些
  • 陌生内容、新知识播得慢
  • 讣告类用慢速表达悲痛,喜庆节目用快速呼应气氛
  • 同一篇稿件中,人名、数字、核心内容要比通篇稍微放慢(这一条对科普口播尤其重要——专业术语、数据、结论句都应刻意放慢)

未找到单一的、专门针对"中文科普/知识区口播"的官方语速研究数字(B站/YouTube 创作者学院均未公开发布过此类统计)。180-220/200-260/220-280 这几种坊间说法,本质都是在"250-260 播音标准"基础上,按内容口语化程度、是否含大量停顿、是否讲解复杂概念做的经验性上下浮动,没有找到能仲裁哪个更准的权威第三方测评。

#2.3 建议:科普长视频取值与分钟-字数换算

综合以上,科普口播(比新闻播音更松弛、需要给听众消化时间,但比日常聊天更紧凑)建议取 220-250 字/分钟作为脚本字数估算基准(不含 CTA 环节可能出现的空拍时间):

视频时长 按 220 字/分钟 按 250 字/分钟 建议脚本字数区间
8 分钟 1760 字 2000 字 约 1750-2050 字
15 分钟 3300 字 3750 字 约 3300-3800 字
25 分钟 5500 字 6250 字 约 5500-6300 字

注:以上字数区间为按 2.2 节查证的 250-260 播音标准,向下取整到更适合"讲解型科普"的 220-250 区间后推算得出的工程估算值,不是某个单一来源直接给出的"科普口播专用数字",正式排期前建议用实际配音引擎(TTS 或人声)跑一遍 30 秒-1 分钟样本稿反推真实语速再校准。

#2.4 英文 WPM 对照

来源:LingoChampion《Average Speaking Speed in YouTube Videos by Language and Category》 https://lingochampion.com/en-US/research/wpm-statistics/ (方法论:基于 YouTube 字幕分析 23 个频道 63 条视频,覆盖 11 种语言,采集于 2026-01-07;不含中文/普通话数据

类别 含停顿 WPM 不含停顿 WPM
Entertainment 154.4 167.8
News 169.5 169.5
Podcasts 172.7 173.5
Tech(最接近科普讲解) 200.2 201.0
整体平均 171.1 171.5

停顿判定方法:字幕间隔超过"该视频字幕间隔中位数的 2 倍,或 1.5 秒,取两者较大值"即视为停顿。Tech 类目 200 WPM 可作为英文科普讲解型视频的参考基准,比中文 220-250 字/分钟的换算比例(中英文信息密度不同,不能直接类比字数)更贴近"知识密度较高、讲解型"内容的语速特征。


#3. 口播稿 vs 书面稿:可执行改写规则清单

#3.1 核心认知(来源:搜狐《短视频口播文案改写指令分析》https://www.sohu.com/a/1010913226_122637087)

"文章是给眼睛看的,口播是给耳朵听的" —— 是感知路径的重新设计,不是简单的文体转换。

五条可执行规则:

  1. 钩子重设计:钩子要回答"观众凭什么此刻停下来听你说话",结构 = 利益或威胁 + 立刻发生感。
  2. 信息颗粒度拆细:把每一个"需要解析的地方"拆开,确保每一小块能被即时消化——不是简单加语气词,而是重新切分信息单元
  3. 情绪密度适配:不同领域要匹配观众的预期情绪密度(如财经类需要"紧迫感"),调整的是情绪浓度而非仅仅语气词。
  4. 一句话删减测试:对每句话自问"这个信息如果拿掉,观众会不会听不懂后面的内容?"——背景信息和延伸解释在口播里是噪音,能删就删。
  5. 结尾从情绪里生长:互动引导(CTA)要跟观众听完后的情绪状态对齐,不能生硬拼接。

#3.2 零基础改写三步法(来源:海螺社博客,见 1.1)

  • 读出声改稿:把稿子读一遍,拗口的长句直接拆短(判定标准就是"读的时候会不会喘不上气/绕口")。
  • 名词换动作:把抽象名词换成具体动作/画面(例如"提升效率"→"少走三步路")。
  • 加"你"和场景:直接对话观众、给出具体场景,增强代入感(例如把"用户"改成"你")。

#3.3 具体改写映射清单(工程手册可直接套用)

综合本节及上文来源整理出的可执行改写对照表(部分为通用书面语转口语的行业常识,标注"经验规则"):

书面语写法 口播稿改写 说明
"如下图所示" "你现在看到的这张图" / "屏幕上这个东西" 口播稿要对着"正在发生的画面"说话,不能引用"图/表"这种阅读时才有意义的指代词(经验规则)
长从句/多重定语 拆成 2-3 个短句,一句只讲一个信息点 依据 3.2 的"读出声改稿"原则,每 5 秒一个信息点(见 1.1)
数字(如 "42.3%") 先说整数概念再补精确数("大概四成,准确说是 42.3%") 播音训练里数字属于要"刻意放慢"的核心内容(见 2.2)
专业术语首次出现 术语 + 一句大白话解释 + 生活化类比 对应 1.5 的"科普脚本 4 段结构:术语转大白话"
"因此""综上所述""值得注意的是" 删除,或替换成"所以""说白了""提醒一下" 见第 5 节"AI 味"高频词清单,这类连接词在口语中极少自然出现
被动语态("被发现""被证实") 改主动("科学家发现""实验证实") 口语中被动句显得生硬,人类口语习惯用主动句
抽象总结句("这具有重要意义") 具体化为"这意味着你以后……" 对应删减测试:空洞总结是噪音,要么删要么具象化
"用户""受众" "你" 3.3 的"加你和场景"

说明:以上表格中"如下图所示""数字怎么念""术语首次出现"三条是根据用户题目明确要求、结合查到的播音语速/口语化改写原理综合推导的工程规则,未找到专门列出这三条的单篇权威文章;"删除连接词""被动转主动"参考了第 5 节 AI 味清单的反向应用。


#4. 分镜(Shot List)的工具化做法

#4.1 最小可用的 6 栏分镜表(中文科普/短视频场景)

来源:海螺社博客 https://www.hailuoshe.com/blog/script

"一张 6 栏的分镜表":镜号 / 景别 / 画面内容 / 台词 / 运镜 / 时长

这是国内短视频行业最常见的轻量分镜表字段,适合科普长视频这种"脚本驱动画面"的制作模式(先定口播稿的句子,再给每句配对应镜头)。

#4.2 专业级字段(StudioBinder 标准,适合更复杂的多机位/实拍项目)

来源:StudioBinder《Shot List Template — Free Download》 https://www.studiobinder.com/blog/shot-list-template-free-download/

核心字段:Scene Number(场次号)/ Shot Number(镜号)/ Shot Description(镜头描述)/ Shot Size(景别,如特写/中景)/ Shot Type-Camera Angle(机位角度,如平视/俯拍/仰拍)/ Camera Movement(运镜,如固定/摇/移/推)

进阶字段:Status(完成状态)/ Subject(拍摄主体)/ VFX(特效备注)/ Camera(机型)/ Equipment(辅助设备如三脚架/摇臂)/ Lens(镜头焦段)/ Frame Rate(帧率:正常/慢动作/快动作)/ Sound(收音方式:吊杆/领夹麦/MOS 静音)/ Lighting(灯光备注)/ Location(拍摄地点)/ Prep Time & Shoot Time(准备/拍摄用时)/ Start Time(排期起始时间)/ Camera Setup(机位变更标记)/ Notes(备注)/ Color Coding(颜色分类)/ Reference Image(参考图/分镜草图)

对纯图形化科普长视频(Remotion/Manim 生成画面,没有实拍)而言,可以精简为:镜号 / 对应口播句 / 时长(秒) / 画面类型(图表/动画/实拍素材/文字卡) / 素材来源或 Prompt / 运镜或转场 / 备注,本质是把 StudioBinder 的实拍字段替换成"素材来源"字段。

#4.3 工具化/AI 辅助做法

工程建议:科普长视频用 Remotion 做画面引擎时,分镜表最实用的落地形式就是一个 JSON/CSV 数组,每个元素对应一个 <Sequence>,字段取 4.2 的精简版(镜号/口播句/时长/画面类型/素材来源/备注),可以直接被脚本读取驱动 Remotion 渲染参数,不需要额外的分镜软件。


#5. "AI 味"的具体特征与去除方法

这是查到资料最系统的一节,来自三个独立信源,交叉验证后总结如下:

#5.1 检测原理(中文,来源:CSDN《AI 生成的文章如何"去 AI 味"?检测原理与自动化改写实战》

https://blog.csdn.net/haoxinpoju/article/details/161653000)

AI 文本的 6 个可检测维度:

  1. 困惑度(Perplexity)低:AI 总是选概率最高的词,人类用词更跳跃、更不可预测。
  2. 突发性(Burstiness)低:人类文本"短句和长句交替出现",AI 生成的句子长度更均匀(可用句长标准差量化)。
  3. 结构指纹:过渡词滥用("然而、此外、值得注意的是、综上所述")、段落开头模式化、对称结构癖好("不仅…而且…")、总是以总结性结尾收尾。
  4. 词汇分布偏差(AI 高频词):"深入探讨、全面解析、旨在、至关重要、不可或缺、显著提升"。
  5. 标点格式模式:AI 很少在段落结尾不加标点,倾向使用"完整"的标点组合。
  6. 语义一致性过高:AI 文本连贯性"过于完美",不会像人类一样跑题、插入个人轶事。

#5.2 中文可直接套用的替换表(同上来源)

AI 高频词 替换为
深入探讨 聊聊 / 拆解一下
全面解析 具体说 / 实操讲一遍
至关重要 很关键 / 这步不能省
综上所述 所以 / 总结一下
值得注意的是 提醒一下 / 注意了

#5.3 六大改写策略(同上来源)

策略 具体做法 示例
打破句长均匀性 长句中间插入 5-10 字的极短句 长句→短句→长句交替
注入口语化 用"说实话、讲真、翻车"等替换书面语 "该方案可行"→"这套方案我跑了两周,效果可以"
具体数字场景 把泛泛而谈改为具体数据 "性能有提升"→"QPS 从 1200 涨到 3400,延迟降 60%"
破坏结构指纹 不要每段都做总结,偶尔用反问句开头 去掉"首先…其次…最后…"这种模板化结构
替换 AI 偏好词 见 5.2 表
段落结尾去标点 列表最后一条可以不加句号,更像手写笔记

#5.4 英文场景的系统规则清单(来源:《Stop Slop》去 AI 味规则指南

https://txtmix.com/posts/tech/hardikpandya-stop-slop-ai-writing-pattern-skill-guide/)

词汇层禁用清单

  • 清嗓式开场(Throat-clearing openers):"Here's the thing:" / "It turns out" / "Let me be clear" / "The real [X] is" → 直接删除,从第一句就进入内容。
  • 空转强调词(Emphasis crutches):"Full stop." / "Let that sink in." / "This matters because" → 全部删除,无信息量。
  • 企业套话:"navigate (challenges)"→handle,"unpack (analysis)"→explain,"lean into"→accept,"deep dive"→analysis,"circle back"→return to。
  • 16 个禁用副词:"really / just / literally / genuinely / honestly / simply / actually" 等 → 全删,不留。
  • 模糊声明:"The reasons are structural" / "The implications are significant" / "The stakes are high" → 只说"重要"不说具体内容是空话,要具象化。

句式层套路

  • 二元对比句:"Not because X. Because Y." / "[X] isn't the problem. [Y] is." → 直接说 Y,跳过否定部分。
  • 负面排比列表:"Not a X... Not a Y... A Z." → 跳过连续否定,直接陈述。
  • 修辞预告句:"What if [reframe]?" / "Here's what I mean:" / "Think about it:" → 直接说观点,删除铺垫脚手架。

句子硬约束(可作为科普口播稿的自查规则):

  • 不用 Wh- 疑问句开头做修辞(What/When/Where/Which/Who/Why/How 开头的"假提问")
  • 不用破折号(em dash)
  • 不用被动语态
  • 避免极端词(every / always / never / nobody / everybody)

结构层套路

  • 戏剧碎片化:"[Noun]. That's it. That's the [thing]." / "X. And Y. And Z." → 合并成完整陈述句。
  • 虚假主语:用"The decision emerges"这种回避主语的说法 → 点名具体执行者。
  • 段落收尾雷同:避免每段都用"punchy one-liner"式金句收尾,每段换一种收尾方式。

5 维自评评分卡:Directness(直接度)/ Rhythm(节奏感)/ Trust(可信度)/ Authenticity(真实感)/ Density(信息密度),总分要求 ≥ 35/50。

#5.5 结构/修辞层的 AI 味特征(来源:aitoolly《LLM Smells》

https://aitoolly.com/zh/ai-news/article/2026-05-29-the-rise-of-llm-smells-identifying-the-predictable-patterns-of-ai-generated-content-and-web-design)

  • 特定句式:"不仅是 X,更是 Y"、"X 是 Z 的 Y"
  • 金句过载:"对称性变成了陷阱"——"人类信任对称性,因为它感觉像是可见的智能",AI 偏爱制造工整的排比金句,但过度使用会显得刻意。
  • 连续短句强调制造语气(如"然而倾斜并非偶然。它是最优化的形状。")——这种手法本身不是问题,问题是使用频率过高、每段都用
  • 过度使用"富有哲理但略显刻意的结论"句式,是科普脚本收尾最容易踩的坑(对应本文第 1.3 节⑤"回扣"环节要避免空洞升华)。

#5.6 落地到科普口播稿的检查清单

结合以上三个信源,整理出可直接用于自查/AI 改写 Prompt 的清单:

  • 全文过渡词是否只剩"然而/此外/值得注意的是/综上所述"这几个?(超过 2 次出现即需替换)
  • 是否每一段都用"总结性金句"收尾?(超过 60% 段落如此即为 AI 味信号)
  • 句长方差是否过低?(读一遍,如果每句话字数都接近,故意插入几句 5-10 字的短句打断节奏)
  • 是否出现"深入探讨/全面解析/旨在/至关重要/不可或缺/显著提升"等高频 AI 词?
  • 是否用"不仅…更是…""不仅是 X,更是 Y"这类对称排比句超过 2 次?
  • 数据/结论是否够具体?("性能有提升"这类空话必须替换为具体数字)
  • 结尾是否是"这提醒我们……"式空洞升华?(应替换为第 1.3 节的"回扣 Hook"做法:呼应开场悬念,给出具体的"所以呢")

#6. 封面与元数据

#6.1 YouTube 封面(Thumbnail)规格

来源:vidIQ《YouTube Thumbnail Design Tips: Best Practices》 https://vidiq.com/blog/post/youtube-thumbnail-design-tips/

技术规格

  • 分辨率 1280×720 px,宽高比 16:9,最小宽度 640px,文件 <2MB,格式 JPG/PNG/GIF(PNG 因文字/图形更锐利被推荐)。

设计套路

  • 文字控制在 3-5 个词以内,避免放在右下角(会被时长标签遮挡);用粗黑无衬线字体,加描边/阴影/色块背景保证可读性。
  • 人脸出现率高:数据显示 69% 的爆款视频用了人脸,头部创作者中这一比例高达 80%;表情要真实自然而非夸张(只有约 5% 的头部视频用了夸张表情);人脸占画面 1/4 到 1/3
  • 保持单一视觉焦点,避免杂乱。
  • 配色要用高对比、互相"打架"而非融合的颜色;避免红/白/黑(会和 YouTube 界面本身的配色融合),偏好橙/青/黄/紫做区分。
  • 移动端优先设计(YouTube 大部分观看时长来自手机),人脸和关键文字要避开画面边缘,防止被裁切。

#6.2 YouTube 章节(Chapters/时间戳)格式要求

来源:YouTube 官方帮助文档 https://support.google.com/youtube/answer/9884579

  • 第一个时间戳必须从 00:00 开始(原文:"Make sure that the first timestamp you list starts with 00:00.")
  • 至少需要 3 个时间戳,按升序排列("Your video should have at least three timestamps listed in ascending order.")
  • 每个章节最短时长 10 秒("The minimum length for video chapters is 10 seconds.")
  • 时间戳格式为 MM:SS(或超过 1 小时用 HH:MM:SS),需在视频描述里按升序列出"时间戳 + 标题"
  • 手动添加的章节会覆盖 YouTube 自动生成的章节

#6.3 YouTube 上传前清单(选取与本项目最相关部分)

来源:CollabPals《YouTube Upload Checklist 2026: 30+ Steps》 https://www.collabpals.com/tools/youtube-upload-checklist

  • 标题:建议 70 字符以内,关键词前置
  • 描述:前两行要有钩子,附时间戳、链接、关键词、Hashtag、CTA
  • 标签5-15 个,从主关键词开始
  • 封面:自定义上传 1280×720,文字可读、高对比、品牌一致
  • 片尾卡:订阅按钮 + 视频链接,配合口播里的语音 CTA 同步出现
  • 字幕:上传字幕文件或复核自动字幕、检查语言设置
  • 设置:儿童内容标记、分类、评论区、变现、版权检查
  • 常被漏掉的步骤(文章特别强调):文件命名优化、等待 HD 处理完成再发布、置顶首条评论、口播里的 CTA 要和片尾卡时间对齐

#6.4 B站分P与"看点"功能

分P:知乎《B站上如何把同类视频做成分P合集》 https://zhuanlan.zhihu.com/p/567615709 用于把一个系列/多集内容打包在同一个投稿下,PC 端网页投稿时可在上传页添加多个分P,用户在同一个播放页通过右侧列表切换集数,适合科普系列课程或长视频拆条发布场景。(该文章为网页版投稿流程教学,未深入运营策略层面,具体操作步骤建议直接看创作中心投稿页。)

看点:其功能定位为B站官方对标 YouTube Chapters 的"进度条分段导航"功能——用于"标注出视频的分段和看点,方便粉丝快速找到感兴趣的内容",创作者可在视频进度条下方添加类似目录的结构标记,用户可通过进度条模块直接跳转到感兴趣的分段。(来源为综合检索结果的归纳描述,未抓到 B站创作学院官方原文页面的具体操作步骤和字段限制,建议正式使用前到"创作学院"后台核实最新交互路径:https://member.bilibili.com/academy/)

#6.5 AI 生成内容标识(发布合规,中国大陆平台强制要求)

来源:中央网信办等四部门《人工智能生成合成内容标识办法》官方通知 https://www.cac.gov.cn/2025-03/14/c_1743654684782215.htm

  • 显式标识(视频类):须在视频起始画面和播放周边的适当位置添加显著提示标识,可以在视频末尾和中间适当位置追加显著提示标识。
  • 隐式标识:服务提供者应在生成合成内容的文件元数据中添加隐式标识,包含内容属性信息、服务提供者名称/编码、内容编号等;鼓励采用数字水印。
  • 必须标识的情形:属于《深度合成管理规定》第十七条第一款所列情形的所有视频生成合成内容(涉及深度合成人脸、语音等生成合成技术)。
  • 可不加显式标识的情形:用户申请且通过协议明确责任、服务提供者留存相关日志不少于 6 个月的,可提供不含显式标识的内容(第九条)。

这一条直接对应用户 checklist 里的"AI 标识"项:只要视频用了 AI 配音(TTS)/AI 生成画面,理论上都落在需要显式+隐式标识的范围内,正式上线前需要在片头/片尾加"本视频内容由人工智能生成"字样。


#7. 横屏长视频切竖屏短视频引流 + 一稿多用

#7.1 自动切片工具对比

工具 定位 价格(查证到的具体数字) 备注
Opus Clip SaaS,AI 自动找爆点切片 Free:60 分钟处理时长/月(带水印,3 天过期);Starter:$15/150 分钟;Pro:$29/300 分钟 来源:QuickReel 对比文章 https://quickreel.io/blog/ai-clip-tool-pricing-compared
Vizard SaaS,同类竞品 Creator 月付 $29/月(600 分钟上传时长/10 小时,4K 导出,无水印);年付约 $16.90/月 同上
Riverside 播客/视频录制平台内置 Magic Clips Free 计划含 Magic Clips;Pro 年付 $24/月含 "Magic clips & show notes" + 无限文字剪辑;具体 Magic Clips 单独用量/额度未在定价页公开,需联系销售 来源:https://riverside.com/pricing(页面未拆分 Magic Clips 具体额度)
Clipsai (clips.ai) 开源 Python 库,非 SaaS 免费(自部署),基于 WhisperX 转录 + Pyannote 说话人识别 来源:https://www.clipsai.com;核心功能是"自动切片+16:9→9:16 智能重新构图跟随说话人"
其他查到的同类产品 2Short Pro / Klap / QuickReel / Submagic 2Short Pro:$19.90/15 小时分析;Klap:$14/月起(年付)10 条/45 分钟;QuickReel Pro+:$49/500 credits(约 8.3 小时);Submagic:$39/月 同 QuickReel 对比文章,注意"价格每月都在变,付款前上官网核实"

工程建议:如果团队已经有 WhisperX 做时间轴对齐(前序调研已覆盖),Clipsai 是最省钱的路线——同样基于 WhisperX,自己部署零边际成本;如果不想自建 pipeline,Opus Clip 的 $15/150 分钟入门档性价比最高。

#7.2 一稿多用:视频转公众号/博客文章

方案一(转录+改写一体化 SaaS,中文场景):来源:https://www.resohub.net/zt/2025/07/18/ai-media2doc-video-to-article-tool/ 工具"提词匠"(微信小程序)流程:上传本地视频/音频或粘贴公开视频链接(支持 8 种视频格式、8 种音频格式、100+ 国内平台链接直接提取)→ 约 5 秒-十几秒出转录初稿(识别准确率宣称 95%+)→ 内置智能改写做口语转书面语的润色 → 导出 TXT/Word/带时间戳 SRT。单文件上限 120 分钟、500MB

方案二(开源工具):搜索中出现"AI-Media2Doc"开源项目,用于把视频转成小红书/公众号图文,具体实现细节未逐行核实,仅作为存在性参考。

工程建议:科普长视频"一稿多用"的最短路径是——口播稿本身就是最好的文章底稿(不需要再从视频转录一遍)。发布流程建议是:先写口播稿 → 渲染视频 → 口播稿去掉画面指代词("你看这张图"之类)+ 补回图片/图表 → 直接发公众号/博客,比"转录视频再改写"更省一道 ASR 误差。转录方案只在"临场发挥、没有逐字稿"的场景下才有必要。


#8. 成片前质检清单(Checklist)

综合 CollabPals 清单(https://www.collabpals.com/tools/youtube-upload-checklist)、YouTube 官方章节规范、AI 标识合规要求,以及前序调研已覆盖的音画同步/响度/编码规格类目,整理成一份可直接勾选的成片前 checklist:

#内容与合规

  • AI 生成内容标识:片头/片尾是否加了"本内容由人工智能生成"类显式标识(见 6.5,中国大陆平台强制要求)
  • 素材授权:所有配图/音乐/素材是否有可商用授权,或来自 CC0/自有素材库
  • 引用/数据来源:视频里出现的关键数据、结论是否可追溯到来源(建议在描述区列参考文献)

#音画质量

  • 音画同步:口播音轨与画面动作(尤其是关键词高亮、图表出现时机)无肉眼可见的错位
  • 响度:整体响度是否符合目标平台标准(前序调研已覆盖具体 LUFS 数值,此处不重复)
  • 字幕:是否有错别字、时间轴漂移;专业术语/人名是否拼写一致
  • 空拍/卡顿:TTS 拼接处/剪辑点是否有不自然停顿

#结构与脚本

  • 是否有"AI 味"残留:过渡词滥用、每段总结式收尾、高频 AI 词(见第 5 节清单)
  • Hook 是否在开场 3-5 秒内出现(见第 1 节)
  • 结尾是否回扣了开场悬念,CTA 是否只有一个明确动作

#编码与规格

  • 分辨率/编码/帧率是否符合目标平台规格(前序调研已覆盖,此处不重复)
  • 文件命名是否规范(CollabPals 清单特别提到这是常被漏掉的一项)

#封面与元数据

  • 封面:1280×720,文字 3-5 词以内,人脸占比 1/4-1/3(若有出镜/拟人形象),高对比配色(见 6.1)
  • 标题:70 字符以内,核心关键词前置
  • 描述:前两行有钩子,附时间戳章节、参考链接
  • 章节(Chapters):第一条必须 00:00 开始,至少 3 条,每条时长 ≥10 秒(见 6.2,格式不合规会导致 YouTube 不生效)
  • B站补充:分P/看点是否设置(长视频拆条或多集科普课程场景)
  • 标签:5-15 个,主关键词优先

#发布前最后一遍

  • HD 处理是否完成再设为公开(CollabPals 特别提示的常见错误)
  • 首条评论是否置顶(引导讨论方向)
  • 片尾卡的语音 CTA 与画面 CTA 是否时间对齐

#未找到可靠来源的部分(如实列出,不编造)

  • 专门针对"中文科普/知识区口播"的官方语速统计数字(180-220/200-260/220-280 具体哪个更准)——未找到权威第三方测评仲裁,本文档给出的是基于播音标准 250-260 字/分钟交叉推算的工程估算值。
  • "8/15/25 分钟科普长视频"分钟级脚本结构占比的官方模板——未查到专门文档,第 1.3 节为综合短视频口播框架外推整理,已在文中标注。
  • Notion 官方 Shot List 模板的具体字段列表——页面为营销落地页,未抓到字段详情,改用 StudioBinder 的详细字段列表替代。
  • Riverside Magic Clips 的具体额度/单独定价——官网定价页未拆分披露,需联系销售。
  • B站"看点"功能的官方操作步骤与字段限制(创作学院原文页面未抓取成功)——已用综合检索结果的功能定位描述替代,建议正式使用前登录创作学院后台核实最新交互。
  • 科普脚本"4 段结构"的具体每段名称(海螺社博客只给了结论性描述"科普脚本4段结构,把专业内容讲到小白能听懂",未展开每段细节)。

来源:沉淀/AI科普长视频-原始调研报告/端到端工程补充.md(整理于 2026-08-18)