30 · 自媒体场景
从长文到能拍的口播与分镜
很多公司的短视频,就是这么来的:公众号文章写完,领导顺手丢给同事一句,“改成一分钟视频,今天拍出来。”
很多公司的短视频,就是这么来的:公众号文章写完,领导顺手丢给同事一句,“改成一分钟视频,今天拍出来。”
然后同事可能就照着文章念,但关键是文章和短视频的逻辑完全不一样:文章是为了把一个东西讲透,而短视频是为了吸引大家把它看完。反正写文章跟做短视频的逻辑还真的挺不一样的。
就算口播写顺了,到了拍摄现场还会出现第二个问题:镜头表里写满“配相关画面”“这里加 B-roll”“适当转场”。话都对,但摄影和剪辑根本不知道该拍什么。
这次我拿一篇已经核验过的长文,在豆包工作里连续跑了两个任务:
已核验长文
→ 改成 60—75 秒自然口播
→ 人工确认口播事实和节奏
→ 拆成 9 个连续镜头
→ 补齐动作、景别、屏幕文字、素材状态
→ 最后检查版权、隐私和事实边界
跑完以后,最终得到一份约 290 字、正常语速 65—70 秒的口播稿,以及一份 68 秒、9 个镜头的分镜执行表。
先选工具:两个任务,不要混在一个提示词里
| 任务 | 最优工具 | 为什么 |
|---|---|---|
| 已核验长文 → 自然口播 | 新媒体写作 Skill | 它明确覆盖短视频脚本,更擅长处理口语节奏、开头和听觉理解 |
| 已确认口播 → 分镜执行表 | 创意视频 Skill | 它离真实拍摄更近,能把机位、动作、B-roll、声音和剪辑要求拆开 |
| 真正生成视频 | Seedance 2.5(可选) | 本案例的目标是“给人拍”,如果你想补充一些素材也可以使用AI视频。 |
任务一:先把长文改成“能说出口”的口播
第一步:选择新媒体写作这个Skill
新建工作任务后,先调用新媒体写作。这个 Skill 的能力说明里直接写了“短视频脚本创作”,比泛用文档写作更贴这个场景。

第二步:不要只说“帮我生成成一分钟的口播”
如果提示词只有“把这篇文章改成一分钟口播”,AI 最容易做的就是删字。所以最关键的是你有没有写清五件事:说给谁听、讲多久、只保留什么、什么绝对不能改、最后按什么格式交付。
这次是把经过核验长文直接粘进输入框。你也可以上传自己的文章;如果上传文件,请把最后的“原始长文”替换成明确文件名,并提醒它只使用该文件。
可直接复制的实测提示词
请使用「新媒体写作」能力,把下面这篇已经核验过的长文改成一段可以直接对镜头说的短视频口播稿。
目标:
- 平台:视频号 / 抖音都能使用
- 时长:60—75 秒
- 受众:企业里的普通打工人、内容运营新手
- 只讲一个核心问题:【在这里写核心问题】
- 只保留一条清晰结论和一个容易听懂的例子
- 开头 5 秒内进入问题,不用“震惊”“一定要”等夸张钩子
- 句子要短,像真实的人在说话,不要论文腔
- 必须保留原文里的关键限制条件,不能把有条件判断改成绝对承诺
- 标注建议停顿【停顿】和需要重读的词【重读】
- 不要生成分镜、镜头或字幕文件
- 不要补写原文没有的数字、案例和结论
请按以下结构输出:
1. 核心信息取舍:用 3 行说明保留了什么、删掉了什么、为什么
2. 最终口播稿:可直接照着念,约 260—320 字
3. 简介补充信息:列出 2—3 条不适合塞进口播、但值得放在视频简介里的边界信息
原始长文:
【把你的已核验长文完整粘贴在这里;或上传文件后写:只读取《文件名》】

第三步:过程里要看见它真的读了 Skill
任务开始后,豆包工作先显示“已读取 Doubao Newmedia Writing 技能”,再判断这次要做的是口播而不是文章摘要。这个中间过程值得留意:如果它没有识别时长、听众和事实边界,结果大概率只是短一点的文章。

实测结果:约 290 字,能直接照着念
最终口播可以看到第一句就能抛出大家最关心的问题:很多人做一稿多发,就是把公众号文章复制到小红书,再缩一下发微博,最后改个标题扔视频号。
中间只保留了一个对比例子:公众号可以把背景、测试和结论讲完;视频号只留一个问题、一条结论和一个听得懂的例子。
它还主动把最危险的一句保住了:
原文如果说“在信息完整、事实已经核验的前提下可以提效”,你不能改成“用 AI 一定能提效”。
全文约 290 字,豆包工作估算正常语速 65—70 秒,并标了停顿和重读位置。

任务二:口播确认后,再拆成真正能拍的分镜
口播稿出来以后,更稳妥的做法是先人工确认口播,再开一个新任务,把确认后的版本交给创意视频。这样分镜任务只能围绕定稿安排画面,不会边拆镜头边改事实。
第一步:使用创意视频Skill
创意视频的能力说明里直接包含商业广告、口播视频和产品推广视频。它不只会写文案,更接近拍摄和剪辑执行。

第二步:把拍摄条件交代清楚
分镜最怕脱离现实。你只有一部手机,就别让它设计三机位轨道镜头;你只有自己拍的素材,就别让它默认使用影视片段和图库。
大部分普通人第一次拍口播,就用自己的手机就行了,找个安静的地方,把手机固定住,就能开录。
分享一个经验:不管是做任何形式的自媒体,口播也好,写文章也好,一开始都要极致的轻量化,把大部分的精力放在选题与标题(短视频就是视频开头)上面。你每次投入的时间够少,但是又在做正确的事情(正确的事情就是把大部分的精力放在选题与标题上),你才能够坚持。也更容易在不经意间获得正反馈,从而进入一个正向的循环。
所以,这次我把条件写死:9:16 竖屏、一位职场人在办公桌前、手机加三脚架、可用素材只有本人正面口播、手部操作、文章录屏和自制关键词卡片。还要求每项素材标成【已有】【需补拍】【需制作】【需确认版权】。
可直接复制的实测提示词
请使用【创意视频】能力,把下面这份已经确认的口播稿拆成一份可以直接照着拍的分镜执行表。只做拍摄与剪辑方案,不要生成实际视频,也不要生成字幕文件。
成片条件:
- 比例:9:16 竖屏
- 总时长:65—70 秒
- 场景:一位职场人在办公桌前对镜口播
- 可用设备:手机、三脚架、笔记本电脑
- 已有素材:本人可拍的正面口播、手部操作电脑、文章页面录屏、自制关键词卡片
- 不使用未经授权的图库、影视片段或他人账号截图
- 节奏:清楚、克制、像实用教程,不要快切炫技
执行要求:
1. 按 0—5 秒、5—12 秒这类连续时间段拆成 8—10 个镜头,时间总和必须覆盖 65—70 秒,不能重叠、不能留空。
2. 每个镜头都给出:对应口播原句、人物动作、景别、机位 / 构图、屏幕文字、B-roll 或截图、转场、声音要求。
3. 屏幕文字只保留关键词,每屏不超过 12 个汉字,不能把整段口播再贴一遍。
4. 不要写“配相关画面”这种空话,要明确拍什么、屏幕录什么、文字放哪里。
5. 标出每项素材状态:【已有】【需补拍】【需制作】【需确认版权】。
6. 不改写口播里的事实和边界,尤其要保留原稿的限制条件,不能把有条件判断改成绝对承诺。
7. 最后再附一份按拍摄顺序整理的拍摄清单,以及按时间顺序整理的剪辑检查清单。
请按以下结构输出:
A. 拍摄设定(机位、光线、收音、背景)
B. 逐秒分镜执行表
C. 拍摄清单
D. 剪辑检查清单
E. 版权与隐私检查
已确认口播稿:
【把上一轮人工确认后的完整口播稿粘贴在这里】

第三步:先算时长,再拆镜头
豆包工作先按口播字数和停顿估算每段时长,再把整条视频拆成 9 个镜头。这个顺序很重要:先写 9 个镜头、最后才硬凑时间,最容易出现口播根本念不完,或者中间突然空出五秒。

实测结果:68 秒,9 个镜头,每一秒都知道拍什么
最终时间线是:
| 时间 | 画面任务 |
|---|---|
| 0—7 秒 | 中近景说出“复制粘贴式一稿多发”,右手敲桌面三次 |
| 7—13 秒 | 近景强调“省时间不等于有效果” |
| 13—21 秒 | 插入手部滚动文章,解释平台阅读方式不同 |
| 21—30 秒 | 本人文章录屏对比“公众号顺着看、视频号听你说” |
| 30—37 秒 | 拿起“结构”卡片,强调改的是表达结构 |
| 37—49 秒 | 文章录屏展示“背景/测试/结论”和“问题/结论/例子” |
| 49—58 秒 | 用“有条件/绝对化”卡片守住事实边界 |
| 58—63 秒 | 近景强调“有条件判断不能变成绝对承诺” |
| 63—68 秒 | 拉远收尾,桌面全景定格 |
9 段相加正好 68 秒,没有空挡,也没有重叠。
结果最后还有三个兜底清单:按拍摄顺序安排先拍什么、按时间顺序检查怎么剪,以及版权和隐私怎么查。尤其最后一项事实边界,要求口播、屏幕文字、标题和封面都不能把条件删掉。

最后,记住这套两段式提示词公式
第一段长文转口播,至少写清:
- 谁听、在哪个平台听、要听多久;
- 只讲哪个问题,只保留哪条结论;
- 哪些限制条件不能删;
- 哪些内容适合移到简介,不要硬塞进口播;
- 输出里要有停顿、重读和字数检查。
第二段“口播转分镜”,至少写清:
- 设备、场景、比例和已有素材;
- 时间段必须连续,合计等于总时长;
- 每个镜头都要有动作、景别、机位、文字、素材和声音;
- 每项素材标状态,别写“配相关画面”;
- 最后检查版权、隐私和事实边界。
拍之前,再用这张清单走一遍:
口播是否真的完整念过一遍
口播里的数字、日期、案例和限制条件是否与原文一致
每个镜头的时间是否连续,总和是否等于成片时长
摄影和剪辑能否看懂每一镜到底要拍什么
屏幕文字是否只是关键词,而不是整段字幕
录屏、字体、音乐、人物和平台界面是否有授权或隐私问题
长文、口播和分镜,其实是三种不同的东西。长文负责把事情说完整,口播负责让人一遍听懂,分镜负责让现场真的拍得出来。
把它们拆成两次任务,你不但更容易得到好结果,也更容易在每一步发现:到底是内容有问题、表达有问题,还是拍摄执行有问题。
AI 办公产品教程 · 完整版