
诗词类短视频一直是个很微妙的内容赛道。做得好评论区全是求教程太有感觉了做得不好就是几张图配一段朗读播放量卡在几百上不去。我前前后后试过纯手工剪辑、模板套用、脚本批量生成几条路子最后稳定下来的方案是用扣子搭一个AI Agent把选题—写诗—配图—配音—合成视频这条链路串起来人只需要在关键节点做审核和微调。这套东西跑顺之后单条视频从构思到成片大概十几分钟而且风格统一、可批量。这篇就把我踩过的坑和最终跑通的配置完整拆一遍。核心关键词是扣子、AI Agent、大模型、剪映、工作流——我会讲清楚Agent和单纯调大模型有什么区别、为什么诗词视频特别适合用Agent来做、工作流里每个节点怎么配、剪映这一环怎么衔接以及那些文档里不会写但实际会卡住你的细节。不管你是完全没接触过扣子的新手还是已经搭过几个Bot想进阶到多节点工作流的老手应该都能从里面捞到点能直接抄的东西。1. 先想清楚诗词视频为什么值得用Agent而不是纯手工1.1 诗词短视频的产能瓶颈到底在哪很多人以为诗词视频的难点在写诗其实不是。大模型写一首五言绝句或者七言律诗质量已经相当能打了你给它限定主题、韵脚、风格出来的东西改两个字就能用。真正的瓶颈在流程的碎片化你要先想主题再让模型写诗然后去配图还得是那种有古风意境的图接着找配音要么自己录要么用TTS最后丢进剪映里对轴、加字幕、配BGM、导出。这一套下来熟练工也得半小时以上而且每一步都要切换工具注意力被切得稀碎。更麻烦的是一致性。今天你用A模型写诗、B工具配图、C音色配音明天换个模型风格就飘了。诗词视频吃的就是那股气韵统一的劲儿画面、文字、声音三者得在一个调性上否则观众一眼就出戏。纯手工做你很难保证每条都稳定在这个水准线上。1.2 Agent和直接调大模型的本质区别这里得先把一个概念掰扯清楚因为热词里agent和llm和ai模型有什么区别被搜了无数次。简单说大模型LLM是一个大脑Agent是给这个大脑配了手脚和记忆的完整的人。你直接调大模型比如问DeepSeek写一首关于秋天的诗它给你返回一段文本任务就结束了。它不知道你要拿这首诗干嘛不会主动去配图不会记得你上次喜欢什么风格。而Agent不一样它有自己的目标生成一条完整的诗词视频、工具可以调用写诗插件、绘图插件、TTS插件、记忆记住你的偏好和历史、规划能力知道先做什么后做什么哪一步失败了要重试。放到诗词视频这个场景里这个区别是决定性的。纯调模型你得到的是一首诗用Agent你得到的是一条视频。前者是原料后者是成品。扣子的价值就在于它把搭Agent这件事的门槛拉到了普通人能上手的程度——你不需要写代码用可视化的工作流把节点连起来就行。1.3 什么样的诗词内容适合批量化不是所有诗词视频都适合走Agent批量路线。我实测下来知识科普型比如唐诗里的月亮意象宋词中的离别、节气节日型立春、中秋、重阳、每日一诗型这三类最适合。它们的共同点是主题可以预先枚举、结构相对固定、对创意惊喜的要求没那么高观众要的是稳定的审美体验和知识增量。反过来那种需要强个人表达、强情绪张力的原创诗歌视频还是老老实实手工做。Agent擅长的是把标准动作做到80分且稳定不是偶尔做出95分的惊艳。想清楚这一点你就不会对工具抱有不切实际的期待。2. 扣子里搭这个Agent的整体架构长什么样2.1 从输入到成品的五个核心节点我在扣子里把这个Agent拆成了五个节点串成一条工作流主题输入节点接收一个主题词比如秋思边塞江南春雨或者直接给一句诗让Agent扩展。诗词生成节点调用大模型按预设的格式要求体裁、句数、韵脚、风格生成诗词正文同时输出白话译文和赏析。画面描述生成节点把诗词拆成几个画面段落为每段生成适合AI绘图的提示词prompt。素材生产节点调用绘图能力生成配图调用TTS生成配音这里可以并行。合成输出节点把文字、图片、音频、字幕打包输出成剪映能直接识别的工程文件或素材包。这五个节点里第2和第3个是纯文本处理最稳定第4个是变数最大的绘图和TTS的质量直接决定成片观感第5个是衔接环节也是最容易被忽略但最容易出问题的地方。2.2 为什么用工作流而不是单Bot对话扣子里有两种玩法一种是搭一个对话式Bot用户跟它聊天另一种是搭工作流Workflow按固定流程跑。诗词视频这个场景必须用工作流。原因很简单对话式Bot是你一句我一句的交互适合问答、客服、陪聊这类场景。但诗词视频生产是一个确定性的流水线——输入主题经过固定几步输出视频。中间不需要用户反复插话需要的是每一步稳定执行、失败能重试、结果能传递。工作流的节点化设计正好干这个。我一开始也想偷懒用对话Bot结果发现每次都要手动把上一步的输出复制到下一步等于没省事。换成工作流之后节点之间自动传参一次配置好后面就是批量跑。2.3 各节点的输入输出怎么设计才不打架这是实操里最容易翻车的地方。节点之间传数据格式必须约定死否则下游节点拿到一堆乱七八糟的文本没法处理。我的做法是强制结构化输出。比如诗词生成节点我要求大模型必须按这个格式返回【正文】 诗词内容每句一行 【译文】 白话翻译 【赏析】 50字以内的赏析 【画面】 1. 第一段画面描述 2. 第二段画面描述 3. 第三段画面描述用这种带标记的格式下游节点就能用字符串分割的方式精准提取每一块。如果你让模型自由发挥它这次用标题下次用【标题】你的解析逻辑就得写一堆兼容非常痛苦。提示在扣子的提示词里一定要明确写严格按照以下格式输出不要添加任何额外说明文字。大模型有很强的补充解释倾向不压住它它会在你的格式外面加一堆废话。3. 诗词生成节点提示词怎么写才能稳定出好诗3.1 体裁、韵脚、风格的约束怎么下大模型写诗最大的问题是看起来像诗但经不起推敲——平仄不对、韵脚乱押、意象堆砌。要压住这个问题提示词里必须把约束条件写死。我的提示词模板大致是这样你是一位精通古典诗词的创作者。请根据主题{主题}创作一首{体裁}。 要求 1. 体裁{五言绝句/七言律诗/词牌名} 2. 韵脚押{平水韵某部}韵偶数句必须押韵 3. 风格{清新/豪放/婉约/苍凉} 4. 意象围绕{主题}选用{季节/地域}相关的典型意象 5. 避免生僻字和现代词汇 输出格式严格如下 【正文】 ... 【译文】 ... 【赏析】 ... 【画面】 ...关键在韵脚这一条。如果你只说押韵模型可能押的是现代汉语拼音的韵读起来怪怪的。指定平水韵或者具体韵部出来的东西才经得起懂行的观众看。当然如果你面向的是大众观众对平仄要求没那么严可以放宽到读起来顺口即可这样模型发挥空间大出稿也快。3.2 怎么让模型输出画面描述而不是干巴巴的诗这是很多人卡住的地方模型给你一首好诗但你不知道怎么把它变成画面。解决办法是在同一个提示词里就让模型把画面描述一起生成而不是事后再调一次。我在提示词里明确要求请将诗词内容拆解为3到4个画面段落每段用一句话描述画面包含主体、环境、光线、色调适合用于AI绘画。这样出来的画面描述天然就跟诗词内容对齐不会出现诗写秋天图画春天的错位。举个例子主题秋思模型可能输出画面1一位青衫文士独立于枫林小径落叶纷飞夕阳斜照暖橙色调画面2远处江水苍茫孤舟一叶暮色四合冷蓝色调画面3文士凭栏远望手中握着未寄出的信笺室内烛光摇曳暖黄与暗影对比这种描述直接丢给绘图模型就能用不需要你再二次加工。3.3 实测中模型最容易犯的三个错跑了几百条之后我总结出模型在诗词生成上最常犯的三个毛病第一凑字数。尤其是七言律诗它为了凑够八句会硬塞一些跟主题无关的句子。解决办法是在提示词里加一句每一句都必须服务于主题宁可少写也不要凑数虽然不能完全杜绝但能改善不少。第二赏析写成复述。你让它写赏析它把诗又翻译了一遍。这时候要在提示词里明确赏析要讲意境和手法不要复述诗句内容。第三画面描述太抽象。它写表现了诗人的孤独这不是画面描述这是情绪描述。绘图模型看不懂。要强调用具体的视觉元素描述不要写情绪和抽象概念。这三个问题本质上都是约束不够具体。大模型很聪明但它不知道你的标准是什么你得把标准翻译成它能执行的指令。4. 配图与配音决定成片质感的两大变量4.1 AI绘图的提示词怎么从诗词描述转过来诗词生成的画面描述是给人看的绘图提示词是给模型看的两者之间还差一层转换。我的经验是画面描述里要补上风格词和技术词。比如画面描述是青衫文士独立枫林落叶纷飞夕阳斜照转成绘图提示词要变成中国水墨画风格一位身着青衫的古代文士独立于枫林小径 枫叶纷飞夕阳斜照暖橙色调工笔细腻 画面留白意境悠远高清4K风格词水墨、工笔、写意决定整体调性技术词高清、4K、留白决定输出质量。这两类词不加出来的图要么风格乱要么糊。另外同一个视频里的所有配图风格词必须统一。你不能第一张水墨、第二张油画、第三张赛博朋克观众会晕。我的做法是在工作流里设一个全局的风格变量所有绘图节点都引用它这样改一处就全改了。4.2 TTS音色选择古风视频别用新闻腔配音这块坑比想象中多。最常见的错误是随便选个默认音色结果出来是新闻播报腔配上古风画面违和感拉满。古风诗词视频的音色我的选择标准是语速偏慢、音色偏温润、有轻微的气声。太字正腔圆反而假稍微带点念白的感觉最好。扣子里接的TTS一般都有多种音色可选你挨个试一遍找到那个读诗不违和的。还有一个细节断句。诗词的停顿跟普通文本不一样床前明月光要在床前后稍顿不能连读成床前明月光一坨。如果TTS支持SSML标记用break标签手动控制停顿如果不支持就在文本里用逗号、句号甚至空格来引导停顿。这个细节做好了配音的质感能上一个台阶。4.3 图片和音频的时长怎么对齐这是合成阶段最头疼的问题。一段配音假设12秒但你生成的图只有一张那这张图要显示12秒太单调如果你生成了3张图每张4秒又可能跟诗句的节奏对不上。我的处理方式是按诗句分组对齐。一首四句的诗通常拆成2到3个画面段落每个段落对应一到两句诗。配音也按这个分段来切保证念到哪句画面就切到哪句。具体操作上我会在生成阶段就让模型把诗句和画面段落做映射比如诗句画面段落预计时长前两句画面16秒第三句画面23秒第四句画面33秒有了这个映射表合成的时候按表来切就行不会乱。5. 剪映衔接Agent输出怎么变成能直接剪的素材5.1 为什么不让Agent直接出成片很多人会问既然都做到这一步了为什么不让Agent直接把视频合成好还要过一道剪映原因有两个。第一精细控制。Agent合成是一刀切转场、字幕样式、BGM卡点这些细节它做不了精细调整而恰恰是这些细节决定成片是能用还是好看。第二容错。AI生成的图和音总有那么一两处不满意你需要一个能快速替换、微调的环节。剪映的可视化时间线正好干这个。所以我的定位是Agent负责把80%的脏活累活干掉剪映负责最后20%的打磨。这个分工是最舒服的。5.2 素材包的目录结构怎么组织Agent输出的素材包目录结构一定要清晰否则丢进剪映里找素材找到崩溃。我的结构是这样的诗词视频_秋思/ ├── 01_文本/ │ ├── 诗词.txt │ ├── 译文.txt │ └── 赏析.txt ├── 02_图片/ │ ├── 画面1.png │ ├── 画面2.png │ └── 画面3.png ├── 03_音频/ │ ├── 配音.mp3 │ └── bgm.mp3 └── 04_字幕/ └── 字幕.srt编号前缀是为了排序剪映导入的时候按文件名顺序来不会乱。字幕单独出srt文件剪映可以直接导入识别省得手动打字幕。5.3 字幕文件怎么自动生成字幕是诗词视频的灵魂之一但手动打字幕极其耗时。我的做法是在Agent里就把字幕生成好输出成标准srt格式。srt的格式是这样的1 00:00:00,000 -- 00:00:06,000 床前明月光疑是地上霜。 2 00:00:06,000 -- 00:00:09,000 举头望明月低头思故乡。时间轴怎么定就按前面说的诗句-画面映射表来。每句诗的起止时间跟对应画面的显示时间对齐。这样字幕和画面、配音三者是同步的不会出现字幕还在上一句配音已经念到下一句的尴尬。注意srt文件的时间格式是时:分:秒,毫秒毫秒用逗号分隔不是点。这个细节错了剪映导入会报错。我第一次做的时候就是用了点号排查了半天。6. 跑通之后才发现的那些坑6.1 节点超时和重试机制工作流跑起来之后最影响体验的不是生成质量而是稳定性。绘图节点和TTS节点都是调外部服务偶尔会超时或者返回失败。如果工作流没有重试机制一次失败整条链路就断了你得从头再跑。扣子的工作流里节点一般可以配置超时时间和重试次数。我的设置是绘图节点超时60秒、重试2次TTS节点超时30秒、重试2次。这样偶发的网络抖动不会导致整条流程失败。但重试次数也别设太多否则一个节点卡住整条流程等半天。6.2 大模型输出的格式漂移前面说了要强制结构化输出但实际跑起来模型还是会有格式漂移——大部分时候按格式来偶尔就自由发挥了。这时候如果你的解析逻辑写得太死就会报错。我的应对是加一层容错解析。比如提取【正文】部分不要只匹配【正文】这个精确字符串而是用正则匹配【正文】到下一个【之间的所有内容。这样即使模型把【正文】写成【正文】或者正文也能兜住大部分情况。另外在工作流的提示词里加一句如果无法按格式输出请返回错误信息这样至少你能知道是哪里出了问题而不是拿到一堆乱码。6.3 批量跑的时候怎么控制成本如果你要批量生成成本是个绕不开的问题。绘图和TTS都是按量计费的跑多了不便宜。我的控制策略是先小批量试跑新主题、新风格先跑3到5条看质量稳定了再放量。复用素材同一主题下的BGM、转场、字幕样式可以复用不用每条都重新生成。分级生成先用低分辨率、快速模式生成预览确认没问题再用高质量模式出终版。这套组合下来成本能压到原来的三分之一左右。6.4 版权和原创性的边界最后说个容易被忽略但很重要的事AI生成的诗词和图片版权归属和使用边界要心里有数。诗词本身如果是模型基于公开语料生成的一般问题不大但如果你直接用了某位现代诗人的作品让模型改写那就有风险。图片同理AI绘图模型训练数据里的版权问题一直有争议。我的做法是诗词尽量让模型原创不套用具体在世作者的作品图片用模型生成不用网络下载的图。这样虽然不能保证100%无争议但至少是相对稳妥的。做内容这行稳比快重要。7. 从单条到批量这套Agent还能怎么扩展7.1 接入选题库实现自动选题现在这套流程的起点是手动输入主题。如果你想进一步自动化可以接一个选题库——比如一个存了几百个诗词主题的表格工作流每次从里面取一个没做过的主题跑完标记为已完成。这样就变成了无人值守的批量生产。扣子的工作流支持读取外部数据源你可以把选题库放在表格或者数据库里用一个节点去读取。这个扩展不难但要注意去重别同一个主题跑两遍。7.2 多平台分发的格式适配一条视频做出来不同平台的规格要求不一样竖屏、横屏、时长限制、封面尺寸。你可以在合成阶段就输出多个版本或者在工作流最后加一个格式转换节点按平台参数批量导出。我目前是输出一个母版高分辨率、无平台水印然后分发的时候用剪映的批量导出功能按平台规格转。这样母版只做一次转换是机械操作不费脑子。7.3 数据回流用播放数据反哺选题最有价值的扩展是数据回流。把各平台发布后的播放、点赞、完播数据收集起来跟选题、风格、发布时间做关联分析找出什么样的诗词视频数据好。然后把这个结论反哺到选题库和提示词里——比如发现边塞诗苍凉风格数据好就多生成这类。这一步需要一点数据处理能力但不需要很复杂一个简单的表格统计就能看出规律。内容生产做到最后拼的不是产能是对受众偏好的理解。Agent帮你解决了产能理解受众这件事还得你自己来。我在实际使用中最大的体会是这套东西的价值不在于全自动而在于把重复劳动压缩到最低把人的精力集中在真正需要判断的地方——选什么主题、哪张图更好、哪个音色更对味。工具再强审美和判断还是人的事。最后分享一个小技巧每次跑完一批把生成的诗和图存一份到自己的素材库时间长了你会发现有些意象和画面是可以跨主题复用的素材库越厚后面出片越快。