首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >提示词工程系列(一):提示词工程不是聊天,值得认真学习一下

提示词工程系列(一):提示词工程不是聊天,值得认真学习一下

作者头像
用户12724357
发布2026-09-15 19:03:46
发布2026-09-15 19:03:46
1300
举报

最近在用 Seedance 做视频生成,反复折腾提示词之后,终于意识到一件事——

提示词的好坏,直接决定结果的天壤之别。不是 AI 不行,是你的"指令"不够好。写代码、画图、做视频,同一套 AI 工具,有人用出大片质感,有人用出灾难现场。区别在哪?在提示词工程。

之前一直觉得提示词没有什么复杂的,不值得叫什么工程。做完视频才发现,不是这么简单,它有专门的术语,各个行业都一样——想要得到满意的结果,提示词就要精准。提示词不是聊天。

提示词不是聊天,是生产指令。

三类核心技术的底层逻辑

零样本、少样本、思维链——大语言模型提示词工程的三类核心技术,这个分类对标的 OpenAI 和 Google DeepMind 的官方最佳实践。光知道"是什么"不够,还得知道"为什么好用、什么时候不好用"。

零样本——通用任务的默认选项

不用给任何示例,直接调用模型预训练阶段学的通用能力。适合日常问答、通用翻译、简单摘要。但它的上限就是模型的"常识认知阈值"——任务一涉及特定格式、小众领域、你的个性化规则,零样本的输出稳定性就急剧下降。这就是编程、图像、视频这些专业场景没人纯靠零样本出结果的原因。

少样本——格式与风格对齐的最好方式

它的原理叫"上下文学习":模型不用更新参数,光靠输入里的示例就能识别规律并照着输出。一个经常被忽视的细节:示例的质量和多样性,远比例子数量重要。2到3个覆盖不同边界情况的例子,效果远好于5个同质化的;示例的输出格式越统一,模型对齐得越好。

这套思路跨模态也能用。图像生成里的"参考图"、视频生成里的"首帧参考",本质就是多模态版本的少样本学习——用视觉示例替代文字示例,让模型对齐风格跟构图。

思维链——复杂推理的放大器

它的作用是把模型的"直觉式输出"拆成"分步推理",逼着模型调用更多认知资源,减少跳跃式错误。进阶玩法有自洽性(让模型生成多条思维链再投票选最优,适合数学和逻辑题)、思维树/思维图(探索多条推理路径、回溯错误,适合复杂架构设计和方案规划)。

不过边界也很清楚:思维链只在需要逻辑推理的任务里有效,编程、文案、数据分析都没问题。但图像、视频这类"感知生成"任务完全不适用——模型不会因为你说"一步步画"就画得更好。这也是不同模态提示词心法完全不同的底层原因。

三大场景的提示词心法

编程、图像、视频,三个场景的提示词心法完全不同。从"交互范式、生成成本、模型特性"三个维度拆开看,每个场景的实操逻辑就清楚了。

编程场景:上下文工程就是"内存管理"

Karpathy 有个比喻很到位:大模型是 CPU,上下文是内存。编程提示词的核心从来不是"一句话写清楚需求",而是把上下文窗口当成运行内存,高效加载最相关的信息,让模型在正确的上下文里输出代码。

几个实操技巧:用结构化分块替代大段描述,项目背景、技术栈约束、功能需求、输出要求、禁止项各一块,模型的注意力分配会更准;给提示词时也放反面示例和错误原因,模型会主动避坑,比只给正面示例效果好30%以上;跟模型沟通时,描述"现象"而不是直接给"解法"——说"这个接口在高并发下响应超时"比说"把它改成异步"效果好得多,模型往往会给出比你想的更优方案。

图像生成:控制变量式的快速迭代

图像场景最大的优势是试错成本极低,不满意重来就行。这套"控制变量调优法"是编程和视频都不具备的:固定种子值,每次只改一个关键词或一个参数,快速定位"哪个元素在影响画面"。

这里必须提一嘴:负面提示词是图像提示词的另一半。正向提示词决定"你要什么",负面提示词决定"你不要什么"。低分辨率、变形、模糊、水印、多余肢体——这些缺陷靠正向描述几乎没法规避,只能靠负面提示词去过滤。

主流图像模型还支持用括号和权重数值调整关键词的注意力(比如(golden hour:1.3)),同时提示词要跟生成参数配合,CFG越高提示词约束力越强,但画面容易过饱和。

视频生成:一次到位的"分镜式提示词"

视频才是提示词工程真正的战场——精度要求最高、试错成本最高、最佳实践迭代最快的领域。

主流视频模型的时序注意力窗口有限,对复杂动作切换、多主体互动的把控力很弱。动作越多、场景越复杂,画面崩坏、逻辑穿模的概率就指数级上升。"一个镜头一个核心动词",说穿了就是主动适配模型的能力边界,把出错概率降到最低。

一个实测好用的结构化模板:

【景别与时长】中景,10秒恒定时长 【核心主体】穿藏青色风衣的中年男性 【核心动作】缓步走在雨后的街道上,右手插兜,视线看向侧方橱窗 【环境场景】夜晚的老上海弄堂,地面有积水反光,两侧挂着红灯笼 【光影氛围】暖黄街灯光影,冷蓝色环境光,湿冷氛围感 【镜头运动】缓慢平移跟拍,镜头高度与人物肩部齐平,运动平稳 【画面风格】电影级质感,王家卫色调,浅景深,颗粒胶片质感 【负面约束】无画面闪烁,无人物面部变形,无肢体穿模,无跳帧

生成效果视频:

两个高阶技巧:动作要写"起止状态",不要只说"走路",要说"从画面左侧走入,走到画面中央停下",时序一致性会大幅提升;用专业术语替代模糊描述,运镜说"推轨、摇臂、慢镜头120fps",光影说"伦勃朗光、侧逆光、柔光箱"——跟模型训练集里的影视语料对齐,效果远好于模糊形容词。

这些专业术语可以先不懂,用起来,然后叫AI给你解释,用中学。

精确的本质:与模型训练分布对齐

提示词的"精确",从来不是"写得越详细越好"——你的描述越接近模型训练数据里的标准表述,生成效果就越稳定。比如"黄金时刻的逆光,暖色调,35mm胶片质感"之所以比"很漂亮"好用,是因为这些词大量出现在模型训练用的专业摄影和影视素材描述里,模型对它们的语义理解很清晰,知道对应什么视觉特征。

"很漂亮"是主观模糊词,模型只能随机采样它认知里的"漂亮",结果当然不可控。

这就解释了为什么专业术语是提示词的核心——编程的技术栈名词、图像的艺术风格名词、视频的影视运镜名词,本质都是用模型训练集里的高频标准表述,降低理解歧义,让意图跟输出精准对齐。

两个进阶方向

提示词模块化与可复用性。成熟的提示词不会每次都从零写,而是拆成可复用的模块。图像的"风格模块""光影模块""画质模块",视频的"运镜模块""负面约束模块",每次只替换主体和动作,既保证输出稳定,也大幅提升效率。

提示词可复现性。编程场景依赖上下文不太需要这个。但图像和视频的生产场景,可复现性是核心指标——固定提示词加固定种子值加固定参数,就能稳定复现结果。这是提示词从"玄学调参"走向"工程化"的标志。

提示词确实不是聊天,是给 AI 的生产指令。编程提示词是可迭代的需求文档,图像提示词是可重拍的摄影brief,视频提示词是开机即定版的分镜剧本。

好的提示词工程师,本质上就是把人类模糊的创意直觉,翻译成AI能精准执行的标准化语言。

喜欢就点击关注我哦~

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2026-06-25,如有侵权请联系 cloudcommunity@tencent.com 删除
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档