图片提示词描述的是一帧画面,视频提示词描述的是画面加上时间——而时间正是大多数提示词翻车的地方。解决问题的思维转换是:别再像画家那样写,要像导演那样写——你在给摄影师和一位演员下指令。
核心公式
镜头语言 + 主体动作 + 场景 + 光线 + 风格- 镜头语言——镜头怎么动:推、环绕、固定
- 主体动作——主体做的一件明确的事
- 场景——事情发生在哪里,周围有什么
- 光线——时段、光源、情绪
- 风格——电影感、动漫、纪录片、定格动画……
对比一下:
弱:一个女人晚上走在城市里,氛围感
强:缓慢跟踪镜头,跟拍一位穿红色大衣的女人走过霓虹店面,
雨后街道倒映着招牌,浅景深,阴郁电影风格强版本回答了每个视频模型都在默默追问的三个问题:镜头在哪、什么在动、画面长什么样。
镜头语言词汇表
视频模型是用带字幕说明的真实影像素材训练的,所以正规电影术语比自创描述更管用。核心词汇:
| 英文术语 | 中文 | 作用 |
|---|---|---|
| Static shot | 固定镜头 | 机位锁死,只有主体在动 |
| Push in / dolly in | 推镜头 | 镜头向主体推进,聚焦情绪 |
| Pull back / dolly out | 拉镜头 | 镜头后退,揭示环境全貌 |
| Pan | 摇镜头 | 机位固定,镜头左右旋转 |
| Tilt | 俯仰镜头 | 机位固定,镜头上下旋转 |
| Tracking shot | 跟踪镜头 | 镜头随移动的主体并行移动 |
| Orbit / arc shot | 环绕镜头 | 镜头绕主体转圈 |
| Crane shot | 升降镜头 | 镜头垂直升起或降落 |
| Handheld | 手持镜头 | 轻微晃动,纪实感 |
| Aerial / drone shot | 航拍镜头 | 高空大全景,气势感 |
| Slow motion | 慢动作 | 拉长时间,强调细节 |
| Rack focus | 变焦点 | 焦点从一个平面移到另一个平面 |
一条提示词只下一个镜头指令。"边环绕边推进然后升起"读起来是三个镜头,模型多半会把三个都做砸。
写模型真能做到的动作
运动是视频模型最难的部分,所以要刻意保守:
- 一个主体,一个动作。"厨师颠了一下煎饼"没问题。"厨师颠煎饼的同时服务员在桌间穿行还有一只狗在追猫"出来的就是错位的四肢。
- 选持续性动词。*飘动、流淌、旋转、行走、荡漾*在整个片段里都撑得住。剧烈的状态突变——花瓶碎裂、变牌魔术——难度高得多。
- 动作要自己说明自己。"她对这个消息做出反应"在视觉上等于零。"她捂住嘴,眼睛睁大"才是能拍的。
- **让环境也动起来。**飘移的雾、落叶、闪烁的招牌能低风险地给画面加活气,因为它们不需要保持解剖学上的连贯。
短片段思维
当前的模型生成的是几秒钟,不是一场戏。每条提示词只写一个节拍——一个镜头运动、一段能在片段内完成的动作弧。如果你的创意需要开头、中间、结尾,就拆成多次生成再剪到一起,和剪辑师的做法完全一样。试图把一个故事压进一条提示词("一个男人醒来、穿衣、错过公交、遇见陌生人")只会得到一堆做了一半的模糊动作。
一个好用的检验标准:这条提示词的内容你能在五秒内表演完吗?不能就砍。
图生视频:描述"怎么动",别重新描述画面
从静帧出发时,主体、场景、光线、风格都已经在图里了。再描述一遍既浪费提示词,还可能和原图打架。只描述什么应该动:
弱:日落时分美丽的高山湖泊,松树和橙色的云,电影感
强:镜头缓慢推向湖面,云向右飘移,水面荡开细微涟漪弱版本写的东西全在图里。强版本把每个字都花在运动上。这也是拿到稳定结果最省钱的路径:先在图片生成器里把首帧打磨好,再送进 AI 视频生成器让它动起来。
五组完整示例
电影感产品镜头:
环绕镜头缓慢绕过石质底座上的哑光黑色无线耳机充电盒,
柔和影棚光,一束光里尘埃漂浮,深色背景,高端商业广告风格自然纪录片:
航拍镜头沿黎明时分蜿蜒的河流滑行,水面雾气升腾,
金色晨光洒过森林覆盖的山丘,自然主义纪录片风格动漫氛围片段:
固定镜头,黄昏的火车站台上站着一个女孩,
头发和围巾在风中飘动,身后驶过的列车灯光拉出光轨,
动漫风格,柔和粉彩色调街头摄影质感:
手持跟踪镜头,跟拍滑板少年穿行在狭窄巷子里,
午后阳光在楼宇间炸出眩光,粗粝 35mm 胶片质感微距抽象:
极近特写,墨水滴入清水,深蓝色墨丝以慢动作舒展开来,
白色背景,影棚布光,极简干净每组示例都是一个镜头想法、一个运动想法、一种风格。更多这个格式的成品提示词见提示词库。
FAQ
视频提示词应该写多长? 比图片提示词短——大约 15 到 40 个词。视频模型要同时兼顾空间和时间,多写一个从句就多一个会跑偏的变量。把字数花在镜头和运动上。
为什么主体在片段中途变形或扭曲? 通常是提示词要的运动量超出了模型能保持连贯的范围——多个主体、快速动作或互相冲突的镜头运动。简化成一个主体、一个持续动作,或者改用图生视频,给模型一个稳定的首帧做锚点。
在 Bno AI 上生成视频需要什么条件? 积分够就行——视频按条扣积分,不强制订阅。免费档每日 10 积分够出一条入门片(Grok Imagine 1.5,480p 6 秒,9 积分),或者按每张 2 积分出约 5 张 GPT Image 2 图片来打磨首帧。更重的模型单条更贵,常态化做视频可参考定价页——Pro 每月 $20 起,含 2000 积分。
