# 我用 Vidu Q4 Preview 把奥特曼和 Dario 凑成男团，跳起了 APT

- 作者：张子豪
- 发布时间：2026-10-08 17:04
- 分类：软件
- 原文：https://www.ifanr.com/1683089

![](https://s3.ifanr.com/wp-content/uploads/2026/11/PixPin_2026-10-08_10-21-26.png)

马龙·白兰度当年争取《教父》里柯里昂这个角色时，制片厂嫌他过气，死活不肯用。他最后拿到角色，靠的是一段试镜带：他往腮帮子里塞了两团棉花，佝偻下来，对着镜头哑着嗓子念了几段台词。

![Image](https://s3.ifanr.com/wp-content/uploads/2026/10/lark2pad-1791424901160-1.png)

好莱坞对这个环节有一种近乎迷信的坚持。不管你拿过多少奖、身价多高，想进组，先演几十秒给我看。

这套制度听起来苛刻，但它能筛的是电影里最贵的东西，演技。一个眼神给不给得到位，一场情绪转不转得过来，几十秒就能见分晓。整部片子上亿的投资，最后都压在这几十秒的判断上。

所以试镜的本质，就是在用最低的成本，验证最贵的能力。

最近我们拿到一个视频模型的预览版，和这个逻辑一样，他想用更低的成本，让 AI 视频生成就有那些最贵的演技。试拍一条视频，0.09 元/秒起。

![Image](https://s3.ifanr.com/wp-content/uploads/2026/10/lark2pad-1791424902227-2.png)

这是生数科技刚开放的 Vidu Q4 Preview，新一代视频生成模型的预览版本。对比前代，Q4 在各方面的能力都得到了明显的提升，官方对它的定位是「**高表现力旗舰模型**」，主打人物演技、镜头张力和复杂特效。

我们提前拿到了 Vidu Q4 Preview 的访问权限，把它当成一个来试镜的演员，一场一场来考验它的「演技」。

![](https://s3.ifanr.com/wp-content/uploads/2026/10/PixPin_2026-10-08_10-11-00.png)

当视频模型的画面都开始有逻辑，运镜也能转动各种角度，甚至清晰度也一路卷到了 4K；一个好的视频生成模型，可能更需要知道在拍什么镜头。主体、情绪和叙事节奏，这些并不会因为运镜数量的增加而变得更好。

Vidu Q4 Preview 给我们的第一感觉，其实还挺「Vidu」的。

它似乎一直不太满足于把一段视频安安稳稳地生成出来。能打起来，就尽量让它打起来；能让摄影机从不同角度捕获画面，就不只站在原地拍；能做一场爆炸，也能把火光、烟雾和人物一起安排进镜头里。

这种偏爱大动作、复杂镜头和强情绪的创作倾向，在 Vidu Q4 Preview 上变得更明显了。只不过这一次，它开始更在意人物有没有戏、镜头为什么要动，以及这些东西最后能不能共同组成一段好看的视频。

![Image](https://s3.ifanr.com/wp-content/uploads/2026/10/lark2pad-1791424908897-3.png)

更强表现力和低到 0.09 元/秒的创作自由，正是这次 Vidu Q4 Preview 要生成一段好看视频的关键。

我们可以在 Vidu 官网体验最新的 Vidu Q4 Preview 模型。这是 Q4 面向创作者推出的首个预览版本，目前它的参考生视频支持最多 15 张参考图、3 段参考音频以及可选 2K、4K 超清输出等配置。

🔗 体验链接：https://www.vidu.cn/home/recommend

🎁 另外，大家还可以输入 APPSO 的专属邀请码 **APPSOQ4**，登录 vidu.cn，新用户注册就能获得 500 积分。

## 一个眼神，比一场爆炸更难

如果说构成一个好的表演有最小单位的话，那它一定是「反应」。

我们听到一句台词只需要两秒，但角色脸上那半秒钟的变化，从听到、消化、到决定回应，这一段反应才是我们判断「这人是真是假」的依据。

那些说 AI 无法取代真人演员的人，也认为这些「反应」是 AI 永远学不会的东西。AI 能做出「悲伤」的表情，却做不出「正在变得悲伤」的过程。

![Image](https://s3.ifanr.com/wp-content/uploads/2026/10/lark2pad-1791424913617-4.png)

我们找了之前测试过其他视频模型的《沙丘》片段，一座沙丘式的深蓝宫殿里，王后从震惊转为恐惧和愤怒，最后只用一个眼神收尾。整场戏没有动作、没有走位，16 秒几乎全靠两个近景的正反打。

![](https://s3.ifanr.com/wp-content/uploads/2026/10/PixPin_2026-10-08_10-11-19.png)

生成的效果自然比不上真人原版，但 AI 视频里王后那段从听完、停顿、眼睛先移过去、再慢慢转回头的反应次序，正是真人演员处理「意识到真相」的方式。

我们还找了一段被北电纳入教材的电影片段，《喜剧之王》里的「我养你啊」那段。尹天仇在雨后的街上喊住柳飘飘，柳飘飘回头笑着回一句「你先养好你自己吧」，转身离开，独自在出租车后座崩溃。

这段戏的难点，大概全在后半段张柏芝从笑到哭，演绎出溃堤的过程。

![Image](https://s3.ifanr.com/wp-content/uploads/2026/10/lark2pad-1791424917178-5.gif)

能发现 Vidu Q4 Preview 在预览阶段还是有些不足，它能把从笑到哭的整个流程演出来，但在表现力之外，整体的节奏，目前看起来还不够自然。

这也符合 Preview 的定位：先把模型交到创作者手里，在真实使用里暴露问题、收集反馈，再继续往正式版迭代。

不过，当表演不需要经历这么剧烈的情绪转折时，Q4 Preview 对人物状态的把握会稳定不少。

在另一段《沙丘》的案例里，伤兵回答完「not my vision」之后，镜头停在他一张疲惫而警觉的脸上，眼周的缝合伤痕在多个取样点都可辨认。

![](https://s3.ifanr.com/wp-content/uploads/2026/10/PixPin_2026-10-08_10-11-31.png)

这种更克制的表演反而显得自然很多。而这种表现力不仅仅体现在神态上，到了动态的动作戏里，Vidu Q4 Preview 也有一些很有「Vidu 味儿」的表现。

毕竟相比安安静静地让两个人坐着对话，Vidu 一贯更有辨识度的那一面，还是那些有点中二、有点热血、恨不得把摄影机一起扔进战场里的大动作。

所以我们干脆把《黑神话：悟空》的天命人和《影之刃零》的魂，塞进一座暴雨中的破古寺，让他们打一场。

![Image](https://s3.ifanr.com/wp-content/uploads/2026/10/lark2pad-1791424923478-6.gif)

我们在提示词规定了一套完整连招，滑步突进、劈头横斩、长棍架挡、接着拧身反扫、跃过棍身、落地追斩等招式，模型都有按照不同的运镜来呈现这场表演。

比较意外的是它没有靠频繁切特写来隐藏双方的位置，毕竟这是过去 AI 打戏最常用的「作弊」手法。

而生成视频的效果，大概就是很典型的「Vidu 式」玩法，先有一个足够抓人的设定，再把动作、镜头和特效全部推上去。

## 运镜应该为叙事服务

如果说高燃和大动作是 Vidu 很容易让人记住的一面，那么摄影机怎么跟着这些动作一起运动，大概就是另一半「Vidu 味儿」。

烂片和好片的运镜数量常常一样多，区别只在一件事，那就是镜头知不知道自己在拍什么。

就像跟拍是为了让观众追上那个人，环绕是为了让我们看清这段关系，推进是为了让情绪逼近顶点。AI 视频过去的问题常常是相机确实会动，但动着动着，人没了，空间也乱了。

![](https://s3.ifanr.com/wp-content/uploads/2026/10/PixPin_2026-10-08_10-11-43.png)

我们先是让它做了一些 FPV 的视频，从一个沙虫口腔里的 FPV 逃生。在视角大幅滚转之后，模型依然能找到同一个牙缝亮口，暗到亮的曝光转换由真实出口遮挡完成。

而另一个模仿了《奥德赛》里，一条古船从独眼巨人手下逃出的那条视频。Vidu Q4 Preview 则有了更多细节，巨物的存在会真实地影响场景的光照，视频结尾从遮天手臂切到开阔金色海面，也让观众能清楚了解危险已解除。

![](https://s3.ifanr.com/wp-content/uploads/2026/10/PixPin_2026-10-08_10-11-52.png)

更复杂的运镜是这段《沙丘》中的机械沙虫从人群全景到顶部骑手。

跟拍、环绕、升降一次集齐，三条巨型机械沙虫冲锋，镜头从逃散人群的胸口高度，绕到主虫侧面，再升高追上顶部的骑手。

![](https://s3.ifanr.com/wp-content/uploads/2026/10/PixPin_2026-10-08_10-12-03.png)

总的来说，能看到 Vidu Q4 Preview 在运镜的**方向感和主体稳定性确实是强项，但视频中也能看到一些细节像是画面风格的控制，和 AI 普遍存在的幻觉问题等还需要优化。**

## 爆炸之后，世界的变化

到了特效这里，Vidu 那种眼前一亮的高燃表现力就更明显了。

巨浪、黑洞、冰裂谷、爆炸、机械沙虫……我们这次挑的案例几乎没有一个是平平无奇的。但 Q4 Preview 真正有意思的地方，也不是它终于学会了往画面里塞更多火花，而是这些东西开始真的影响周围的世界。

我们还是用一个 FPV 的视频，在落日海面上一道千米级潮汐巨浪，第一视角沿着水壁爬升，右绕翻卷水帘，越过浪尖，沿浪背另一侧下降。

![Image](https://s3.ifanr.com/wp-content/uploads/2026/10/lark2pad-1791424931177-7.gif)

能明显看到，水流条纹确实在沿浪壁拉伸，海面反光也随这视角倾斜改变，水体的层次超出了我对「平面特效」的预期。

另一个包含爆炸、宇宙黑洞等特效的空间站逃生视频同样干净利落。

![Image](https://s3.ifanr.com/wp-content/uploads/2026/10/lark2pad-1791424938145-8.gif)

还有一个冰裂谷的特效视频，从狭窄冰峡坠冰、到入水、再到开阔的地下海，末段一头青蓝色荧光鳐形巨兽从暗轮廓逐渐变成前景主体。

![Image](https://s3.ifanr.com/wp-content/uploads/2026/10/lark2pad-1791424943297-9.gif)

负责视觉冲击的特效，也能负责检验复杂场面的完成度。

搭配 2K、4K 等画质选项，我们能看到火光可以照到人物，烟雾也会影响视线，特效的出现很好地和世界进行交互。

我们体验下来，最直观的感受就是 Vidu Q4 最值得期待的地方，或许就是那些需要人物可以在一个近景里经历表情变化，以及大量的动态镜头能围绕目标推进，还有能接上后续动作的复杂特效。

这些成片也并非只靠一句提示词生成。参考图在这里的作用可以说是非常大，它像开拍前的一叠工作照片，人物长什么样，门开向哪里，镜头最后要停在哪个位置，都得提前交代。

Vidu 是最早提出「参考生」能力的视频模型之一，而到了 Q4 Preview，这项能力也在继续往更精细的控制方向迭代。

Vidu Q4 Preview 官方支持最多 15 张参考图，但我们实际体验起来，比数量更重要的，是让每张图清楚自己各自负责什么。

![Image](https://s3.ifanr.com/wp-content/uploads/2026/10/lark2pad-1791424948075-10.png)

人物资料图用来固定身份，环境图交代空间，动作节点提供阶段目标。把这些要求写清楚，后面才能判断成片究竟引用了哪一项，又漏掉了哪一项。

多图参考的能力，让我们的创作要求变得更具体的同时，也让视频验收有了依据。

## 试镜通过之后，开始谈薪酬

从手里小小的一块屏幕，到家里墙上的大电视，再到院线的巨幕，AI 生成的视频几乎已经霸占我们全部的视野。

我们对 AI 视频模型的期待越来越像是一个真实演员，在能力之外，我们还要考虑这个「演员」的片酬、流量、演技等等。

这些对模型的体验，和开头提到的试镜一样。而试镜这个环节最诚实的地方在于它是双向的：演员在试镜，剧组也在试镜。我们在判断这个角色值不值得签，角色背后的团队也在判断这个剧组值不值得来。

Vidu Q4 Preview 这个版本，本质上也是这么一场双向试镜。生数科技把这个「高表现力的旗舰模型」提前交给创作者，看它在真实工作流里的表现；而创作者也在用这几天的时间判断，这个「演员」值不值得放进自己未来的剧组名单里。

![Image](https://s3.ifanr.com/wp-content/uploads/2026/10/lark2pad-1791424952280-11.gif)

从《黑神话》和《影之刃零》在雨中的古寺打起来，到巨人伸手抓向海上的古船，再到一个角色在十几秒里从克制走向崩溃，这些案例看起来完全不是一种题材，但最后却有一种相似的劲儿。

而 0.09 元/秒在改变的，还让这种「劲儿」不再需要一次生成就押中，我们可以大胆地玩、去不断尝试，去多生成几版。

更重要的是，从「分」时代的低成本试镜，到「角」时代的高清交付，不同画质档位都进一步降低了创作门槛。创作者可以先用低成本反复试镜，再用更高规格完成最终成片，把钱花在真正满意的镜头上。

正如电影拍摄里，真正昂贵的从来不只是最终留下来的那几秒，而是为了找到这几秒，前面试掉的几十条、上百条素材。

AI 视频也是一样，生成成本足够低之后，创作者才能真的像导演一样，多试一个表情、多换一个机位、多拍一条，再从里面挑出最好的那个。

![Image](https://s3.ifanr.com/wp-content/uploads/2026/10/lark2pad-1791424959456-12.png)

Vidu Q4 Preview 目前可以认为还是一场试镜，它还在持续的优化之中。但当这些原本最贵、最难反复尝试的东西，都可以用几毛钱重新来一遍，AI 视频已经能让**我们用更低的成本，去试出一个原本很贵的好镜头。**

五十多年前，马龙·白兰度往嘴里塞了两团棉花，用几十秒试镜换来了柯里昂。

今天，视频模型也在争取自己的下一场戏。试镜结束，真正的拍摄才刚刚开始。
