视频Agent作为一个导演台,尽管还不够成熟,但值得尝试。

| 园长

| 陈梅希

跨越65年的太空营救、中国版的星际穿越、两代航天人用东方红一号卫星发信号......《群星闪耀时》还没上映,本科幻爱好者就期待拉满。万万没想到,上映没两天,啪!撤档了!

2026年初,在刺猬公社(ID:ciweigongshe)举办的第六届新内容探索者大会上,AI视频创作领域的作者们都说,科幻、奇幻是最适合AI创作的内容类型。

既然《群星闪耀时》撤了,我们正好拿着这个最适合AI表现的故事练练手。

不过,都2026年了,再做视频肯定不能用古法手搓,也就是先写好剧本,再换个大模型生成图片,再把图片放到另一个视频生成大模型里跑视频,效果不行的话可能还要换好几个大模型,最后去剪映或者Pr把零零散散的音视频素材拼起来。

Agent遍地,当然是通过对话的方式,最好用一句话、几张参考图片把方向设定好,放手让Agent去操作各大模型,把生成提示词、图片和视频的具体细碎工作交给AI,你只需要做一个“领导”,去审核各个阶段的工作成果就可以了。

我用的工具是Flova。它官方网站的介绍是这样写的:


看不懂不要紧,接下来我会用手搓《群星闪耀时》的过程,说明它到底能做什么,又是如何实现的。

先别紧张,这可比配置一个龙虾(OpenClaw)简单多了,你只要会打字、会聊天,就能完成所有的操作。

打开Flova的网站,我们最先看到的就是一个对话框。


第一步,告诉Flova AI你想做什么。在对话框里敲下你的想法,不用长篇大论,它的文本生成可以在你的基础上发挥,只用告诉它方向就行。

如果你对即将生成的视频风格还没有想法,那么可以在下方Skill库里面挑选。


在AI视频的语境里,我认为Skill可以理解为一种视频风格,但它不能和修图软件里的滤镜或者配方划等号,它背后还有一整套审美、剪辑习惯、运镜习惯等等。如果你是一个熟练的影视工作者,那么你也可以创作自己的Skill,一些平台的Skill还能卖钱。


对于没有做过影视项目的用户来说,先用别人的Skill比较保险。比如,这个汉斯季默风格的Skill看起来就很不错。我决定来个混搭,用好莱坞史诗的宏大乐章,去搭配东方式的科幻浪漫,看看AI能不能把这两种风格融到一起。

接着,在Agent对话框里用一段文字,描述出我想要的视频。为了尽可能准确,我写得多了点,其实完全不用这么啰嗦。


点击生成,连Agent也直夸我的创意不错,开始加载Skill。


之后,Agent会询问关于风格的问题,并且会给出我们选项。


选择好了节奏风格,接下来就是确认分镜方案,也就是每个片段拍什么,怎么拍。当然,不满意的地方可以继续调整,如果有需要新增加的分镜,也能继续新增。其实在整个创作过程中,都可以随时新增分镜或者调整分镜细节,并同步更新到故事版上。


比如,我就加入了一个“动员群众修理电线塔”的情节,来增加它的宏大叙事风格,看看Agent能不能把我的要求转化成一致的画面。


果然,AI生成了一段颇具集体主义风格的场面描述,让新增剧情能够以一致的画风,融入整个短片。

之后是非常关键的视觉元素生成环节,因为核心视觉元素和场景会贯穿全片,所以必须在这一步就确定好。无需我们手动写作提示词,只用根据Agent给到我们的初版效果图,提出修改意见就行了。值得注意的是,它还会在左上角给出生成来源。


嗯,是Nano Banana Pro,牌子货,这方面我很满意。


但飞船实在是过于先进了,毕竟设定的背景是近未来的2035,不是亚洲舰队自然选择号。让AI去改,一句话的事儿。


然后我得到了一张类似神舟飞船的照片。好像还是不太够味。

我干脆找了一些风格对味的飞船图片,发给Agent参考。其实花时间最多的就是视觉元素的环节。由于人脸出现不多,倒是不用担心一致性问题,视觉元素的不出戏才是最关键的。

确认了全部视觉元素,Agent就开始生成提示词了。我全程没有干预,展开看了一下,全部是用英文书写的。不久前,一个AI影像创作者告诉我,他从来不用中文撰写提示词,用英语得到的效果更好。

对于英语不好的人来说,这里就更加凸显出Agent的必要性了,我用中文大白话和它对话,它帮我直接生成英文提示词,如果不是我点开,竟然都发现不了。


这段提示词别说用英文写,就是用中文,一个没有接受过影视专业训练的创作者也搞不定。只看第一句话Ultra-slow drone pull-back camera move,意思是“超慢速无人机后退运镜”起手就是这类专业表述,几十行下来,全是这种“咒语”级别的提示词。

到这一步,就要生成视频,该交钱了。开通会员是140块,附赠1000积分。按理说生成一条一分钟左右的视频够用。而且Flova还有个解锁奖励机制,就是第一次解锁生成视频、图片等等会赠送100个积分。


活久见!终于在AI生成这块见到回头钱了这种游戏式的探索激励机制还是挺好玩的,至少情绪价值有了。


充值之后,马上开始生成,而且是多个视频分镜同步进行。等到分镜做完之后,我们可以像对图片提出修改意见那样,用对话的方式去修改某一个分镜。


第一批分镜我是用可灵生成的。由于还要继续修改,并且积分还没用完,我看到可选Seedance2.0模型,虽然更贵,但还是抱着来都来了的心态尝尝咸淡。于是,我就在Agent对话框里让它重新生成一批。

这种指挥AI干活的感觉太爽了,不满意随时就换一批,虽然得加钱。为了用上Seedance2.0,我再次充值了70块钱,买了1000积分。


然而,1000积分很快就用完了,没有替换完所有的可灵片段就提示我继续充钱。我不打算继续花钱,因为我觉得Seedance2.0的效果,在有些分镜确实更惊艳,但仍然也要抽卡,并不是所有的分镜都比可灵要好,但贵是一定比可灵更贵。

所有分镜都生成完毕之后,就可以点击生成时间线,用户可以自由剪辑拼接。


我也是在这里才开始熟悉Flova的功能布局:右侧是主对话框,和Agent聊天的主要窗口,提示目前进行到哪一步了,当然也可以随时返回之前的步骤进行追问;

左侧是故事版,包含关键视觉元素(图片)、分镜(视频)和音频层,用户可以随时修改调整,同样是以对话的形式。

中间是显示区域,用来放大展示生成的图片或者视频;部则是时间线。进行到这一步,短片已经制作完成,可以导出了。

下面请欣赏成片。

先说好的地方,至少《群星闪耀时》的精神内核得到了完整的保留,这部小小的短片,在气质上和电影灵魂相通。

接下来是吐槽:


首先,它总是试图在同一个分镜里面,呈现过多的东西。比如,一个分镜里,有笔尖上的计算,也要升华成飞船脱险;同一个画面中,左边是70年代的工程师在黄土房里,右边是未来的宇航员向过去举手敬礼。

这样就显得不够有电影感,太直白,太像ppt,或者说不够高级。

其次,在创作过程中,关键视觉元素的修改并不会及时同步给Agent,做视频的和做图片的没有对齐颗粒度,需要用户在对话框里专门强调才行。


虽然可以返回对话去调整关键视觉元素,但没有在一开始就确认好的代价是,等于要画双倍的积分,重新生成一遍视频。在这个环节,我浪费了最大两笔积分。


最后要说的是,Agent虽然对话起来很方便,但抽卡的本质没变,而且用的模型越好,抽卡的代价越是高昂。所有模型都很擅长大场面,比如黑洞吞噬飞船——当然,这也是因为谁也没见过,AI能编得比较好看,但大家都见过的打算盘之类细节,AI很难处理好算珠与手指的关系。

总结一下吧,Flova AI作为一个AI 影视Agent,并不能用几百块钱就帮你生成电影级质感的大片,哪怕一分钟也不行,它替代不了真人表演、导演的镜头语言,所有需要创意和人味的地方,还是要靠人类手搓。

但是,它向我们清晰地展示了,Agent可以是一个新时代的导演台。Flova AI打包了当代影视工业的基础能力,哪怕没有基础的用户也有了落地创意的工具,能把脑海中的画面呈现在屏幕上。

在一个对话框里,创作者可以通过与Agent对话生成一切、修改一切,减少来回切换工具的繁琐,也不需要在各个模型之间反复开通会员,甚至不需要会剪辑,把精力聚焦在内容质量和创意本身就够了。

作为文字工作者,我对于文字工作使用Agent的前景并不乐观,最大的问题是,我仍然需要核实其准确性,这不是增加效率,而是引入新的负担。

视频Agent不一样,无需专业知识,任何人一眼望过去,就能看到视频生成的质量好坏。

这,就是我认为视频Agent作为一个导演台,尽管还不够成熟,但值得尝试的底层逻辑。

它并不意味着所有人都适合使用Flova,AI视频Agent更适合商用——如果你有做短剧、TVC广告等硬核商业需求,或者想要借助AI视频拿奖,那么确实可以用,越大体量的视频工程,越能显现出Agent的效率。但对于没那么复杂的视频项目,直接用可灵、Seedance模型逐个生成会是更好的选择:

就像你在家做饭,只用买普通大小的电饭煲就行了,没必要买一次可以蒸几十公斤米饭的商用蒸箱。