开始忘记软件以后,创作才真正开始。

  作者|Moonshot

  编辑|郑玄

  三个月前,我第一次体验 LibTV。它更像一套专业的视频制作工具。我花了很多时间理解 Workflow、节点和模型之间如何协作,最后得出的判断是:只要掌握了 LibTV,就能完成过去一个影视团队才能完成的事情。

  三个月后,LibTV 上线了 Agent 和 Skill 功能。我决定重新体验一次。

  这一次,我给自己设了一个限制:不学习任何功能,不切换任何面板,全程只和 Agent 对话,来做出 AI 视频。

  做到第三个 Demo 时,我突然意识到,我开始想的,不再是下一步该怎么操作,而是这个故事还能怎么发展。

  这时,软件退出了,创作进入了。

  过去大家讨论 AI 视频,总是在讨论它能做到什么,却很少讨论普通人究竟有多大概率做到。

  包括三个月前的 LibTV,它让我看见,当我真正掌握这套工具以后,它的上限到底有多高。

  可另一面也同样存在。

  如果工具越来越多,工作流越来越复杂,我甚至不知道每一种能力应该在什么时候出现,那么再高的天花板,对大多数人来说,它先是一个天花板。

  所以这一次,我第一次觉得,LibTV 更新的重点已经不是模型了。

  它开始重新组织这些能力,把繁杂的工作流隐去,回归到用自然语言沟通的「片场」。

  01

  软件退场,创作上场,回到片场

  当复杂的工作流退到后台,LibTV Agent 留给创作者的,是一种接近片场的沟通方式。

  我不需要先把创作意图翻译成模型、节点和参数,我只需要用自然语言和 Agent 说出我的想法。

  这个过程像是在片场,而我就是导演。我不必亲自操作每一台设备,但要持续告诉团队,故事往哪里走,人物怎么演,这个镜头怎么拍……

  Skill 带来的第一步,就是快速进入一种熟悉的创作语境。

  我最先点开的是首页里的 A24 风格 Skill。A24 式恐怖美学,有一种安静中透着诡异,把噩梦拍成油画的美感。它让我想到今年大火的电影《后室》。但我没有兴趣复刻一条标准的「后室」短片。我更好奇的是,如果把这种空间错位放进中国人的共同记忆里,它会是什么样子。

  于是我想到了中式梦核,以及其中最具体的一类场景:校园。

  最初的想法很简单。一个打工人意外掉进了教学楼的走廊里,他在里面漫无目的的穿行。

  我没有准备人物设定和故事,只告诉 Agent 大致的氛围、风格和片长,希望它先帮我搭出一个中式「后室」。

  接下来,Agent 开始把这个模糊的念头往前推。

  它先给出视觉方向,再补充场景组合、人物形象和声音设计。每一步都会提供几套方案,我可以直接选择,也可以推翻它的建议,继续用自己的语言描述。

  创作由此进入一种持续往返的状态,想法变成可见的选项,我再根据选项判断和探索。也正是在这一轮轮沟通中,原本只有氛围的短片开始长出故事。

  我突然想到,校园对于打工人来说,真正可怕的地方未必是空间本身,而是那些早已结束、却始终没有彻底离开的高考记忆。

  于是,故事又往前走了一步:一个成年人掉回高考现场,他陷入了被一道题困住的噩梦里。

  Agent 随着这个变化继续扩展篇幅,空荡的走廊,也开始有了教室、试卷、角色反应。

  我的工作逐渐从「提出一个想法」,转向判断这个想法应该长成什么样子。

  到这一步,我意识不到自己正在操作一款 AI 视频软件,我更像是在和一支前期筹备的团队沟通,而故事也在这种沟通里,一点点显出轮廓。

  「高考噩梦」的开场

  接下来,创作进入了我更熟悉的阶段。

  场景氛围对不对,人物该做什么动作,镜头之间能不能接得住?这些问题开始一个个出现。我原本只想做出一种压抑、失真的校园氛围,但当画面真正生成出来以后,很多问题会立刻变得具体。

  我开始像坐在监视器前的导演一样,对着每一条镜头提出意见。只不过,我的意见直接输出在 Agent 对话框里。

  比如要求镜头分切,剪辑节奏加快,也会因为前后两条素材接不上,重新调整场景顺序。很多判断很难提前写进一份完整的提示词里,它们只有在画面出现后才会发生。

  这时,Agent 的作用也开始发生变化,场景之间缺少过渡,它会补充镜头;原来的情节不够完整,它也会尝试扩展前后关系;甚至在我说「差点儿氛围,你懂吗?」这种模棱两可的话后,它都会根据上下文,自己给出几套「增强氛围感」的方案。

  这种来回很像真正的创作沟通。我当然一直在指挥它,但它给出的选项也在反过来提醒我:这个故事还可以往哪里走,哪些地方没有想清楚。

  我全程用自然语言,像在片场和团队交流的方式,跟 Agent 一起打磨短片。

  AI 独有的低成本的试错能力,也让这些分岔变得很容易。一个方向不成立,可以马上换,某个镜头意外地有效,也可以顺着它继续发展。

  在 LibTV Agent 上,创作不再需要等到所有问题都想清楚以后才开始。

  我后来又用「对话创作」的方法做了几支完全不同的短片。

  一支是基于韦斯·安德森「对称美学」的 skills,这个 skill 让我联想到了《花束般的恋爱》,我用「对称」带来的镜像关系,做了一条想表达「恋爱关系中的自恋投射」的小短片;

  一支是用了皮克斯风格 skills,做了一条关于「一个人刷到 AI 视频 Agent 后,瞬间幻想自己靠它起号爆红、财富自由、环游世界。当幻想结束,他带着满足感睡去,仿佛已经完成了这一切,却始终没有迈出第一步。」

  另一支则是「一个女孩每天都和自己的狗说心事,直到有一天,狗回应了她。」

  每一次的起点都很轻,有时只是一句判断,有时只是一个想法,甚至只是我对某种风格的好奇。

  但 Skill 先给出一条可以进入的路径,Agent 再把这条路径往人物、场景和镜头上展开,等我去挑选和修改,作品慢慢长成自己的样子,

  

  使用「皮克斯 Skill」做出的 30 秒小短片,想表达「幻想成功,是一种即时满足,即时满足,会杀死真正的行动。」

  整个过程中,我几乎都在对着电脑说话。相比打字,语音更接近片场里的工作方式。

  因为导演不会先把每一条意见整理成完整指令,再交给演员和摄影师。而是坐在监视器前,直接用对讲机说「这条哪儿不对」。

  这种沟通里有犹豫、临时变卦、灵机一动,最重要的是,团队能否理解这些变化。LibTV Agent 就能承接这种上下文。上一轮我们讨论过的人物、场景和镜头,会继续影响下一轮修改。它「看」得懂我在说什么,而不只是听得懂,这是一个完整的视频 Agent 必须拥有的能力。

  而这种「判断力」,最集中的体现在某支短片生成后,我没有直接上手改,而是先问 Agent:「你自己看,这支片子还有什么问题?」于是它重新检查了人物动作、镜头连续性和节奏,自己给出一版修正。

  Agent 已经有了自我纠错的能力

  当然,视频生成的黑箱没有消失,人物动作、表情和空间关系仍然很难完全控制,改好一处,也可能带出新的错误。这是所有 AI 都解决不了的问题,LibTV 能做的,是尽量把输出质量提高,修改次数降低。说白了,盲盒还在,但抽取的质量更高了。

  在我完成了短片 Demo 后缩小画布,我才看见后台发生了什么。故事板、人物资产、声音、镜头节点和生成链路铺满整个页面。刚才所有自然语言的沟通,已经被系统翻译成一套复杂的 Workflow。

  这套流程不是我逐个节点搭出来的。它来自前面说过的每一句话,也来自我对人物、场景和镜头的每一次判断。但 Agent 和我共创的全过程里,我只需要盯着一个片段,在对话框里给出我的判断。

  所以,创作的复杂性依然存在,只是退出了创作者的视线。我的想法,沿着一条直线抵达成片。

  LibTV Agent 功能在交互上做得最好的一点是:我只需要面对 1~3 个镜头,复杂的面板只有缩放时才会看到。

  这就是我使用 LibTV Agent 后,在创作方式上最直接的变化。

  三个月前,我需要先研究软件,理解模型、节点和工作流如何组合,再开始创作。现在顺序反了,我可以先进入作品,剩下的组合交给 Agent 在后台完成。

  这背后降低的是常常被 AI 行业忽视的「执行成本」。

  大模型降低了视频的拍摄成本,解决的是画面能不能做出来,但从一段提示词到一支完整视频,中间仍然隔着人物设定、分镜、模型调用、素材管理、场景搭建等等门槛。

  Agent 降低的就是「执行成本」,即创作者到底能不能用简单的方式,做出一条片子。

  执行成本下降后,人的工作会变得更集中。我就面对画面做判断,决定人物、镜头和节奏;Agent 负责调用工具,把这些判断继续往下推演。

  这也解释了为什么 LibTV 这次把重点放在 Agent 和 Skill 上。模型再多、能力再强,只要用户仍然要先学会复杂的工作流,它们就很难真正进入创作。

  三个月前,我看到的是 LibTV 能够容纳多少专业能力。现在,我更在意这些能力能不能主动靠近创作者。

  因为模型决定一支视频最终能达到多高,而 Agent 决定一个普通人,有多大概率真正走到那里。

  02

  影视经验,开始变成一种 Skill 能力

  如果说,第一阶段的视频 AI 在竞争模型,那么下一阶段,竞争的或许就是经验。

  过去两年,所有人都在讨论模型能力:画质有没有更高,动作是不是更自然,人物能不能保持一致。

  但当这些能力越来越接近以后,另一个问题开始浮现:同样的模型,为什么有人能做出电影感,有人却只能做出一段素材?

  想理解这里面的差别,可以先看看电影学院到底在教什么。

  在电影学院前两年的课程里,老师不会教学生怎么操作摄影机、怎么使用剪辑软件。

  而是教拉片和模拟拍摄,学生反复拆解一段电影,甚至 1:1 复刻拍摄一个经典片段。就是为了学习导演为什么这样组织镜头,摄影为什么这样调度,美术为什么这样设计场景,剪辑为什么这样控制节奏。这些能力,很少写在教材里。

  一个学过摄影的人,或许几周就能掌握相机的原理。但只有在片场待过足够久,才会知道导演为什么愿意多等十分钟,只为了等到一束「金色时刻」。

  电影《巴比伦》中就描绘了片场如何全员等待「金色时刻」|图源:《巴比伦》

  影视行业真正宝贵的,正是这些长期积累下来的经验。

  而 Skill,就把过去只能在片场慢慢积累的经验,变成了一种普通创作者也可以直接借用的能力。

  它可以让我快速进入 A24、韦斯·安德森,或者岩井俊二的创作语境。

  但更重要的是,它提供的不只是画面风格,而是一条已经被验证过的创作路径。它告诉创作者,这类故事通常怎样组织镜头,这种情绪怎样建立节奏,这种风格怎样展开叙事。我仍然可以修改、推翻、再创作,但已经不用每一次都从零开始。

  所以 Skill 不是替我完成创作,也没有把作品限制在一套固定模板里,它更像一个已经搭好的片场,布景、灯光和基本的镜头逻辑已经存在,我可以直接走进去,再决定要在里面拍什么。

  对于一个只有模糊想法的人来说,这一步很重要。不知道从哪儿下笔的空白页,常常比工具本身更难面对。

  当一种经验能够被反复调用,它带来的就不只是效率,还有重新组合的可能。

  过去,一个创作者很难同时拥有广告导演对于节奏的控制、电影导演对于叙事的组织,以及 MV 导演对于视觉风格的处理,因为这些经验分别属于不同的人、不同的团队,也属于不同的行业。

  Skill 第一次让我觉得,这些原本彼此独立的经验,可以在一次创作里重新借用。

  我可以借用岩井俊二的美学,去拍一个数码产品的广告;也可以把韦斯·安德森的镜头秩序,与 A24 的诡谲美学放进同一支短片里。

  也是到这里,我才慢慢理解,为什么 LibTV 会把 Skill 单独做成一个产品。

  模型解决的是生成,Agent 解决的是执行,而 Skill 解决的,是创作经验。

  对于没有接受过影视训练的人来说,最大的困难是不知道一种风格应该怎样开始,一段故事应该怎样展开,一个想法应该怎样慢慢长成一支片子。

  Skill 把片场经验精炼为可调用的能力,Agent 再把这种能力,通过自然语言真正交到创作者手里。

  过去,我们一直在讨论 AI 视频能做到什么。但对于绝大多数潜在创作者来说,更现实的问题始终是:我有没有能力做到。

  或许,这才是视频 AI 下一阶段真正的竞争。不只是比谁拥有更强的模型,更丰富的工具,更复杂的面板,而是谁能够让更多人真正开始创作。

  03

  一个视频,从一句话开始

  现在的 LibTV,总让我想到十多年前,智能手机普及后,自媒体时代到来了。

  那时候,越来越多人开始习惯举起手机,人们开始拍日常、拍生活、拍观点,也开始拍那些以前觉得」不值得拍」的东西,把它们简单剪辑后传到社交媒体上。后来我们把它叫作自媒体时代。

  体验 LibTV Agent 和 Skill 的几天里,我一直有一种兴奋感。那是创作者第一次遇到一种新创作方式时才会有的感觉,就像十多年前,人们第一次举起手机拍视频。

  我越来越少去想提示词应该怎么写,而是描述脑子里的想法、画面、节奏、情绪,然后看着它生成 V1、V2、V3……一点点把它改成更接近自己想象的样子。我想把这种过程叫作 Vibe Filming。

  

  这支小短片就源于我一直有的一个念头:很多人试图找到「世另我」的伴侣,本质上是自恋。

  我第一次觉得,这个工具开始推着我创作,而不是等着我操作。

  作品的起点,不一定是一套已经完成的剧本、分镜。它可以只是一个画面,一个情绪,一个突然冒出来的念头。

  作品的终点,也不一定是大银幕或 AI 电影节。它可能只是一条朋友圈,一条小红书,一条属于你的自我表达。

  很多人会说,AI 出来以后,最重要的是有没有好想法。我反而觉得,有没有想法,一直都是创作者自己的命题。真正改变的是,那些原本挡住表达的障碍,随着软件的进化,一层一层消失了。

  就像十多年前,智能手机没有让所有人成为创作者,它只是让「不会拍」不再成为理由。我不知道 Vibe Filming 会不会成为下一个 Vibe Coding,LibTV 等工具会不会带来 AI 时代的「新·自媒体」。

  但至少,它让我相信,一个作品可以从一句还没想清楚的话开始。

  *头图来源:LibTV