大家看到Coding Agent发展这么快,也是因为harness有大量给 AI 报错自己修复、自己探索的空间。Coding Agent可以找到错误并自纠偏,视频Agent不行。它永远读不懂创作的心,它最多就抽帧,也无法理解一个视频的正常时间流速下的情感共鸣。即便是视频理解模型,也只是在解构一个视频,并不是真的正着推过去build一个视频。
这件事后来越想越重。正向生成其实不是最难的部分,难的是让系统知道「这次不够好」,知道哪里错了,知道该回到哪一步重来。人做导演时,大量时间并不花在「再拍一条」本身,而花在判断:这条能不能用,情绪对不对,节奏塌没塌,观众会不会在第三秒划走。如果 AI 视频系统缺少这一层,所谓智能就更像一条只会往前冲的流水线。它能提高产量,却很难提高品味,也很难形成自我迭代。