
短视频自十几年前诞生以来内容创作不断优化大量网民在此类APP花费的时间也在不断增加但是下一代内容平台还会只是“更短、更快、更高清的视频”吗我不太这样认为。过去二十多年互联网内容经历了从网站、博客、论坛到微博、朋友圈再到短视频和直播的变化。表面上看是内容载体换了更深一层看是人们表达和消费内容的方式变了。我们已经从“读别人写的东西”走到了“看别人拍的东西”。下一步也许是直接进入别人创造的世界。从网页到短视频变化的不只是内容格式2000 年前后很多人上网是为了浏览门户网站、论坛和博客。那个阶段互联网更像一个巨大的信息公告栏。网站负责生产和整理内容用户主要负责阅读。博客兴起之后普通人也可以拥有自己的页面。后来微博、朋友圈和社交平台把发布内容变得更简单写几句话配一张图片就可以参与讨论。短视频的爆发又往前走了一步。智能手机降低了拍摄成本4G 网络解决了视频传输推荐算法让内容更容易找到观众。以前需要专业设备和剪辑团队才能完成的视频后来一个人拿手机就能做出来。所以互联网内容的每次升级背后都离不开一个条件创作成本下降了。当更多人能创作平台上才会出现更多内容当内容足够多新的分发和消费方式才会出现。3D 内容的普及也可能遵循同样的规律。3D 内容的门槛为什么比视频高这么多视频主要是一种线性的观看体验。它当然复杂但创作者只需要保证镜头、声音和叙事能够按照预定顺序播放。观众看到的内容大体也是创作者提前决定好的。3D 内容不一样。如果用户可以进入一个场景那么场景里的东西就不能只“看起来像真的”还要能够运行角色要能移动摄像机要能控制物体要有碰撞关系任务要有触发条件交互要有反馈场景要能保持连贯游戏还要经过测试、优化和发布。做一张游戏概念图并不难。做一个真的可以玩的游戏难得多。它需要美术、程序、策划、技术美术、测试等多个环节一起工作。一个人即使有很好的创意也经常会卡在“不会把它做出来”这一步。这也是为什么3D 游戏和互动内容长期以来主要由专业团队生产。图片来源SEELE AI 公开展示的《Shattered Front》游戏画面。Seele Agent 更像是今天正在发生的变化我现在参与的是 Seele Agent 生成 3D 游戏内容的相关工程。我的工作重点在 Unreal但从整个产品方向来看Unreal 只是其中一个具体的技术入口并不能代表全部。今天更现实的变化不是世界模型已经完全成熟而是 Agent 开始能够调用不同的工具和游戏引擎帮助用户把一个想法逐步变成可运行的 3D 内容。用户可以先描述一个方向我想做一款俯视角Roguelite玩家在黑暗雨林中抵御不断涌现的敌人在战斗间隙选择强化能力最终挑战boss逃出生天。接下来Agent 需要处理的就不只是“生成一张雨林生存的图片”还包括场景、角色、敌人、交互、规则和运行环境。这类工作可能会涉及不同的引擎、资产工具、脚本和发布流程。对于用户来说重要的不是底层到底使用哪一个引擎而是能不能少面对一些重复性的搭建工作把注意力放回到创意和体验本身。从我自己的工程经历来看真正难的地方也不是让 AI 偶尔生成一个漂亮场景而是让生成结果能够运行、能够被检查、能够继续修改最后成为一个可以交付的内容。现在是 Agent 生产未来才是世界模型成为主力这里需要区分两个阶段。当前更接近“Agent 游戏引擎”的阶段。Agent 理解用户意图再调用建模、编程、关卡、资产和引擎工具把内容组织成一个可以运行的项目。引擎仍然承担渲染、碰撞、物理、输入和运行时等重要工作。这条路线已经可以解决很多实际问题尤其适合快速做原型、验证玩法、制作小型作品和尝试不同创意。但它仍然受到传统生产流程的约束。AI 需要理解引擎调用工具处理项目文件再通过多轮操作把内容拼起来。未来的世界模型则可能进一步改变这件事。今年 4 月百度云游戏广州大会的公开分享以及随后公开报道中的相关采访都提到了 Seele AI 对 3D 多模态模型和世界模型的探索。报道中也明确区分了当前阶段与未来阶段现阶段仍然需要依托 Unity、Unreal Engine 等引擎完成很多运行和交互工作世界模型成熟之后才有可能减少对传统引擎生产链的依赖。这不是“现在已经完全实现了”而是一条逐步推进的技术路线。按照公开信息所表达的方向未来几年世界模型会继续解决几个关键问题生成内容的空间一致性视觉表现和物理规律的统一场景状态的持续记忆更长时间的连续交互世界在用户行为下的动态变化。如果这些能力逐渐成熟3D 内容的生产方式就可能发生一次真正的变化。现在是 Agent 帮你调用工具搭建世界。未来世界模型可能直接理解并生成一个能够持续运行的世界。为什么“世界模型”比“生成模型”更接近下一代内容生成一张图片重点是画面是否成立。生成一段视频重点是画面能否连续变化。生成一个世界模型还需要理解这个世界中的规律。它不仅要知道“这是火”还要知道火会燃烧、会发光、会产生温度靠近它的人会受到影响。它不仅要知道“这是一个房间”还要知道门在哪里、墙是什么、桌子能不能被推动以及玩家离开房间后房间里的状态是否应该继续保持。这也是世界模型最难的地方它需要把视觉、空间、时间和物理关系放在一起处理。所以世界模型并不是简单地把图片和视频生成能力叠加起来。它最终要生成的是一套可以继续变化的状态。未来的平台可能推荐的是“世界”今天的平台推荐一条视频、一篇帖子或一场直播。未来的平台可能推荐另一种内容一个五分钟可以体验完的小游戏一段可以自由探索的剧情一座能够参观的虚拟城市一个由用户自己设计的社交空间一个会根据玩家行为发生变化的世界。用户打开内容后不一定是从头看到尾而是进入其中自己决定去哪里、做什么、和谁互动。文字 / 图片 / 视频用户创意Seele Agent游戏引擎与工具链可运行的3D内容预览 / 互动 / 修改 / 发布未来世界模型生成持续演化的世界这会改变很多平台机制。推荐算法推荐的可能不只是“你喜欢看的内容”还包括“你可能愿意进入的世界”。收藏不再只是保存一个链接而是保存一个还想回去继续玩的空间。评论也不只是文字留言还可能包含路线、玩法、角色设定和二次创作。创作者的收益也不一定只来自播放量。互动时长、用户付费、虚拟物品、作品授权和社区运营都可能成为新的收入方式。这不会只属于传统游戏游戏只是最容易理解的切入口因为游戏天然具备角色、规则、目标和反馈。但当 3D 内容生产成本降下来之后很多内容都可能变成可交互的一部可以参与剧情的动画一座可以自由游览的城市一场能够进入其中的演出一个用于教育和培训的模拟环境一个用于建筑展示和虚拟制作的数字空间一个可以和用户一起成长的品牌世界。到那个时候用户可能不会特别在意它究竟属于游戏、动画还是社交产品。他只会问这个内容值不值得我进去AI 不会让创作者消失但会改变创作者的工作方式公开报道中王诗沐提到过一个很重要的判断AI 不会简单地让游戏人下岗真正发生的更可能是岗位和生产方式迁移。我很认同这一点。如果 AI 能够处理更多重复的搭建工作创作者反而有机会把时间放在更重要的事情上设计一个真正有意思的玩法找到作品独特的表达方式判断一个生成结果是否值得保留让内容拥有自己的价值观持续和 AI 沟通、修改和试错。未来的创作者可能不再只被定义为程序、美术或策划而是一个能够提出想法、组织资源、判断结果并完成作品的人。这也是 3D 内容生产真正有想象力的地方。它不只是帮助专业团队降低重复劳动也可能让更多原本没有完整开发能力的人第一次拥有把创意做出来的机会。从“观看内容”到“进入内容”短视频把内容消费变得更快。Agent 正在把 3D 内容生产变得更容易。而当世界模型逐渐成熟之后内容本身可能会变成一个可以持续运行、持续变化、持续被探索的世界。这条路不会在一夜之间完成。未来几年Agent 和各种游戏引擎仍然会是重要的生产方式世界模型则会逐渐补上空间理解、物理一致性和长时间交互这些能力。所以我现在更愿意把它理解成一个连续的过程今天用户通过 Agent 调用工具搭建一个 3D 内容。明天用户可能直接描述一个想法让系统生成一个完整的可交互世界。互联网内容的下一次变化未必是让我们看到更多东西而是让我们有机会真正走进去。如果想体验公开的 AI 3D 内容创作流程可以访问SEELE AI Workspace如果你更关注 AI 开发游戏也可以查看SEELE AI 游戏创作页面