8月24日,阿里巴巴旗下AI视频模型「通义万相3.0」(Wan3.0)宣布全面开放。相比上一代,万相3.0将单次生成视频的时长提升一倍,最长可生成30秒视频,并支持文字、图片、视频、音频等多种输入的混合驱动——甚至连网页、PDF、PPT幻灯片都能作为“素材”喂给模型,直接生成对应画面。

这一升级背后,是AI视频生成赛道竞争白热化的一个缩影。从字节跳动的即梦、快手可灵,到海外的Sora、Runway,各家都在比拼视频时长、画质一致性与可控性。万相3.0把输入源从传统的“文/图”拓展到文档、网页等结构化内容,其实是在向“生产力工具”方向靠拢——让AI不仅能“拍段子”,更能服务于营销物料、课件、演示视频等真实商业场景。

不过,能力越强,争议也越大。万相3.0在官方宣传中展示的一段“汤姆·克鲁斯”视频,再度把AI视频的版权与肖像权问题推到了台前。用名人形象生成以假乱真的视频,早已不是新鲜事,此前字节即梦也曾因类似演示引发争议。当AI生成的“阿汤哥”在屏幕上以假乱真时,观众、创作者与平台都需要直面一个老问题:技术的边界,到底该由谁来划?

客观地说,中国厂商在视频生成领域的进展已经相当能打,万相3.0的30秒长视频与多模态输入,放在全球范围内也具备竞争力。但“能生成”与“能用好”之间,还隔着版权合规、内容治理与商业落地三道关卡。对于阿里而言,万相3.0更大的价值或许不在消费级娱乐,而在通义大模型整体向企业服务的渗透——让视频生成成为toB能力矩阵中的一块拼图。AI视频的“百模大战”还远未到终局,但可以确定的是,生成的门槛正在以肉眼可见的速度被抹平。