Alibaba推出了Wan3.0人工智能视频生成模型。该模型能够根据多种输入创建最长30秒、分辨率达1080p的视频片段,输入包括文本、图像、音频和视频,以及PDF文件、演示文稿、网页和电子表格。
该模型自8月初起已通过Alibaba Cloud旗下的Model Studio和Qwen Cloud平台以试用形式提供,随后正式向更广泛的用户开放。Wan3.0被定位为Alibaba视频生成家族的最新成员。
实际有哪些变化?
Wan3.0将单次生成视频的最长时长提高到30秒,而此前的Wan2.7模型为15秒。据Alibaba介绍,在更长的视频片段中,该模型能够更好地保持人物和物体外观、场景元素排列以及动画的一致性。
该公司还表示,模型支持与面部表情同步的动作以及多语言音频输出。输入不再局限于文本提示或图像;用户可以将演示文稿或PDF文档的内容转换为视频素材,从而拓展该模型在企业传播、营销和社交网络内容制作中的潜在用途。
用途与成本
Alibaba列出的目标用途包括营销和企业传播片段、短视频、社交媒体内容以及短剧。公司还提到,该模型可以用于自动驾驶车辆和机器人系统的训练模拟,但材料没有提供有关这些应用的其他技术细节。
成本取决于分辨率:480p为每秒0.05美元,720p为每秒0.10美元,1080p为每秒0.20美元。因此,制作一分钟1080p视频的成本约为12美元。作为来源中提供的比较,Google的Veo 3.1模型在标准层级的价格为每秒0.40美元。
可用性与开放程度
Wan3.0代表了Wan此前模型路线的转变,因为Alibaba目前仍将模型权重保持为闭源。该模型正通过Model Studio和Qwen Cloud逐步开放,同时计划分阶段推出应用程序编程接口。公司还计划通过wan.video提供基于订阅的面向消费者的平台。
为什么这次发布很重要?
Wan3.0的重要性不仅在于将视频时长翻倍,还在于它将来自演示文稿和文档等多种企业来源的视频生成,与相对更长、分辨率最高达1080p的输出结合起来。这可能对需要处理现成材料并将其转换为视频的营销和传播团队具有意义,但这些实际能力的价值将取决于转换质量和结果的一致性,而来源没有提供相关的独立测量数据。
此次发布是在Alibaba宣布在香港出售约102亿美元股票、以筹集人工智能投资资金之后进行的。公司表示,将把发行7.1亿股新股所得的全部资金用于芯片、人工智能基础设施和模型开发。在最近一个季度,年度净利润下降75%,而资本支出增长75%,达到676.8亿元人民币。与此同时,云计算和人工智能收入在截至6月的季度增长45%,达到484.4亿元人民币。Alibaba此前曾在2025年初宣布,计划在三年内向人工智能基础设施投资3800亿元人民币。