阿里云发力视频大模型：通义万相升级为2.1版本全面开放使用

　　新京报贝壳财经讯（记者罗亦丹）1月9日，阿里云通义万相携2.1版本升级杀入了视频生成大模型的竞技场，并在权威评测集VBench上登顶。此次升级，通义万相在大幅度复杂运动、物理规律遵循、艺术表现等方面全面提升。

　　版本升级后，新版的通义万象在视频生成领域的权威评测集VBench登上榜首位置，超越混元、海螺AI、Gen3、Pika等国内外视频生成模型。具体来看，VBench一共有16个评分维度，而通义万相在运动幅度、多对象生成、空间关系等关键能力上拿下最高分，最终以总分84.7%的成绩斩获第一。

　　目前，精准理解和模拟物理世界是当下视频生成模型的核心难题，现有模型生成的视频在大幅运动、物理复杂场景表现较差，容易生成肢体扭曲、违背物理定律的视频。针对这一难题，通义万相团队采用自研VAE和DiT架构，有效增强了时空上下文关系建模能力。

　　在DiT的设计中，全新通义万相使用时空全注意机制，这一机制让模型能够更准确地模拟现实世界的复杂动态；团队还引入了参数共享机制，不仅提升了模型的性能，还有效降低了训练成本；此外，针对文本的嵌入进行优化，实现更优的文本可控性的同时也减少了计算需求。

　　在视频VAE方面，通义万相设计了一种创新的视频编解码方案。通过将视频拆分成若干块（Chunk）并缓存中间特征的方式，代替直接对长视频的E2E编解码过程，实现显存的使用与原始视频长度无关，从而能够支持无限长1080P视频的高效编解码，这一关键技术为任意时长视频的训练提供了新的路径。

　　在全新架构下，通义万相在大幅度的肢体运动和肢体旋转场景的视频生成上表现更稳定，即便是花样滑冰、游泳、跳水等运动视频也能保持肢体协调并符合正常运动轨迹。通义万相在文字视频生成上实现了突破，成为首个支持中文文字生成能力、且同时支持中英文文字特效生成的视频生成模型，可满足广告设计、短视频等领域的创作需求。