阿里巴巴发布通义万相2.6(Wan 2.6)系列模型,并在阿里云百炼等入口开放使用。新版主打“角色扮演”与可控叙事:可参考输入视频中的角色外观与音色,结合提示词生成单人、多人或人与物合拍视频,并可将简短提示词扩写为多分镜脚本,提升跨镜头连贯性与主体一致性。
在能力上,万相2.6强调更自然的音画同步与更稳定的多人对话,同时覆盖音乐与歌曲生成,并提供“音频驱动”用文本与音频带动多镜头演绎。公开视频信息显示,视频生成最长可达15秒(不同形态可能存在10秒标注),API计费页面显示部分调用价格为0.6元/秒起,具体以平台控制台规则与配额为准。使用真实人物形象或声音时,仍需注意肖像权、声音权与版权授权,避免侵权与误导传播风险。
常见问题
Q:通义万相2.6(Wan 2.6)是什么?
A:它是阿里通义体系的视频与图像生成模型系列的新版本,面向创作场景做了能力升级。
Q:万相2.6的“角色扮演”具体能做什么?
A:模型可参考视频中的外观与音色,按提示词生成角色演绎内容,支持多人合拍与人与物合拍。
Q:万相2.6的“智能分镜”有什么用?
A:它能把简单提示词扩写为多分镜脚本,帮助生成更连贯的多镜头视频。
Q:万相2.6最长能生成多长视频,是否支持音画同步?
A:公开信息显示最长15秒,并强调音画同步与对话稳定性提升。
Q:万相2.6费用与主要风险点是什么?
A:页面标注部分API调用0.6元/秒起;风险主要在肖像、声音与素材版权合规。