2026 年 10 月 1 日,AI 云平台 Modal 在官方工程博客宣布,Modal Clusters 正式可用:只需要在 Python 代码里加一个装饰器 @modal.clustered,就能获得一个完整的多节点 GPU 集群。节点之间通过 InfiniBand verbs 通信,带宽最高 6.4 Tbps,PyTorch 和 NCCL 会被自动配置好。Modal 称这是市面上拿到多节点集群最快的方式——请求发出后几秒内代码就能跑起来,而且按秒计费,用多少付多少。
多节点训练和推理一直是件麻烦事。训练时,每一步都要在节点间同步动辄几百 GB 的权重;做推理的 prefill-decode 分离时,几十 GB 的 KV 缓存要在几百毫秒的首 token 预算内搬运到位。RDMA 能解决这些问题,但各家云的 RDMA 实现各不相同,驱动、环境变量、用户态库都要自己调。Modal 把这些藏到了一个开关后面:rdma=True,PyTorch + NCCL 的工作负载开箱即用。为此 Modal 还重写了调度器——从单节点贪心调度换成 gang 调度,一次把 N 个节点摆到位;甚至在多租户安全容器运行时 gVisor 里自己实现了 RDMA 支持,并把改动 upstream 到了开源社区。
谁已经在用它
博客公布了三个生产案例。Decagon 用 Modal Clusters 微调了万亿参数级别的开放模型(基于 Miles 框架),Modal 还为此给 Miles 贡献了 LoRA 支持;做家用机器人 NEO 的 1x 用 B300 多节点集群预训练世界模型,跑大任务时用 RDMA 集群,跑评估时切回单节点任务;Runway 的视频生成模型 Gen-4.5 和 Aleph 2.0 则把多节点集群直接用在推理线上,靠自动扩缩容应对流量波动。
三个例子背后是同一个卖点:弹性。训练和推理都要在几十到几百张卡之间快速伸缩,传统按小时计费或预留容量要么贵、要么拿不到卡。Modal 把多节点集群做成无服务器——随时要、随时有、按秒付。
对开发者意味着什么
官方案例里 Decagon、1x、Runway 都是先成为客户再跑起来的,普通用户先从小规模集群验证流程更稳妥。