AI导航

Modal Clusters 正式发布:一条装饰器调动多节点 GPU 集群

AI资讯
2 min read
0 次阅读

2026 年 10 月 1 日,AI 云平台 Modal 在官方工程博客宣布,Modal Clusters 正式可用:只需要在 Python 代码里加一个装饰器 @modal.clustered,就能获得一个完整的多节点 GPU 集群。节点之间通过 InfiniBand verbs 通信,带宽最高 6.4 Tbps,PyTorch 和 NCCL 会被自动配置好。Modal 称这是市面上拿到多节点集群最快的方式——请求发出后几秒内代码就能跑起来,而且按秒计费,用多少付多少。

多节点训练和推理一直是件麻烦事。训练时,每一步都要在节点间同步动辄几百 GB 的权重;做推理的 prefill-decode 分离时,几十 GB 的 KV 缓存要在几百毫秒的首 token 预算内搬运到位。RDMA 能解决这些问题,但各家云的 RDMA 实现各不相同,驱动、环境变量、用户态库都要自己调。Modal 把这些藏到了一个开关后面:rdma=True,PyTorch + NCCL 的工作负载开箱即用。为此 Modal 还重写了调度器——从单节点贪心调度换成 gang 调度,一次把 N 个节点摆到位;甚至在多租户安全容器运行时 gVisor 里自己实现了 RDMA 支持,并把改动 upstream 到了开源社区。

谁已经在用它

博客公布了三个生产案例。Decagon 用 Modal Clusters 微调了万亿参数级别的开放模型(基于 Miles 框架),Modal 还为此给 Miles 贡献了 LoRA 支持;做家用机器人 NEO 的 1x 用 B300 多节点集群预训练世界模型,跑大任务时用 RDMA 集群,跑评估时切回单节点任务;Runway 的视频生成模型 Gen-4.5 和 Aleph 2.0 则把多节点集群直接用在推理线上,靠自动扩缩容应对流量波动。

三个例子背后是同一个卖点:弹性。训练和推理都要在几十到几百张卡之间快速伸缩,传统按小时计费或预留容量要么贵、要么拿不到卡。Modal 把多节点集群做成无服务器——随时要、随时有、按秒付。

对开发者意味着什么

官方案例里 Decagon、1x、Runway 都是先成为客户再跑起来的,普通用户先从小规模集群验证流程更稳妥。

推荐工具

NVIDIA Chat with RTX AI聊天 Chat with RTX 是 NVIDIA 面向 RTX 电脑的本地 AI 聊天工具,可围绕本地文档和视频资料做问答,适合重视隐私、离线检索并具备硬件条件的用户更适合资料不便上传云 HuggingChat AI聊天 HuggingChat 是 Hugging Face 的开源模型聊天应用,支持 Omni 自动选模型,也可手动选社区开放模型对话。它适合体验开源模型、技术探索和问答,结果可能不稳定,重要内容需复核。 纳米AI搜索 AI搜索 纳米AI 是 360 旗下 AI 搜索和智能体入口,支持文字、语音、拍照提问、多模型协作与内容创作,适合中文用户做日常搜索、学习问答、移动查询、热点追踪、生活决策、知识整理和轻量创作。 Qwen Chat(通义千问) AI聊天 Qwen Chat 是Qwen 大模型聊天助手,支持Qwen 模型聊天、写作和编程问答,适合中文用户和开发者完成 AI 对话、资料问答和任务协作,适合上线前核对权限、成本和资料质量。 DuckDuckGo AI Chat AI聊天 DuckDuckGo AI Chat 适合重视隐私的普通用户使用,围绕隐私 AI 聊天、免账户使用和多模型问答提供对话式 AI 支持和任务协作能力,适合上线前核对权限、成本和资料质量。 Goody-2 AI聊天 Goody-2 是以极端安全和伦理对齐为特色的 AI 聊天助手,常用于观察模型拒答边界、内容安全策略、保守输出体验和 AI 风险讨论,更适合作为安全边界样本使用前应理解它偏实验性质,不适合。