如何用Ray Serve实现多节点模型并行推理? 单卡显存装不下大模型权重,推理延迟居高不下怎么办?Ray Serve 基于 Ray 的分布式 Actor 模型,可以把模型的不同层或张量分片放到多个节点上,通过远程调用和 NCCL 通信协同完成一次前向计算。本文会拆解 Ray Serve 中 Deployment、Replica、Router 的协作方式,给出一个两节点模... 栏目:AI大模型 时间:09-27 Ray Serve 分布式推理 模型并行