随着生成式 AI 的普及,越来越多的个人用户和企业开始部署本地大模型。然而,在实际操作中,用户往往面临硬件资源分散的挑战:家中或办公室里可能同时存在搭载 Apple Silicon 的 Mac、配备 RTX 显卡的 PC 以及 NVIDIA DGX Spark 等不同类型的设备。如何将这些孤立的计算节点整合起来,形成一个统一的推理集群,是许多开发者面临的难题。近日,NVIDIA 顺势推出了开源项目 **Personal AI Router (PAIR)**,为解决这一痛点提供了创新的虚拟路由方案。
什么是 PAIR?
PAIR 是一个开源的虚拟推理路由器,其核心功能是充当本地网络中的“智能管家”。它能够识别并连接网络上现有的 AI 推理节点(如运行 Ollama 或 LM Studio 的机器),并将用户的 AI 请求智能地分发到最合适的设备上执行。对于开发者而言,PAIR 最显著的优势在于其兼容性。它通过代理现有的 Ollama 和 LM Studio 端点,使得上层应用无需进行任何代码修改,即可透明地享受分布式计算带来的性能提升。
智能调度与负载均衡
PAIR 不仅仅是简单的流量转发,它内置了一个复杂的调度器。该调度器会实时监控网络中各个节点的状态,包括节点的就绪状态、引擎状态、具体模型的加载情况、当前的任务负载以及 GPU 利用率。通过这些维度的过滤,PAIR 能够确保请求被路由到真正具备算力且正在运行的节点上,从而避免了将任务发送到空闲或未准备好的设备上。
性能实测:分布式推理的潜力
NVIDIA 在演示中展示了 PAIR 的实际效能。在一个包含三台设备的集群中运行“五子代理”演示任务时,PAIR 将任务平均分配到了不同的节点上。结果显示,在单台 RTX Spark 笔记本上运行该任务耗时约 18 分钟,而在由三台设备组成的集群上,该任务仅需 8 分 48 秒即可完成。这种接近两倍的加速比,直观地证明了通过合理的资源调度,本地多设备协同工作能够显著缩短 AI 任务的响应时间。
官方定位与局限性
值得注意的是,NVIDIA 在发布说明中明确指出,PAIR 目前被标记为“非官方”演示,而非严格的性能基准测试。这意味着虽然 PAIR 展示了强大的功能,但其调度逻辑可能仍有优化的空间。此外,目前的 PAIR 存在一些已知局限性。例如,它目前仅支持单一的调度策略,且对显存(VRAM)大小和模型的“预热”状态缺乏感知。如果模型尚未加载到显存中,或者某个节点的显存不足以容纳当前模型,PAIR 可能无法自动做出最优决策。不过,作为一款开源工具,PAIR 的出现无疑降低了用户构建本地 AI 集群的门槛,为未来的多设备协同推理提供了宝贵的参考。
(本文来源:MarkTechPost)
信息来源:MarkTechPost,原文链接:https://www.marktechpost.com/2026/09/04/nvidia-releases-personal-ai-router-pair-an-open-source-virtual-inference-router-that-distributes-local-ai-requests-across-rtx-dgx-spark-and-mac-nodes/