Prime Intellect 推出 Prime Inference:前沿大模型的无服务器推理新方案

随着人工智能技术的飞速发展,大语言模型(LLM)的部署与推理已成为产业界关注的焦点。近日,AI 基础设施领域传来重磅消息,初创公司 Prime Intellect 正式推出了名为 Prime Inference 的新平台。该平台旨在为前沿开放模型提供高性能、灵活且成本可控的推理服务,标志着无服务器 AI 推理领域的又一次重要突破。

Prime Inference 是一个完全兼容 OpenAI API 的服务平台,这意味着开发者可以无缝迁移现有的应用,而无需修改代码。其核心亮点在于利用了 NVIDIA 最新的 Blackwell 架构,这是目前业界领先的 GPU 平台,能够为复杂的 AI 任务提供强大的算力支持。

在具体的模型部署方面,Prime Intellect 展示了其在 GLM-5.3 模型上的卓越表现。GLM-5.3 作为一种前沿的开放模型,参数规模庞大,对计算资源的需求极高。为了在保证性能的同时最大化资源利用率,Prime Inference 采用了一系列先进的优化技术。据官方数据显示,该平台利用了 vLLM 推理引擎,并通过 NVFP4 KV 压缩技术,显著降低了显存占用。这种技术上的创新,使得平台能够在单组预填充(prefill)会话中支持高达 66 个并发会话,同时为每个用户维持 101 token/s 的生成速度。

性能指标的突破是 Prime Inference 的核心竞争力之一。在当前 AI 应用竞争激烈的环境下,推理速度直接关系到用户体验和应用的响应效率。101 token/s 的生成速率在同类平台中属于领先水平,而 66 个会话的并发处理能力则证明了其在资源调度上的高效性。NVFP4 KV 压缩技术尤为重要,它通过降低键值对的存储需求,使得在有限的显存空间内可以容纳更多的上下文,这对于处理长文本输入或需要高上下文连贯性的应用场景至关重要。

除了硬核的性能指标,Prime Inference 的商业模式也极具吸引力。它提供了“无服务器”和“预留服务”两种模式。无服务器模式允许用户按使用量付费,无需担心闲置资源,非常适合初创公司或处于探索阶段的 AI 应用开发者。而预留服务模式则为有长期、大规模需求的客户提供了更具性价比的解决方案。这种灵活的计费方式极大地降低了企业使用前沿 AI 模型的门槛。

行业分析人士认为,Prime Inference 的推出恰逢其时。目前,开源社区涌现出了许多参数量巨大的模型,如 Llama-3、Mistral 等,但如何高效、低廉地运行这些模型一直是业界的痛点。Prime Intellect 通过整合底层的硬件优化和上层的服务架构,试图解决这一痛点。它不仅是一个推理服务提供商,更是在推动 AI 基础设施民主化进程中的重要一环。

总而言之,Prime Inference 的上线为开发者提供了一个强大的工具,让他们能够专注于应用开发,而非底层硬件的维护。随着 NVIDIA Blackwell 算力的加持和先进的推理优化技术的应用,我们有理由相信,这将加速更多前沿 AI 产品的落地,推动人工智能技术在各行各业的深度融合。

信息来源:MarkTechPost,原文链接:https://www.marktechpost.com/2026/10/02/prime-intellect-launches-prime-inference-serverless-and-reserved-serving-for-frontier-open-models/

由 oaido_ai

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注