随着大语言模型(LLM)在企业级应用中的普及,推理成本与响应延迟成为了制约其大规模落地的关键瓶颈。近日,数据库技术领军企业 Redis 官方宣布推出了一款名为“Redis LangCache”的托管式语义缓存服务。这款工具宣称能够将 LLM API 调用成本降低高达 90%,并将缓存命中速度提升 15 倍,为 AI 应用的优化提供了新的解决方案。
在当前的 LLM 应用架构中,大多数生产环境的应用(如智能客服、企业知识库问答)往往面临着“重复查询”的困境。用户或内部员工在处理相同意图的问题时,往往会使用不同的措辞。例如,询问“如何重置密码”与“忘记密码怎么办”,尽管核心意图一致,但在传统的基于精确字符串匹配的缓存系统中,这些请求会被视为全新的请求,从而触发昂贵的 LLM API 调用。Redis LangCache 正是针对这一痛点而生。
与传统缓存技术不同,Redis LangCache 采用先进的语义搜索技术。它不依赖关键词的完全一致,而是通过将用户的查询转化为高维向量,计算查询向量与缓存中历史向量之间的余弦相似度。这意味着,即使两个问题的措辞大相径庭,只要其语义含义相近,LangCache 就能将其识别为“命中”,并直接从内存中返回之前生成的回复,而无需再次调用昂贵的生成模型。这种“语义级”的缓存策略,极大地提高了缓存命中率。
作为 Redis 生态体系的一部分,LangCache 提供了完全托管的体验,开发者无需自行搭建复杂的向量检索基础设施,即可将其无缝集成到现有的应用架构中。它通常部署在应用程序与 LLM API 之间,充当智能的“中转站”。当收到用户请求时,它首先在本地或 Redis 向量数据库中检索语义相似的缓存条目;如果命中,则立即返回结果;若未命中,则转发请求给 LLM 并将结果存入缓存以备后用。
这一服务的推出对于 RAG(检索增强生成)系统尤为重要。在 RAG 场景下,系统通常会在生成答案前先检索相关的上下文文档。由于检索到的上下文往往是固定的,而用户的提问方式千变万化,导致 RAG 系统每天需要处理大量语义相同但表述不同的查询。Redis LangCache 能够有效拦截这些重复请求,直接复用之前的生成结果,从而显著降低 Token 消耗。对于企业而言,这意味着每百万次查询的边际成本将大幅下降,使得将 AI 集成到高流量业务场景中变得更加经济可行。
此外,Redis LangCache 在响应速度上的优势也不容小觑。相比直接调用 LLM API 所需的秒级乃至几十秒级的生成时间,从 Redis 缓存中读取数据的延迟通常在毫秒级别。15 倍的加速意味着用户体验的质的飞跃,这对于实时性要求极高的应用场景(如在线编程助手、实时交易分析)至关重要。
综上所述,Redis LangCache 的出现标志着 LLM 应用优化进入了一个新阶段。它不仅仅是一个简单的缓存工具,更是推动 AI 应用从“实验原型”向“商业产品”转变的关键基础设施。通过解决成本和速度两大核心痛点,它为开发者释放了更多的资源去专注于模型微调和业务逻辑的创新,而非被高昂的基础设施成本所束缚。
参考来源: MarkTechPost
信息来源:MarkTechPost,原文链接:https://www.marktechpost.com/2026/09/10/meet-redis-langcache-a-managed-semantic-cache-that-cuts-llm-api-costs-by-up-to-90-and-returns-cache-hits-up-to-15x-faster/