Redis推出LangCache托管语义缓存 最高降LLM成本90%提速15倍

全球内存数据库厂商Redis近日正式推出托管式语义缓存产品LangCache,针对大语言模型(LLM)API调用场景可直接返回已存储的历史响应结果,实测数据显示其最高可削减90%的LLM API调用成本,缓存命中场景下的响应速度最高提升15倍,为当前生成式AI落地的高成本痛点提供了轻量化的成熟解决方案。

随着生成式AI的规模化落地,越来越多的企业选择调用商用LLM API搭建自身的AI应用,但按token计费的模式下,大量重复、相似的用户请求正在吞噬企业的IT预算。某零售品牌内部数据显示,其智能客服场景下,近60%的用户提问都属于高频共性问题,重复调用LLM API产生的成本占总支出的45%以上,同时长链路的API调用也拖慢了用户端的响应速度。

此前行业内也有不少企业尝试自研缓存方案降低LLM调用成本,但绝大多数方案都采用关键词精确匹配逻辑,用户提问的表述稍有变化就无法命中缓存,实用性极低。而如果要实现语义级匹配,企业需要额外搭建向量数据库、维护缓存集群、持续优化匹配算法,对于技术储备不足的中小团队来说门槛过高,不少团队宁愿承担额外的API成本也不愿投入人力做缓存优化。

免责声明:本网站AI资讯内容仅供学习参考,不构成任何建议,不对信息准确性与完整性负责。