Perplexity公开GPU嵌入栈细节 三大组件支撑pplx-embed服务

AI搜索初创公司Perplexity近日首次公开其自研GPU嵌入服务栈完整技术细节,旗下Ivy、Tulip、ROSE三大组件协同支撑pplx-embed嵌入模型对外服务。配套披露的CUDA图捕获、LazyTensor调度优化方案及vLLM基准测试数据显示,该栈较通用部署方案吞吐量提升超40%,延迟降低27%,可为高并发RAG场景提供性能参考。

随着生成式AI应用进入落地深水区,检索增强生成(RAG)技术已经成为企业降本增效、提升大模型输出准确率的核心方案,而嵌入模型的服务性能,直接决定了RAG系统的响应速度和并发承载能力。

对多数中小团队而言,直接用通用框架部署嵌入模型往往会出现GPU算力利用率不足、高并发场景下延迟飙升的问题,头部AI企业的自研优化方案也因此受到行业普遍关注。Perplexity作为日活超千万的AI搜索平台,每日需要处理亿级文本嵌入请求,其技术栈的落地验证价值远高于实验室测试方案。

此次Perplexity披露的三层架构,针对性解决了嵌入服务的多个常见性能痛点。

免责声明:本网站AI资讯内容仅供学习参考,不构成任何建议,不对信息准确性与完整性负责。