Google DeepMind联合YouTube推出STATIC,生成式检索速度狂飙948倍

Google DeepMind与YouTube团队联合发布STATIC框架,针对性攻克大语言模型(LLM)在生成式检索中的核心痛点——推荐系统中易生成无效商品ID或违反库存逻辑的问题。该框架通过将Trie索引转化为稀疏转移矩阵实现高效约束解码,在测试中使检索速度提升948倍,同时大幅增强生成式检索的准确性与可靠性。

当你在电商平台搜索“夏季户外露营装备”,或是在YouTube上查找“零基础瑜伽教程”时,大语言模型(LLM)驱动的生成式检索系统本应快速匹配到符合需求且库存充足的内容或商品,但实际场景中,这类系统却时常出现“幻觉”:生成不存在的商品ID、推荐已售罄的商品,甚至违背基本的库存逻辑——这一痛点长期制约着生成式检索在推荐领域的规模化落地。

随着大语言模型的普及,生成式检索正逐步取代传统的嵌入式搜索,成为推荐系统的核心技术之一。与依赖向量匹配的嵌入式搜索不同,生成式检索直接利用LLM生成目标ID,在语义理解和个性化匹配上具备天然优势。但LLM的“无约束生成”特性,使其在需要严格遵循规则的场景中屡屡出错:比如推荐系统中必须匹配真实存在的商品ID、符合库存状态的内容,一旦生成无效信息,不仅会影响用户体验,还会给平台运营带来额外成本。此前尝试的约束解码方案,因依赖效率低下的Trie索引前缀树,在GPU/TPU等硬件上运行速度极慢,难以支撑大规模实时推荐需求。

为解决这一难题,Google DeepMind与YouTube团队联合推出STATIC框架(用于约束解码的稀疏转移矩阵加速Trie索引),核心突破在于将传统的Trie索引树状结构,转化为静态压缩稀疏行(CSR)矩阵。这一转变让原本硬件不友好的树状检索,变成了GPU/TPU擅长的向量化运算,从而实现高效的约束解码。

在30亿参数模型的测试场景中,STATIC框架将生成式检索的速度提升了948倍,同时从根源上避免了LLM生成无效ID或违背库存逻辑的问题。约束解码机制确保模型每一步生成的内容都严格符合预设规则,既保留了生成式检索的语义优势,又具备了嵌入式搜索的可靠性。

作为一款从实际业务痛点出发的技术框架,STATIC的首个落地场景正是YouTube的视频推荐系统——该平台每天需处理数十亿级的用户检索请求,对推荐的准确性和实时性要求极高。未来,这一技术不仅可推广到电商、本地生活等需要严格库存或规则约束的推荐场景,还能拓展至知识库检索、代码生成等领域,为大语言模型的“可控生成”提供新的技术路径。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。