一、 PLUM [2026]

《PLUM: Adapting Pre-trained Language Models for Industrial-scale Generative Recommendations》

  1. 大型语言模型(Large Language Models: LLM)为信息任务带来了新的建模范式和计算范式。推荐系统是一个关键的应用领域,有望从这些大型模型中固有的 sequence modeling 能力和世界知识中显著受益。在本文中,我们介绍了 PLUM,一个旨在将 pre-trained LLMs 适配于工业级推荐任务的框架。PLUM 包括使用 Semantic IDs 的 item tokenization、在 domain-specific data上的 continued pre-training: CPT,以及针对 recommendation objectives 的 task-specific fine-tuning。在 fine-tuning 方面,我们特别关注 generative retrieval ,其中模型被直接训练为基于 user context 来生成 Semantic IDs of recommended items。我们在大规模内部视频推荐数据集上进行了全面的实验。我们的结果表明,与使用 large embedding tables 构建的经过高度优化的 production model 相比,PLUM 在检索方面取得了实质性的改进。我们还展示了模型检索性能的 scaling 研究、我们在 CPT 方面的经验、对 Semantic IDs 的一些增强,以及 training 和 inference 方法的概述(这些方法使得该框架能够在 YouTube 上向数十亿用户发布)。

  2. 推荐系统在现代数字平台中至关重要,深刻影响着用户发现内容和与之互动的方式。过去几十年见证了深度学习模型在推荐系统的检索阶段(retrieval stage)和排序阶段(ranking stage)取得的显著成功。尽管使用了神经网络,但 industrial recommenders 中的主导范式仍然依赖于大规模 embedding tables 来表示 high-cardinality categorical features,如 item IDs。在这些 Large Embedding Models: LEMs中,绝大多数参数位于这些 embedding tables 中。虽然这种架构选择在记忆 user-item interactions 方面非常有效,但它阻碍了更深的、更复杂的网络的潜在收益。这种专注于扩大 embedding tables 的 scaling 方法论,与 LLM 的 scaling 方法论形成对比,后者强调增加神经网络规模以学习 compositions of compact input tokens。

    The success of LLMs 激发了一种新兴范式转变从而用于构建推荐模型。LLM 中固有的 sequence modeling 能力和庞大的世界知识为构建更智能、更个性化的推荐系统提供了机会。然而,将 LLM 适配于推荐任务并非易事。主要挑战在于弥合领域差距(domain gap):LLM 并未在 target domain 的 user behavior data 和 item corpus 上被预训练,这使得它们更难从 user activities 和细微的 item quality 中理解 user preferences。因此,直接应用现成的 LLM 到推荐任务中,即使在小型公共数据集上也显示出持续的性能差距。其次,基于 large embedding tables的 traditional input representation 带来了 scaling 挑战。这些 tables 需要大量的训练数据,使得训练大型 Transformer 架构成本高昂。

    本文朝着教会 LLM 解决推荐任务的方向迈出了一步。我们介绍了 PLUM,一个用于有效地将 pre-trained LLMs 适配于工业级 generative recommendation 的框架。PLUM 包括三个关键阶段:

    • Item tokenization:语料库中的每个 item 由 a sequence of discrete tokens 来表示,称作 Semantic IDs: SIDs。基于先前使用 RQ-VAE 的工作,我们引入了一套新技术(称为 SID-v2 ),用于整合 user behavioral signals 和 multi-modal content embeddings,并通过 multi-resolution codebooks 和 progressive masking 来改善 hierarchical integrity。

    • Continued pre-training: CPT:在此阶段,pre-trained LLM 的 vocabulary 被扩展以包含新的 SID tokens。模型在 a mixture of domain-specific item data and user sequences, and general-domain text data 上进一步被预训练,以将新的 SID modality 与模型现有知识进行对齐。

    • Task-specific fine-tuning:最后,模型针对 specific recommendation objectives 进行微调。虽然 PLUM 可以支持各种下游任务,但本文重点关注其在 generative retrieval 中的应用,其中 a decoder-only model 被训练为自回归地生成 SIDs of next items,其中用户可能与这些 next items 进行互动。Generative retrieval 不需要维护 a separate index of an item corpus,并且绕过了 embedding-based retrieval 中的 dot-product limitation(《On the Theoretical Limitations of Embedding-Based Retrieval》)。

    PLUM 框架旨在解决上述挑战。continued pre-training: CPT 通过 enriching the pre-trained LLMs with domain corpus and user behavior patterns 来弥合 domain gap。我们观察到 CPT 后的模型可以展示出 basic few-shot learning capability,从而根据 SID input 来生成 text tokens。SID-based input representation 绕过了 Large Embedding Models 的 scaling bottleneck。我们的实验表明,通过将模型复杂度从 input embeddings 转移到神经网络,基于 PLUM 的 generative retrieval 相比 a production Transformer-based retrieval model with large embedding tables 可以实现显著更好的样本效率。因此,尽管 PLUM retrieval 使用的 Transformer 架构的 dense parameters 是 Large Embedding Models 的 100 倍,但由于更快的收敛速度,retrieval 任务的 overall training cost 与 Large Embedding Models 相当。我们还观察到了有效的 scaling:retrieval 性能持续提升,逼近一个 Mixture-of-Experts: MoE 模型,其 activated parameters 超过 900M (总参数约 4.2B)。

    除了这些贡献之外,我们还将分享在大规模生产环境中部署 PLUM-based retrieval 的实际经验,特别是在 online A/B testing 中对 PLUM retrieval 和 Large Embedding Model-based retrieval 的比较。PLUM 框架已在 YouTube 推荐中投入生产,通过 online inference 和 offline inference 为多个核心页面同时提供长视频和短视频的 retrieval 服务。

1.1 相关工作

  1. 我们看到了受 LLM 最新进展启发的两条主要研究路线。

    • 第一条路线关注使用 Transformer 架构(或其变体)来 scaling up Large Embedding Models 的神经网络组件。

    • 第二条路线聚焦于 token-based generative recommendation,并将 recommendation retrieval 重新定义为 seq2seq transduction 任务。

  2. Sequential Recommendations:modeling user sequences and feature interactions 一直是改进推荐模型的关键领域,从使用经典 sequential neural networks(《Session-based Recommendations with Recurrent Neural Networks》、《Self-Attentive Sequential Recommendation》)到设计定制化的 feature interaction components (《DCN V2: Improved Deep & Cross Network and Practical Lessons for Web-scale Learning to Rank Systems》、《Wukong: Towards a Scaling Law for Large-Scale Recommendation》)。

    最近,新兴趋势是使用 Transformer-like 架构将 user history 和 heterogeneous features 统一到单个序列中(《MTGR: Industrial-Scale Generative Recommendation Framework in Meituan》、《Towards Large-scale Generative Ranking》、《Actions Speak Louder than Words: Trillion-Parameter Sequential Transducers for Generative Recommendations》),显示出相比 traditional MLP 架构更好的 scaling。

    此外,训练范式本身也在向 LLM 的方向演变,一些工作采用 self-supervised pre-training objectives,随后进行 task-specific fine-tuning(《PinFM: Foundation Model for User Activity Sequences at a Billion-scale Visual Discovery Platform》、《Foundation Model for Personalized Recommendation》)。

    所有这些进展的共同点是它们持续依赖大规模 embedding tables 来表示 categorical features。我们的工作通过用 compact input tokens 替换 large embedding tables 来脱离这一范式。除了 SID ,我们还通过 tokenizing numerical features 或直接使用 dense embedding features 作为 soft tokens,来使用 LLM 处理 heterogeneous features。

  3. Semantic IDs and Quantization:representing items as sequences of discrete tokens (即,Semantic IDs: SIDs)的概念,已成为 traditional ID embeddings 的一种强大替代方案。这种方法允许将 items 视为一种“语言”,并可由 sequence models 进行处理。早期工作证明了 training retrieval models from scratch 以预测 SIDs 的可行性(《Recommender systems with generative retrieval》);后续研究显示,SIDs 可以被哈希处理以替代 random item ID embeddings,从而增强 ranking models的泛化能力(《Better Generalization with Semantic IDs: A Case Study in Ranking for Recommendation》、《Enhancing Embedding Representation Stability in Recommendation Systems with Semantic ID》)。

    近期大量研究致力于通过将 diverse signals 融入 quantization 过程,来提升 SIDs 的质量和表达能力。这包括融合 multi-modal content features(《MMQ: Multimodal Mixture-of-Quantization Tokenization for Semantic ID Generation and User Behavioral Adaptation》),以及从 user behaviors 中注入 collaborative filtering signals(《BBQRec: Behavior-Bind Quantization for Multi- Modal Sequential Recommendation》、《Semantic IDs for Joint Generative Search and Recommendation》、《Recommender systems with generative retrieval》、《DAS: Dual-Aligned Semantic IDs Empowered Industrial Recommender System》)。PLUM 与这一研究方向并行。

    • 与 MMQ (《MMQ: Multimodal Mixture-of-Quantization Tokenization for Semantic ID Generation and User Behavioral Adaptation》)(为每种模态生成不同 tokens)不同,我们简单地将 multiple content embeddings 拼接起来,然后通过 MLP 进行编码,从而提供了 supporting more embeddings 的灵活性。

    • 在融入 user behaviors 方面,多数工作是在 quantization 过程中将协同过滤(collaborative-filtering: CF) item embeddings 与 content embeddings 融合,但 CF-based item embeddings 通常随 item popularity 变化而动态变化,需要频繁地重新训练 quantizer 及下游模型。我们通过在 a contrastive training objective 中使用 CF signals 来引导 quantizer 从 content information 中捕获有用信息,从而避免了这一问题。

    此外,我们还提出了另外两项关键创新,以改进 SID training 与 generative retrieval 之间的对齐。

  4. Generative Retrieval and Alignment:generative retrieval 将 recommendation retrieval 重新定义为 sequence-to-sequence 任务,其中模型以自回归方式直接生成 the SIDs of relevant items。自从在 document search(《Transformer memory as a differentiable search index》)和 recommendation(《Recommender systems with generative retrieval》)领域的开创性工作以来,这一想法在业界获得了显著关注(例如,《Generative Recommendation with Semantic IDs: A Practitioner’s Handbook》、《Semantic IDs for Music Recommendation》、《Generative Retrieval and Alignment Model: A New Paradigm for E-commerce Retrieval》、《Generative Next POI Recommendation with Semantic ID》)。

    • 例如,OneRec (《OneRec Technical Report》)采用 an encoder-decoder architecture 来生成 video SIDs,并利用 RL training 通过 a reward model 提升模型质量。

    • 其他工作(《Unifying Generative and Dense Retrieval for Sequential Recommendation》、《Sparse Meets Dense: Unified Generative Recommendations with Cascaded Sparse-Dense Representations》)提出了 hybrid models,同时生成 SIDs 和 dense embeddings 以缓解 quantization 带来的 information loss。

    这些方法的一个共同点是它们大多专注于 training generative models from scratch。我们的工作则侧重于将 SIDs 与LLMs 对齐,并研究 LLM pre-training 和 CPT 对 generative retrieval 性能的影响。虽然一些研究(《Aligning Large Language Models with Recommendation Knowledge》、《A Decoder-only Foundation Model for Personalized Ranking and Recommendation》)探索了将 LLM 与推荐任务对齐,但它们的重点主要在于 language interfaces。关于如何有效地将 SID 作为一种新模态整合的研究是有限的。

1.2 PLUM Framework

1.2.1 Semantic IDs

  1. 一个 Semantic ID: SID 被概念化为:从 an item’s underlying content features 导出的 a tuple of discrete codewords 。这个过程涉及两个主要阶段:

    • (1):将 high-level content features 编码为 a dense semantic embedding。

    • 以及 (2):将该 embedding 量化(quantizing )为 a hierarchical tuple of codewords 。

    a generative retrieval model 的有效性根本上取决于 SID 的语义丰富性(semantic richness)和结构完整性(structural integrity)。基于 foundational TIGER framework(该框架利用 Residual-Quantized Variational AutoEncoder: RQ-VAE),我们对这个 generation 过程引入了一系列重大改进。初始方法受限于仅依赖 a single content embedding source 、以及在 ID structure 中缺乏 collaborative signals。我们的方法旨在生成更全面、更对齐 user behavior、且更具 hierarchically coherent 的 SIDs。Figure 1 展示了我们的 training the SID model 的整体设计。

  2. Fused Multi-Modal Content Representation:《Recommender systems with generative retrieval》中依赖 a single content representation 的一个主要局限性是其无法捕获复杂 media items 的多方面性质。例如,一个视频的完整语义含义是通过其文本元数据、视觉内容、以及音频的组合来传达的。单模态 representation 本质上忽略了丰富的、正交的信息来源。

    为了克服这一点,我们将框架设计为对 input sources 的具体数量和类型是无感知的(agnostic),使其能够接收并融合 multiple, heterogeneous representations 。该模型被设计为:接受每个 item 的 a set of distinct embedding vectors {x→m}m=1M。这些 multiple representations 的 fusion 通过一个单独的 embedding encoder Em 来实现,该编码器:

    • 将 x→m 编码为 latent vector z→m。

    • 然后拼接这些 latent vectors 从而得到 z→~=[z→1,⋯,z→M] 。

    • 然后紧跟着一个投影层,形成一个统一的 feature encoded vector z→。

    通过集成来自各模态的信息,我们为后续的 RQ-VAE quantization 过程形成了更优的 input,确保 resulting SIDs 对 item’s content 有了全面的理解。

  3. Hierarchical Refinements in Quantization:我们进一步改进 RQ-VAE 架构本身,以产生更高效的、更有意义的 hierarchy。这涉及两个关键创新:

    • Multi-Resolution Codebooks:先前工作 《Recommender systems with generative retrieval》采用 a fixed uniform-resolution codebooks ,这可能参数效率低下,导致 SID space 庞大且稀疏,其中大多数潜在 codeword combinations 未被分配。我们将其替换为 a multi-resolution codebook structure,其中 initial SID levels 具有高分辨率且最具区分性,而后续 codewords 编码 low-entropy residuals 并具有较低分辨率。具体而言,codebook cardinality 作为 quantization level 的函数:2048/2level - 1,从而产生更紧凑和高效的 SID 。

    • Progressive Masking:为了在 residual quantization 期间强制更严格且更可解释的 hierarchy,我们引入了 progressive masking 。具体而言,我们定义了一个 binary mask scalar ml∈{0,1},其中 l 是 codebook level ,使得 ml=1l<r,其中 r∈[1,L] 是一个随机整数,L 是 codebook levels 的总数。该 mask 用于在 SID training 中选择 first r codebook levels 。

  4. RQ-VAE with Co-occurrence Contrastive Regularization:纯粹从 item’s intrinsic content 导出的 SID 可能无法完全捕获用户在 recommendation context 中感知的 similarity 。user behavior 提供了一个强大的、外部的 signal of video relatedness ;经常被一起观看的视频通常在语义上是相关的。为了弥合 content-based similarity 和 behavior-based similarity 之间的 gap,我们在 ID generation 阶段直接注入了一个强的 collaborative signal,在 RQ-VAE training objective 中引入了一个 co-occurrence contrastive loss 项 Lcon。该 objective function 旨在根据 user interaction sequences 中的 item co-occurrence patterns 来改造 embedding space。该 loss 鼓励模型为经常一起出现的 items 生成相似的 SID representations,同时推开不常一起出现的 items 的 representations。具体而言,contrastive loss 定义为:

    Lcon=−∑i=12Nbexp⁡(sim(p→i,p→i+))∑j=12Nbexp⁡(sim(p→i,p→j))

    其中:

    • p→i 表示一批 Nb 个视频中的一个 video representation,Nb 为 batch size。

    • p→i+ 表示与视频 i 共现的视频的 representation。

    • sim(p→i,p→j) 是视频 i 和 j​ 之间的点积相似度。

    论文采用的是类似 SimCLR / NT-Xent 的对称对比损失:不仅把原始视频 p→i 当锚点,也把它的共现视频 p→i+ 当锚点,正样本互为对方的 positive pair。所以 loss 要对 2Nb 个 pairs 分别计算一次,而不是只对 Nb 个原始视频计算。

  5. SID Training Loss:除了 《Better Generalization with Semantic IDs: A Case Study in Ranking for Recommendations》中引入的 training loss 之外,我们还引入了 co-occurence contrastive loss 项。具体而言,overall loss 定义为:

    L=Lrecon+Lrq+Lcon

    其中:

    • Lrecon=∑m=1M‖x→m−x→^m‖2 是每个 multi-modal embedding 的重建损失(reconstruction loss)。

    • Lrq=∑l=1Lβ‖r→l−sg[e→∗l]‖2+‖sg[r→l]−e→∗l‖2,其中 e→∗l 是第 l 层 codebook 中最近的 code (对应的 vector),r→l=r→l−1−e→∗l 是在每一层递归计算得到的残差,从 r→0=z→ 开始,sg(⋅) 是 stop-gradient 算子。如 Figure 1 所示,final quantized vector z→^ 使用 progressive masking 计算为每层所选 codes 之和:

      z→^=∑l=1Lmle→∗l

      quantized vector z→^ 随后被用作每个解码器 Dm 的输入,以重建 input embeddings x→^m。

      注意,这里是 knn 最近邻分配,而不是 knn-means 自动聚类。二者区别在于:

      • knn 最近邻分配只会修改分配的 cluster 编号,不会移动 cluster 质心。所以这里需要对质心进行梯度反向传播,从而更新质心 e→∗l。

      • knn-means 自动聚类不仅修改分配的 cluster 编号,也会移动 cluster 质心。也有很多论文直接使用的是 knn-means 自动聚类。

      一句话总结:KNN 只改变分配;码本是否变,取决于你是否执行码本更新。经典 k-means 会重算质心,RQ-VAE 的码本是可学习参数,需要用损失或 EMA 显式更新。

1.2.2 Continued Pre-training

  1. 在创建 SID vocabulary 之后,continued pre-training: CPT 阶段的一个主要目标是开发 a base model checkpoint,其中 SID tokens 在语义上得到基础支撑,并与 existing text tokens of the base language model 进行对齐。为此,我们在一个大规模语料库(由两个主要数据源而构成)上使用 next-token predictions 来训练模型:

    • User behavior data:该数据源对于 personalization 和捕获 watch histories 至关重要。在训练期间,每个样本利用 user watch histories 以及额外的 watch features 来建模 user behavior sequences。

    • Video metadata corpus:这个大规模语料库旨在建立 SID 与其对应文本特征之间的强关联。每个样本包括一个视频的SID、标题、描述文本、ASR 字幕、频道名称(channel name)、以及人工合成生成的数据。

    Table 1 展示了我们的 CPT 训练数据模式。

  2. Data Mixture and Training:CPT 阶段的训练集由 user behavior data 和 video meta-data corpus 的 mixture 组成,每个数据源各占训练样本的 50%。CPT 阶段进行了 1 million training steps,使用 batch size = 16,总计约 260 billion tokens。我们设置了多项评估,以衡量 generating SIDs based on user history 的性能、通过 held-out video metadata corpus 联合建模 SID 和 language 的能力,并通过 standard text benchmarks 跟踪 general language capabilities 的退化情况。

  3. In-context Learning:CPT 模型在 a mixed corpus of SIDs and natural language 上训练后,保留了生成自由格式文本的灵活性,并具备 in-context few-shot learning 的能力。我们在附录 A.3 中提供了一些示例。

1.2.3 Generative Retrieval

  1. 虽然 continued pre-training: CPT 阶段使模型能够根据 user history 生成 next-video SIDs,但后续的 Supervised Fine-Tuning: SFT 阶段对于使其专门化以完成 retrieval 任务至关重要。此 SFT 阶段使模型能够融入更丰富的 feature set,特别是 real-time context,并能直接针对 a reward signal(这个奖励信号与 user experience 对齐)进行优化。

    这个 fine-tuning 采用标准的自回归最大似然目标(autoregressive, maximum-likelihood objective)。模型学习预测 ground-truth videos 的 SID tokens,这些 ground-truth videos 定义为:在给定 user context 和 user history 的情况下,来自 user logs 中的 clicked videos。具体来说,模型被训练以最小化以下 loss:

    LSFT=−∑t=1Lr(user,vclick)×log⁡P(sidt∣Contextuser,Historyuser,sid<t)

    其中:

    • [sid1,⋯,sidL] 代表被 clicked video vclick 的 SID。

    • 而 𝑟(user,vclick) 是每次点击的人工设计的奖励信号。在实际操作中,鉴于训练成本高昂,我们基于此奖励信号对训练样本进行采样,然后在 loss 中对 sampled examples 进行加权。

    如 Figure 2 所示,input prompt 不仅包含 SID tokens 和 custom tokens for numerical features,还包含可由 pre-trained LLMs自然编码的其他 text features。

  2. 在 inference 过程中,我们使用 beam search 来解码 multiple SID sequences,这些 SID sequences 作为 the set of retrieved candidates。每个 generated SID 随后被映射到我们 billions-scale corpus 中的一个真实视频。虽然此生成过程可能产生无效 SID(幻觉)、或 SID-to-video 的冲突,但我们观察到:经过 SFT 之后的幻觉率非常低(< 5%),且 SID-to-video mapping 唯一性保持较高(见 Table 4 )。

1.3 实验

  1. 在本节中,我们进行了一组全面的实验来验证 PLUM 框架。

    • 我们首先将 PLUM-based generative retrieval model 与一个 Transformer-based large-embedding retrieval model (该模型贡献了生产中大部分 impressions )进行性能比较。

    • 随后,我们展示了我们提出的 SID enhancements 功能的有效性。

    • 接着,我们对 PLUM 框架中的两个关键组件进行了消融研究:

      • 首先量化了 continued pre-training: CPT 阶段的精确影响。

      • 然后评估了从 pre-trained LLM 中初始化的价值。

    • 最后,我们展示了详细的 scaling 研究,以分析模型大小、计算量与 retrieval 性能之间的关系。

1.3.1 Generative Retrieval 的性能

  1. 传统的推荐系统使用 large embedding models 来推荐 candidates。然而,generative retrieval 相比传统系统具有诸多优势。在本节中,我们研究 generative retrieval 在 YouTube 生产环境中的有效性。

a. Experiment Setup
  1. Model:在以下实验中,我们训练了一个来自 Gemini-1.5 Mixture-of-Experts: MoE 家族的、拥有 900M activated-param 的 PLUM 模型,该模型同时应用于长视频(Long Form Video: LFV)和短视频(Shorts)。该模型从 Gemini 热启动,并按照上述描述在 new engagement data 上持续地微调。训练数据是 a mixture of the most recent data and historical data。在 serving 期间,使用 beam search 进行解码从而得到 target sequences。在我们的实验中,beam search 的表现优于 random decoding,尽管以牺牲一些多样性(diversity)为代价。

    random decoding:在自回归生成每一个 SID token 时,不选概率最大的 token(这是确定性的结果),也不像 beam search 那样保留多条最优候选路径,而是按照模型输出的概率分布随机抽取 next token。

  2. Baseline:我们将上述模型的性能与 traditional Large Embedding Models retrieval 进行比较。此 baseline 是表现最佳的 production model ,来自 《Top-K Off-Policy Correction for a REINFORCE Recommender System》 的早期工作以来已经过高度优化。该模型也基于 Transformer 架构,但其大部分参数位于 embedding layer,input item IDs 和 output item IDs 的 vocab sizes 约为 O(10M)。具体来说,Large Embedding Models 的神经网络仅占其总参数的 0.4%,而 PLUM 的神经网络则占其总参数的 90%。

b. Experiment Results
  1. Recommendation Quality:我们从几个不同维度评估推荐质量。

    • 首先,我们将 recommender 的有效词表大小(effective vocab size)定义为覆盖 95% of its impressions 所需的 unique videos 数量。通常,较大的 vocab size 对于个性化发现小众内容是可取的,这表明模型具有更好的泛化能力。

    • 接下来,我们使用两个指标来比较推荐的有效性:点击率(click-through-rate: CTR)和推荐接受度(Recommendation Acceptance)。对于推荐接受度,我们同时比较了观看视频时长(WT/View)和观看视频的完成度占比(WF/View)。

    在所有情况下,我们都报告了 900M MoE 模型指标与 Large Embedding Models 模型指标的比率,如 Table 2 所示。

    我们观察到:PLUM 模型实现了更大的 effective vocab size;同时在与 user reactions 相关的指标上,其性能与 LEM 相比具有竞争力。

  2. 在线实验:我们通过将 PLUM 模型的 recommendations 添加到 candidate pool 中进行了在线实验。为了公平比较,我们将 production 中表现最佳的 retrieval model 的配额增加(以相同数量),并将其用作 baseline。我们将此修改后的 production baseline 记为 LEM+。在 Table 3 中,我们报告了在 LFV 和 Shorts 上,相对于 LEM+ 在四个关键指标上观察到的指标变动。这表明,即使没有 large embedding tables,PLUM-based retrieval 也能在现有系统之上增加 unique value 。

    这个 online 实验用的是增加 candidate 而不是替代 candidate,因此很难说明 PLUM 要比 production model 更好,只能说明 PLUM 可以作为一路额外的检索通路。

  3. Sample Efficiency:在我们的研究中,PLUM 模型具有极高的样本效率。900M MoE 模型每天训练约 250M 个样本。相比之下,传统 Large Embedding Model 每天训练数十亿个样本。这种样本效率也使得这些模型在实际生产中具有实用性,尽管每个样本的训练成本要高得多。与 Large Embedding Model 相比,900M MoE 模型训练所需的浮点运算量(FLOPs )不到 Large Embedding Model 模型的 0.55 倍。

1.3.2 Semantic IDs Ablation Study

  1. 在 Table 4 中,我们讨论了我们对先前 SID (Recommender systems with generative retrieval)引入的不同改动的重要性。我们将先前工作称为 SIDv1,并在表中将我们提出的方法称为 SIDv2。由于每个 SID 模型都会导致不同的 indexing structure,我们报告 index uniqueness,表示语料库中有多少视频在 SID space 中被唯一表示,以及在 SID 上训练GenRetrieval 模型后的 final Video Recall@10。Video Recall@K 是通过计算在 PLUM 的 Top K SID predictions 中成功检索到 a specific video 的召回率来确定的。当一个 SID 映射到多个视频时,我们在计算召回率指标时随机采样一个视频。

    我们在一个简单 setting 中对 SIDv2 的改动进行了消融实验,使用了一个 900M MoE PLUM retrieval model,没有进行 CPT 并且 prompt 中没有 watch history。如 Table 4 所示,这些实验评估了 Semantic ID 的 uniqueness 和下游的 generative retrieval VID Recall@10。结果表明,所有改动都改善了 generative item retrieval 的召回率。值得注意的是,引入 Co-occurrence alignment 任务同时大大提高了 Semantic ID uniqueness 和召回率。

1.3.3 Impact of Continued Pre-training

  1. 为了衡量 continued pre-training 阶段的重要性,我们评估了其对 generative retrieval 最终模型的训练效率和 retrieval 性能的影响。

a. Experiment Setup
  1. 我们的训练方法包含两个阶段:continued pre-training 和 generative retrieval fine-tuning,每个阶段都有特定的 learning objective 和相应的一组超参数。为了评估每个阶段的独特贡献,我们设计了一个受控的 2 x 2 消融研究。这涉及四个模型配置,它们共享相同的 decoder-only Transformer architecture。我们在此研究中使用 MoE-900M 架构。这四个模型如下:

    • R1: retrieval SFT (random init):Transformer 模型直接在 generative retrieval task 上训练,模型权重随机初始化。

    • R2: retrieval SFT (LLM init):该模型从 pre-trained LLM checkpoint 初始化,但跳过 CPT 阶段。

    • CR1: CPT (random init) + retrieval SFT:模型训练遵循 PLUM 的两个训练阶段,但 CPT 中使用的模型是随机初始化的。

      retrieval SFT 也是 LLM init 的。

    • CR2: CPT (LLM init) + retrieval SFT:这代表了我们提出框架的完整且预期的实现。

      retrieval SFT 也是 LLM init 的。

b. Experiment Results
  1. Impact of Continued Pre-training:主要结果总结在 Table 5 中。遵循 scaling 研究,四个模型中的每一个都在一个大型的、held-out next day 的数据集上进行评估,我们报告 recall@10 作为 retrieval 指标。在 R1 和 CR1(或 R2 和 CR2 )之间存在很大的性能差距,显示了 CPT 对 retrieval fine-tuning 的益处。

    此外,Figure 3 显示了 8-th day recall@10 和 training loss 随 training steps 的变化。很明显,models with CPT 可以更快地收敛。因此,CPT 可以有益于 task-specific fine-tuning 的训练效率,特别是当多个下游任务共享同一个 CPT 模型时。

  2. Impact of Pre-trained LLMs:现在我们来研究 training from a general-purpose LLM 相比 training from a randomly initialized state 的好处。从 Table 5 的结果中浮现出一个一致的模式:models initialized from a pre-trained LLM 在with or without CPT 的情况下始终优于其随机初始化的对应模型。我们假设这一优势主要源于 pre-trained LLM 对自然语言的已有理解,或者通过大规模 LLM pre-training 所学到的 general sequence processing 能力直接对 recommendation 有用。对这一观察的进一步研究超出了本文的范围。

1.3.4 Scaling Study

  1. 在本节中,我们使用 YouTube production data 对 generative retrieval models 进行 scaling 研究。我们使用了 Gemini-1.5 Mixture-of-Experts: MoE (《Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context》)模型家族的四种不同尺寸:MoE-110M、MoE-370M、MoE-900M 和 MoE-3B(这里的尺寸表示每个 token 的 activated parameters 数量),它们的总参数范围从不到 1B 到超过 10B。特别地,我们的目标是回答:

    • (1):loss 如何随不同的模型尺寸和 compute 而 scale up?

    • (2):retrieval 指标如何随不同的模型尺寸和 compute 而 scale up?

    • (3):对于不同的 compute 预算,最佳模型尺寸是什么?

a. Experiment Setup
  1. 我们的研究在一个 production 规模的 YouTube dataset 上进行,针对 candidate generation 任务,其目标是根据 a sequence of watch history and contextual features 来预测 next video ID。模型从 continued pre-training checkpoints 进行热启动,并在 7 天的数据上进行微调,然后在第二天(第 8 天)进行评估。完整详情请参阅附录 A.1。

b. Experiment Results
  1. Loss Scaling with Compute and Model Size:Figure 4 显示了 training/evaluation loss(第 8 天)与 training Iso-FLOPS 之间的相关性。

    • Figure 4a 揭示了每个模型尺寸的 Iso-FLOPS 与 training loss 之间存在明显的幂律相关性(power-law correlation)。随着 Iso-FLOPs 的增加,代表训练损失前沿(training loss frontier)的最优模型尺寸(optimal model size)逐步 shift。这种 shift 从 MoE-110M(红线)开始,转移到 MoE-370M(绿线),再到 MoE-900M(紫线),并假设最终会到达MoE-3B(蓝线)。

    • Figure 4b 显示,在最终开始饱和之前,每个模型尺寸的 Iso-FLOPS 与 evaluation loss 之间也存在 power-law correlation,我们将其归因于我们的扩展训练(extensive training)。

    • 我们还观察到,evaluation loss frontier 向更大模型 shift 的速度明显早于 training loss,这表明更大的模型对 future data distributions 具有更好的泛化能力。

  2. Retrieval Metric Scaling with Compute and Model Size:类似地,在 Figure 5 中我们报告了 training/evaluation Recall@10(第 8 天)与 training Iso-FLOPS 之间的关系,两个轴均以对数尺度呈现。结果与 Figure 4 中的类似,有一点不同:在 Figure 5 中,evaluation Recall@10 显示出更少的放缓迹象,这表明模型在生成准确的且完整的 sequences 从而得到 correct document 方面持续改进。此外,三个较小的模型已经处理了超过一个 epoch 的数据,其中 MoE-110M 训练了多达 4.24 epochs,但仍未显示出过拟合迹象(见 Figure 5b)。

  3. Optimal Model Size for Fixed Iso-FLOPS Budgets:在 Figure 6 中,我们展示了随着给定 Iso-FLOPs 预算的增加, optimal model size 逐渐向更大模型转移。请注意,我们对每个模型使用恒定的学习率,使我们能够通过 a single run 直接评估每个 Iso-FLOPs 预算下的模型性能。与 Chinchilla 论文(《Training compute-optimal large language models》)类似,在 Figure 6b 中,对于我们考虑的大多数 Iso-FLOPs 预算,存在一个峰值。

c. 局限性讨论
  1. 我们注意到,在我们考虑的计算预算下,MoE-3B 模型的表现并未超过 MoE-900M 模型。我们的 scaling 研究受到计算资源的限制。次优的超参数设置(suboptimal hyperparameter setup)可能是一个重要因素。例如,我们的初步研究表明,对于相同的模型尺寸,较大的 batch size 与较高的训练效率相关。由于我们为每种模型尺寸分配相同的训练资源,并使用能饱和 HBM 的 batch size (见 Table 6),较大的模型可能因其 batch size 相对较小而处于劣势。实际上,在训练结束时,MoE-3B 模型仅处理了0.57 epochs 的训练数据(约 5B 样本),与第二大模型相比有超过 2 倍的差距。我们对 generative retrieval 任务的 scaling 研究表明,compute-optimal training 需要同步 scale 训练样本和模型尺寸。

1.4 结论与未来工作

  1. 我们介绍了 PLUM ,一个用于将 pre-trained LLMs 适配于大规模推荐任务的框架。我们的方法通过 SIDv2 增强了 item tokenization,使用 large-scale continued pre-training 阶段来使 LLM 与 user behavior 对齐并将 SID 建立在文本基础上,随后进行 supervised fine-tuning 阶段,从而使模型在 generative retrieval 中表现出色。

    作为 YouTube 中的 a launched platform,PLUM 能够为当前系统增加 unique value,同时是我们第一个没有使用 large embedding tables 而构建的神经模型。我们的消融实验验证了 CPT 阶段的价值、从 pre-trained LLM 初始化的益处、以及我们提出的 SID 技术。本文是关于将 LLM 与现实世界推荐系统对齐的初步研究,开辟了未来的研究方向,例如将 PLUM 框架应用于 ranking 和 personalized search 等其他任务,开发用于 candidate diversity 的新的解码策略,以及实现 SID 和自然语言的无缝 generation。

1.6 附录

A.1 Scaling Study Experiment Setup

  1. Dataset:我们的研究是在一个 production 数据集上进行的,该数据集源自 YouTube 的一个关键 surface,该 surface 根据当前观看的视频和其他 contextual signals(例如,watch history )(参见 《Recommending what video to watch next: a multitask ranking system》 中的 Figure 4)来推荐接下来要观看的视频。这里的推荐系统采用多阶段架构,包括 candidate generation、pre-ranking 和 ranking 等阶段。我们的研究集中于 candidate generation 阶段,并针对包含数十亿视频的 video corpus 来评估 retrieval 性能。

  2. Training and Evaluation:

    • 我们的 input prompt 格式如下:"watch history | user features | context video features",其中 watch history 是按时间顺序排列的 sequence of watches ,每个 watche 由 SID tokens 和其他 feature tokens 的拼接来表示。在本研究中,input sequence length 固定为 1536 tokens,大约可以覆盖最近的 100 watches 以及其他特征。

    • SFT labels 是使用 YouTube 上的 next watch,并采用基于 user engagement and satisfaction signals 的降采样机制来选择的。next watch 的 SID tokens 被用作 prediction targets。

    • 我们随机打乱了连续 7 天(从 2025 年 7 月)的数据用于训练。评估在第 8 天进行。

    • 我们的实验使用了 1,024 Google’s v6e Tensor Processing Units: TPUs ,每块配备32GB High Bandwidth Memory: HBM。

    • 我们并行运行了 4 trainers,每个 trainer 使用 256 TPUs。

  3. Hyperparameter Selection:我们使用 MoE-900M 模型进行了一项试点研究,以确定模型对 global batch size 和学习率的敏感性(详见附录 A.2 )。基于此项试点研究的经验,我们在每种情况下都将 batch size 设置为大致饱和 HBM 的程度,因为结果表明较大的 batch size 更可取。在学习率方面,以 MoE-900M 使用的 5×10−5 作为锚点,我们根据最佳判断,对较小的模型使用稍大的学习率(反之亦然)。请注意,与自然语言处理中的 scaling law 研究(例如 《Training compute-optimal large language models》)不同,我们采用了恒定的学习率。这种选择基于两个原因:

    • (1):production 环境中的 continuous training 不涉及特定的 stopping step number。

    • (2):恒定学习率可以在整个训练过程中对所有的 intermediate data points 进行完美且精确的插值。

    不同大小模型的超参数汇总在 Table 6 中。所有模型都从其对应的 Continued Pre-training checkpoints(均使用 Iso-FLOPS 1×1022 )进行热启动。本节中所有 FLOPs 数值均不包括 Continued Pre-training training FLOPs。

     

A.2 Scaling Pilot Study

  1. 作为 scaling study 的前期准备,我们使用 MoE-900M 模型进行了一项试点研究。该试点的目标是确定模型对两个超参数( global batch size 和学习率)的敏感性。该试点的结果将为后续更广泛的 scaling analysis 提供超参数选择的依据,确保计算资源得到有效利用。

  2. Experiment Setup:我们并行运行了四个 trainers ,每个使用 256 TPUs,并从(相同的)pre-trained checkpoint 初始化。试点运行了大约两周,这段时间足以建立明确的性能趋势。"base setup" (Trainer A) 使用 1×10−4 的恒定学习率、以及使得 HBM 饱和的 batch size。其他 configurations 则系统地改变这两个超参数中的一个。

  3. Results:

    • Learning Rate Sensitivity:结果表明,在合理的范围内,training 过程对不同的学习率具有容忍度。具体来说,在试点研究期间,基础学习率 1×10−4(Trainer A)和较低学习率 5×10−5(Trainer D)之间的性能差异在统计上不显著。然而,将学习率加倍至 2×10−4(Trainer C)会导致性能显著下降,表明该学习率可能超出了该模型和数据集的理想范围。

    • Batch Size Sensitivity:使用较小的 batch size 会损害训练效率。将 batch size 减半需要超过两倍的 training steps 才能达到相当的性能水平。这凸显了为了达到 compute optimal training,将 batch size 最大化至硬件内存极限的重要性。

A.3 In-context Learning Examples

  1. Table 8 展示了一些示例,以演示 model after CPT with Semantic IDs 的 in-context learning 能力。基于 pre-trained LLM 的 CPT model 能够通过遵循 few-shot task description,用语义上恰当的短语正确补全句子。相比之下,如果我们对 randomly-initialized model 应用相同的 recs pre-training,该模型则难以形成连贯的短语,并且难以区分 SID tokens 和text tokens。