一、SCL [2024]

《Enhancing Taobao Display Advertising with Multimodal Representations: Challenges, Approaches and Insights》

  1. 尽管 multimodal data 在提升模型准确性方面的潜力已被认可,但许多大规模工业推荐系统,包括 Taobao display advertising system,其模型仍主要依赖 sparse ID features。在这项工作中,我们探索了利用 multimodal data 来增强推荐准确性的方法。我们首先识别出在工业系统中以既有效又 cost-efficient 的方式采用 multimodal data 的关键挑战。为应对这些挑战,我们引入了一个两阶段框架,包括:

    • 1):pre-training of multimodal representations 以捕获 semantic similarity。

    • 2):将这些 representations 与现有的 ID-based models 集成起来。

    此外,我们详细介绍了我们的 production system 的架构,该系统旨在促进 multimodal representations 的部署。自 2023 年中期集成 multimodal representations 以来,我们观察到 Taobao display advertising system 取得了显著性能提升。我们相信,我们所收集的见解将为从业者提供宝贵资源,其中从业者希望在其系统中利用 multimodal data。

  2. 传统上,Taobao display advertising system 中使用的 recommendation models,与许多其他工业系统一样,主要依赖 discrete IDs 作为特征。尽管 ID-based models 被广泛使用,但它们具有内在缺陷,例如无法捕获 multimodal data 中包含的semantic information。

    为了解决这些问题,某些工业系统尝试将 multimodal data 纳入 ID-based models(《Better Generalization with Semantic IDs: A case study in Ranking for Recommendations》、《COURIER: Contrastive User Intention Reconstruction for Large-Scale Pre-Train of Image Feature》)。通常,这些方法采用两阶段框架,包括:

    • 1):通过 generic or scenario-specific pre-training 获得 multimodal representations。

    • 2):将这些 representations 集成到推荐模型中。

    尽管取得了这些进展,大量工业系统仍然完全依赖 ID features。这通常归因于一种担忧: multimodal data 带来的性能收益可能无法补偿其部署成本。这些成本包括 pre-training multimodal encoders、为 new items 增量地 generating representations、以及同时对 online servers 和 near-line training systems 的其他必要升级。因此,multimodal representations 的 successful integration 取决于能否在提升其性能收益的同时最小化部署成本。

    为实现这两个关键目标,应解决三个实际挑战:

    • Design of the pre-training task:multimodal representations 在提升性能方面的有效性取决于其提供有意义 semantic information 的能力,而这是 ID features 难以捕获的。必须设计 pre-training tasks,使 multimodal representations 能够封装此类 semantic information。

    • Integration of multimodal representation:ID features 与 multimodal representations 之间的固有 discrepancies ,例如 training epochs 的 difference,要求采用能够有效将 multimodal representations 纳入 ID-based model 的方法。这些方法应利用每种 feature type 的优势来提升模型的整体性能。

    • Design of the production system:整个 production workflow,包括为 new items 生成 multimodal representations 及其在下游任务中的最新应用,都应以高效方式来设计。

    为应对这些挑战,我们采用如 Figure 1 所示的两阶段框架。

    • 在 pre-training 阶段,我们提出语义感知对比学习(Semantic-aware Contrastive Learning: SCL)方法。具体而言,我们利用用户的 search query 和后续 purchase action 来构建语义相似样本对(semantically similar sample pairs),捕获电子商务场景中与用户最相关的 dimensions of semantic similarity。对于负样本,我们从一个大型 memory bank 中抽取。SCL 方法使 multimodal representations 能够有效度量 items 之间的 semantic similarities。

    • 在获得高质量 multimodal representations 后,我们提出两种方法将这些 representations 纳入现有的 ID-based model。

      • 首先,我们开发了一种名为 SimTier 的方法,用于度量 target item 与用户先前交互过的 items 之间的相似程度。所得到的 SimTier vector 随后与其他 embeddings 拼接起来,并馈入后续层。

      • 此外,为解决 multimodal representations 与 ID embeddings 之间的 training epochs 差异,我们引入 MultimodAl Knowledge Extractor: MAKE 模块。MAKE 模块将 multimodal representations 相关的 parameters 的 optimization (例如与 multimodal representations 相连的 MLP 的参数)与 ID-based model 的 parameters optimization 分离,从而使 multimodal representations 相关的 parameters 能够更有效地学习。

    我们还介绍了 production system 的设计,该系统促进 multimodal representations 的部署。具体而言,系统实时地为 newly introduced items 生成 multimodal representations,并确保这些 representations 立即可供 training infrastructure 和 online prediction server 使用。这种设计实现了极低延迟——从 introduction of an item 到模型使用其 multimodal representations 仅需几秒钟。自 2023 年中期以来, multimodal representations 已部署在 Taobao display advertising system 中,带来了显著性能提升。

    论文就是一些工程技巧的应用,创新点不足。

1.1 相关工作

  1. 目前,ID features 构成工业推荐模型的核心。尽管 ID features 被广泛采用,ID features 具有显著局限性,包括难以捕获 semantic information 、以及持续存在的冷启动问题(《Image Matters: Visually Modeling User Behaviors Using Advanced Model Server》、《Image Feature Learning for Cold Start Problem in Display Advertising》、《Methods and metrics for cold-start recommendations》、《Adversarial gradient driven exploration for deep click-through rate prediction》)。相反, multimodal data 提供丰富的 semantic information,促使许多研究探索将其纳入推荐模型。

    一些研究探讨了以端到端方式与 recommendation model training 一起学习 multimodal representations 的潜力(《Deep CTR Prediction in Display Advertising》、《End-to-End Image-Based Fashion Recommendation》、《Where to Go Next for Recommender Systems? ID- vs. Modality-based Recommender Models Revisited》)。然而,此类过程所需的巨大计算资源常常阻碍其在工业系统中的采用。因此,我们关注两阶段范式(《Multimedia features for click prediction of new ads in display advertising》、《Image Matters: Visually Modeling User Behaviors Using Advanced Model Server》、《Ups and Downs: Modeling the Visual Evolution of Fashion Trends with One-Class Collaborative Filtering》、《Images Don’t Lie: Transferring Deep Visual Semantic Features to Large-Scale Multimodal Learning to Rank》、《PinnerSage: Multi-Modal User Embedding Framework for Recommendations at Pinterest》、《Better Generalization with Semantic IDs: A case study in Ranking for Recommendations》、《COURIER: Contrastive User Intention Reconstruction for Large-Scale Pre-Train of Image Features》),并旨在分享我们的方法和宝贵见解。

1.2 预备知识

  1. 在深入细节之前,我们首先介绍工业系统中使用的典型 ID-based model 结构。

  2. 推荐模型中的 ID Features:常见推荐模型在包含数十亿 ID features 的大规模数据集上训练(《XDL: An Industrial Deep Learning Framework for High-Dimensional Sparse Data》、《PICASSO: Unleashing the Potential of GPU-centric Training for Wide-and-deep Recommender Systems》)。这些 ID features 用于表示 users profiles、user historical interacted items、target item(待预测)以及 contextual information。例如,我们可以用相应的 item ID 和 category ID 表示 target item,并通过 a sequence of corresponding item IDs and category IDs 表示 user historical interacted items。

  3. ID-based Model 的结构:ID-based recommendation model 遵循 embedding and MLP 的架构,通常包含 historical behavior modeling 模块(《Deep Interest Evolution Network for Click-Through Rate Prediction》、《Deep interest network for click-through rate prediction》)。

    • 最开始,所有 ID features 都被转换为 embeddings。

    • historical behavior modeling 模块随后通过分析 the embedding of target item 与 embeddings of the user’s historical interacted items 之间的相关性,度量用户对 target item 的兴趣。具体而言,这些模块通过聚合 the embedding of target item 和 embeddings of the historical interacted items,从而生成 fixed-length vectors。

    • 这些 fixed-length vectors 随后与其他 ID embeddings 拼接,形成后续 MLP 的输入,最后产生 final prediction。

1.3 Pre-Training of Multimodal Representations

  1. 至于 multimodal data ,对它的利用(utilization)可以改进 historical behavior modeling。具体而言, multimodal data 可用于度量 target item 与 users's historical interacted items之间的 semantic similarity。以 item images 为例,它们可用于度量 image of the target item 与 images of historical interacted items 之间的视觉相似性(visual similarity)。直观上,更高的 semantic similarity 表示 target item 与 users’ historical behavior 之间更强的相似性,表明用户感兴趣的可能性更高。这一见解强调了 designing a pre-training task 的重要性,该任务应使 multimodal representations 能够有效辨别 item pairs 之间的 semantic similarity。

1.3.1 Semantic-Aware Contrastive Learning

  1. 为获得能够辨别 semantic similarity 的 representations,我们提出语义感知对比学习(semantic-aware contrastive learning: SCL)方法,该方法吸引语义 sample pairs 并排斥语义不相似 sample pairs。为实现这一点,必须定义用于监督的语义相似 sample pairs 和不相似对 sample pairs 。为理解这一点的重要性,考虑 Figure 5 中所示的例子,其中三个枕头(pillows)几乎相同,但显示出细微差异,例如图案差异或轻微外观差异。如果语义相似 sample pairs 的 definition 不充分,representations 可能无法捕获这些细微差异。实际上,这些细微区别常常被专注于捕获通用概念(general concepts)的 representations 所遗漏。

    下面,我们将详细阐述为电子商务场景定制的 pre-training dataset 的构建,以及 contrastive learning 过程的 optimization 策略。

1.3.2 Construction of Pre-Training Dataset

  1. 在电子商务背景下,用户的 search query 和后续 purchase action 通常表示 query 与 purchased item 之间的强烈的 semantic similarity。例如,如果用户搜索一张枕头图片并随后购买一个枕头,这一系列行为表明这两张图像(queried image 和 image of the purchased item)在语义上足够相似,能够满足用户的 purchase intentions。因此,如 Table 1 所示,在训练 text encoder 时,我们将 text of the user’s search query 与 title of the item they ultimately purchased 配对为语义相似 sample pairs 。类似地,对于图像模态,将用户的 image query(从淘宝的 image search 场景获得)与后续所购买 item 的图像配对。这种配对策略自然捕获了电子商务场景中与用户最相关的 semantic similarity 维度,反映了影响其购买决策的元素。

    对于每个语义相似 sample pairs ,我们将所有其他样本视为潜在不相似样本,这可以通过使用当前 mini-batch 中的样本作为负样本来实现。为了进一步提高模型性能,我们旨在增加训练期间可用的负样本数量。具体而言,我们从 MoCo (《Momentum Contrast for Unsupervised Visual Representation Learning》)中获得灵感,采用一种使用动量更新模型的技术,从而便于从更大的 memory bank 中采样更多负样本。更复杂的 negative pairs 构建策略,例如识别 hard negatives (《FaceNet: A unified embedding for face recognition and clustering》),将在实验章节中详细阐述。

    论文中引入了三种负样本:

    • 当前 mini-batch 内样本:当前 batch 中,其他样本相对于某个 query 就是负样本。这是最基础的负样本。

    • MoCo memory bank 中的历史负样本:通过 Queue,把过去很多 batch 的 key representation 保存下来。当前 query 会和 Queue 中大量 key 对比。论文中 Queue size K=196,800,这意味着每个 query 可以和约 20 万个 key 做对比,负样本数量远大于普通 in-batch 负采样。

    • Hard negative:如果用户搜索了某个 query,点击了某个商品,但最终购买的是另一个商品。那个 “点击了但没买” 的商品,与 query 和正样本都很相似,但它是负样本。这种样本叫 hard negative。

    MoCo 式负采样:MoCo 的关键设计是维护一个队列 (queue),也就是论文里说的 memory bank。假设队列大小为 K(论文中设置为 K=196,800 。这个队列里存的不是原始图片或文本,而是 encoded key representation,并且通常经过L2 归一化。队列按时间顺序更新:

    • 当前 mini-batch 的样本经过 key encoder 而被编码。

    • 这些 key representations 入队。

    • 最旧的 key representations 出队。

    • 队列大小始终保持 K。

    这样,每个 query 在做 InfoNCE 对比时,不只和当前 batch 里的少量样本对比,而是和队列中约 20 万个 key representations 对比。

    为什么要用动量编码器:如果只是简单维护一个队列,会有问题:队列里的旧 key 是由旧参数编码出来的,而当前 query 是由当前参数编码出来的。如果 encoder 参数变化太快,旧 key 和当前 query 就不在同一个 representation space 里,对比学习会不稳定。

    MoCo 的解决办法是使用两个 encoders :

    • query encoder:参数 θq,通过梯度反向传播正常更新。

    • key encoder:参数 θk,不通过梯度更新,而是动量更新:

      θk←mθk+(1−m)θq

      其中 m 通常接近 1,例如 0.999。也就是说,key encoder 缓慢跟随 query encoder 变化。

      这其实是一个递推公式:

      θk(t)=mtθk(0)+(1−m)∑i=1tmt−iθq(i)

      当 θk(0)=θq(0) ,那么 θk(t) 就是过去历史所有 θq(i) 的加权平均,权重按照 mt−i 指数衰减。当 m=0.999 时,权重的时间常数约为:1/(1−m)=1000 。也就是说,θk 大致相当于最近约 1000 步的 θq 的平滑版本。

      因为 MoCo 要维护一个很大的负样本队列 memory bank。队列里的 key 是过去很多步由 θk 编码出来的。如果 θk 更新太快,队列里旧 key 和新 key 就来自差异很大的 encoder,representation space 不一致,对比学习会失效。所以这里需要一个较大的 m ,使得 θk 缓慢地跟随 θq 。所以 “更新慢” 是特性,不是缺陷。它用一定的滞后换取队列的一致性和大规模负采样能力。

    这样做的好处是:

    • 队列中的旧 key 虽然来自过去,但因为 key encoder 变化很慢,它们仍然和当前 query处于相近的 representation space。

    • 队列可以开得很大,不需要每次重新编码所有负样本;

    • 显存和计算可控,因为队列只存编码向量,不存计算图,也不对队列中的 key 反传梯度。

    所以论文说 “采用动量更新模型的技术,从而便于从更大的 memory bank 中采样更多负样本”,本质就是:动量更新保证队列中历史 key 与当前 query 的 representation 一致,因此可以放心使用超大 memory bank 作为负样本池。

1.3.3 Optimization

  1. 我们使用广受认可的 InfoNCE loss(《Representation learning with contrastive predictive coding》)作为损失函数。给定 encoded query q→ 及其对应 encoded positive sample k→+,以及 k→0,k→1,⋯,k→K 表示 memory bank 中的 encoded sample representations 的集合,其中 K 表示 memory bank size 大小(《Momentum Contrast for Unsupervised Visual Representation Learning》),InfoNCE loss 采用点积来度量相似性(所有 representations 均进行 L2 归一化)。如下公式所示,当 query q→ 与其指定正样本 k→+ 紧密匹配、并与 memory bank 中所有其他样本偏离时,损失值降低。

    LInfoNCE=−log⁡exp⁡(q→⋅k→+/τ)∑i=0Kexp⁡(q→⋅k→i/τ)

    注意,这里的 k→0 就是正样本 k→+。所以分母就把正样本、负样本用一个统一的公式来表达。分母一共有 K+1 项,其中一个正样本,K 个副样本。

    这里,τ 表示可学习的温度参数。在我们的实验中,我们将 K 的值设为 196,800。

    通过这种方式,SCL 方法使 representations 能够辨别 comparable items 之间的细微差异,这对推荐模型至关重要。

    注意,论文使用了两种对比损失:InfoNCE loss 和 Triplet Loss。

    • InfoNCE loss 是主损失:负责大规模对比学习,利用 MoCo memory bank 中的大量负样本,让 query 靠近正样本、远离所有其他 key。

      注意:in-batch negative 并没有被排除,而是被 MoCo memory bank 统一吸收了。在这里,负样本集合写成了 memory bank,而当前 mini-batch 的样本本身也会进入这个 memory bank,所以 in-batch negative 隐含在其中,只是没有单独强调。

    • Triplet Loss 是辅助损失:专门针对 <Query, Positive, Negative> 三元组中的 hard negative,用 margin 约束强化细粒度区分。

    对于 hard negative,SCL 对每个 <Query, Positive, Negative> 三元组应用 triplet loss,使模型:拉近 Query 和 Positive,推远 Query 和 Negative。

    这样模型能区分非常细粒度的差异,比如三个几乎一样的枕头,只是图案或外观略有不同。普通随机负样本可能太容易区分,而 hard negative 能迫使模型学到更精细的语义判别能力。

    常用的 Triplet Loss 定义为:

    Ltriplet=max(0,d(a,p)−d(a,n)+γ)

    其中:

    • a 为锚点,即这里的 Query;p 为正样本,即这里的 Positive ;n 为负样本的 Negative。

    • d(⋅,⋅) 为距离函数(例如余弦相似度),γ>0 为 margin 。其语义是:距离 d(a,p) 要比距离 d(a,n) 至少近 γ 。

1.4 Integration with Recommendation Models

  1. 将 multimodal representations 集成到 ID-based recommendation model 中的一种直接方法,是将这些 multimodal representations 与 ID embeddings for both the target item and users’ past interacted items 拼接(《Image Matters: Visually Modeling User Behaviors Using Advanced Model Server》、《COURIER: Contrastive User Intention Reconstruction for Large-Scale Pre-Train of Image Features》)。这种 concatenation 之后接入 user behavior modeling 模块,随后馈入 MLP 进行 final prediction。尽管这种方法很直接,但我们发现性能提升有限。为研究此事,我们分享我们的观察和见解。

1.4.1 Observations and Insights

  1. 我们首先分享关于纳入 multimodal representations 的观察和见解。

  2. Observation 1:简化 multimodal representations 的用法可提升性能。我们的研究表明,将 multimodal representations 直接集成到 ID-based model 中并不能产生最优性能,详见实验章节。该问题出现的原因是, multimodal representations 关联的 parameters(例如与 multimodal representations 相连的 MLP 的参数),在 joint training process with the ID embeddings 过程中没有得到充分学习(《COURIER: Contrastive User Intention Reconstruction for Large-Scale Pre-Train of Image Features》)。相反,简化 multimodal representations 用法的策略,例如将其转换为 semantic IDs(从而 representing the embedding vectors with IDs)(《Better Generalization with Semantic IDs: A case study in Ranking for Recommendations》、《COURIER: Contrastive User Intention Reconstruction for Large-Scale Pre-Train of Image Features》),似乎提供了更好的性能。

  3. Observation 2:ID-based models 和 multimodal-based models 存在 training epoch discrepancy。

    • 在工业场景中,ID-based models 通常只训练 one epoch 以避免过拟合(《Towards Understanding the Overfitting Phenomenon of Deep Click-Through Rate Model》)。

    • 相反,CV 和 NLP 领域的模型通常训练 multiple epochs。

    一个自然的问题出现了:一个 multimodal-based recommendation model 理想的 training epochs 是多少?为回答这个问题,我们开发了一个仅使用 multimodal representations 作为 input features、没有任何 ID features 的推荐模型,并分析其性能如何随 training epochs 变化。

    详细 convergence curve 如 Figure 3 所示。我们发现:

    • 采用 multimodal data 的模型受益于在同一数据集上训练多个 epochs,其性能随 epochs 增加而显著提升。

    • 相反,ID-based models 遭受 one-epoch overfitting 现象,模型性能在第二个 epoch 开始时急剧下降(《Towards Understanding the Overfitting Phenomenon of Deep Click-Through Rate Model》)。

    结果表明, multimodal representations 关联的 parameters 需要更多 epochs 才能正确收敛,这与 ID-based model 的行为形成对比。因此,当将 multimodal representations 纳入 ID-based model 并仅训练 one epoch 时,存在 multimodal-related parameters 可能训练不足的风险。

1.4.2 Method I: SimTier

  1. observation 1 要求简化 multimodal representations 的使用。为此,我们提出一种简单却有效的方法 SimTier。如 Figure 2 (a) 所示,SimTier 首先计算 target candidate item 的 multimodal representations v→c 与 user’s historically interacted items 的 multimodal representations {v→i}i=1L 之间的点积相似性:

    si=v→i⋅v→c,∀i∈{1,⋯,L}

    在计算 similarity scores 之后,我们将 score range [−1.0,1.0] 划分为 N 个 predefined bins。在每个 bin 内,我们统计落入相应 range 的 similarity scores 数量。因此,我们获得一个 N 维向量,每个维度表示对应 bin 中 similarity scores 的数量。这样,SimTier 有效将一组高维 multimodal representations 转换为一个 N 维向量,该向量封装了 target item 与 user’s historical interactions 之间的相似程度。所得 N 维向量随后与其他 embeddings 拼接,并馈入后续 MLP。我们在 Algorithm 1 中提供 SimTier 的伪代码。注意,SimTier 可被视为 a set-to-set function(《Deep Sets》)。未来工作可以探索将时间信息集成到 SimTier 中的更高级方法。

    其实就是以多模态 representation 作为桥梁,计算 target item 和 historical items 的相似度,然后对相似度集合进行池化操作(这里是分桶池化)。如果替换为最大池化,效果会如何?论文并未说明。

1.4.3 Method II: Multimodal Knowledage Extractor (MAKE)

  1. 为解决 ID features 与 multimodal representations 所需 training epochs 的差异,我们引入多模态知识提取器(MultimodAl Knowledge Extractor: MAKE)模块,将 multimodal related parameters 的 optimization 与 ID features 的 optimization 解耦。MAKE 模块包含两个步骤:

    • 1):multi-epoch training 以提取有用的多模态知识,

    • 2):下游任务对知识的利用。

  2. Multi-epoch training of multimodal related parameters:MAKE 模块的目标是预训练 parameters related to multimodal representations 多个 epochs,以确保其收敛。在实践中,我们利用 CTR prediction task 作为 recommendation pre-training task。如 Figure 2 (b) 所示,我们首先开发一个 DIN-based user behavior modeling 模块(《Deep interest network for click-through rate prediction》)。该模块处理 target item 和 historical interacted items 的 pre-trained multimodal representations ,产生 output v→MAKE:

    v→MAKE=DIN({v→i}i=0L,v→c)

    之后,v→MAKE 被馈入一个四层的多层感知机(MLPMAKE)并产生 logit v^:

    v^=MLPMAKE(v→MAKE)

    然后我们优化 predicted click probability 与二元 click label y 之间的 cross-entropy loss,如下公式所示:

    LMAKE=∑−ylog⁡σ(v^)−(1−y)log⁡(1−σ(v^))

    recommendation pre-training task 允许 MAKE 模块通过多轮训练细化其参数,并从 multimodal representations 中提取知识 v→MAKE,从而增强其在推荐任务中的有效性。

    注意:这里的 pre-training 不是用预训练 embedding,而是预训练一个 DIN network。然后把这个 DIN network 整体迁移到下游。

  3. Knowledge utilization:在获得向量 v→MAKE 后,下一步是将其集成到下游推荐任务中。在实践中,我们将 v→MAKE 、 MLPMAKE 的 intermediate outputs 与 other embeddings 拼接,并将该 combined data 馈入后续层。MAKE 模块 multi-epoch training 的 implementation 调和了 ID embeddings 和 multimodal representations 所需 training epochs 的差异,从而带来更好的性能。

    在下游应用时,会把这个 pretrained DIN network 直接集成过来。注意,在 Figure 2 中提示了:multimodal embeddings are frozen (non-trainable) in both the SimTier and MAKE approaches 。而 pretrained DIN network 既可以冻结起来,也可以进行微调(以一个较小的学习率)。

1.5 Online Deployment 的工业设计

  1. 在工业环境中,new items(包括广告)不断被创建。为了保持对这些 new items 的预测准确性,推荐模型实时获取 new items 的 multimodal representations 至关重要。这要求能够持续为 new items 生成 multimodal representations,并由 near-line trainer 和 online server 实时利用。我们 online system 的示意概览如 Figure 4 所示。为实现 multimodal representations 的 real-time generation,当 new items 被引入时,系统自动向 pre-trained multimodal encoders 发起请求,以计算这些 new items 的 multimodal representations。一旦 inference 完成,这些 representations 被发送到 multimodal index table。在此步骤之后,下游 training system 和 inference servers 能够从 index table 检索 multimodal representations,促进 near-line training 和 real-time online prediction 能力。该过程确保极低延迟——从 item’s introduction 到 utilization of its multimodal representation by the model 仅需几秒钟。

1.6 实验

  1. 在本节中,我们深入进行一个案例研究,考察将 image representations 集成到 CTR prediction 模型中,旨在提供全面分析。值得注意的是,我们的方法是通用的,能够容纳多种模态类型(如文本和视频),并适用于推荐系统中的不同阶段。

  2. 数据集:我们首先详述用于 pre-training 阶段和下游 integration 阶段的数据集。

    • Pre-training Dataset:在 pre-training dataset 中,每个样本由一个 Query(用户的 image query)和一个 Positive(image of the purchased item)组成。为了进一步提高性能,我们还添加了一个 hard Negative(image of the clicked item triggered by the positive item)。pre-training dataset 的一个案例见 Figure 5。

    • CTR Prediction Dataset。CTR prediction dataset 来自 Taobao display advertising system,使用一周的 impression logs。

  3. Compared Pre-training Methods:我们采用一系列广泛使用的 pre-training 方法进行比较。

    • CLIP-O:CLIP-O 指使用通用数据集预训练好的 CLIP visual encoder(CLIP-ViT-B/16)(《Learning Transferable Visual Models From Natural Language Supervision》)。

    • CLIP-E:CLIP-E 是基于 CLIP-O 模型在电子商务场景中使用 aligned item descriptions and item images 微调后的版本。

    • SCL:所提出的 semantic-aware pre-training 方法。SCL 方法采用 Momentum Contrast: MoCo 来扩展 negative samples。此外,SCL 对每个 <Query, Positive, Negative> 三元组应用 triplet loss(《FaceNet: A unified embedding for face recognition and clustering》),以有效区分 hard negatives。

  4. Compared Recommendation Methods:我们采用一系列广泛使用的 integration 方法进行比较。

    • ID-based Model (production baseline):baseline 是支撑我们在线系统的 ID-based model。

    • Vector:Vector 方法利用 pre-trained multimodal representations 作为每个 item 的 side-information,并将其与模型内其他 ID embeddings 拼接起来。

    • SimScore:相似性分数(Similarity Score: SimScore)可视为 Vector 方法的简化版本。每个 historical interacted item 相对于 target item 的 semantic similarity score 被用作 side information。

    • SimTier 和 MAKE:所提出的 SimTier 和 MAKE 方法。

  5. 评估指标:我们评估所提出方法的 pre-training 性能和 CTR prediction 性能。

    • 评估 Pre-training 方法:在我们的大量实验中,我们发现 Top-N accuracy: Acc@N 与下游推荐模型的性能高度相关。具体而言,Acc@N 指标衡量 representation 识别 semantic similar items 的能力:

      Acc@N=1D∑i=1DI(pi∈TopN(qi,S))

      其中:

      • D 表示测试集大小。

      • qi 和 pi 分别对应第 i 个样本的 query 和正样本。

      • S={posi}i=1D 表示包含所有正样本的集合。

      • TopN 是一个函数,通过利用集合 S 中的 multimodal representations 为每个 query 检索 top-N results 个结果。

      • 符号 I(⋅) 表示指示函数,当第 i 个 pi 位于 qi 的检索结果中时取值为 1,其他所有情况为 0。

    • 评估 Recommendation 方法:我们使用 AUC 和 Group AUC: GAUC 指标评估 CTR prediction 模型的有效性,其中更高的 AUC/GAUC 值表示更优的排序能力。

1.6.1 在 Pre-Training Dataset 上的性能

  1. 利用 Accuracy 来评估 Pre-trained Representations 有效性的理由:衡量 pre-trained representations 有效性最精确的方式,是测量集成 multimodal representations 后推荐准确率的提升。然而,这一评估过程对于 pre-training 方法的迭代可能耗时较长,因此需要一种用于更快评估 pre-trained multimodal representations 的中间指标。

    在我们的研究中,我们观察到 pre-training accuracy 的提升与 recommendation performance 的提升之间存在强相关性。我们在 Figure 6(a) 中展示这种关系,可以看到 Acc@1 的提升与 GAUC 的提升一致。因此,我们主要依赖 pre-training accuracy 来判断 multimodal representations 的质量。探索用于评估 pre-trained multimodal representations 的其他潜在中间指标仍然是一个有趣的未来工作主题。

  2. Semantic-Aware Contrastive Learning 的重要性:为研究不同 pre-training tasks 如何影响 multimodal representations 的质量,我们进行了一系列实验。Table 2 中的结果提供了两个重要观察。

    • 首先,提出的 SCL pre-training 方法超越了其他语义相似度无关(semantic-similarity-agnostic)的方法,强调了 semantic-aware learning 的必要性。

    • 其次,纳入 Momentum Contrast: MoCo(《Momentum Contrast for Unsupervised Visual Representation Learning》)和 Triplet Loss (《FaceNet: A unified embedding for face recognition and clustering》)等技术进一步提升了 multimodal representations 的质量,表明 negative sample 的选择极大影响性能。`

1.6.2 在 CTR prediction Dataset 上的性能

  1. 不同 Integration 策略的性能:在 CTR prediction 数据集上,我们评估提出的 SimTier 和 MAKE 与其他方法。整体结果如 Table 3 所示,从中可以注意到两个观察。

    • 首先,SimTier 和 MAKE 显著优于其他方法。

    • 其次,SimTier 和 MAKE 的组合可以进一步提升性能,与 ID-based model 相比,GAUC 提升 1.25%,AUC 提升 0.75%。

    上述结果证明了所提出方法在将 multimodal representations 集成到 ID-based model 中的有效性。

  2. 不同 Training Epochs of MAKE 的性能:为探索 MAKE 的 multi-epoch pre-training 对最终推荐性能的影响,我们进行实验,其中 MAKE 在集成到推荐模型之前被预训练不同 epochs。结果如 Figure 6(c) 所示。注意,0 epochs 意味着 MAKE 不进行预训练,而是与下游任务联合优化。结果表明,随着 MAKE 的 pre-training epochs 数量增加,最终推荐模型的性能也提升。这表明 MAKE 的 multi-epoch training 有效增强了模型性能。

  3. Infrequent Items 的性能:为考察 multimodal representations 在 long-tail items 上的泛化能力,我们评估按 item 出现频率分组后的相对提升。我们将所有 items 分为八组,Group 1 包含训练数据集中频率最低的 items,Group 8 包含频率最高的 items。之后,我们为每组计算 AUC 的相对提升:

     |AUCMM−AUCID|AUCID

    其中:MM 表示 SimTier 和 MAKE 方法的组合,ID 表示 ID-based production baseline model。

    我们还计算 LogLoss 的相对提升以衡量校准能力:

    |LogLossMM−LogLossID|LogLossID

    Figure 6(b) 中呈现的结果表明, multimodal representations 在所有组中均表现出显著提升,证明了我们的模型在不同类型 items 上的有效性。同时,我们看到低频 items 的提升更显著。结果表明, multimodal representations 可以解决基于 ID-based model 在 long-tail items 上的缺陷,并提升 prediction 准确性。

1.6.3 在线性能

  1. 自 2023 年中期以来, multimodal representations 已集成到 Taobao display advertising system 中的 pre-ranking models、ranking models 和 re-ranking models 中,带来了显著性能提升。例如,在 CTR prediction 模型中纳入 image representations,整体 CTR 提升 3.5%,RPM 提升 1.5%,ROI 提升 2.9%。

    值得注意的是,对于新广告(过去 24 小时内创建),影响更为显著,CTR 提升 6.9%,RPM 提升 3.7%,ROI 提升 7.7%。新广告上的显著收益也验证了 multimodal data 在缓解冷启动问题方面的有效性。

1.7 结论与讨论

  1. Multimodal-based recommendation 已经吸引了数十年的关注。然而,将 multimodal representations 集成到工业系统中提出了许多艰难挑战,特别是在 representation quality、integration methods 和 system implementation 领域——这些挑战在大规模工业系统背景下被放大。

    在本研究中,我们深入探讨这些挑战,并分享我们用于 pre-training 和纳入 multimodal representations 的方法。此外,我们提供在 online deployment 过程中获得的见解。我们相信,我们在旅程中积累的策略和见解,将成为那些希望在工业系统中加速采用 multimodal-based recommendations 的人们的宝贵资源。