《Enhancing Taobao Display Advertising with Multimodal Representations: Challenges, Approaches and Insights》
尽管 multimodal data 在提升模型准确性方面的潜力已被认可,但许多大规模工业推荐系统,包括 Taobao display advertising system,其模型仍主要依赖 sparse ID features。在这项工作中,我们探索了利用 multimodal data 来增强推荐准确性的方法。我们首先识别出在工业系统中以既有效又 cost-efficient 的方式采用 multimodal data 的关键挑战。为应对这些挑战,我们引入了一个两阶段框架,包括:
1):pre-training of multimodal representations 以捕获 semantic similarity。
2):将这些 representations 与现有的 ID-based models 集成起来。
此外,我们详细介绍了我们的 production system 的架构,该系统旨在促进 multimodal representations 的部署。自 2023 年中期集成 multimodal representations 以来,我们观察到 Taobao display advertising system 取得了显著性能提升。我们相信,我们所收集的见解将为从业者提供宝贵资源,其中从业者希望在其系统中利用 multimodal data。
传统上,Taobao display advertising system 中使用的 recommendation models,与许多其他工业系统一样,主要依赖 discrete IDs 作为特征。尽管 ID-based models 被广泛使用,但它们具有内在缺陷,例如无法捕获 multimodal data 中包含的semantic information。
为了解决这些问题,某些工业系统尝试将 multimodal data 纳入 ID-based models(《Better Generalization with Semantic IDs: A case study in Ranking for Recommendations》、《COURIER: Contrastive User Intention Reconstruction for Large-Scale Pre-Train of Image Feature》)。通常,这些方法采用两阶段框架,包括:
1):通过 generic or scenario-specific pre-training 获得 multimodal representations。
2):将这些 representations 集成到推荐模型中。
尽管取得了这些进展,大量工业系统仍然完全依赖 ID features。这通常归因于一种担忧: multimodal data 带来的性能收益可能无法补偿其部署成本。这些成本包括 pre-training multimodal encoders、为 new items 增量地 generating representations、以及同时对 online servers 和 near-line training systems 的其他必要升级。因此,multimodal representations 的 successful integration 取决于能否在提升其性能收益的同时最小化部署成本。
为实现这两个关键目标,应解决三个实际挑战:
Design of the pre-training task:multimodal representations 在提升性能方面的有效性取决于其提供有意义 semantic information 的能力,而这是 ID features 难以捕获的。必须设计 pre-training tasks,使 multimodal representations 能够封装此类 semantic information。
Integration of multimodal representation:ID features 与 multimodal representations 之间的固有 discrepancies ,例如 training epochs 的 difference,要求采用能够有效将 multimodal representations 纳入 ID-based model 的方法。这些方法应利用每种 feature type 的优势来提升模型的整体性能。
Design of the production system:整个 production workflow,包括为 new items 生成 multimodal representations 及其在下游任务中的最新应用,都应以高效方式来设计。
为应对这些挑战,我们采用如 Figure 1 所示的两阶段框架。
在 pre-training 阶段,我们提出语义感知对比学习(Semantic-aware Contrastive Learning: SCL)方法。具体而言,我们利用用户的 search query 和后续 purchase action 来构建语义相似样本对(semantically similar sample pairs),捕获电子商务场景中与用户最相关的 dimensions of semantic similarity。对于负样本,我们从一个大型 memory bank 中抽取。SCL 方法使 multimodal representations 能够有效度量 items 之间的 semantic similarities。
在获得高质量 multimodal representations 后,我们提出两种方法将这些 representations 纳入现有的 ID-based model。
首先,我们开发了一种名为 SimTier 的方法,用于度量 target item 与用户先前交互过的 items 之间的相似程度。所得到的 SimTier vector 随后与其他 embeddings 拼接起来,并馈入后续层。
此外,为解决 multimodal representations 与 ID embeddings 之间的 training epochs 差异,我们引入 MultimodAl Knowledge Extractor: MAKE 模块。MAKE 模块将 multimodal representations 相关的 parameters 的 optimization (例如与 multimodal representations 相连的 MLP 的参数)与 ID-based model 的 parameters optimization 分离,从而使 multimodal representations 相关的 parameters 能够更有效地学习。

我们还介绍了 production system 的设计,该系统促进 multimodal representations 的部署。具体而言,系统实时地为 newly introduced items 生成 multimodal representations,并确保这些 representations 立即可供 training infrastructure 和 online prediction server 使用。这种设计实现了极低延迟——从 introduction of an item 到模型使用其 multimodal representations 仅需几秒钟。自 2023 年中期以来, multimodal representations 已部署在 Taobao display advertising system 中,带来了显著性能提升。
论文就是一些工程技巧的应用,创新点不足。
目前,ID features 构成工业推荐模型的核心。尽管 ID features 被广泛采用,ID features 具有显著局限性,包括难以捕获 semantic information 、以及持续存在的冷启动问题(《Image Matters: Visually Modeling User Behaviors Using Advanced Model Server》、《Image Feature Learning for Cold Start Problem in Display Advertising》、《Methods and metrics for cold-start recommendations》、《Adversarial gradient driven exploration for deep click-through rate prediction》)。相反, multimodal data 提供丰富的 semantic information,促使许多研究探索将其纳入推荐模型。
一些研究探讨了以端到端方式与 recommendation model training 一起学习 multimodal representations 的潜力(《Deep CTR Prediction in Display Advertising》、《End-to-End Image-Based Fashion Recommendation》、《Where to Go Next for Recommender Systems? ID- vs. Modality-based Recommender Models Revisited》)。然而,此类过程所需的巨大计算资源常常阻碍其在工业系统中的采用。因此,我们关注两阶段范式(《Multimedia features for click prediction of new ads in display advertising》、《Image Matters: Visually Modeling User Behaviors Using Advanced Model Server》、《Ups and Downs: Modeling the Visual Evolution of Fashion Trends with One-Class Collaborative Filtering》、《Images Don’t Lie: Transferring Deep Visual Semantic Features to Large-Scale Multimodal Learning to Rank》、《PinnerSage: Multi-Modal User Embedding Framework for Recommendations at Pinterest》、《Better Generalization with Semantic IDs: A case study in Ranking for Recommendations》、《COURIER: Contrastive User Intention Reconstruction for Large-Scale Pre-Train of Image Features》),并旨在分享我们的方法和宝贵见解。
在深入细节之前,我们首先介绍工业系统中使用的典型 ID-based model 结构。
推荐模型中的 ID Features:常见推荐模型在包含数十亿 ID features 的大规模数据集上训练(《XDL: An Industrial Deep Learning Framework for High-Dimensional Sparse Data》、《PICASSO: Unleashing the Potential of GPU-centric Training for Wide-and-deep Recommender Systems》)。这些 ID features 用于表示 users profiles、user historical interacted items、target item(待预测)以及 contextual information。例如,我们可以用相应的 item ID 和 category ID 表示 target item,并通过 a sequence of corresponding item IDs and category IDs 表示 user historical interacted items。
ID-based Model 的结构:ID-based recommendation model 遵循 embedding and MLP 的架构,通常包含 historical behavior modeling 模块(《Deep Interest Evolution Network for Click-Through Rate Prediction》、《Deep interest network for click-through rate prediction》)。
最开始,所有 ID features 都被转换为 embeddings。
historical behavior modeling 模块随后通过分析 the embedding of target item 与 embeddings of the user’s historical interacted items 之间的相关性,度量用户对 target item 的兴趣。具体而言,这些模块通过聚合 the embedding of target item 和 embeddings of the historical interacted items,从而生成 fixed-length vectors。
这些 fixed-length vectors 随后与其他 ID embeddings 拼接,形成后续 MLP 的输入,最后产生 final prediction。
至于 multimodal data ,对它的利用(utilization)可以改进 historical behavior modeling。具体而言, multimodal data 可用于度量 target item 与 users's historical interacted items之间的 semantic similarity。以 item images 为例,它们可用于度量 image of the target item 与 images of historical interacted items 之间的视觉相似性(visual similarity)。直观上,更高的 semantic similarity 表示 target item 与 users’ historical behavior 之间更强的相似性,表明用户感兴趣的可能性更高。这一见解强调了 designing a pre-training task 的重要性,该任务应使 multimodal representations 能够有效辨别 item pairs 之间的 semantic similarity。
为获得能够辨别 semantic similarity 的 representations,我们提出语义感知对比学习(semantic-aware contrastive learning: SCL)方法,该方法吸引语义 sample pairs 并排斥语义不相似 sample pairs。为实现这一点,必须定义用于监督的语义相似 sample pairs 和不相似对 sample pairs 。为理解这一点的重要性,考虑 Figure 5 中所示的例子,其中三个枕头(pillows)几乎相同,但显示出细微差异,例如图案差异或轻微外观差异。如果语义相似 sample pairs 的 definition 不充分,representations 可能无法捕获这些细微差异。实际上,这些细微区别常常被专注于捕获通用概念(general concepts)的 representations 所遗漏。
下面,我们将详细阐述为电子商务场景定制的 pre-training dataset 的构建,以及 contrastive learning 过程的 optimization 策略。

在电子商务背景下,用户的 search query 和后续 purchase action 通常表示 query 与 purchased item 之间的强烈的 semantic similarity。例如,如果用户搜索一张枕头图片并随后购买一个枕头,这一系列行为表明这两张图像(queried image 和 image of the purchased item)在语义上足够相似,能够满足用户的 purchase intentions。因此,如 Table 1 所示,在训练 text encoder 时,我们将 text of the user’s search query 与 title of the item they ultimately purchased 配对为语义相似 sample pairs 。类似地,对于图像模态,将用户的 image query(从淘宝的 image search 场景获得)与后续所购买 item 的图像配对。这种配对策略自然捕获了电子商务场景中与用户最相关的 semantic similarity 维度,反映了影响其购买决策的元素。
对于每个语义相似 sample pairs ,我们将所有其他样本视为潜在不相似样本,这可以通过使用当前 mini-batch 中的样本作为负样本来实现。为了进一步提高模型性能,我们旨在增加训练期间可用的负样本数量。具体而言,我们从 MoCo (《Momentum Contrast for Unsupervised Visual Representation Learning》)中获得灵感,采用一种使用动量更新模型的技术,从而便于从更大的 memory bank 中采样更多负样本。更复杂的 negative pairs 构建策略,例如识别 hard negatives (《FaceNet: A unified embedding for face recognition and clustering》),将在实验章节中详细阐述。
论文中引入了三种负样本:
当前
mini-batch内样本:当前batch中,其他样本相对于某个query就是负样本。这是最基础的负样本。
MoCo memory bank中的历史负样本:通过Queue,把过去很多batch的key representation保存下来。当前query会和Queue中大量key对比。论文中Queue size,这意味着每个 query可以和约20万个key做对比,负样本数量远大于普通in-batch负采样。
Hard negative:如果用户搜索了某个query,点击了某个商品,但最终购买的是另一个商品。那个 “点击了但没买” 的商品,与query和正样本都很相似,但它是负样本。这种样本叫hard negative。

MoCo式负采样:MoCo的关键设计是维护一个队列 (queue),也就是论文里说的memory bank。假设队列大小为(论文中设置为 。这个队列里存的不是原始图片或文本,而是 encoded key representation,并且通常经过L2归一化。队列按时间顺序更新:
当前
mini-batch的样本经过key encoder而被编码。这些
key representations入队。最旧的
key representations出队。队列大小始终保持
。 这样,每个
query在做InfoNCE对比时,不只和当前batch里的少量样本对比,而是和队列中约20万个key representations对比。
为什么要用动量编码器:如果只是简单维护一个队列,会有问题:队列里的旧
key是由旧参数编码出来的,而当前query是由当前参数编码出来的。如果encoder参数变化太快,旧key和当前query就不在同一个representation space里,对比学习会不稳定。
MoCo的解决办法是使用两个encoders:
query encoder:参数,通过梯度反向传播正常更新。
key encoder:参数,不通过梯度更新,而是动量更新: 其中
通常接近 1,例如0.999。也就是说,key encoder缓慢跟随query encoder变化。这其实是一个递推公式:
当
,那么 就是过去历史所有 的加权平均,权重按照 指数衰减。当 时,权重的时间常数约为: 。也就是说, 大致相当于最近约 1000步的的平滑版本。 因为
MoCo要维护一个很大的负样本队列memory bank。队列里的key是过去很多步由编码出来的。如果 更新太快,队列里旧 key和新key就来自差异很大的encoder,representation space不一致,对比学习会失效。所以这里需要一个较大的,使得 缓慢地跟随 。所以 “更新慢” 是特性,不是缺陷。它用一定的滞后换取队列的一致性和大规模负采样能力。 这样做的好处是:
队列中的旧
key虽然来自过去,但因为key encoder变化很慢,它们仍然和当前query处于相近的representation space。队列可以开得很大,不需要每次重新编码所有负样本;
显存和计算可控,因为队列只存编码向量,不存计算图,也不对队列中的
key反传梯度。所以论文说 “采用动量更新模型的技术,从而便于从更大的
memory bank中采样更多负样本”,本质就是:动量更新保证队列中历史key与当前query的representation一致,因此可以放心使用超大memory bank作为负样本池。
我们使用广受认可的 InfoNCE loss(《Representation learning with contrastive predictive coding》)作为损失函数。给定 encoded query encoded positive sample memory bank 中的 encoded sample representations 的集合,其中 memory bank size 大小(《Momentum Contrast for Unsupervised Visual Representation Learning》),InfoNCE loss 采用点积来度量相似性(所有 representations 均进行 L2 归一化)。如下公式所示,当 query memory bank 中所有其他样本偏离时,损失值降低。
注意,这里的
就是正样本 。所以分母就把正样本、负样本用一个统一的公式来表达。分母一共有 项,其中一个正样本, 个副样本。
这里,196,800。
通过这种方式,SCL 方法使 representations 能够辨别 comparable items 之间的细微差异,这对推荐模型至关重要。
注意,论文使用了两种对比损失:
InfoNCE loss和Triplet Loss。
InfoNCE loss是主损失:负责大规模对比学习,利用MoCo memory bank中的大量负样本,让query靠近正样本、远离所有其他key。注意:
in-batch negative并没有被排除,而是被MoCo memory bank统一吸收了。在这里,负样本集合写成了memory bank,而当前mini-batch的样本本身也会进入这个memory bank,所以in-batch negative隐含在其中,只是没有单独强调。
Triplet Loss是辅助损失:专门针对<Query, Positive, Negative>三元组中的hard negative,用margin约束强化细粒度区分。对于
hard negative,SCL对每个<Query, Positive, Negative>三元组应用triplet loss,使模型:拉近Query和Positive,推远Query和Negative。这样模型能区分非常细粒度的差异,比如三个几乎一样的枕头,只是图案或外观略有不同。普通随机负样本可能太容易区分,而
hard negative能迫使模型学到更精细的语义判别能力。常用的
Triplet Loss定义为:其中:
为锚点,即这里的 Query;为正样本,即这里的 Positive;为负样本的 Negative。
为距离函数(例如余弦相似度), 为 margin。其语义是:距离要比距离 至少近 。
将 multimodal representations 集成到 ID-based recommendation model 中的一种直接方法,是将这些 multimodal representations 与 ID embeddings for both the target item and users’ past interacted items 拼接(《Image Matters: Visually Modeling User Behaviors Using Advanced Model Server》、《COURIER: Contrastive User Intention Reconstruction for Large-Scale Pre-Train of Image Features》)。这种 concatenation 之后接入 user behavior modeling 模块,随后馈入 MLP 进行 final prediction。尽管这种方法很直接,但我们发现性能提升有限。为研究此事,我们分享我们的观察和见解。
我们首先分享关于纳入 multimodal representations 的观察和见解。
Observation 1:简化 multimodal representations 的用法可提升性能。我们的研究表明,将 multimodal representations 直接集成到 ID-based model 中并不能产生最优性能,详见实验章节。该问题出现的原因是, multimodal representations 关联的 parameters(例如与 multimodal representations 相连的 MLP 的参数),在 joint training process with the ID embeddings 过程中没有得到充分学习(《COURIER: Contrastive User Intention Reconstruction for Large-Scale Pre-Train of Image Features》)。相反,简化 multimodal representations 用法的策略,例如将其转换为 semantic IDs(从而 representing the embedding vectors with IDs)(《Better Generalization with Semantic IDs: A case study in Ranking for Recommendations》、《COURIER: Contrastive User Intention Reconstruction for Large-Scale Pre-Train of Image Features》),似乎提供了更好的性能。
Observation 2:ID-based models 和 multimodal-based models 存在 training epoch discrepancy。
在工业场景中,ID-based models 通常只训练 one epoch 以避免过拟合(《Towards Understanding the Overfitting Phenomenon of Deep Click-Through Rate Model》)。
相反,CV 和 NLP 领域的模型通常训练 multiple epochs。
一个自然的问题出现了:一个 multimodal-based recommendation model 理想的 training epochs 是多少?为回答这个问题,我们开发了一个仅使用 multimodal representations 作为 input features、没有任何 ID features 的推荐模型,并分析其性能如何随 training epochs 变化。
详细 convergence curve 如 Figure 3 所示。我们发现:
采用 multimodal data 的模型受益于在同一数据集上训练多个 epochs,其性能随 epochs 增加而显著提升。
相反,ID-based models 遭受 one-epoch overfitting 现象,模型性能在第二个 epoch 开始时急剧下降(《Towards Understanding the Overfitting Phenomenon of Deep Click-Through Rate Model》)。
结果表明, multimodal representations 关联的 parameters 需要更多 epochs 才能正确收敛,这与 ID-based model 的行为形成对比。因此,当将 multimodal representations 纳入 ID-based model 并仅训练 one epoch 时,存在 multimodal-related parameters 可能训练不足的风险。

observation 1 要求简化 multimodal representations 的使用。为此,我们提出一种简单却有效的方法 SimTier。如 Figure 2 (a) 所示,SimTier 首先计算 target candidate item 的 multimodal representations user’s historically interacted items 的 multimodal representations
在计算 similarity scores 之后,我们将 score range predefined bins。在每个 bin 内,我们统计落入相应 range 的 similarity scores 数量。因此,我们获得一个 bin 中 similarity scores 的数量。这样,SimTier 有效将一组高维 multimodal representations 转换为一个 target item 与 user’s historical interactions 之间的相似程度。所得 embeddings 拼接,并馈入后续 MLP。我们在 Algorithm 1 中提供 SimTier 的伪代码。注意,SimTier 可被视为 a set-to-set function(《Deep Sets》)。未来工作可以探索将时间信息集成到 SimTier 中的更高级方法。
其实就是以多模态
representation作为桥梁,计算target item和historical items的相似度,然后对相似度集合进行池化操作(这里是分桶池化)。如果替换为最大池化,效果会如何?论文并未说明。


为解决 ID features 与 multimodal representations 所需 training epochs 的差异,我们引入多模态知识提取器(MultimodAl Knowledge Extractor: MAKE)模块,将 multimodal related parameters 的 optimization 与 ID features 的 optimization 解耦。MAKE 模块包含两个步骤:
1):multi-epoch training 以提取有用的多模态知识,
2):下游任务对知识的利用。
Multi-epoch training of multimodal related parameters:MAKE 模块的目标是预训练 parameters related
to multimodal representations 多个 epochs,以确保其收敛。在实践中,我们利用 CTR prediction task 作为 recommendation pre-training task。如 Figure 2 (b) 所示,我们首先开发一个 DIN-based user behavior modeling 模块(《Deep interest network for click-through rate prediction》)。该模块处理 target item 和 historical interacted items 的 pre-trained multimodal representations ,产生 output
之后,logit
然后我们优化 predicted click probability 与二元 click label cross-entropy loss,如下公式所示:
recommendation pre-training task 允许 MAKE 模块通过多轮训练细化其参数,并从 multimodal representations 中提取知识
注意:这里的
pre-training不是用预训练embedding,而是预训练一个DIN network。然后把这个DIN network整体迁移到下游。
Knowledge utilization:在获得向量 intermediate outputs 与 other embeddings 拼接,并将该 combined data 馈入后续层。MAKE 模块 multi-epoch training 的 implementation 调和了 ID embeddings 和 multimodal representations 所需 training epochs 的差异,从而带来更好的性能。
在下游应用时,会把这个
pretrained DIN network直接集成过来。注意,在Figure 2中提示了:multimodal embeddings are frozen (non-trainable) in both the SimTier and MAKE approaches。而pretrained DIN network既可以冻结起来,也可以进行微调(以一个较小的学习率)。
在工业环境中,new items(包括广告)不断被创建。为了保持对这些 new items 的预测准确性,推荐模型实时获取 new items 的 multimodal representations 至关重要。这要求能够持续为 new items 生成 multimodal representations,并由 near-line trainer 和 online server 实时利用。我们 online system 的示意概览如 Figure 4 所示。为实现 multimodal representations 的 real-time generation,当 new items 被引入时,系统自动向 pre-trained multimodal encoders 发起请求,以计算这些 new items 的 multimodal representations。一旦 inference 完成,这些 representations 被发送到 multimodal index table。在此步骤之后,下游 training system 和 inference servers 能够从 index table 检索 multimodal representations,促进 near-line training 和 real-time online prediction 能力。该过程确保极低延迟——从 item’s introduction 到 utilization of its multimodal representation by the model 仅需几秒钟。

在本节中,我们深入进行一个案例研究,考察将 image representations 集成到 CTR prediction 模型中,旨在提供全面分析。值得注意的是,我们的方法是通用的,能够容纳多种模态类型(如文本和视频),并适用于推荐系统中的不同阶段。
数据集:我们首先详述用于 pre-training 阶段和下游 integration 阶段的数据集。
Pre-training Dataset:在 pre-training dataset 中,每个样本由一个 Query(用户的 image query)和一个 Positive(image of the purchased item)组成。为了进一步提高性能,我们还添加了一个 hard Negative(image of the clicked item triggered by the positive item)。pre-training dataset 的一个案例见 Figure 5。
CTR Prediction Dataset。CTR prediction dataset 来自 Taobao display advertising system,使用一周的 impression logs。

Compared Pre-training Methods:我们采用一系列广泛使用的 pre-training 方法进行比较。
CLIP-O:CLIP-O 指使用通用数据集预训练好的 CLIP visual encoder(CLIP-ViT-B/16)(《Learning Transferable Visual Models From Natural Language Supervision》)。
CLIP-E:CLIP-E 是基于 CLIP-O 模型在电子商务场景中使用 aligned item descriptions and item images 微调后的版本。
SCL:所提出的 semantic-aware pre-training 方法。SCL 方法采用 Momentum Contrast: MoCo 来扩展 negative samples。此外,SCL 对每个 <Query, Positive, Negative> 三元组应用 triplet loss(《FaceNet: A unified embedding for face recognition and clustering》),以有效区分 hard negatives。
Compared Recommendation Methods:我们采用一系列广泛使用的 integration 方法进行比较。
ID-based Model (production baseline):baseline 是支撑我们在线系统的 ID-based model。
Vector:Vector 方法利用 pre-trained multimodal representations 作为每个 item 的 side-information,并将其与模型内其他 ID embeddings 拼接起来。
SimScore:相似性分数(Similarity Score: SimScore)可视为 Vector 方法的简化版本。每个 historical interacted item 相对于 target item 的 semantic similarity score 被用作 side information。
SimTier 和 MAKE:所提出的 SimTier 和 MAKE 方法。
评估指标:我们评估所提出方法的 pre-training 性能和 CTR prediction 性能。
评估 Pre-training 方法:在我们的大量实验中,我们发现 Top-N accuracy: Acc@N 与下游推荐模型的性能高度相关。具体而言,Acc@N 指标衡量 representation 识别 semantic similar items 的能力:
其中:
query 和正样本。
multimodal representations 为每个 query 检索 top-N results 个结果。
符号 1,其他所有情况为 0。
评估 Recommendation 方法:我们使用 AUC 和 Group AUC: GAUC 指标评估 CTR prediction 模型的有效性,其中更高的 AUC/GAUC 值表示更优的排序能力。
利用 Accuracy 来评估 Pre-trained Representations 有效性的理由:衡量 pre-trained representations 有效性最精确的方式,是测量集成 multimodal representations 后推荐准确率的提升。然而,这一评估过程对于 pre-training 方法的迭代可能耗时较长,因此需要一种用于更快评估 pre-trained multimodal representations 的中间指标。
在我们的研究中,我们观察到 pre-training accuracy 的提升与 recommendation performance 的提升之间存在强相关性。我们在 Figure 6(a) 中展示这种关系,可以看到 Acc@1 的提升与 GAUC 的提升一致。因此,我们主要依赖 pre-training accuracy 来判断 multimodal representations 的质量。探索用于评估 pre-trained multimodal representations 的其他潜在中间指标仍然是一个有趣的未来工作主题。

Semantic-Aware Contrastive Learning 的重要性:为研究不同 pre-training tasks 如何影响 multimodal representations 的质量,我们进行了一系列实验。Table 2 中的结果提供了两个重要观察。
首先,提出的 SCL pre-training 方法超越了其他语义相似度无关(semantic-similarity-agnostic)的方法,强调了 semantic-aware learning 的必要性。
其次,纳入 Momentum Contrast: MoCo(《Momentum Contrast for Unsupervised Visual Representation Learning》)和 Triplet Loss (《FaceNet: A unified embedding for face recognition and clustering》)等技术进一步提升了 multimodal representations 的质量,表明 negative sample 的选择极大影响性能。`

不同 Integration 策略的性能:在 CTR prediction 数据集上,我们评估提出的 SimTier 和 MAKE 与其他方法。整体结果如 Table 3 所示,从中可以注意到两个观察。
首先,SimTier 和 MAKE 显著优于其他方法。
其次,SimTier 和 MAKE 的组合可以进一步提升性能,与 ID-based model 相比,GAUC 提升 1.25%,AUC 提升 0.75%。
上述结果证明了所提出方法在将 multimodal representations 集成到 ID-based model 中的有效性。

不同 Training Epochs of MAKE 的性能:为探索 MAKE 的 multi-epoch pre-training 对最终推荐性能的影响,我们进行实验,其中 MAKE 在集成到推荐模型之前被预训练不同 epochs。结果如 Figure 6(c) 所示。注意,0 epochs 意味着 MAKE 不进行预训练,而是与下游任务联合优化。结果表明,随着 MAKE 的 pre-training epochs 数量增加,最终推荐模型的性能也提升。这表明 MAKE 的 multi-epoch training 有效增强了模型性能。

Infrequent Items 的性能:为考察 multimodal representations 在 long-tail items 上的泛化能力,我们评估按 item 出现频率分组后的相对提升。我们将所有 items 分为八组,Group 1 包含训练数据集中频率最低的 items,Group 8 包含频率最高的 items。之后,我们为每组计算 AUC 的相对提升:
其中:MM 表示 SimTier 和 MAKE 方法的组合,ID 表示 ID-based production baseline model。
我们还计算 LogLoss 的相对提升以衡量校准能力:
Figure 6(b) 中呈现的结果表明, multimodal representations 在所有组中均表现出显著提升,证明了我们的模型在不同类型 items 上的有效性。同时,我们看到低频 items 的提升更显著。结果表明, multimodal representations 可以解决基于 ID-based model 在 long-tail items 上的缺陷,并提升 prediction 准确性。
自 2023 年中期以来, multimodal representations 已集成到 Taobao display advertising system 中的 pre-ranking models、ranking models 和 re-ranking models 中,带来了显著性能提升。例如,在 CTR prediction 模型中纳入 image representations,整体 CTR 提升 3.5%,RPM 提升 1.5%,ROI 提升 2.9%。
值得注意的是,对于新广告(过去 24 小时内创建),影响更为显著,CTR 提升 6.9%,RPM 提升 3.7%,ROI 提升 7.7%。新广告上的显著收益也验证了 multimodal data 在缓解冷启动问题方面的有效性。
Multimodal-based recommendation 已经吸引了数十年的关注。然而,将 multimodal representations 集成到工业系统中提出了许多艰难挑战,特别是在 representation quality、integration methods 和 system implementation 领域——这些挑战在大规模工业系统背景下被放大。
在本研究中,我们深入探讨这些挑战,并分享我们用于 pre-training 和纳入 multimodal representations 的方法。此外,我们提供在 online deployment 过程中获得的见解。我们相信,我们在旅程中积累的策略和见解,将成为那些希望在工业系统中加速采用 multimodal-based recommendations 的人们的宝贵资源。