《MUSE: A Simple Yet Effective Multimodal Search-Based Framework for Lifelong User Interest Modeling》
Lifelong user interest modeling 对于工业推荐系统至关重要,然而现有方法主要依赖 ID-based features,在 long-tail items 上泛化能力差,且 semantic expressiveness 有限。虽然最近的工作探索了在通用搜索单元(General Search Unit: GSU)中使用 multimodal representations 进行 behavior retrieval,但它们通常忽视了 fine-grained modeling 阶段——即精确搜索单元(Exact Search Unit: ESU)中的 multimodal integration。在这项工作中,我们对如何在两阶段 lifelong modeling 框架的两个阶段中有效利用 multimodal signals 进行了系统性分析。我们的关键洞察是:
在 GSU 中简单性(simplicity)就足够了:使用高质量 multimodal embeddings 的轻量级余弦相似度优于复杂的 retrieval 机制。
相比之下,ESU 需要更丰富的 multimodal sequence modeling 和有效的 ID–multimodal fusion 以释放 ESU 的全部潜力。
在这些原则的指导下,我们提出了 MUSE,一个简单而有效的 multimodal search-based 的框架。MUSE 已部署在 Taobao display advertising system 中,实现了 100K-length user behavior sequence modeling,并在 online latency 开销可忽略的情况下,在 top-line metrics 上带来了显著提升。为了促进社区研究,我们分享了工业部署实践,并开源了第一个大规模数据集,该数据集包含 ultra-long behavior sequences,同时搭配了高质量的 multimodal embeddings。我们的代码和数据可在 https://taobao-mm.github.io 获取。
点击率预测(Click-Through Rate: CTR prediction)在工业推荐系统中扮演着关键角色。随着 user behavior logs 随时间累积——通常每个用户超过 behaviors ——它们包含了丰富的、不断演变的 interest patterns。为了利用这些 lifelong sequences,现代 CTR prediction models 采用两阶段架构(《TWIN: TWo-Stage Interest Network for Lifelong User Behavior Modeling in CTR Prediction at Kuaishou》、《Search-Based User Interest Modeling with Lifelong Sequential Behavior Data for Click-Through Rate Prediction》):
(1):通用搜索单元(General Search Unit: GSU)从 full historical behaviors 中检索一个简短的且相关的子序列。
(2):精确搜索单元(Exact Search Unit: ESU)对该子序列进行精细的 user interest modeling 以进行 final prediction。
然而,现有方法在两个阶段中几乎完全依赖于 ID-based features(《TWIN: TWo-Stage Interest Network for Lifelong User Behavior Modeling in CTR Prediction at Kuaishou》、《Search-Based User Interest Modeling with Lifelong Sequential Behavior Data for Click-Through Rate Prediction》)。这导致了两个关键限制:
(1):long-tail items 或过时 items 的 ID embeddings 的学习效果不佳,降低了 GSU 的 retrieval 质量。
(2):ESU 缺乏 semantic expressiveness,因为它无法泛化到 co-occurrence signals 之外。虽然最近的工作(例如,MISS 《MISS: Multi-Modal Tree Indexing and Searching with Lifelong Sequential Behavior for Retrieval Recommendation》)将 multimodal representations 引入 GSU,但其在 ESU 中仍然仅对 ID features 进行建模,留下了第二个限制未得到解决。
在这项工作中,我们系统地研究了如何充分利用多 multimodal information 来增强 lifelong user interest modeling,重点关注将 multimodal representations 同时整合到 GSU 和 ESU 中。通过在工业规模数据上的大量实验,我们得出了三个关键见解:
在 GSU 阶段,multimodal embeddings 之间的简单余弦相似度足以进行有效的 retrieval。更复杂的相似度评分机制(例如,attention 或 joint ID–multimodal fusion)带来的提升可以忽略不计。
在 ESU 阶段,显式的 multimodal sequence modeling(例如,通过 SimTier 《Enhancing Taobao Display Advertising with Multimodal Representations: Challenges, Approaches and Insights》)显著提升了性能,而通过将 multimodal semantics 融合到 ID-based attention 中(通过我们提出的 SA-TA)则获得了进一步的提升。
Representation quality 在 ESU 中比在 GSU 中更重要,通过 multimodal embeddings(例如,SCL 《Enhancing Taobao Display Advertising with Multimodal Representations: Challenges, Approaches and Insights》)产生了最强的结果,其中 multimodal embeddings 能够捕获细粒度 item semantics 。
在这些见解的指导下,我们提出了 MUSE(MUltimodal SEarch- based framework for lifelong user interest modeling)——一个简单而有效的范式,将我们的发现统一到一个可部署的系统中(见 Figure 1)。具体来说,MUSE 在两个阶段都使用 frozen SCL-based multimodal embeddings(《Enhancing Taobao Display Advertising with Multimodal Representations: Challenges, Approaches and Insights》):
(1):在 GSU 阶段,它通过轻量级的 multimodal 余弦相似度检索 most top-K relevant behaviors。
(2):在 ESU 阶段,它通过 dual-path architecture design 来融合 ID 和 multimodal signals 以进行 lifelong user interest modeling:
Semantic-Aware Target Attention: SA-TA 用高质量的 semantic guidance 来增强 ID-based attention。
而 SimTier 将 multimodal cosine similarity sequence 压缩为直方图以捕获 semantic relevance。

除了算法贡献之外,我们还做出了两个额外的实际贡献:
首先,我们分享了生产部署的经验。自 2025 年年中起,MUSE 已部署在 Taobao display advertising system 中。它被集成到 online serving pipeline 中,在高效处理长达 100K-length 的 lifelong user behavior sequences 的同时,带来了可忽略的延迟开销,并实现了显著的 top-line metrics 提升。
其次,为了促进社区研究,我们开源了第一个大规模公共数据集,该数据集包含来自 Taobao displaying advertising system 真实用户流量的 lifelong user behavior sequences,搭配以高质量的 multimodal embeddings。
总之,我们的贡献是:
我们首次对 lifelong user interest modeling 中的 multimodal integration 进行了系统性分析,揭示了 GSU(simplicity )和 ESU(richness + fusion)的不同设计原则。
我们提出了 MUSE,一个体现这些原则并在离线评估和在线评估中均达到 SOTA 性能的实用框架。
我们发布了工业部署实践和一个大规模 multimodal lifelong behaviors 数据集,以支持未来的研究。
我们的工作涉及两个活跃的研究方向:lifelong user interest modeling,multimodal recommendation。
Lifelong User Interest Modeling:Modeling ultra-long user behavior sequences 对于捕获不断演变的兴趣至关重要。早期方法如 MIMN(《Practice on Long Sequential User Behavior Modeling for Click-Through Rate Prediction》)使用 memory networks 维护 user interest states over time。一个重大突破来自于 SIM(《Search-Based User Interest Modeling with Lifelong Sequential Behavior Data for Click-Through Rate Prediction》)和 UBR4CTR(《User Behavior Retrieval for Click-Through Rate Prediction》)引入的两阶段框架,该框架将 retrieval 和 modeling 解耦:
通用搜索单元(General Search Unit: GSU)从 full history 中高效检索 behaviors。
精确搜索单元(Exact Search Unit: ESU)对该子序列进行精细的 sequence modeling 以进行 final prediction。
后续工作改进了 GSU 设计:
ETA(《End-to-end user behavior retrieval in click-through rateprediction model》)使用 locality- sensitive hashing with Hamming distance 进行快速检索。
SDIM(《Sampling Is All You Need on Modeling Long-Term User Behaviors for CTR Prediction》)通过 hash signatures 对 items 进行分组。
TWIN(《TWIN: TWo-Stage Interest Network for Lifelong User Behavior Modeling in CTR Prediction at Kuaishou》)将 Target Attention(《Deep Interest Network for Click-Through Rate Prediction》)扩展到 GSU,选择具有最高 attention scores 的 behaviors。然而,由于 attention scores 是针对 behavior aggregation 而优化,并非针对 behavior selection 而优化的,这使得它们对 retrieval 而言是次优的(《Long-Sequence Recommendation Models Need Decoupled Embeddings》)。
更根本的是,所有这些方法都仅依赖于 ID-based features,继承了众所周知的局限性:对 long-tail items 的泛化能力差、以及缺乏 semantic expressiveness。这些缺点促使了最近的努力——包括我们的工作——将 multimodal signals 集成到 lifelong modeling 中。
Multimodal Recommendation:多模态信息(例如,图像、文本)在提高推荐准确性方面显示出巨大潜力。
AlignRec(《AlignRec: Aligning and Training in Multimodal Recommendations》)在 collaborative filtering supervision 下将 fixed CLIP features 与 ID embeddings 对齐。
《Enhancing Taobao Display Advertising with Multimodal Representations: Challenges, Approaches and Insights》 提出了 Semantic-aware Contrastive Learning: SCL,在 pre-training 期间构建behavior-grounded positive pairs(例如,search query <--> purchased item),然后使用这些 fixed representations 通过 SimTier 和 MAKE 来建模用户兴趣。
QARM(《QARM: Quantitative Alignment Multi-Modal Recommendation at Kuaishou》)在 pre-training 期间将 multimodal features 与 item-item relationships 对齐,并通过 quantized codes (《Autoregressive Image Generation Using Residual Quantization》、《Recommender systems with generative retrieval》)实现 end-to-end optimization。
与我们工作最相关的是,MISS(《MISS: Multi-Modal Tree Indexing and Searching with Lifelong Sequential Behavior for Retrieval Recommendation》)通过引入 a multimodal GSU alongside the ID-based GSU,开创了 lifelong behavior modeling 中的 multimodal integration。然而,MISS 在ESU 中丢弃了multimodal signals,将 semantic enrichment 限制在 GSU retrieval 阶段,使得 ESU stage 容易受到 ID embedding limitations 的影响。
相比之下,我们提出了在 GSU 和 ESU 两个阶段系统性地集成 multimodal information。我们的分析揭示了每个阶段不同的设计原则—— simplicity 在 GSU 中就足够了,而 ESU 则受益于显式的 multimodal sequence modeling 和 ID–semantic fusion ——从而形成了一个简单而高效的框架 MUSE。
本节介绍了全文使用的关键概念和符号,重点是关于用于 CTR prediction 的 lifelong user behavior sequences modeling 以及我们框架中使用的 multimodal representations。
CTR Prediction with Lifelong Behavior Sequences:CTR prediction 估计用户将要点击所展示 target item 的概率,通常被表述为一个二分类任务。在工业规模的推荐系统中,用户通常拥有 ultra-long historical behavior sequences(例如,数百万次 interactions)。给定一个用户 behavior sequences target item other features
其中 click label。
现代架构(例如,SIM 《Search-Based User Interest Modeling with Lifelong Sequential Behavior Data for Click-Through Rate Prediction》 和 TWIN 《TWIN: TWo-Stage Interest Network for Lifelong User Behavior Modeling in CTR Prediction at Kuaishou》)通过两阶段框架设计来解决 lifelong sequence 的挑战:
(1): 一个通用搜索单元(General Search Unit: GSU),它检索一个简短的且与 target 相关的子序列
(2):一个精确搜索单元(Exact Search Unit: ESU),它在 final CTR prediction。
我们的工作专注于用丰富的 multimodal information 同时增强 GSU 和 ESU 两个阶段。
Multimodal Item Representations:为了利用 items 的丰富的 multimodal information(例如,item images and titles ),我们考虑了三种 pre-trained multimodal embedding 方法,所有这些方法都将一个 item 映射到一个固定维度的向量。
OpenCLIP(《Chinese CLIP: Contrastive Vision-Language Pretraining in Chinese》):一个开源的、适配中文的 CLIP 模型(《Learning Transferable Visual Models From Natural Language Supervision》),通过 contrastive learning 在 200M image–text pairs 上预训练好的。它提供了强大的、开箱即用的 universal semantic embeddings,但缺乏 user interaction signals。
I2I (Item to Item):一个在源自 Taobao’s user behavior logs 的 item co-occurrence patterns 上训练好的对比模型(contrastive model)。Positive pairs 由 frequent item–item transitions 组成,而 negative pairs 则通过 MoCo (《Momentum Contrast for Unsupervised Visual Representation Learning》)采样。这种方法有效地将 collaborative signals 注入 multimodal embeddings 中。
SCL (Semantic-aware Contrastive Learning):从用户 search–purchase behavior(例如,query image <--> purchased item image )构建 positive pairs。使用 InfoNCE loss(《Representation learning with contrastive predictive coding》)进行训练,SCL 学到能够同时捕获 semantic signals 和 behavioral relevance 的 embeddings ,并已被证明对 CTR prediction 有效。
所有三种方法都产生 frozen multimodal embeddings,在推理期间通过 table lookup 进行访问。
在本节中,我们研究如何充分利用 multimodal information 来增强 lifelong user interest modeling,系统性地专注于将 multimodal representations 同时整合到 GSU 和 ESU 这两个阶段。通过在工业规模数据上的大量实验,我们得出以下关键见解:
GSU:Multimodal similarity 优于 ID-based retrieval,但复杂性带来的提升甚微——简单的内积就足够了。
ESU:Multimodal sequence modeling 有显著帮助,而 ID–multimodal fusion 则能带来进一步的提升。
设计原则:Simple GSU + enhanced ESU 是最优的;ESU 对 representation quality 远比 GSU 敏感。
GSU 的主要作用是从 lifelong historical sequences 中高效检索与 target item 最相关的 user behaviors。我们分析两个关键的设计选择:
(1):用于 similarity computation 的 representation 类型。
(2):retrieval 机制的复杂性。
Multimodal-based GSU vs. ID-based GSU:我们将 ID-based GSU 与使用 multimodal representations(即 OpenCLIP、I2I 和 SCL)的变体进行比较。具体来说,我们使用各自的 embedding 类型来计算 target item 与每个 historical behavior 之间的余弦相似度,并检索 top-K most similar behaviors 作为 GSU 的输出。
如 Table 1 所示,GSUs based on multimodal representations 持续优于 ID-based baseline,这表明来自 multimodal embeddings 的 semantic signals 比 discrete IDs 能更好地捕获 user–item relevance。

GSU 中增加建模复杂度是否能提升性能?我们探索了两种增强策略:
(1):在计算相似度之前,应用一个可学习的 MLP 来转换 multimodal embeddings(称为 multimodal attention score)。
(2):通过 fusing ID-based scores(称为 ID Cosine 或 ID attention score)和 multimodal semantic similarities 进行联合检索。
结果总结在 Table 2 中。
对于 (1) ,我们发现 attention 机制——尽管对 ID-based features 有效——并不能直接迁移到 multimodal similarity modeling,并导致性能明显下降。
对于 (2),简单的 fusion 方法(同时在 ID space 和 multimodal space 计算并求和 normalized cosine similarities)带来的提升很小。即使使用 learnable fusion weights 来结合 ID-based attention scores 和 multimodal similarities,该方法也仅能达到与最简单的 multimodal inner-product baseline 相当的性能,同时伴随着更高的计算开销。
这些发现使我们得出结论:当拥有合适的 multimodal representations 时,增加 retrieval 机制的复杂性并不一定能带来性能提升。相反,轻量级的 inner-product similarity 就足以实现有效的 GSU retrieval。

虽然先前的工作已经探索了使用 multimodal representations 来改进 GSU,但大多数方法在 ESU 中仍然仅依赖 ID-based representations ——通常通过 Target Attention 来聚合 historical behaviors ——而忽视了 multimodal signals 在细粒度 sequence modeling 中的潜力。在这项工作中,我们研究两个关键问题:
(1):multimodal representations 能否提升 ESU 性能?
(2):在 ESU 中增加建模复杂度(例如,通过 multimodal–ID fusion )是否能带来额外收益,还是说简单的设计就足够了——正如在 GSU 中观察到的那样?
为了解决这些问题,我们分析两个关键的 design choices :
(1):将仅 ID-only ESU 替换为 multimodal-only ESU。
(2):在 ESU 中进一步融合 multimodal and ID representations,类似于在 GSU 中探索的 joint retrieval 策略。
Multimodal-based ESU vs. ID-based ESU:对于 ESU 中的 multimodal sequence modeling,我们采用 SimTier (《Enhancing Taobao Display Advertising with Multimodal Representations: Challenges, Approaches and Insights》)作为代表性架构。如 Table 3 所示,我们评估了 SimTier 和标准的 ID-based Target Attention 模块各自、以及组合的效果。结果表明,SimTier 无论是单独使用还是与 Target Attention 结合使用时,都带来了显著的性能提升,突出了在 ESU 中显式建模 multimodal semantics 的巨大好处。

Fusing multimodal and ID representations 能带来进一步的提升。我们探索了在 ESU 中融合 multimodal representation 和 ID representation,类似于在 GSU 中研究的 joint retrieval 策略。具体来说,我们将 ID-based attention scores 与 multimodal semantic similarity 整合到 Target Attention 机制中,以产生统一的、语义感知的 attention 权重。我们将这种增强方法称为 Semantic-Aware Target Attention: SA-TA,详细内容见 1.4.3 节。
如 Table 3 所示,我们提出的 SA-TA 在 ESU 中始终优于原始的 ID-only Target Attention,表明 multimodal and ID representations 提供了互补信号,可以有效地被融合从而增强 fine-grained modeling of lifelong user interests。
能够捕获细粒度 item semantics 的高质量 representations 能带来更好的性能。如 Table 1 所示,模型性能遵循 SCL > I2I > OpenCLIP 的排序。这是因为 SCL embeddings 捕获了更细粒度的 multimodal semantics(《Enhancing Taobao Display Advertising with Multimodal Representations: Challenges, Approaches and Insights》),从而实现了更准确的 GSU retrieval 和更强的 ESU modeling。我们通过附录 A.1 中的 GSU 案例研究来可视化这些 representations 之间的差异。
Representation quality 对 ESU 的影响远大于对 GSU 的影响。如图 Figure 2 所示,我们通过在不同 settings 下评估不同的 multimodal representations 来量化这种效应:
(1):在 GSU 中替换 representation ,同时在 ESU 中保持为 SCL representation (GSU ONLY);
(2):在 GSU 和 ESU 中同时替换 representation(GSU 和 ESU)。
当仅改变 GSU representation 时,性能保持相对稳定。相比之下,在 ESU 中改变 representation 会导致显著的性能差异,其中 fine-grained SCL representaions 带来了明显的提升。这表明 ESU 对 multimodal representation quality 的敏感性远高于 GSU,强调了 semantic modeling 在 ESU 中的重要性。

在 1.3 节洞察的指导下,我们提出了MUSE(MUltimodal SEarch-based framework for lifelong user interest modeling),它遵循三个关键原则:
(1):利用高质量的 SCL representations。
(2):采用简单的、基于相似度的 GSU。
(3):设计一个multimodal-enhanced ESU,既执行显式的 multimodal sequence modeling,又执行有效的 ID–multimodal fusion。
这种设计在效率和建模能力之间取得了有效的平衡。概览见 Figure 1。

如 1.3 节所示,representation quality 对性能影响至关重要——尤其是在 ESU 中。在候选方法(OpenCLIP、I2I、SCL)中,SCL 因其细粒度的语义感知能力(semantic awareness)而产生了最强的结果。因此,MUSE 在 GSU retrieval 和 ESU modeling 中都采用 SCL embeddings。
与我们的发现 “简单的 inner-product similarity 在 GSU 中就足够“ 的结论一致,MUSE 使用 frozen SCL embeddings,通过余弦相似度计算 semantic relevance。
具体来说,给定一个 target item lifelong historical behavior sequences lookup 将每个 item 映射到其 pre-trained multimodal embedding,得到
GSU 计算 target item 与每个 behavior item 之间的相似度:
然后,我们选择具有最高 top-K behaviors 来形成子序列 retrieval 与我们的洞察一致,即当拥有高质量的 multimodal embeddings 时,复杂的机制不会带来收益。
与 GSU 相反,我们的分析表明,ESU 需要显式的 multimodal sequence modeling 以及有效的 fusion of ID and semantic signals,以充分利用 lifelong behavior 数据。为此,MUSE 的 ESU 由两个互补组件组成:
(1):一个 multimodal sequence modeling 模块(SimTier),它捕获 retrieved behavior sequence 中的细粒度 semantic relevance patterns。
(2):一个 multimodal semantic-aware ID attention 模块(SA-TA),它用 multimodal semantic guidance 增强传统的 ID-based attention。
通过 SimTier 进行显式 Multimodal Sequence Modeling:SimTier(《Enhancing Taobao Display Advertising with Multimodal Representations: Challenges, Approaches and Insights》)不是处理原始的 multimodal embeddings,而是操作 target item 与 GSU-retrieved behaviors semantic similarity sequence ESU 受益于 modeling the structure of semantic relevance,而不是 individual embeddings。
具体来说,similarity range bins)。SimTier 将 similarity sequences entry 统计有多少个 similarity scores 落入相应的 bin。这个直方图作为 user’s multimodal interest distribution 的紧凑而富有表现力的 representation:
这种方法构成了我们显式的 multimodal sequence modeling ——它将 multi-level semantic patterns(例如,有多少 behaviors 是 highly/weakly relevant 的)捕获在一个单一向量中。
它捕获了
target item与user history interest的多模态相似性。
Semantic-Aware Fusion in ID-Based Attention (SA-TA):虽然 SimTier 有效地捕获了 multimodal semantics,但 ID path 对于捕获 collaborative filtering signals 仍然是必不可少的。然而,如 1.3 节所述,ID-only attention 在 lifelong user behaviors 中的 long-tail items 上存在泛化能力差的问题。
为了解决这个问题,我们提出了如 Figure 3 所示的语义感知目标注意力(Semantic-Aware Target Attention: SA-TA),它将 ID-based attention scores 与 multimodal semantic similarity signals 融合。给定 ID embeddings target)和 behaviors),标准的 Target Attention (《Deep Interest Network for Click-Through Rate Prediction》)计算如下:
SA-TA 使用 multimodal similarity vector fused attention scores:
其中:
final ID-based lifelong user interest representation 通过以下方式获得:
这种设计实现了我们的洞察,即 ID 和 multimodal signals 是互补的—— SA-TA 使用 multimodal semantic similarity 来增强 ID attention,特别是对于 sparse items。

最后,完整的 lifelong user interest representation 通过拼接两个 paths 形成:
prediction tower 中进行 CTR prediction。
总之,MUSE 的 ESU 直接实现了第 1.3 节的两个关键发现:
(1):显式的 multimodal sequence modeling 显著优于 ID-only baselines。
(2):在 attention 中 fusing ID and multimodal signals 从而实现进一步的提升。
工业规模的推荐系统必须在严格的 latency 预算内(通常是几百毫秒)从数十亿的 items 的 corpora 中返回个性化结果。为了满足这一约束,production systems 通常采用多阶段 pipeline:
一个 candidate generation(matching)阶段,检索一个可控规模的集合(大约 items)。
随后是一个计算密集型的 ranking 阶段,对 candidates 应用精细建模。
在 Taobao display advertising system 中,我们将 MUSE 部署在 ranking 阶段,以有效地建模长达 100K interactions 的 lifelong user behavior sequences。主要的性能瓶颈来自于获取这些 long behavior sequences 、以及它们在 GSU 中的 embeddings 所需的大量网络通信,这可能导致系统超出其 latency budget。请注意,这个瓶颈与 candidate items 无关,因为一旦 request 到达,用户就是固定的。为了消除这个瓶颈,我们将 GSU feature/embedding fetching 从关键的 ranking path 中解耦出来,使其与 matching stage 异步并行执行,并将 embeddings 缓存在 GPU 内存中。在 ranking stage,我们执行 similarity computation、Top-K Selection 和 ESU modeling:
Pre-fetching of GSU:与 matching 并行,GSU server 从 remote storage 中检索 user behavior sequence 和 multimodal embeddings,并将它们缓存在 GPU memory 中。Pre-fetching 通常比 matching 完成得更快,因此其 latency 被完全隐藏。
Top-K Selection of GSU:在 ranking 期间,模型使用 cached embeddings 来计算相似度,并选择与 target 最相关的 top-K historical interactions,以馈入到 ESU 中。请注意,similarity computation 和 top-K selection 可以与 ranking 阶段的其他 feature-processing 操作并行执行,产生的 latency 可以忽略不计。
ESU modeling:在 selected top-K sub-sequence 基础上,ranking 模型在 ESU 内应用 SimTier 和 SA-TA,并产生最终的 CTR prediction。
通过上述异步设计,MUSE 在 production 环境中带来的增量 latency 可以忽略不计。其高效的两阶段设计将资源消耗控制在预算之内。自 2025 年年中部署以来,MUSE 已处理了大部分流量,提供了稳定的性能和显著的提升。

MUSE 框架针对工业规模的推荐场景,这些场景需要通过 ultra-long behavior sequences 和丰富的 multimodal item content 来建模 lifelong user interests。这种能力对于 Taobao display advertising platform 这样的真实世界系统至关重要。
然而,现有的公共推荐数据集(《KuaiRec: A Fully-observed Dataset and Insights for Evaluating Recommender Systems》、《A Content-Driven Micro-Video Recommendation Dataset at Scale》、《Tenrec: A large-scale multipurpose benchmark dataset for recommender systems》)通常要么缺乏 long user behavior sequences,要么缺乏全面的 multimodal features。为了全面评估和展示 MUSE 的有效性,我们在两个自建数据集上进行实验,这两个数据集均源自 Taobao display advertising system,都具有 long user behavior sequences 和 multimodal item representations。
第一个是我们的 production dataset,完全反映真实世界的流量,并用于在工业环境中验证 MUSE 的性能。
第二个是精心策划的 academic dataset,为研究目的进行了仔细采样和匿名化处理。值得注意的是,我们将开源这个高质量的数据集,以促进社区对 multimodal recommendation 和 lifelong user interest modeling 的研究。
industrial dataset 由 Taobao display advertising system 中的 impression logs 构建。对于我们的实验,我们使用一周的数据:前六天用于训练,最后一天用于测试。该数据集中的每个样本都包含数百个精心设计的特征。如 Table 4 总结,该数据集包含来自 0.19B 用户的 3.71B 样本,每个用户拥有 100K historical behavoirs。该数据集能够对像 MUSE 这样的 lifelong modeling 方法进行严格的离线评估。

为了促进可重复的研究,我们发布了一个保护隐私的开源 academic dataset。它包括一组简洁的关键特征和长达数千次 interactions 的 user behavior sequences。由于 product images and titles 的版权限制,我们不提供原始的 multimodal content。相反,我们为所有 items 提供 SCL-based multimodal embeddings(《Enhancing Taobao Display Advertising with Multimodal Representations: Challenges, Approaches and Insights》)——如第 1.3 节所验证,这些高质量 representations 能够捕获 semantic relevance 和 behavioral relevance。
该数据集包含以下组成部分:
User features:匿名化的 user ID, age, gender, city, and province。
Item features:item ID, category, item city, and province。
Behavior sequences:用户的 historical sequence 最多包含 1K behaviors,每个 behavior 由其 item ID 标识。每个 item 仅由一个 128 维的 SCL embedding 来表征。
Label:一个指示 click (1) or non-click (0) 的二元标签。
如 Table 4 所示,开源数据集包含来自 8.86M 用户的 107M 样本,覆盖了 275M unique items。最大序列长度限制为 1K,以在 research utility 和 distribution feasibility 之间取得平衡。
我们相信,这个将 long user behavior sequences 与 high-quality multimodal embeddings 相结合的数据集,将能够系统性地探索 multimodal lifelong interest modeling。该数据集以及 preprocessing scripts 和 baseline implementations 现已公开可用(https://huggingface.co/datasets/TaoBao-MM/Taobao-MM、https://github.com/TaoBao-MM/MUSE)。
我们进行了全面的实验,以在 CTR prediction 的背景下评估 MUSE。
Baselines:我们将 MUSE 与以下 SOTA 且广泛采用的 lifelong interest modeling 方法进行比较:
DIN(《Deep Interest Network for Click-Through Rate Prediction》):该方法引入了一种 Target Attention 机制,从 historical behaviors 中建模 user interest,是 short-sequence interest modeling 中最广泛采用的模型。
SIM-Hard (《Search-Based User Interest Modeling with Lifelong Sequential Behavior Data for Click-Through Rate Prediction》):该方法采用两阶段方法进行 long-sequence modeling。
在 GSU 阶段,它检索与 target item 具有相同 category 的 top-K behaviors。
在 ESU 阶段,它应用 DIN 来建模用户的细粒度兴趣(fine-grained interest)。
SIM-Soft (《Search-Based User Interest Modeling with Lifelong Sequential Behavior Data for Click-Through Rate Prediction》):该变体将 SIM-hard GSU 阶段中 category-based retrieval 替换为 embedding-based similarity search,同时在 ESU 阶段仍使用 DIN 进行 user fine-grained interest modeling。
TWIN(《TWIN: TWo-Stage Interest Network for Lifelong User Behavior Modeling in CTR Prediction at Kuaishou》):该方法提出了一种高效的 Target Attention 机制,同时适用于 GSU 阶段和 ESU 阶段,从而在 GSU 阶段就实现了 attention-based retrieval。
MISS(《MISS: Multi-Modal Tree Indexing and Searching with Lifelong Sequential Behavior for Retrieval Recommendation》):该方法采用了一种 hybrid retrieval 策略:一个 ID-based Co-GSU 和一个 multimodal-based MM-GSU。在 ESU 阶段,它使用 ID-based DIN 进行 user interest modeling。
实现细节:
为了公平比较,所有方法共享相同的网络架构,包括 embedding layers 和 upper MLP tower,除了long-term behavior modeling模块。
所有方法都统一使用 SCL(《Enhancing Taobao Display Advertising with Multimodal Representations: Challenges, Approaches and Insights》)作为 multimodal representation。
每个模型训练一个 epoch(《Towards Understanding the Overfitting Phenomenon of Deep Click-Through Rate Models》、《RecIS: Sparse to Dense, A Unified Training Framework for Recommendation Models》)。
对于 DIN,由于其 processing long sequences 的瓶颈,我们使用最近的 50 behaviors。对于两阶段模型(SIM、TWIN、MISS、MUSE),GSU 从 lifelong behavior sequence 中检索 50 behaviors 用于 ESU。
production dataset 的 full behavior sequence length 上限为 5,000,open-source dataset 为 1,000。
我们严格按照原始论文复现了每种方法的 GSU。
对于 SIM-soft 和 SIM-hard,我们采用与 MUSE 相同的 ESU(SA-TA 和 SimTier)。考虑到 TWIN 使用了一种特殊的 Target Attention 变体以提高计算效率,我们保留了其原始设计,并将 SimTier 集成到 TWIN 的 ESU 中。对于 MISS,我们保留其原始的 ID-only ESU,以说明 multimodal-enhanced ESU 的显著效果。
在 open-source dataset 上,对于所有 parameter groups 我们使用 Adam 训练所有模型:embedding layers 使用 2.0e-3 的学习率,而 DNN parameters 使用 2.0e-4 的学习率。batch size 为 8,000。
Evaluation Metrics:我们采用 Group AUC: GAUC ——一个已被证明与在线指标更一致的指标(《Joint Optimization of Ranking and Calibration with Contextualized Hybrid Model》、《One Model to Serve All: Star Topology Adaptive Recommender for Multi-Domain CTR Prediction》、《Deep Interest Network for Click-Through Rate Prediction》)。
Table 5 显示了所有模型在 production dataset 和 open-source dataset 上的性能,其中 MUSE 始终取得最佳结果。这些比较进一步验证了第 1.3 节中建立的见解,证实了我们方法的有效性。
首先,multimodal-based GSU 优于 ID-based GSU。当搭配以相同的 ESU 时,MUSE 的性能优于 ID-based similarity search 的 SIM-hard 和 SIM-soft。
在这里,
SIM-Hard/SIM-Soft/TWIN使用与MUSE相同的ESU。
其次,复杂的 GSU 机制几乎不能带来任何改进。TWIN 采用 attention 机制来建模 target-behavior relevance,但性能有限,部分原因是 ID embedding inner products 的 attention scores 不可靠,特别是对于 long-tail items。回想一下,在第 1.3.1 节中,我们还在 GSU 中使用了 fused attention scores of SA-TA,引入了额外的计算开销,但并未优于 MUSE 的更简单的 multimodal semantic similarity search。
最后,multimodal-enhanced ESU 带来了显著的改进。尽管 MISS 引入了额外的 multimodal GSU 阶段,但它未在 ESU 阶段利用 multimodal information,导致了次优的结果。

我们评估了 MUSE 在不同 behavior sequence length 下的有效性。如 Figure 5 所示,我们观察到:
(1):MUSE 的性能随着序列长度的增加而显著提高,从 5K behaviors 扩展到 100K behaviors 带来了 +0.38% 的 GAUC 增益。
(2):在所有长度下,multimodal-enhanced ESU 始终大幅优于 ID-only ESU。这与我们的洞察一致,即 ESU 受益于高质量的 multimodal representations。

为了评估 MUSE 在不同 user activity levels 上的表现,我们按 behavior sequence length 将用户划分为九个大小相等的组。如 Figure 6 (a) 所示,relative GAUC improvement 从 Group 1(最短)到Group 9(最长)单调增加,证实了 MUSE 从丰富的 behavioral context 中获益最多。

以类似的方式,我们将 items 划分为九个大小相等的组,从 Group 1(最不流行)到 Group 9(最流行),并计算每组的 relative GAUC improvement。如 Figure 6 (b) 所示,MUSE 在冷门 items 上获得了更高的增益,展示了 multimodal information 的强大泛化能力。
我们于 2025 年年中在 Taobao display advertising system 中实现了 MUSE(序列长度为 100K),并通过长期的 A/B test 评估了其在线性能。production baseline 是基于 SIM with behavior length of 5K。如 Table 6 所示,部署 MUSE with the 100K-length version 带来了显著的性能提升,CTR 提升了 +12.6%,RPM(Revenue Per Mille)提升了 +5.1%,ROI(Return On Investment)提升了 +11.4%。

在这项工作中,我们系统地研究了如何有效地将 multimodal representations 集成到 lifelong user interest modeling 中。通过大量实验,我们揭示了两阶段架构的不同设计原则:
通用搜索单元(General Search Unit: GSU)受益于简单性(simplicity)——高质量的 multimodal embeddings 加上 inner-product similarity 就足够了。
而精确搜索单元(Exact Search Unit: ESU)则需要显式的 multimodal sequence modeling 以及 effective fusion of ID and semantic signals 。
在这些见解的指导下,我们提出了 MUSE,一个简单而有效的框架,在离线评估和在线评估中均达到了 SOTA 的性能。自 2025 年年中起,MUSE 已部署在 Taobao display advertising system 中,以可忽略的延迟开销带来了显著的 top-line business metrics 提升。此外,我们发布了工业部署实践和第一个大规模开源数据集,该数据集包含 ultra-long behavior sequences ,搭配以 SCL-based multimodal embeddings,以支持未来的研究。我们希望我们的分析、框架和资源能够激发学术界和工业界在 multimodal-enhanced lifelong interest modeling 方面产生更有效、更高效的方法。
我们在 Figure 7 中展示了三个案例,以说明不同 GSU 类型在 diverse target items(即儿童防晒衣 children’s sun-protection clothes、发夹 hairpin 和移动 Wi-Fi )上的不同搜索结果:
MUSE with SCL:multimodal GSU with SCL embeddings 能够精确捕获区分 individual items 的视觉细节,展现出细粒度的 semantic matching 能力。它能准确地检索出在款式、形状、颜色、质地等方面与 target item 高度相似的 historical items。
MUSE with OpenCLIP:相比之下,GSU based on OpenCLIP embeddings以更粗糙的粒度进行搜索,关注整体的图像内容。它通常根据 irrelevant background 或 contextual similarity 而不是 item 本身来检索 items。例如,在 case 1 中的儿童模特(child model),case 2 中的商标(trademark),以及 case 3 中的文字 "3000G" 在检索过程中被过度强调。
SIM-hard:category-based GSU 能正确识别与 target item 属于同一 category 的 items,但忽略了如颜色和款式等细粒度属性,而这些往往是用户最关心的方面。
SIM-soft:ID-based GSU 优先考虑在 users’ interaction histories 中与 target item 频繁共现的 items,导致 high popularity bias 和 low semantic relevance。例如,case 1 中的儿童玩具(children’s toys)、case 2 中的女性用品(women’s products)和 case 3 中的电子设备(electronic devices),被检索出来的主要原因都是与 target item 的 co-occurrence,而不是与target item 的 semantic similarity。
