推荐系统大模型脉络梳理

Liao Jiayi Liao Jiayi #AI#推荐系统#LLM

一个“新瓶装旧酒”的故事,如何利用 LLM 的思路来系统性的重构推荐系统?

从 ChatGPT 诞生以来,Facebook、阿里、快手、字节也都在从不同角度研究推荐系统如何跟 LLM 的底层技术相结合,把 rule-based 架构变得更加容易 scale。

基本知识:

1. 推荐系统进入大模型时代

Meta 2024.02: Actions Speak Louder than Words: Trillion-Parameter Sequential Transducers for Generative Recommendations

  • 数据层面上基本抛弃了人工特征,只留下时间序列(item,ts,action),采用 casual attention 和 target 候选做 cross attention;
  • 模型层面引入 HSTU 结构,相比 LLM 的 Transformer 主要有两个变化(合理性值得怀疑?):
    • HSTU,Attention 后引入门控 U,用于 attention 后聚合结果进一步做交叉;(原文是 This design is motivated by the difficulty of approximating dot products with learned MLPs.)
    • 非线性变换,从 Softmax 改成了 SiLu,和 DIN Pooling 时类似,为了保留用户兴趣表征的强度;

image

2. 使用 LLM 来轻量化改造推荐系统

Bytedance 2024.09: HLLM: Enhancing Sequential Recommendations via Hierarchical Large Language Models for Item and User Modeling

  • 字节早期利用大语言模型,轻量化改造推荐系统的思路,从 User 和 Item 两个方向去看,
    • Item: 用 LLM 对每个 Item 属性做描述,然后进 LLM 取最后一层的 item embedding(当做是这批描述的表征)
    • User: 用户的所有历史行为序列,用文本描述,也喂进 LLM;
    • User x Item 交叉有两种方式:
      • Early Fusion:在输入侧把 Item concat 到 User 表征后面,然后 cross-attention 算每个 item 和用户历史行为的相似度;
      • Late Fusion: 用类似 Item 的方式把用户历史行为做压缩,出一个用户兴趣的 embedding 表征,然后走一个 prediction head,预测用户兴趣和 Item 的相似度;

image

3. GR 和 DLRM 路线的结合

Alibaba 2025.02: Unlocking Scaling Law in Industrial Recommendation Systems with a Three-step Paradigm based Large User Model(LUM)

  • 这是阿里在 2025 年提出的,在 GR 和 DLRM 各自发扬光大的背景下,提出了一套两个方案相结合的方法,原因是:
    • GR 能做大规模 scale,但是生成的目标(下一个 item)和实际预测目标 CTR 未必完全一致;
    • DLRM 里长期积累下来的大量 sparse feature,没有那么容易被 GR 替换;
    • GR 依赖的长期历史数据,每次训练/推理的成本都非常高; 所以为了兼顾已有系统,提出三段论:
  1. 先用 AR 自回归的方式,使用用户序列+当前搜索词数据训练用户兴趣,得到 Embedding 表征(condition by 搜索词)
  2. 用户 request 发起时,用兴趣表征 x 当前 context(如用户搜索词),得到当前兴趣
  3. 把 2 的信息放到 DLRM 进行统一的预测和特征交叉

image

5. 推荐系统去 ID 化的尝试

OneRec Technical Report

  • 视频表征:
    • Token 化,这里叫 Semantic ID,通过多模信息 + 对比学习得到 embedding
    • embedding 做 RQ-Kmeans 生成 3 个 semantic ID
    • 存下 semantic ID -> video 的映射关系
  • 预训练:
    • 输入是 sid + 其他交互类特征
    • 输出是目标视频的 3 个 sid
  • 强化学习
    • ECPO: 由用户反馈作为 label,提升正样本概率,打压负样本概率;
    • ECPO vs GRPO: 和 GRPO 类似使用的是 Group 内奖励比较,但是 GRPO 只对组内偏差做了 clip(K-L 散度造成的影响没有 clip),发现负样本会造成梯度波动大,影响训练效果;

image

OneRec-V2 Technical Report

  • V2 最大的改动是 OneRec 的 Encoder-Decoder 模型结构改成了 Decoder-Only 结构,整体的模型结构更统一,共享 K/V 能够复用,Scale 能力更强;

6. LLM 思想解决召回问题

Alibaba 2025.07: RecGPT Technical Report

  • 阿里 2025.07 提出的三塔召回,全程主要利用 LLM 强大的表征能力,最后做召回的时候,转成 embedding 做点积

    • 用户兴趣:用户属性 + 历史行为,过 LLM 生成兴趣描述
    • 商品标签: 根据用户兴趣预测用户需求(对应的就是商品标签)
    • 三塔召回:用户兴趣 x 商品标签 x 商品
  • LLM 如何训练?基于 Qwen-14B 微调,用了 DeepSeek-R1 合成,以及真实线上的用户交互数据做训练;

  • 最后三塔通过 DNN 和 token embedding 的 weights 做联合训练;

image

7. LLM-Style Latent Transformers for Temporal Events

Meta 2026.01: LLaTTE: Scaling Laws for Multi-Stage Sequence Modeling in Large-Scale Ads Recommendation

  • 又是 Meta!在 2026 年发布的 paper 里讲的是如何把用户序列模型的收益,带到低延迟广告排序里。

整体思路是采用两阶段模型:

  • Async: 输入是用户长历史,输出是用户兴趣表征 user embedding
  • Sync: 输入是最新历史、候选、上下文,输出是 CTR

两个模型结构做了级联,好处是长历史可以复用,低频执行,坏处是两阶段模型不够本质,近期行为无法和历史行为做足够的交叉。

image