news 2026/8/3 14:06:37

生成式推荐系统ETEGRec:从动态分词到端到端训练

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
生成式推荐系统ETEGRec:从动态分词到端到端训练

1. 从传统推荐到生成式推荐的范式转变

推荐系统在过去十年经历了三次明显的技术迭代。早期的协同过滤(Collaborative Filtering)方法依赖用户-物品交互矩阵,通过矩阵分解挖掘潜在特征。2016年后,深度神经网络开始主导推荐领域,Wide&Deep、DeepFM等模型通过特征交叉提升了点击率预测准确率。而当前最前沿的生成式推荐(Generative Recommendation)则完全改变了问题定义——它不再预测用户对现有物品的偏好概率,而是直接生成符合用户兴趣的新物品序列。

这种范式转变带来两个核心挑战:首先,传统推荐模型依赖预定义的特征工程,难以捕捉物品描述的语义信息;其次,生成式推荐需要端到端地理解用户行为序列与物品文本的深层关联。这正是ETEGRec模型的创新切入点——通过端到端可学习的物品分词(Tokenization)技术,将离散的文本描述转化为连续语义空间中的向量表示,使生成过程能够直接操作语义单元。

2. ETEGRec的架构设计与核心创新

2.1 动态物品分词机制

传统推荐系统通常使用预训练的词嵌入(如Word2Vec)或固定分词器(如BERT的WordPiece),这些方法存在词汇表外(OOV)问题和语义粒度不匹配的缺陷。ETEGRec提出了一种可微分分词器(Differentiable Tokenizer),其关键实现包括:

  1. 字符级卷积编码器:对物品标题/描述进行字符级卷积,生成n-gram特征图。以"智能手机"为例,3-gram卷积核会捕获"智能"、"能手"、"手机"等局部特征。

  2. 动态聚合门控:通过可学习参数决定哪些n-gram应该合并为语义单元。公式表示为:

    g = σ(W_g · [h_i; h_j] + b_g)

    其中h_i, h_j为相邻n-gram的向量表示,σ为sigmoid函数,当g>0.5时执行合并。

  3. 词袋约束损失:为防止分词结果偏离自然语言结构,添加基于TF-IDF的重构损失:

    L_bow = ||BOW(x) - BOW(decoder(tokens))||^2

这种设计使得模型能够根据下游推荐任务自适应地调整分词粒度。例如在电商场景中,"iPhone 13 Pro Max"可能被整体作为一个token,而在长尾商品推荐时则可能拆分为"iPhone"和"Pro Max"两个语义单元。

2.2 生成式推荐的三阶段训练

ETEGRec采用分阶段训练策略解决端到端学习的优化难题:

阶段一:语义空间预训练

  • 使用海量物品描述文本训练分词器
  • 采用掩码语言建模(MLM)目标,随机遮盖15%的字符
  • 关键技巧:对高频商品名采用实体保护策略,避免过度拆分

阶段二:用户行为对齐

  • 冻结分词器参数
  • 用用户交互数据训练序列推荐模块
  • 引入课程学习(Curriculum Learning),先训练头部商品,逐步加入长尾商品

阶段三:端到端微调

  • 联合优化分词器和推荐器
  • 采用强化学习策略,用NDCG作为reward信号
  • 梯度裁剪阈值设为1.0防止分词器崩溃

3. 关键技术实现细节

3.1 基于Transformer的序列建模

ETEGRec的生成模块采用改进的Transformer架构:

  1. 相对位置编码:替换原始正弦位置编码,解决长序列推荐中的位置敏感性问题。计算公式为:

    e_{ij} = (q_i + a_{ij})^T k_j

    其中a_{ij}表示物品i到j的相对位置偏置。

  2. 稀疏注意力机制:使用局部敏感哈希(LSH)将复杂度从O(n²)降至O(n log n),使模型能处理500+长度的用户历史序列。

  3. 温度采样策略:在推理阶段采用动态温度softmax:

    p_t = softmax(logits / τ_t) τ_t = max(0.1, 1.0 - t/1000)

    随着生成步数t增加逐渐降低温度,平衡探索与利用。

3.2 多任务损失设计

模型同时优化三个损失函数:

  1. 生成损失:标准交叉熵,衡量生成序列与真实交互序列的差异

  2. 多样性正则项:惩罚重复生成相似商品

    L_div = -log det(S^T S + λI)

    S为生成序列的embedding矩阵

  3. 因果一致性约束:确保生成的第t个物品只依赖前t-1个物品

    L_causal = ∑_{t=2}^T ||h_t - stop_grad(h_{t-1})||^2

4. 实战效果与调优经验

在Amazon商品数据集上的测试表明,ETEGRec相比传统方法有显著提升:

指标SASRecBERT4RecETEGRec
NDCG@100.4120.4380.487
多样性(Entropy)2.312.453.02
冷启动覆盖率18.7%22.3%34.5%

在实际部署中我们总结了以下经验:

  1. 分词粒度控制:通过调整卷积核大小和合并阈值来适配不同领域。例如:

    • 电商场景:3-5gram卷积核,合并阈值0.6
    • 新闻推荐:2-3gram卷积核,合并阈值0.4
  2. 内存优化技巧

    • 对商品embedding使用PQ量化,将1.2GB的模型降至300MB
    • 使用FAISS进行最近邻搜索加速
  3. 在线服务策略

    • 采用两阶段生成:首先生成100个候选,再用精排模型筛选top10
    • 对高活跃用户启用实时分词器更新,每日增量训练

5. 典型问题排查指南

问题一:生成结果重复率高

  • 检查多样性正则项权重(建议0.1-0.3)
  • 验证温度采样策略是否生效
  • 分析用户历史序列是否过于集中

问题二:长尾商品曝光不足

  • 调整课程学习的阶段过渡节奏
  • 在损失函数中添加逆频率加权
  • 检查分词器是否过度拆分长尾商品名

问题三:推理速度慢

  • 将LSH桶数从默认64增至128
  • 启用TensorRT加速Transformer层
  • 对低频用户采用缓存策略

一个实际案例:某视频平台部署ETEGRec后,发现动漫类推荐质量下降。根本原因是日语片假名被拆分为单个字符。解决方案是在预训练时添加动漫标题语料,并设置片假名保护规则。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/3 14:05:55

Qobuz-DL终极指南:轻松获取无损高解析音乐的完整方案

Qobuz-DL终极指南:轻松获取无损高解析音乐的完整方案 【免费下载链接】qobuz-dl A complete Lossless and Hi-Res music downloader for Qobuz 项目地址: https://gitcode.com/gh_mirrors/qo/qobuz-dl 你是否渴望拥有录音室级别的无损音乐收藏,却…

作者头像 李华
网站建设 2026/8/3 14:04:00

科学运动系统构建:从目标设定到损伤预防的完整指南

1. 项目概述:从“动起来”到“科学地动起来” “运动”这个词,听起来太简单了,简单到我们每个人每天或多或少都在进行。从早上起床伸个懒腰,到通勤路上快走几步,再到健身房里的挥汗如雨,它无处不在。但作为…

作者头像 李华
网站建设 2026/8/3 14:03:01

抖音批量下载终极指南:3分钟掌握高效内容收集神器

抖音批量下载终极指南:3分钟掌握高效内容收集神器 【免费下载链接】douyin-downloader A practical Douyin downloader for both single-item and profile batch downloads, with progress display, retries, SQLite deduplication, and browser fallback support. …

作者头像 李华
网站建设 2026/8/3 14:02:16

决策树算法全解析:从原理到实战调优与集成应用

1. 从“如果…就…”到数据洞察:决策树的本质与价值 如果你曾经玩过“二十个问题”这个游戏,或者看过一些流程图式的“傻瓜式”操作指南,那么你已经接触过决策树最朴素的思想。在数据科学和机器学习的工具箱里,决策树(…

作者头像 李华
网站建设 2026/8/3 14:01:47

ExifToolGui终极指南:3步掌握照片批量重命名与元数据管理

ExifToolGui终极指南:3步掌握照片批量重命名与元数据管理 【免费下载链接】ExifToolGui A GUI for ExifTool 项目地址: https://gitcode.com/gh_mirrors/ex/ExifToolGui ExifToolGui是一款功能强大的Windows图形界面工具,专门为摄影师和图像管理者…

作者头像 李华