桃子桃子快讯
返回首页
研究论文

Netflix 发布 GenRec:基于自研 LLM 的推荐排序系统

Netflix 公开论文 GenRec,介绍基于内部基础 LLM 的推荐排序器,两阶段训练并在 A/B 测试中以更少标注…

2026.08.28 · 周五3 分钟阅读

Netflix 在 arXiv 公开论文《GenRec: An LLM-Backed Recommendation Ranker at Netflix》,介绍其基于自研基础大模型构建的推荐排序系统 GenRec。该论文聚焦推荐链路中的排序环节,探索以自然语言形式直接建模用户、内容与上下文,相较传统依赖大量人工特征工程的判别式排序器,是一种新的范式尝试。

两阶段训练框架

GenRec 采用两阶段方案构建排序能力:

  • 第一阶段:以开源 LLM 为起点,使用 Netflix 内部数据进行继续预训练,使其深入理解目录内容与用户行为,同时兼顾内容理解与指令跟随等通用能力。
  • 第二阶段:在第一阶段所得基础模型上,用推荐排序专有的数据、标签与奖励信号进行后训练(post-training),使模型对齐业务目标与长期用户满意度。

论文重点描述了第二阶段的工作,包括输入「语言化」(verbalization)与上下文工程、后训练数据构建、奖励整合、模型架构选择,以及在成本约束下基于「仅 prefill」推理的服务方案。

从特征工程到上下文工程

传统排序模型依赖数千个手工构造的特征。GenRec 则以「语言化」的用户历史与上下文驱动排序,作者将这一转变概括为:

  • 从特征工程(feature engineering)转向上下文工程(context engineering);
  • 从为推荐任务定制的专属架构转向共享的基础模型主干(shared foundation backbones)。

这一思路的关键收益在于:模型可以利用 LLM 本身在语言理解、长上下文建模与泛化上的能力,潜在减少对领域特征工程的投入。

A/B 测试与核心结果

论文报告了一项大规模 A/B 实验,将 GenRec 与当前线上生产排序模型对比。结果显示:GenRec 在第二阶段使用的标注训练样本与输入信号显著更少的前提下,仍在离线与在线指标上取得了统计显著的提升。作者将这一现象归因于预训练阶段积累的内容理解与用户行为建模能力。

工程实践与成本权衡

在生产部署层面,论文讨论了真实资源约束下的服务设计。具体而言,GenRec 采用 prefill-only 推理路径,避免完整 decode 带来的时延与算力开销,从而在可控成本下将 LLM 引入排序主链路。作者也分享了若干实操经验,例如输入长度管理、上下文压缩策略与推理批处理技巧,供业界团队参考。

局限与意义

GenRec 仍是 Netflix 内部的探索方向,目前论文仅聚焦排序环节而非召回或重排全链路;同时,仅靠 A/B 指标验证并不能完全回答长期用户满意度与内容生态影响等问题。但作为头部流媒体平台公开的一手工业实践,该论文为「LLM 能否替代传统推荐架构」这一争论提供了真实场景下的工程数据与思路样本。

原文链接:arXiv:2608.10257 [cs.IR],DOI: 10.48550/arXiv.2608.10257。

信源