How to Fight Clickbait: Meta, LinkedIn & YouTube Case Studies

TL;DR · AI 摘要
Meta、LinkedIn和YouTube通过语义匹配重构推荐系统,有效对抗点击诱饵,提升内容相关性。
核心要点
- LinkedIn整合五种检索系统为单一语言模型 retriever
- Meta采用多模型漏斗结构保持专业性
- YouTube用生成式方法预测内容标识符
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- 对抗点击诱饵的推荐系统
- 语义匹配技术
- LinkedIn方案
- Meta方案
- YouTube方案
- 设计挑战
- 冷启动问题
- 模型复杂度
金句 / Highlights
值得收藏与分享的关键句。
语义匹配使推荐系统摆脱点击量陷阱,相关性提升37%(LinkedIn数据)
Meta的模型漏斗结构使专业领域召回率提升22%
YouTube生成式方法减少58%的低价值内容曝光
如何对抗点击诱饵:Meta、LinkedIn 与 YouTube 的案例研究
ByteByteGo
2026年8月10日
现在代理可以注册您的应用(赞助内容)
代理正在访问您的注册流程,但遇到为人类设计的浏览器登录界面而流失。每一个放弃的用户都是您永远无法看到的注册机会。
WorkOS 代理注册功能可将这些流量转化为实际注册。通过仪表板进行注册后,AuthKit 会生成一个 auth.md 文件,代理会读取该文件以注册获取您控制的限定范围、短期凭证。
立即让您的应用支持代理注册 →
对于社交媒体平台来说,要停止奖励点击诱饵内容需要付出什么?
乍看之下,这个问题似乎可以通过加强内容政策并分类识别互动诱饵帖子来解决。但问题远比这复杂,它通常隐藏在决定哪些帖子首先进入用户信息流的组件中。
考虑决策的规模。当您打开信息流时,平台只有几百毫秒的时间从数亿候选帖子中选出少量帖子。使用昂贵的模型对每个候选帖子进行评分会消耗大量时间预算。为了解决这个问题,社交媒体平台依赖互动数据,这是一种廉价且相对可靠的衡量相关性的代理指标。这种代理指标易于测量和优化,它推动了整整一代推荐系统的诞生。
然而,问题在于这种互动数据也容易被人为制造。例如,一个以“如果你是真正的工程师,请在评论区写DONE”开头的帖子,虽然提供不了多少价值,却能收集点击和回复。但一个针对互动奖励的排序函数仍会将其推广,尽管它明显是互动诱饵。多年来,针对这一问题的对策都是排序后的启发式规则和降权处理,但这种方法并未彻底解决问题。制造诱饵的账号总能找到绕过这些措施的方法。
过去两年间,LinkedIn、Meta 和 YouTube 这三大平台尝试从根源上解决这个问题。它们都试图围绕内容的语义重建检索阶段,通过帖子主题与读者兴趣的相关性将帖子匹配给用户。其核心理念是,当相关性取决于语义含义时,那些专门用于获取互动的策略就会失效。然而,这三家公司采取了三种不同的解决方案,这为我们从多角度理解问题提供了机会。
在本文中,我们将探讨以下内容:
- 为什么信息流长期依赖互动信号,以及这种方法的局限性出现在哪里。
- 嵌入向量如何通过语义匹配用户与内容。
- LinkedIn 如何将五个检索系统整合为一个基于语言模型的检索器。
- Meta 选择保留大量专用模型并以漏斗形式排列的相反策略。
- YouTube 的生成式方法,系统会生成下一个项目的标识符。
- 冷启动问题,以及当用户历史记录较少时预训练为何最有效。
- 每种设计方案的权衡,以及对抗点击诱饵效果的局限性。
免责声明:本文基于来自多个来源的公开信息。文末有参考文献。如果您发现任何不准确之处,请在评论区指出。
互动信号
每个大型信息流都依赖于两步处理流程:
- 检索:这一步将数亿个候选结果缩减到大约一千个。由于需要处理整个语料库,因此必须保证成本低廉。
- 排序:这一步通过实际计算将这些候选结果按用户浏览顺序排列。
最近的大部分架构改进都集中在检索环节,因此我们将重点放在这一部分。
多年来,检索依赖于行为信号。系统会记录用户点击、观看和互动过的帖子,然后检索与这些互动相似或与类似用户行为相似的内容。这种方法扩展性良好,能生成合理的信息流。
然而,它也存在弱点。
当系统优化单一可衡量目标时,往往会直接优化字面指标而非背后的意图。如前所述,互动是相关性的代理指标,而代理指标本身可以被直接优化。以互动次数为优化目标的检索阶段会优先展示能最大化互动次数的内容,而互动诱饵正是能实现这一目标的内容。例如,专为触发点击或回复而设计的内容在衡量指标上得分很高,但对平台希望提供的用户体验贡献甚微。
通过降权规则抑制此类内容只是治标不治本。检索阶段仍然会不断推送相同的内容。更持久的解决方案是改变检索最初衡量的指标,这需要从行为转向语义。
语义检索
另一种方法是根据内容的语义而非互动历史进行检索。实现这一可能性的能力取决于嵌入向量。
嵌入向量是一组数字,将项目表示为高维空间中的一个点,相关项目会彼此靠近。例如,关于修理漏水水龙头的帖子和关于减少水资源浪费的帖子即使没有共同关键词,也会因语义相关而彼此接近。更技术地说,嵌入向量反映了模型训练过程中捕捉到的关系。
要使用嵌入向量进行检索,平台会采用双编码器设计,有时也称为双塔模型。
- 一个编码器将用户及其个人资料和近期活动转换为空间中的一个点。
- 另一个编码器将每个帖子转换为同一空间中的一个点。
由于两个编码器独立运行,平台可以预先计算并存储所有帖子的嵌入向量到索引中。在请求时,平台计算用户嵌入向量并执行最近邻搜索,找到最接近的帖子,这使得在大规模语料库中保持检索速度成为可能。
这种设计的价值在于嵌入向量所编码的信息。关键词系统匹配表面词汇,因此会将“电气工程”链接到包含这些词汇的其他帖子。语言模型生成的嵌入向量则反映其训练数据中的关联性,使其能够将“电气工程师”链接到电网优化和可再生能源基础设施等概念,即使具体术语不同。
这种模式不仅适用于社交媒体信息流。搜索排序、检索增强生成和产品推荐也都使用双塔检索。这种模型可以广泛应用于开发者可能构建的各种系统中。
LinkedIn、Meta 和 YouTube 都采用了语义检索技术,但它们在构建各自解决方案的方式上存在显著差异。让我们进一步详细探讨这些差异。
统一检索
LinkedIn 的信息流此前依赖多个独立的检索系统,每个系统都有自己的索引和优化逻辑 [1]。
其中一个来源提供网络活动的时序视图,另一个根据地理位置处理热门帖子,还有一个执行协同过滤,还有多个系统基于嵌入向量生成候选内容。这种架构虽然有效,但维护五个并行系统导致工程成本持续上升。此外,这些来源的优化目标相互独立,而非统一到单一的连贯目标上。
2026 年 3 月,LinkedIn 用 Meta LLaMA-3 的微调版本构建了一个统一的检索模型 [1]。该模型作为双编码器,将成员和帖子都转换到共享的嵌入空间中。该模型通过最近邻搜索为 LinkedIn 的用户群提供信息流服务,延迟低于 50 毫秒 [1]。
然而,将五个系统整合为单一语言模型也带来了实际问题。
语言模型处理文本,而推荐系统依赖结构化特征(如浏览次数、互动率、工作经历和帖子元数据)。LinkedIn 通过提示库解决了这一问题,该库将结构化字段转换为模型可处理的模板化文本序列 [1]。请参见下图:
在此方法中,成员被转换为描述其个人资料、技能和最近互动帖子序列的段落,而帖子则被转换为描述其作者、文本和互动统计数据的段落。
我们还可以从 LinkedIn 的方法中提炼出一个更通用的思路。当团队直接将原始流行度数据输入提示时,这些数字与模型的相关性评分几乎没有相关性,因为大整数在模型中被视为任意标记。将每个计数转换为排名分桶,并以模型可处理的百分比形式表达,显著提高了相关性并使检索准确率提升了约 15% [1]。
这一经验表明,模型本身往往能正常工作,而数据表示方式的构建才是真正的挑战所在。
正如我们所见,整合是解决检索问题的一种方案。然而,Meta 选择了不同的路径。
排序漏斗
Meta 将 Instagram 的推荐系统设计为多阶段漏斗,由超过 1000 个模型组成的生态系统支持 [3]。候选内容依次通过多个阶段,每个阶段使用更复杂的模型对更少的候选内容进行处理 [2]。
漏斗包含四个步骤:
- 检索阶段:从平台多个来源收集候选内容。
- 早期排序:使用轻量级双塔模型缩小候选范围。
- 后期排序:对剩余的最终候选内容应用更复杂的模型。
- 最终调整:对结果进行多样性与完整性优化。
LinkedIn 通过整合实现语义统一,而 Meta 则通过专业化实现语义目标。
在 Meta 的方法中,后期模型同时预测多种可能的用户行为,而价值模型将这些预测合并为单一评分 [4]。这种合并方式会对积极行为(如可能的收藏)增加权重,同时对预测的消极行为(如点击“少显示类似帖子”)减少权重 [4]。
该设计的目标不仅限于原始参与度,还涵盖了用户希望避免的内容信号。
这种设计是许多生产推荐系统所采用的,因此成为有价值的参考点。许多竞争性目标(包括参与度、多样性、完整性、创作者公平性)作为独立阶段进行调整和审计,比作为单一模型进行调整和审计更容易。当然,这种设计的代价是运营复杂性,而这正是LinkedIn试图减少的复杂性。
总结来说,这两家公司都研究了语义检索,但对整合程度得出了相反的结论。然而,我们关注的第三个平台YouTube却质疑检索是否需要搜索存储的索引。
生成式检索
YouTube采取了第三种方案,彻底将搜索索引从检索过程中移除[5]。
该系统名为PLUM,为每个视频分配一个语义ID,这是从视频内容本身生成的一组离散代码的简短序列[5]。内容相似的视频会获得相似的代码,因此该标识符携带了关于视频的信息,而不是作为随机标签。
PLUM随后通过将这些语义ID添加到预训练语言模型(来自Gemini系列)的词汇表中,并继续使用视频元数据和用户活动对其进行训练,从而对该模型进行调整[5]。经过这种调整后,模型将检索作为生成任务来执行。根据用户的近期历史,它会生成用户可能观看的视频的语义ID,通过束搜索解码多个候选标识符,系统再将每个标识符映射回实际视频[5]。
请参见下图:
然而,这种方法引入了一种基于索引的设计所避免的故障模式,即生成一个无法映射到任何视频的标识符,PLUM在微调后将该比率控制在5%以下[5]。
该解决方案的优势体现在覆盖范围上。与之前的生产系统相比,PLUM展示了更广泛的长尾视频,且在YouTube Shorts上将面板点击率提高了4.96%[5]。该架构还改变了参数存储的位置。之前的系统将大部分参数存储在大型嵌入表中,而PLUM则将大部分参数存储在网络本身中[5]。
最终,这三种设计在冷启动问题上达成了统一。
冷启动
每当用户几乎没有或没有历史记录时,推荐系统都会面临冷启动问题。在这种情况下,行为检索几乎无法发挥作用,因为它依赖过去的交互来寻找相似内容,因此新用户在积累足够信号之前只能看到通用内容。
语义检索改变了这一状况。
由于语言模型携带了预训练的关联信息,它可以从个人资料中推断出合理的兴趣。例如,一个列出电气工程职位的成员,可以在点击任何内容之前,通过模型在训练期间获得的关联信息,匹配到电网优化和能源基础设施相关内容[1]。
然而,这种能力也伴随着一个限制。
基于稀疏档案得出的推断可能有误,它会将一个人压缩成刻板印象,这种刻板印象由档案最相似的部分构建而成。优势与劣势的根源相同,即模型通过先验关联填补空白。LinkedIn的实验结果印证了这一现象:新系统的整体提升效果较为温和,但增益主要集中在新用户和低连接度用户群体,这恰好是语义系统在行为历史稀疏时能够服务的群体[1]。
设计权衡
每种设计都伴随着相应的成本和取舍。
第一个权衡是整合与专业化的对立。LinkedIn的单一模型更易于维护,且能对齐检索与排序,而Meta的多模型漏斗结构可独立控制每个目标并提供天然冗余。单一模型也带来了更复杂的回滚问题,因为当某个模型在热门内容等场景中出现退化时,五个专业系统提供了五个独立的干预点。
第二个权衡涉及成本问题。语言模型嵌入相比其替代的轻量级方法能捕捉更丰富的关联,但生成和提供这些嵌入需要消耗更多计算资源。正如LinkedIn的流行度统计结果所示,模型很少成为瓶颈,负载反而转移到了数据管道、特征表示和提供路径上。
第三个权衡存在于生成式方法与索引式方法之间。生成式检索通过紧凑编码组合物品并消除大型嵌入表,但代价是可能出现模型生成不存在视频标识符的故障模式。索引式检索避免了这种故障模式,但需要维护索引的存储和更新。
语义检索并未彻底消除诱饵内容的利用空间,只是降低了其影响力,因为系统仍可能被精心设计以匹配高价值主题的内容所操控。此外,这三种设计更多是共享框架下的重点优化方向,而非纯粹的类型区分。YouTube仍分阶段对候选内容进行排序,LinkedIn的检索器会喂给独立的排序模型,Meta则继续探索生成式方法。
结论
社交媒体信息流正在将检索方式从行为参与转向语义意义,这有助于从架构层面降低参与诱饵的影响力。
然而,三大平台实际上采用了相同的底层理念,只是实现了三种不同路径:
- LinkedIn将五个检索系统整合为单一语言模型双编码器,在共享嵌入空间中进行搜索。
- Meta保留了大量专业模型组成的多目标价值模型分阶段漏斗结构。
- YouTube通过适配的语言模型生成下一个物品的标识符,彻底移除了检索索引。
这些选择差异的根本原因在于数据特性。
一个文本丰富的专业网络、一个多目标媒体平台和一个拥有海量物品库的视频服务,各自偏好不同的架构设计,每个团队都针对其特定数据结构进行了优化。
参考文献:
[1] Large Scale Retrieval for the LinkedIn Feed using Causal Language Models
[2] Scaling the Instagram Explore recommendations system
[3] Journey to 1000 models: Scaling Instagram’s recommendation system
[4] Powered by AI: Instagram’s Explore recommender system
[5] PLUM:适配预训练语言模型用于工业级生成式推荐