引言:一个经典的"细思极恐"时刻
你刚和朋友聊完某样东西,打开手机App,发现推荐页上赫然出现了它。
这一刻,你可能会觉得毛骨悚然——“手机在监听我”。
但真相比这更微妙,也更值得玩味。推荐系统大概率没有在监听你的对话——它只是通过你的行为数据,推测出了你此刻可能感兴趣的东西。而它之所以能"猜中",靠的不是读心术,而是一个简单到令人惊讶的统计技巧。
更扎心的是:这个技巧和"理解你"几乎没有关系。它只是发现了你和其他人之间的"模式相似性"。
一、推荐系统的"原始版本":买了这个的人也买了那个
故事要从电商说起。
2003年,亚马逊的工程师们面临一个现实问题:Amazon上有几千万用户和几亿件商品,如何给每个用户推荐他们可能感兴趣的东西?
当时的推荐算法有两种主流思路:
第一种:找"和你相似的人"(User-based协同过滤)。 如果你和另外100个人的购物历史高度重合,那这100个人买了但你还没买的东西,很可能也是你想要的。这个思路听起来很合理,但有一个致命问题——计算"用户之间的相似度"需要遍历所有用户,当用户量达到几千万时,这个计算量会爆炸。
第二种:找"和这个商品相似的商品"(Item-based协同过滤)。 亚马逊提出的方案是:不比较用户,只比较商品。 如果买了A的用户中,有很大比例也买了B,那就说A和B"相似"——下次有人买A时,就推荐B。
这个思路的精妙之处在于:商品的数量远少于用户的数量(至少在当时如此),所以计算"商品之间的相似度"比计算"用户之间的相似度"快得多。而且商品之间的关系相对稳定——今天"手机和手机壳"是搭配的,明天大概率还是。
亚马逊把这个方法落地后,效果出奇的好。直到今天,你打开淘宝看到的"买了这个的人也买了那个",本质上还是这个思路的变种。
但问题来了:这个方法真的"理解"你了吗?
想象一下,你买了一部手机,但没买手机壳,因为你觉得太贵了。推荐系统告诉你"买了手机的人也买了手机壳"——它给出了一个看似"合理"的推荐,但对你来说,这个推荐恰恰是你不想要的。
推荐系统不知道你为什么不买手机壳。它只知道"很多人同时买了这两样东西"。 它捕获的是统计共现,不是因果理解。
二、从"猜你喜欢"到"让你上瘾":推荐系统如何进化
2003年的协同过滤虽然好用,但有一个明显的缺陷:它只能推荐"看起来像你已经买过的"东西。 它无法发现你"潜在的可能喜欢但从未接触过"的东西。
这就好比一个图书管理员,只推荐你"借过这本书的人也借了那本书"——但如果你从未借过科幻小说,他永远不会推荐你任何科幻作品,即使你可能会喜欢。
2016年,Google的工程师们提出了一个更聪明的方案:Wide & Deep(宽深模型)。
这个名字听起来很技术,但它的核心思想其实很简单:“记忆"和"泛化"要配合使用。
- “记忆"部分:记住那些已经被验证过的组合——比如"喜欢iPhone的人通常也喜欢AirPods”。这部分和2003年的协同过滤类似,但做得更精细。
- “泛化"部分:学习用户行为的"深层模式”——比如"喜欢简约设计手机的人,可能也喜欢简约设计的耳机、手表、甚至家具”。这部分通过深度学习实现,可以从用户的行为数据中"归纳"出用户看不见的偏好。
这个模型在Google Play商店上线后,App购买率提升了3.9%。这个数字听起来不大,但放在Google Play的体量上,意味着每天多出数百万次应用下载。
从此,推荐系统从"猜你喜欢"进化到了"创造你喜欢"——它不再只是推荐你已知的东西,而是开始引导你的偏好。
三、但AI真的"懂"你吗?
到这里,我们似乎已经有一个很强大的推荐系统了——它既记得住你的历史偏好,又能发现你潜在的兴趣。听起来像是"很懂你",对吧?
但让我们停下来想想:推荐系统学到的"你",和真实的"你",有多大的差距?
差距一:你的行为不是你。
你点开了一个视频,可能不是因为喜欢,而是因为封面太夸张。你买了某件商品,可能不是因为需要,而是因为打折。你收藏了一篇文章,可能不是因为想读,而只是因为"先马后看"。
但推荐系统不知道这些区别。 它只知道"你点了"、“你买了”、“你收藏了”——它把你的行为当成了你的偏好。推荐系统建立一个"你"的模型,但这个模型只是你行为的统计学投影,不是你真实的内心。
差距二:相关性不等于因果性。
推荐系统的核心假设是"过去的行为能预测未来的偏好"——但这个假设有一个巨大的漏洞:相关性不等于因果性。
你喜欢看推理小说,可能不是因为"推理"这个标签,而是因为"喜欢解谜的感觉"。但推荐系统只知道"你买了推理小说"这个行为,于是它给你推荐更多推理小说,而忽略了也许你也会喜欢数学谜题、密室逃脱、甚至悬疑类游戏。
推荐系统在"行为的表面"上构建偏好模型,却没有触及"行为背后的动机"。
差距三:你看到的,只是"你"的某一个侧面。
推荐系统会根据你的最近行为,动态调整推荐策略。你今天搜了"考研",明天整个App就变成了考研资料库;你今天看了几条搞笑视频,后天首页全是搞笑内容。
这不是"AI懂你",而是AI把你的某一个行为放大成了你的全部画像。它不像一个了解你的朋友,而像一个只看了你最近几条朋友圈就来下结论的陌生人。
四、推荐系统真正在做的事
所以,推荐系统到底在做什么?
答案是:它不是在做"心理学",而是在做"统计学"。
它不关心你"为什么"喜欢某样东西,它只关心"和其他人相比,你表现出了哪些相似的行为模式"。它的核心逻辑是:
如果你和A组用户有80%的行为重合,那么A组用户剩下的20%行为,大概率也是你想要的。
这是一个纯粹的"模式匹配"过程。它不需要理解你的情感、动机、价值观——它只需要发现行为模式之间的相似性。
这听起来很"机械",但效果出奇的好。 为什么呢?
因为人类的行为模式,在统计学层面上,远比我们想象的要稳定和可预测。我们以为自己很独特,但在推荐系统的眼里,你只是"模式123456"的一个实例——你的偏好,已经被无数个和你相似的人"预演"过了。
五、问题不在推荐系统,而在于"什么被推荐"
推荐系统本身没有好坏——它只是一个工具。问题在于它被用来做什么。
当推荐系统用来帮你发现新的兴趣时,它是有益的。当它被用来固化你的兴趣时,就变成了"信息茧房"的制造者。
你刷抖音时,每点一个"喜欢",系统就记录下这个信号,然后给你推荐更多类似的内容。久而久之,你看到的永远是你"已经喜欢"的东西,而"可能喜欢但还没见过"的东西,永远没有机会出现。
推荐系统的"泛化"能力,被商业目标收窄了。
Google的Wide & Deep模型在论文中说"记忆"和"泛化"互补——但在实际应用中,商业平台更倾向于"记忆"(因为已经验证过的推荐能带来更高的点击率),而"泛化"(推荐用户可能不熟悉的内容)往往被压缩到最低限度,因为"冒险"意味着可能流失用户。
结语:推荐系统的"镜像"与"盲区"
下次你打开淘宝或抖音,看到"猜你喜欢"的推荐时,可以想一想:你看到的不是"AI眼中的你",而是AI根据你的行为数据,重建出的一个统计学模型。
这个模型很精准,但它有一个盲区——它永远无法理解"你为什么喜欢"。
它知道你喜欢看推理小说,但不知道你是因为喜欢解谜、还是因为喜欢悬疑氛围、还是因为这本小说是朋友推荐的。它只告诉你"你喜欢的",但不告诉你"你为什么喜欢"。
而这,恰恰是推荐系统下一步进化的方向——从"猜你喜欢什么"到"理解你为什么喜欢"。当AI开始追问"为什么"的时候,推荐系统才真正从"统计魔法"走向"认知理解"。
但在此之前,请记住:推荐系统不是你的影子,而是你行为的一面镜子。镜子里的人,不是你,是你做过的事。
参考资料
- Linden, G., Smith, B., & York, J. (2003). “Amazon.com Recommendations: Item-to-Item Collaborative Filtering.” IEEE Internet Computing, 7(1), 76-80. https://doi.org/10.1109/MIC.2003.1167344
- Cheng, H. T., et al. (2016). “Wide & Deep Learning for Recommender Systems.” DLRS 2016. https://arxiv.org/abs/1606.07792
- 本文核心论证素材来源于论文论证卡库推荐系统领域:Amazon协同过滤论证卡、Wide & Deep论证卡,经Ω-CFI审查框架校验。