返回博客

亚马逊误将买家当作机器人:8条商品评价及其对所有爬虫用户的影响

在2026年8月初,亚马逊开始将评论的发放限制为八条,针对那些被其反机器人系统视为抓取者的用户——这影响到了没有VPN和自动化的真实买家。这与针对AI代理Perplexity的法院禁令的取消相吻合。我们来分析一下,为什么平台从封锁转向内容的静默退化,这对数据收集意味着什么。

📅2026年8月10日
亚马逊误将买家当作机器人:8条商品评价及其对所有爬虫用户的影响

在2026年8月初,数十名亚马逊的买家发现,他们在商品页面上只能看到八条评论——没有排序,没有过滤,也无法查看其他评论。没有任何警告。客服解释称,这是由于“在收集和提取社区内容方面违反了使用条款”。也就是说,平台将真实用户误认为了爬虫。

如果没有与另一个事件的日期重合,这个故事本身看起来会很滑稽:2026年8月4日,第九巡回上诉法院撤销了亚马逊对AI代理Perplexity Comet的禁令。与自动化斗争的法律途径出现了故障——几乎同时,技术上的限制却急剧加强。我们来分析一下究竟发生了什么,以及为什么这改变了所有收集公共数据的人的游戏规则。

发生了什么:八条评论和五天的上诉

关于大规模限制的消息在2026年8月3日至4日由TechSpot、Android Authority和Shopifreaks报道。受影响者的情况都是一样的:

  • 任何商品上只能看到8条评论,而不是完整列表;
  • 评论的排序和过滤工具消失;
  • 没有限制通知——用户自己发现;
  • 要解除限制,必须联系支持团队,并等待最多五个工作日的回复。

其中一位受害者,弗雷德·霍尔,在7月中旬研究空气净化器时遇到了限制。聊天客服提到违反了有关提取用户内容的使用条款;几天后,上诉被批准,但没有任何解释。第二个案例更具代表性:肖恩·考夫曼在所有商品上都遇到了同样的八条评论限制。他没有使用VPN、广告拦截器或AI浏览器——他唯一的特点是长时间比较竞争商品并仔细阅读评论。亚马逊给他提供了10美元的账户补偿,并在五天后恢复了访问权限。

公司的官方评论是:“我们理解,可能会有个别情况,客户无法访问评论,我们正在努力确保访问。”与此同时,亚马逊拒绝透露任何实质性细节:既没有受影响账户的数量,也没有触发检测器的行为,没有限制开始的日期,也没有上诉审查的原则。根据讨论,自2025年11月以来就有个别投诉——这意味着该机制早已在运行,而在8月只是变得显而易见。

为什么是现在:法院剥夺了亚马逊的便利工具

要理解背景,需要了解亚马逊与Perplexity之间的冲突时间线。

  1. 2024年11月——2025年11月。 亚马逊声称已向Perplexity发送了不少于五次警告,要求停止代表用户进行代理购买。
  2. 2025年8月。 亚马逊对Comet设置了技术障碍。根据亚马逊的说法,Perplexity在24小时内发布了绕过措施,将其代理伪装成普通的Chrome会话,而不是诚实地自我介绍。
  3. 2026年3月10日。 法官麦克辛·切斯尼在旧金山发布了初步禁令:Comet不能进入亚马逊的受密码保护的部分并代表用户进行购买。关键表述是——代理“在亚马逊用户的授权下行动,但没有亚马逊的授权”。
  4. 2026年8月4日。 第九巡回法院撤销了禁令。法院认为亚马逊不太可能在《计算机欺诈和滥用法案》下获胜:当用户委托助手执行任务时,访问亚马逊服务器的是用户本人而不是Perplexity。CFAA要求证明故意的未授权访问和每年超过5000美元的损害——法院没有看到这些要素。

亚马逊回应称“尊重地不同意”这一决定,并保留请求复审的权利。旧金山的案件并未关闭——仅撤销了初步禁令。但市场已经发出了信号:试图将代理的行为等同于黑客行为在法庭上尚未成功。

顺便提一下,Perplexity一直坚持认为,诉讼保护的不是安全,而是广告收入:代理购买商品时,绕过了用户所看到的广告展示。这个论点并不那么牵强:亚马逊的广告业务在2025年时估计价值560亿美元,而所有这些收入都依赖于真实买家亲自浏览商品。

当法院无能为力时,平台还能做什么

亚马逊早已在两个战线上并行作战。除了诉讼,公司还通过robots.txt逐步关闭对AI爬虫的访问:被封锁的名单中包括Meta、Google、华为和Mistral的机器人,而更早之前则是Anthropic、Perplexity和Google Project Mariner的爬虫。相比之下,沃尔玛和eBay并没有设置类似的robots.txt封锁。问题在于,robots.txt只是请求,而不是障碍:它仅对自愿遵守的爬虫有效。

因此,合理的步骤是将保护转移到不需要征求同意的层面。正是这样,评论的故事开始了:平台不再逐个封锁特定的爬虫,而是开始评估会话行为,并减少那些模式类似于机器的用户的展示。评论是市场上最有价值和最容易被复制的资产,因此实验正是从这里开始的。

这种方法的实际问题是误报。行为分类依赖于互动的动态:移动的节奏和速度、停顿、过渡的顺序、深度和重复性。一个系统地比较十种空气净化器并逐一打开所有评论的人,在这些指标上看起来就像一个解析器。考夫曼的案例是一个教科书式的例子:干净的IP,普通的浏览器,没有任何自动化,仍然被封禁。

主要结论:干净的IP不再是通行证

对于那些收集公共数据的人来说,这个故事带来了一个不愉快的事实。以前的逻辑很简单:IP声誉差——被封禁,声誉好——可以访问。现在亚马逊展示了,决策可以违背完美的网络信号。用户坐在家庭提供商的网络上,来自自己的国家,使用真实的Chrome,拥有多年的完整购买历史——但仍然因为连续阅读太多评论而受到限制。

这改变了数据收集基础设施的优先级。高质量的住宅代理仍然是必要的——没有它,您甚至无法通过第一层过滤器,无法看到与本地买家相同的展示。但这不再是充分条件:如果在良好的IP上运行的是机器节奏的机器人,检测器将在第二层捕捉到您。关于这一层的详细分析,请参见我们关于行为生物识别和代理的材料。

实践中该怎么办

  1. 物理上分开“个人”和“工作”。 如果您在同一个浏览器和同一个IP上监控竞争对手的价格和评论,同时登录您的买家账户,那么您就面临数据和账户的风险。单独的个人资料,单独的出口地址,单独的会话。
  2. 一个池子——一个任务。 监控Buy Box、收集评论和检查库存不应通过同一组地址进行:这些任务的请求模式不同,混合它们意味着收集复合指纹,这比任何单一组件都更显眼。
  3. 限制每个会话的深度。 八条评论并不是一个随机数字:这是平台认为正常兴趣的阈值。通过不同的会话分批收集评论,而不是一次性提取整个列表。
  4. 保持人类的节奏。 随机的停顿、不均匀的过渡速度、自然的顺序(商品页面→评论→返回展示)比在请求的机枪式旋转中轮换千个地址要便宜。
  5. 监控降级,而不仅仅是错误。 亚马逊方法中最狡猾的地方在于——您不会收到403错误。您会收到HTTP 200,但内容被削减。仅检查响应代码的解析器会在几个月内稳定地将八条评论写入数据库,而不会发出任何警报。添加完整性检查:元素数量、分页的存在、过滤器块的存在。
  6. 留出余地。 根据2026年《网络抓取状态》研究(Apify和The Web Scraping Club)的数据,65.8%的专业人士使用的代理比去年多,而58.3%增加了预算——尽管每GB的价格总体上在下降。上涨的不是价格,而是所需的数量和复杂性。43.1%的团队已经拥有2-3个提供商以确保故障转移。

值得注意的是,保持相反的趋势:当一些平台掩盖过滤器时,行业试图合法化“好的”自动化——通过请求的加密签名和明确的代理身份识别。我们在关于Web Bot Auth和签名代理的文章中探讨了这一点。问题在于,签名代理本质上将自己置于平台的任意之下:亚马逊乐于知道面前的是一个机器人——并会拒绝。

谁将在未来几个月受到影响

悄然减少展示而不是诚实封锁——这种手段容易被复制。我们很可能会在其他平台上看到它:它比验证码便宜,不会损害跳出率,也不会给爬虫明确的信号,表明他们被发现。

最冒险的场景是那些数据完整性重要而不仅仅是访问事实的场景:商品分析的评论分析、声誉监控、基于用户内容的模型训练、卖家的竞争情报。如果您与市场平台合作,重新阅读基本的过滤器绕过实践是有益的——例如,我们对亚马逊价格抓取的反机器人保护的分析——并在此基础上增加对响应不完整的检查。

这也影响到普通人。被误认为机器人的用户失去了他们来到市场平台的唯一功能:阅读关于商品的评论。没有警告,没有解释,没有明确的恢复时间——只有一封支持邮件和五个工作日的等待。

结论

2026年8月标志着一个分水岭。第九巡回法院实际上表示,按照人类指令行动的代理就是人,不能将其归入计算机滥用法。平台理解了这一回应,并将斗争转移到法院无法介入的地方——他们自己的前端行为过滤器。根据亚马逊的评论,活跃买家受到的副作用,限制在八条评论,似乎并未引起他们的过度关注。

实践中的结论很简单:数据收集基础设施不再是“找到好IP”的任务。好的IP是入场券,而之后的评估则基于您的行为和请求的数量。根据这一点规划预算、请求深度和响应完整性控制——并检查不仅是数据是否到达,还要检查到达的数据是否与预期一致。