还在一年前,通过一个 GET请求 和参数 num=100 就可以抓取 Google 的搜索结果——一百个结果以纯 HTML 的形式返回。但在 2026 年,这种方式已经不再有效:Google 杀死了无 JavaScript 的访问,限制了每页结果为一百个,并在搜索结果中增加了一个 AI 概述 块,该块是异步渲染的,并不是每个 IP 都能看到。我们来探讨一下如何在新的条件下收集 SERP,隐藏的陷阱在哪里,以及为什么选择代理类型比解析器本身更重要。
本指南适合谁
搜索结果抓取(SERP scraping)不仅仅是关于 SEO 位置。今天,它被以下人员使用:
- SEO 专家和机构——跟踪自然流量、特色摘要、“人们还问”的问题、本地结果以及网站是否出现在 AI 概述中。
- 市场分析师——监控 Google 在商业查询中引用了谁,并观察竞争对手的首页变化。
- AI 和数据团队——收集 SERP 作为 RAG 系统、模型训练和事实核查的数据源。
所有人都有一个共同的问题:在 2026 年,Google 积极区分自动流量和真实流量,没有正确的基础设施,数据收集在前几十个请求中就会崩溃。
发生了什么变化:Google 对抓取器的三次打击
为了让指南诚实,我们先来看看为什么旧的指令不再有效。
2025 年 1 月——SearchGuard。 Google 启动了 JavaScript 挑战系统:通过 requests 或 httpx 的普通 HTTP 请求现在返回的不是 HTML,而是挑战页面。没有执行 JavaScript,就无法看到搜索结果——直接的“正面”抓取会立即失败。
2025 年 9 月——num=100 的结束。 Google 删除了返回 100 个结果的参数。现在,前 100 个结果是 十个单独的请求,带有分页。对于深度监控而言,这实际上是请求数量的十倍增长(因此,代理和预算的负担也增加了)。
2025 年 12 月——法律压力。 2025 年 12 月 19 日,Google 对 SerpApi 提出了 DMCA 投诉,声称 SearchGuard 是一种“技术保护措施”,其规避行为违反了反规避规范。这个先例尚未解决,但它设定了基调:Google 的灰色抓取在技术上和法律上变得更加昂贵。
特别指出:Google 的官方自定义搜索 API 正在关闭——现有客户被告知迁移截止日期为 2027 年 1 月 1 日。也就是说,“合法”的替代方案也在缩小。
搜索结果的主要新功能——AI 概述
AI 概述(以前称为 SGE)——是由 AI 生成的摘要,位于搜索结果的顶部,并附有来源链接。对于抓取而言,这是 2026 年最复杂的元素,原因有三。
数量众多。 根据 Ahrefs 的数据,AI 概述出现在大约 30% 的查询中;更晚的估计(Olostep)显示,所有查询中高达 48% 和信息查询中高达 80%。忽视这个块意味着收集到的搜索结果显然是不完整的。
它们是异步渲染的。 该块存在三种状态:最少见的是直接以 HTML 形式返回,最常见的是在主页面加载后几秒通过 JavaScript 加载,或者根本不出现。在延迟加载的情况下,原始 HTTP 响应包含一个空容器——内容稍后会被提取,解析器需要等待(在实践中,大约需要 8 秒的浏览器自动化)。
并不是每个 IP 都能看到。 这是旧指南沉默的关键点:Google 将移动用户视为 AI 搜索的优先受众。在实践中,这意味着 使用数据中心 IP 时,AI 概述通常根本无法返回,而通过移动运营商的相同查询则返回完整的块。即使是顶级聚合器也承认不完整性:到 2026 年初,SerpApi 声称成功检测到 AI 概述的比例约为 68%。
逐步分析:如何在 2026 年收集 SERP
- 确定请求量。 每天 ~100 个请求可以通过自己的浏览器自动化来处理。从 100 到 10,000——需要一个可管理的解析器或 SERP API。超过 10,000 个请求每天没有企业级基础设施和批处理及 Webhook 是无法完成的。这决定了后续的整个技术栈。
- 收集正确的 URL。 基本端点是 /search,关键参数包括:q(查询,URL 编码)、hl(界面语言)、gl(结果国家)、start(分页:start=10——第二页,start=20——第三页,依此类推)。请记住:num=100 不再有效,深度只能通过分页来增加。
- 使用浏览器渲染。 由于没有 JavaScript 就没有搜索结果,基本技术栈是 Playwright 或使用无头 Chromium 的 Selenium。务必去除自动化标记(标志 --disable-blink-features=AutomationControlled),否则反机器人系统会根据 navigator 属性识别出可控浏览器。
- 等待 AI 概述。 页面加载后不要立即抓取 DOM:让 networkidle 稳定,并等待块的加载(参考时间——最多 8 秒)。通过标题文本“AI 概述”来更可靠地确定块的存在,而不是通过 CSS 类——因为 Google 的类是动态的并会变化(条件 Kevs9、Y3BBE 今天是一个,明天可能是另一个)。
- 按结构而非类抓取。 根据标题标签(h3)和语义抓取自然流量,而不是脆弱的类名。2026 年可用的搜索结果包括:自然结果、特色摘要、“人们还问”的问题、相关查询、知识图谱、本地包、广告和 AI 概述中的引用。
- 轮换 IP 并适当延迟。 在请求之间设置现实的暂停(4–12 秒),并大约每 5 分钟更换一次 IP,变换城市/运营商。过于规律的节奏和单一 IP 是最容易触发验证码的。
潜在问题
- “空”的 AI 概述。 如果您在加载后立即抓取 DOM,延迟块将是空的——您会认为它不存在。始终预留等待时间并进行重新检查。
- 一次性会话用于加载。 某些 API 的会话密钥用于加载延迟的 AI 概述是一次性的,持续约 60 秒——不要指望稍后重新使用。
- 数据中心的虚假节省。 便宜的数据中心 IP 在 5–10 个请求时就会触发验证码,并且不显示 AI 概述。节省成本反而导致数据不完整和时间浪费。
- 脆弱的选择器。 如果依赖于 CSS 类名,解析器将在搜索结果的下一个重新设计中崩溃。坚持文本和结构。
- 请求的均匀指纹。 所有流中的 User-Agent、时间和标题相同会暴露出机器人网络。多样化指纹和 IP 一样重要。
选择哪种类型的代理
在 2026 年,正是代理,而不是解析器,决定您是否能看到完整的搜索结果。我们来逐项分析。
移动代理——用于 AI 概述和最“重”的请求。 由于 Google 首先将 AI 块提供给移动受众,真实的运营商 IP(如 T-Mobile、Verizon、Vodafone 等)最稳定地触发 AI 概述,并且能够承受明显更多的请求——根据观察,50–200 个请求出现摩擦,而数据中心仅为 5–10 个。此外,移动 CGNAT-IP 与数百个真实用户共享一个地址,因此 Google 不敢封禁它。如果您的任务是专门收集 AI 概述或监控最受保护的 SERP,请从 移动代理 开始。
住宅代理——用于自然流量和大规模抓取的工作马。 对于收集普通搜索结果、位置、特色摘要和本地包,住宅 IP(家庭提供商的地址)提供了最佳的性价比。它们很难与真实用户区分,而轮换可以在不从单一地址发起大量请求的情况下扩展抓取。当 AI 概述不是重点,而是量和地理位置重要时,最佳选择是 住宅代理 进行轮换。
数据中心——仅用于草稿测试。 快速且便宜,但在 2026 年对抗 Google 的请求屈指可数,并且无法看到 AI 块。适合调试解析器逻辑,而不适合实际抓取。
不确定在特定任务下选择什么——可以从分析 2026 年住宅代理与移动代理的比较 开始:详细说明了哪种类型节省资金,哪种节省数据。
结论
在 2026 年,抓取 Google 不再是“编写解析器”的任务。SearchGuard 强制执行 JavaScript 渲染,num=100 的取消使请求数量增加了十倍,而 AI 概述增加了一个主要通过移动 IP 可见并延迟加载的块。从技术上讲,这一切都是可以解决的:浏览器自动化、按结构抓取、合理的暂停和轮换。但支撑数据完整性和稳定性的基础是正确的代理:移动代理用于 AI 概述和受保护的请求,住宅代理用于自然流量和大规模抓取。根据您的任务选择代理类型——解析器将不再因验证码而绊倒。
```