Hacker News 中文摘要

RSS订阅

住宅代理与爬虫现状的最新动态 -- An update on residential proxies and the scraper situation

文章摘要

2025年初的文章探讨了AI爬虫对网站的冲击问题,一年多后情况仍在恶化。大量匿名爬虫通过住宅代理等渠道发起攻击,导致网站流量激增,开放网络的维护日益困难。文章分析了流量来源及应对措施。

文章总结

好的,这是根据您的要求,对原文主要内容进行的中文重述,已保留关键细节并删减了与主题无关的订阅推广信息。


关于网站爬虫攻击现状的更新

2025年初,我们曾撰文讨论AI爬虫机器人对网站的大规模数据抓取问题。一年多过去,这个问题非但没有缓解,反而愈演愈烈。来自不明势力的攻击流量达到了新的高度,维护开放网络的难度与日俱增。这些流量从何而来?我们又该如何应对?

住宅代理网络

正如去年所述,爬虫攻击的源头遍布整个网络。攻击者常通过数百万个独立IP地址在数小时内发起协同请求,每个IP仅访问网站两三次,并伪造用户代理等数据,伪装成普通用户。虽然可以通过不加载图片或CSS等行为识别它们,但往往在识别完成前,该IP地址已不再使用。

这些流量主要来自住宅和移动网络,由中央控制节点指挥。普通设备在用户不知情或未同意的情况下被安装软件,听从控制节点指令抓取网页并回传数据。这种被利用的系统被称为“住宅代理”。

运营住宅代理网络攻击网站的主要有两类操作者。第一类是纯粹的犯罪分子,他们在被恶意软件感染的系统上运行爬虫。今年年初,谷歌曾打击一个名为IPIDEA的僵尸网络,其被关闭后,LWN网站的爬虫流量显著减少,但好景不长。近期,媒体流媒体设备也被发现是恶意爬虫软件的主要载体。

第二类操作者则更为公开,他们打着“合法”的旗号,提供“道德来源”的IP地址。例如,Bright Data公司通过提供“免费”VPN服务,获取用户设备的网络路由权限,从而将其设备纳入自己的住宅代理网络,用于攻击其他网站。许多其他类似公司通过向应用开发者付费,让其将SDK嵌入应用中,从而劫持用户的网络连接。

需要强调的是,这些住宅代理网络不仅能用于网站抓取,还能访问数百万设备所连接的任何网络资源,其潜在危害远不止于此。

当然,还有那些以开发模型为核心业务的高调公司。它们通常自行抓取数据,会在用户代理字段中明确标识,并遵守robots.txt规则。虽然它们也会反复抓取整个网站,但不会从数百万个系统产生压倒性的流量,因此并非最大问题。

目前尚不清楚是谁在付费使用这些住宅代理网络。没有证据表明前沿模型公司使用了它们,但如果它们确实这么做了,也不会令人惊讶。这些公司需要训练数据,却对其来源讳莫如深,对内容创作者也缺乏尊重。

除了公开的模型,必然还有大量秘密模型。许多公司、政府机构乃至大型犯罪组织都在试图构建自己的模型,将AI视为武器,展开了一场军备竞赛。整个互联网都陷入了这场交火之中。

捍卫开放互联网

面对这一切,网站运营者纷纷采取防御措施,同时尽量减少对真实用户的影响。例如,Anubis通过要求工作量证明来抵御爬虫;其他网站则使用商业服务,要求用户点击“证明你是人类”按钮、识别图片或完成拼图等。许多网站功能被置于登录或付费墙之后。一些网站还尝试使用iocaine等工具主动污染发送给爬虫的数据。

设置和维护这些机制,以及用户为访问网站而必须应对这些机制,都构成了沉重的负担。

最近,LWN遭受了有史以来最严重的爬虫攻击。得益于已实施的防御措施,网站承受住了流量,大多数读者可能并未察觉。我们不愿详细讨论防御措施,因为这也是一场军备竞赛。我们能说的是,我们已尽力将对真实读者的影响降至最低。我们没有采用Anubis,部分原因是它会造成恼人的延迟,也因为它似乎不可避免会被爬虫绕过。当攻击者拥有数百万台他人的机器来执行工作量证明时,这并非巨大障碍。

我们也希望不阻碍合法搜索引擎、互联网档案馆等组织的运作。一些网站可能会添加白名单,例如允许某主流搜索引擎访问,但这会进一步巩固一个本已服务不佳的垄断者地位,应予以避免。我们目前成功做到了这一点。

我们积极优化了网站部分功能,并在遭受攻击时尽量减少高消耗操作。匿名读者偶尔会遇到这些措施,而登录用户则不会。有趣的是,遭受攻击时的响应时间往往比平静时期更好。但我们深知问题并未解决,必须考虑当前措施失效后的下一步行动。

7月2日,谷歌宣布与美国联邦调查局等机构合作,捣毁了一个名为“NetNut”的住宅代理网络。此举暂时降低了爬虫攻击的强度。但经验表明,这种和平不会持续太久。谷歌指出其Play商店将检查受NetNut感染的应用程序,但所有主要供应商都对为何将带有住宅代理功能的应用轻易放入应用商店保持沉默。

在开放网络被彻底逼入防御壁垒、失去其激发创造力的本质之前,我们亟需找到更持久的解决方案。驱动这些攻击的行业似乎对将独立网站洗劫一空后变成冒烟弹坑的行为毫不在意。然而,我们中的一些人反对这种想法,并将为之抗争。但愿有朝一日,整个世界能决定让大型语言模型及相关技术的公司遵守最低限度的道德标准。在此之前,这种行为将继续下去,我们别无选择,只能自卫。

评论总结

根据评论内容,主要观点和论据如下:

1. 对爬虫行为的道德和法律质疑(评分:无) - 观点:住宅代理常被用于爬虫,但用户同意条款(TOS)中已隐含同意,问题在于美国等国家未能有效执法。 - 关键引用:cyanydeez: "these residential proxies are media boxes, and they consent as much as anyone else consents to what amazon, or google or facebook does; it's buried somewhere in the recesses of the TOS." / "The question is more about why the US and others can't properly enforce the bullshit all this amounts to."

2. 对爬虫的对抗与毒化(评分:无) - 观点:存在社区主动毒化爬虫数据,如Poison Fountain项目每天传输数百GB毒化数据,且技术不断升级。 - 关键引用:atomic128: "There is a large community of people that poison scrapers." / "Poison Fountain, alone, transmits hundreds of gigabytes of poison per day, which goes into scrapers, git repositories on every hosting platform, social media, etc."

3. 解决方案:改进Common Crawl或使用Anubis等工具(评分:无) - 观点:支持改进Common Crawl以降低信息获取门槛,或采用Anubis等PoW工具对抗爬虫,但需平衡用户体验。 - 关键引用:mips_avatar: "I feel like the solution is a better common crawl." / "we should reset the baseline of information accessibility so there's less marginal advantage on these labs." / harshreality: "It's massively less annoying than a captcha... PoW scales."

4. 对爬虫的正面看法(评分:无) - 观点:爬虫有助于开源LLM发展,且未来LLM足够强大后,网站本身可能不再必要。 - 关键引用:zb3: "This is a good thing, thanks to this we have powerful open source LLMs." / "When LLMs get good enough, we won't need those sites anymore :)"

5. 对反爬措施的双刃剑效应(评分:无) - 观点:反爬措施可能伤害开放网络,并让Cloudflare等公司掌握更多控制权。 - 关键引用:mips_avatar: "I worry a lot of the anti scraping rhetoric will just injure the open web and put somebody like cloudflare in charge."

6. 对爬虫强度的具体担忧(评分:无) - 观点:问题在于爬虫的强度和数量,而非个人偶尔使用wget/curl;住宅代理被视为公开的僵尸网络。 - 关键引用:sixtyj: "The issue with scrapping is the intensity and volume of bots." / Bratmon: "Residential Proxies are the most emblematic technology of our era... a group of people looked at something that used to be considered a crime (botnets) and realized that if they just did it openly, no one would ever punish them."

7. 对IP封锁和IPv6的讨论(评分:无) - 观点:爬虫不抓取图片/CSS,但IP黑名单可能无效;IPv6可能带来新问题。 - 关键引用:andai: "Don't we keep blacklists of this stuff? And if they hammer thousands of requests per site per second and never reuse an IP, they'd run out of addresses in a few weeks." / "Then they'd switch to IPv6, and... well, are we using IPv6 for anything important?"

8. 对内容公开性的反思(评分:无) - 观点:公开内容应允许合理使用,反爬措施可能巩固搜索引擎垄断。 - 关键引用:rao-v: "you put your content up publicly on the web! That should be part of reasonable use!" / "Such measures have the effect of further entrenching a monopoly that already serves us poorly and should be avoided."

9. 对PoW抗爬虫的可行性讨论(评分:无) - 观点:PoW可能被绕过,但若比特币崩溃则证明其失效;PoW结合CPU和网络声誉更有效。 - 关键引用:TZubiri: "The moment it does you'll be able to tell because Bitcoin will crash to 0." / "Will bots use infected computers to do compute to work around it? Maybe, but it requires a CPU in addition to a network reputation, 2 mechanisms are stronger than one."

10. 对设备安全性的担忧(评分:无) - 观点:媒体流设备常被植入爬虫软件,需审计设备是否被入侵。 - 关键引用:ValentineC: "media-streaming devices have been identified as a major carrier of malicious scraping software." / "Are there ways of auditing that devices aren't compromised? Tracking which devices still send lots of data when no one else is using the network?"