文章摘要
作者分享其网站PatronView一年来对抗机器人的经历:一周内收到250万次请求,但真实访客仅5977次页面浏览,机器人流量占比高达99%。文章列举了具体数据,包括中国机器人单日360万次请求、Anthropic爬虫35,000:1的爬取比例、亚马逊AI爬虫日读11.7万页却从未带来访客,以及CAPTCHA仅0.24%的解决率。
文章总结
好的,这是根据您的要求,对原文主要内容进行的中文重述,保留了关键细节,并删减了与主题无关的幽默或比喻性内容。
标题:我网站99%的流量都是机器人
核心问题: 作者运营着一个美国慈善家数据库网站,发现其服务器收到的请求中,超过99%来自各种网络爬虫和机器人,而非真实用户。这导致服务器成本增加、分析数据失真,并可能影响真实用户的访问体验。
关键数据与事件:
- 惊人的流量比例: 在一周内,服务器处理了250万次请求,但分析工具只记录了约6000次页面浏览。这意味着每1次真实用户访问,背后就有约214次机器人请求。
- 来自中国的机器人攻击: 某日,网站单日收到来自36万多个中国IP地址的360万次请求。作者最终选择在防火墙层面屏蔽了整个中国(以及随后的越南和新加坡)。
- AI爬虫的“投入产出比”极低: 作者引入了一个关键指标:“每带来一个访客,爬虫爬取了多少页面”。
- Anthropic的Claude爬虫: 爬取35,000页才能带来1个访客。在屏蔽前,它一周爬取了42万页,仅带来12个访客。
- 亚马逊的Amzn-SearchBot: 每天爬取11.7万页,但从未带来任何访客。作者已将其屏蔽。
- 对比: 谷歌的爬取与访客比为46:1,被认为是“物有所值”。
- 住宅IP代理网络: 作者遭遇了更难防御的攻击——通过租用全球各地普通家庭IP地址(如来自AWS、Azure等数据中心的IP)发起的请求。这些请求看起来像真实用户,难以通过地理位置或IP段规则拦截。
- CAPTCHA的失效: 网站设置的CAPTCHA挑战,解决率仅为0.24%,说明机器人根本不尝试破解,或者能轻易绕过。
作者的应对策略(基于Cloudflare WAF):
- 国家/地区封锁: 直接屏蔽中国、越南等非目标用户所在国家。
- 用户代理(User-Agent)屏蔽: 屏蔽已知的SEO爬虫(如SemrushBot, AhrefsBot)和“投入产出比”极低的AI爬虫(如Claude-SearchBot, Amzn-SearchBot)。
- 验证机器人放行: 对谷歌、必应等经过Cloudflare验证的“好”爬虫放行,确保网站能被正常收录。
- 洲际挑战: 对北美以外的所有访客发起一次性的隐形CAPTCHA挑战。
- 数据中心IP挑战: 对来自AWS、Azure、Google Cloud等46个数据中心ASN的IP发起挑战,因为真实用户不会从这些地方浏览网页。
- 老旧浏览器挑战: 对使用Chrome 100-130、Firefox 100-124等过时版本浏览器的请求发起挑战,因为这是机器人常用的伪装。
- 速率限制: 限制单个IP在10秒内最多请求30个页面。
效果与成本:
- 效果显著: 实施规则后,24小时内直接拦截了4.6万次请求,并发出6.3万次挑战,其中仅552次被解决(解决率0.87%),证明规则有效。
- 成本: 网站托管在Cloudflare Workers上,正常月费约90美元。机器人流量导致账单在高峰月份上涨约500%。作者认为,机器人消耗了99%的服务器资源,却由他支付100%的费用。
- 数据污染: 最大的隐性成本是分析数据被严重污染,作者无法判断真实用户的阅读偏好,影响了业务决策。
结论与建议:
- 现状: 与机器人的斗争是一场“打地鼠”游戏,需要不断更新规则。
- 根本解决思路: 作者认为,经济手段是最终解决方案,例如Cloudflare正在开发的“按爬取付费”模式,让爬虫为其消耗的资源付费。
- 给其他站长的建议:
- 查看服务器日志,而非仅依赖分析工具。
- 按ASN(网络运营商)而非IP地址进行封锁。
- 对可能包含真实用户的流量使用“挑战”而非直接“屏蔽”。
- 监控挑战解决率,以判断规则是否误伤真实用户。
- 评估安全功能(如CAPTCHA脚本)对网站性能的影响。
核心原则: “一个从未给我带来任何访客的爬虫,就应该被屏蔽。”
评论总结
根据评论内容,总结主要观点及论据如下:
1. 机器人流量泛滥,严重影响网站运营 - 多位站长反映,真实用户流量被机器人严重稀释。例如,作者提到“99.999% is bots”,Cloudflare显示近100万“访客”,但真实用户每天仅几十人(评论5)。 - 机器人爬取导致服务器负载飙升、成本增加。有站长称,Gitlab实例在屏蔽中国爬虫后,服务器负载从99%降至0.1%(评论12);作者账单从每月90美元一度飙升500%(评论13)。
2. 对AI爬虫的强烈不满与防御措施 - AI爬虫(如GPTBot、ClaudeBot)被指“只索取不回报”。例如,Claude-Searchbot在72小时内抓取约20.5万页面,但仅带来1个推荐(评论25)。 - 站长们采取多种防御手段:使用Cloudflare的AI机器人屏蔽功能(评论11)、Anubis的“工作量证明”检测(评论8)、iptables按IP段封禁(评论12)、在内容中掺入“数字毒素”(评论16)等。 - 数据显示,网站所有者对AI爬虫的屏蔽率持续上升:GPTBot从2023年Q4的2.21%升至2026年Q3的3.45%,ClaudeBot同期从0%升至3.01%(评论18)。
3. 对Cloudflare等集中化防御的争议 - 部分用户批评Cloudflare“外包了决策权”,可能导致无辜用户被误伤。例如,有用户因家庭IP被标记而陷入无限验证循环(评论24)。 - 另一些用户认为Cloudflare的“非交互式挑战”有效,但整体体验下降:“验证你是人类”的等待时间让网页加载变慢(评论28)。
4. 对开放互联网未来的悲观预期 - 有评论预测,网络将变成“私有围墙花园”,多数网站设置“no index”,仅通过真人推荐发现(评论2)。 - 作者自嘲“一边爬取公开文档,一边抱怨爬虫”,承认自身行为的矛盾性(评论1)。
5. 对文章写作风格的批评 - 评论7批评作者将连续内容拆分为多个短段落,认为这种“推特式”写作影响阅读体验,并提供了修改示例。
6. 其他技术讨论 - 有建议将网站改为静态站点以降低成本(评论13)。 - 有评论指出,机器人重复抓取同一页面的动机不明(评论22)。 - 有用户提到,来自新加坡的流量近期激增(评论27)。
平衡性说明:多数评论对机器人流量持负面态度,但少数观点认为“机器人流量不一定是坏事”(评论19),并指出网站本身优化不足才是根本问题。对Cloudflare的争议也呈现两极分化。