文章摘要
该文章基于5000多个网站的数据,总结了AI机器人流量统计:机器人流量占总流量的35%,其中28%与AI相关;AI聊天带来的访问仅占0.1%;机器人对robots.txt规则的遵守率达98.5%。
文章总结
好的,这是根据您的要求,对原文主要内容进行的中文重述,已保留关键细节并删减了与主题无关的内容。
代理网络指数:AI机器人流量统计概览
该指数基于对超过5,000个使用特定分析工具的网站数据进行统计,旨在揭示AI机器人(即“代理”)与人类在网络上的活动现状。
核心指标
- 机器人 vs. 人类流量:在所有网站访问中,机器人流量占比为35%,较前90天下降了2%。
- “代理化”程度:在机器人流量中,与AI相关的流量占比为28%,较前90天上升了11%。
- AI聊天推荐流量:来自AI聊天平台(如ChatGPT)的人类网站访问量占比仅为0.1%,较前90天下降了9%。
- Robots.txt 有效性:机器人遵循网站
robots.txt规则的比例高达98.5%。
主要机器人类型与活动
机器人根据其功能被分为多种类型,其中活动最频繁的类型包括:
- AI助手:根据用户提示抓取网页内容,用于生成AI回答。
- AI数据抓取器:下载网站内容,用于训练AI模型。
- AI搜索爬虫:索引网站内容,以便在AI驱动的搜索结果中引用。
- 搜索引擎爬虫:系统性地扫描和索引网页,用于传统搜索引擎结果。
- SEO爬虫:分析网站结构以优化搜索引擎排名。
访问量最高的机器人包括:bingbot (8.2%)、Googlebot (7.9%)、AhrefsBot (6.2%)、ChatGPT-User (3.3%)、ClaudeBot (3.2%) 等。
AI专项活动分析
AI数据抓取活动:这类机器人专门抓取网站内容用于训练AI模型。主要抓取者包括
ClaudeBot(27.0%)、meta-externalagent(19.5%) 和Amazonbot(19.2%)。它们最常访问的网站类别是“法律与政府”、“在线社区”和“家居与园艺”。AI实时获取活动:这类机器人实时获取网页内容,以支持AI助手或编程助手等应用。
ChatGPT-User占据了此类流量的绝大多数(86.4%)。它们最常访问的网站类别是“参考”、“科学”和“金融”。AI搜索索引活动:这类机器人爬取网站,以便在AI搜索引擎中提供带引用的答案。主要爬虫包括
PetalBot(25.4%)、Amzn-SearchBot(17.3%) 和Applebot(16.7%)。它们最常访问的网站类别是“旅行与交通”、“参考”和“健康”。AI自主浏览活动:这类机器人使用真实浏览器,像人类一样自主导航和操作以完成任务。主要代理包括
Google-Agent(43.0%)、Manus-User(40.1%) 和ChatGPT Agent(16.9%)。它们的平均会话时长为1分钟,每次会话平均浏览7.6个页面。
Robots.txt 合规性与安全
- 规则遵循情况:大多数机器人(98.5%)会遵守
robots.txt规则。但仍有部分机器人遵守率较低,如Baiduspider(82.6%) 和Amazonbot(94.7%)。 - 被屏蔽最多的机器人:
GPTBot、CCBot和ClaudeBot是被最多顶级网站屏蔽的机器人。 - 身份伪造威胁:存在广泛的AI机器人身份伪造活动,攻击者冒充知名机器人(如
Googlebot、ChatGPT-User)来扫描网站漏洞,特别是针对AI编程工具使用的凭证和配置文件路径。
AI聊天推荐流量
来自AI聊天平台的人类推荐流量虽然总量很小(0.1%),但不同平台(如ChatGPT、Claude、Perplexity)均有贡献。在AI聊天回答中被引用最多的网站类别是“参考”、“科学”和“金融”,而用户实际点击跳转最多的类别是“旅行与交通”。
方法论说明
该指数的数据来源于超过5,000个自愿接入分析工具的网站,每日更新。数据并非全球网络的随机样本,因此其结果反映的是观察范围内的趋势,而非精确的全球普查。各项指标的计算方式(如机器人流量占比、Robots.txt有效性、伪造流量识别等)均有详细定义,以确保统计的严谨性。
评论总结
根据评论内容,主要观点及论据总结如下:
观点一:虚假用户代理(User-Agent)泛滥,需通过IP归属地识别。 - 评论1(Bender)指出:“Many of those user-agents listed are often faked. Look up which ASN owns their IP. If I block most VPS providers most of the faked bots vanish.”(许多列出的用户代理是伪造的,应通过ASN查询IP归属,屏蔽VPS提供商可减少虚假机器人。) - 评论4(binaryturtle)补充:“You'll see a lot of deepfield, censys-scanner, visionheight.com, shadowserver.io, etc., but also the usual suspects of Chinese or Russian IPs.”(常见扫描源包括特定服务商及中俄IP。)
观点二:大规模漏洞扫描是常态,并非新现象。 - 评论2(pjc50)强调:“Someone is always running mass vulnerability scans. That's a 'water is wet' state of the Internet.”(大规模漏洞扫描是互联网常态,如同“水是湿的”一样普遍。) - 评论3(yabones)指出:“Every server with port 80/443 open has thousands of hits a day... The only new thing is that they're pretending to be a different type of annoying bot.”(开放80/443端口的服务器每天遭受数千次扫描,唯一变化是机器人伪装方式升级。)
观点三:伪装成AI机器人可能适得其反,动机存疑。 - 评论8(Tharre)质疑:“Why would you voluntarily pretend to be a AI bot, when those have already a much higher chance of being blocked?”(伪装成AI机器人易被屏蔽,动机不明,可能是为了抹黑AI公司。)
观点四:需多层防护,如Cloudflare结合非Cloudflare层。 - 评论5(j45)建议:“It seems like a good idea to have another layer behind it that's non-cloudflare for when vulnerabilities are discovered.”(在Cloudflare后增加非Cloudflare层,以应对漏洞发现时的风险。) - 评论6(nate-gehringer)分享实践:“I recently blogged about some Cloudflare Workers I developed to combat this type of traffic.”(开发Cloudflare Workers对抗此类流量。)
观点五:开放互联网可能终结,转向KYC模式。 - 评论9(blobbers)提出:“What if the idea of an open internet is over... moving into a world of strictly KYC.”(开放互联网可能终结,转向类似Facebook的KYC实名制世界。)
平衡性说明: 评论中既有对现状的客观描述(如扫描常态化),也有对技术对策的探讨(如IP屏蔽、多层防护),同时包含对趋势的反思(如KYC化)。未出现明显对立观点,整体呈现技术应对与趋势预判的平衡。