Hacker News 中文摘要

RSS订阅

Cloudflare为客户提供的新AI流量选项 -- Cloudflare's new AI traffic options for customers

文章摘要

Cloudflare推出新AI流量管理选项,允许网站所有者灵活控制AI爬虫访问,包括一键屏蔽和按次付费模式,以解决AI无偿抓取内容的问题,并保护原创内容权益。

文章总结

一年前,Cloudflare 发起了首个“内容独立日”,赋予网站所有者控制其内容的权利。过去,爬虫与网站之间的默认协议是“爬取内容,换取流量”,但如今 AI 爬虫无偿获取内容,却不再回馈流量,这对网站所有者构成了生存威胁。为此,Cloudflare 推出了“一键屏蔽 AI 爬虫”选项和“按爬取付费”市场。

一年来,情况发生了变化。人们不再仅仅关注“屏蔽未经补偿的 AI 训练”,而是希望更精细地管理内容:既要保护原创内容并获得补偿,又不想一刀切地屏蔽所有自动化工具。对于小型网站而言,问题不仅是内容被用于训练模型,更在于难以被用户发现。它们被迫在“被搜索到但允许 AI 训练”和“失去可见性”之间做出艰难选择,这给了现有搜索巨头不公平的优势。

如今,AI 已无处不在。谷歌搜索已从 AI 排序演变为直接回答问题的“答案引擎”。因此,Cloudflare 不再简单地将爬虫定义为“AI”与否,而是更深入地追问其行为:它们在网站上做什么?存储什么?如何重新分享内容?

为此,Cloudflare 提出了一个务实的分类体系,聚焦于三种 AI 用例: - 搜索:收集或索引内容,以便日后回答相关问题。网站所有者应期望获得流量回馈或公平补偿。 - 代理:代表用户实时执行任务的自动化行为,如聊天抓取机器人或浏览器代理。通常有用户在另一端等待。 - 训练:爬取内容用于训练或微调模型。数据会被永久吸收进 AI 架构。

许多流行爬虫可能属于上述一种或多种分类。Cloudflare 认为,爬虫运营商应将其不同用途的爬虫分开,以便网站所有者更透明地了解其访问目的并管理权限。

基于此,Cloudflare 推出了按三大用例管理 AI 流量的新选项,所有客户(包括免费版)均可使用。从 2026 年 9 月 15 日起,对于所有新接入 Cloudflare 的域名,在显示广告的页面上,“训练”和“代理”类爬虫将被默认屏蔽,而“搜索”类爬虫默认允许。广告是网站所有者希望人类访问并看到的信号,因此应保护这些页面上的用户注意力。同时,多用途爬虫(如同时进行搜索和训练的爬虫)将根据其所有行为被允许或屏蔽,遵循最严格的规则。

此外,Cloudflare 为企业客户推出了 BotBase,这是一个全新的已知爬虫数据库,提供可搜索的视图,并支持按行为分类和内容使用级别(即时、引用、完整)进行精细管理。同时,Cloudflare 更新了“已验证”爬虫的定义:不再默认允许所有已验证爬虫,而是根据其所属类别决定是否允许。爬虫运营商需诚实表明身份且不滥用权限才能获得验证。

Cloudflare 还探索了“传递信任”机制,利用 Forwarded 头部信息让网站所有者对爬虫运营商及其背后的最终用户进行信任传递。这些措施旨在让网站所有者对内容的使用拥有更多控制权,同时鼓励透明和诚信。新的 AI 流量管理选项现已上线,所有客户均可配置。

评论总结

根据评论内容,主要观点和论据如下:

1. 对Cloudflare新政策的质疑与批评(评分:None) - 评论3(simonw)指出,从9月15日起,Googlebot等“多用途爬虫”将因“阻止训练”政策被屏蔽,因为Google使用相同基础设施进行搜索索引和AI训练。关键引用:“multi-purpose crawlers such as Googlebot, Applebot, and BingBot will be blocked by customers who have selected to block Training”。 - 评论4(tekacs)批评Cloudflare“两面下注”,既提供AI产品又限制爬虫,认为其立场虚伪。关键引用:“It's kind of exhausting seeing Cloudflare playing both sides of the arms race”和“flagrantly calling out their position here as if it's a positive”。

2. 对“按爬取付费”功能的失望(评分:None) - 评论5(zzzeek)抱怨“按爬取付费”功能长期无法使用,申请后无回应,希望AI爬虫直接付费。关键引用:“I want pay-per-crawl. I clicked the link for it a year ago... I heard absolutely nothing”和“I want the AI crawlers to pay me cash”。

3. 对网站控制权的担忧(评分:None) - 评论9(Fizz43)认为网站应完全禁止机器人,而非区分行为。关键引用:“The question is are they a bot or a human. It doesnt matter what they are doing I dont want bots on my site”。 - 评论10(sneak)指出技术上无法区分“允许索引但禁止训练”,认为此类承诺是谎言。关键引用:“You can’t give responses that say ‘this is ok for indexing but not for training’. Anyone trying to sell you this sort of technology is lying”。

4. 对Cloudflare技术影响的负面反馈(评分:None) - 评论7(fc417fc802)建议使用PoW方案替代Cloudflare功能,批评其导致网站被完全屏蔽。关键引用:“I increasingly encounter outright blocks rather than any sort of captcha when visiting cloudflare ‘protected’ sites”和“You really are choosing to erode the core basis of the internet”。 - 评论11(noduerme)报告Cloudflare漏洞导致POST数据丢失,认为默认设置应关闭。关键引用:“the cf bug that stripped all POST data from requests to a SPA I manage for 4-5 hours last week”。

5. 对AI爬虫付费前景的怀疑(评分:None) - 评论8(holografix)认为AI公司不会付费爬取,更可能私下与Reddit等平台达成协议。关键引用:“I don’t think ADOG (anthropic, deepmind, openai, google) is going to pay to crawl”和“It’s more likely they’ll strike undisclosed agreements with major sources of discussion like reddit”。

6. 对灵活控制的需求(评分:None) - 评论12(TekMol)希望允许特定AI爬虫(如Google、OpenAI)并阻止匿名机器人,询问Amazon Cloudfront是否有类似方案。关键引用:“So is it possible to say ‘No bots except Google, OpenAI, Grok, Claude and Perplexity’?”和“I am getting hurt badly with insane amounts of requests from residential IPs that mimic real humans”。