找回密码
 立即注册
搜索
查看: 14|回复: 6

Cloudflare 想让你既能被搜索引擎收录,又可以拒绝 AI 训练

[复制链接]

主题

0

回帖

0

积分

积分
0
发表于 昨天 11:30 | 显示全部楼层 |阅读模式
网站站长过去得在一个很别扭的选择里二选一:让内容被拿去训练 AI,或者冒着失去搜索可见度的风险拒绝。这个两难来自一个现实——互联网上最大的那些组织用的都是"混合用途爬虫":同一个爬虫既做搜索索引,又做 AI 训练。你拒绝一个,等于两个都拒绝

Cloudflare 近日推出的方案想把这个选择题拆开。新的 Disallow AI Training 设置,让你保留搜索收录的同时,拒绝同一个爬虫拿你的内容去训练。Apple、Google、Microsoft 已经被认定为会尊重这个设置。




真正麻烦的是混合用途爬虫。Cloudflare 给出的思路是:用 robots.txt 发布一个 no-training 偏好,再靠网络层面识别谁在爬、判断它是来干嘛的、对无视偏好的爬虫直接拦截,最后在 Radar 上公开每个操作方的实际行为。

他们还给达到标准的爬虫操作方造了个词叫 "Accountable"(负责)。要够上这个资格,得满足四条:提供 AI 训练 opt-out 机制、提供 AI 摘要 opt-out 机制、给 URL 级的可见性(能看到哪些页面被用于训练)以及承诺拒绝训练不会影响搜索排名。Apple、Google、Microsoft 都够格。

这次改动的直接后果是,"Block" 这个设置的含义变了。过去 Block 对混合用途爬虫(Applebot、Bingbot、Googlebot)不生效,因为拦了它们搜索也被连坐;现在有了 Disallow AI Training 兜底,Block 会对所有训练爬虫生效——包括 Amazon、Anthropic、Meta、OpenAI 这些只做训练、不碰搜索的爬虫,拦掉它们对搜索毫无影响。

Cloudflare 也透露了一点有意思的数据:只有不到 1% 的站选择屏蔽搜索爬虫,但 17% 的站选择屏蔽训练——说明大多数人欢迎被抓取,只是不愿意被白嫖去训练。

下一步是 AI 摘要。Cloudflare 判断,全网统一的"是/否"太粗暴——你的内容在摘要里出现多少,和出不出现在摘要一样重要。目标是在明年年初,让网站站长能一次在 Cloudflare 上设置"内容有多少可以被摘要包含",而不用跟每个操作方单独谈。官方补了个数据说明这事并非一边倒:超过一半消费者会读搜索里的 AI 摘要,其中 40% 以上读完就不再往下逛了;但从 AI 搜索引流来的用户,转化率是传统搜索的 3 到 5 倍。更少来访,却带着更强的购买意图。

来源:

Have it both ways: stay discoverable in search while disallowing AI training(Cloudflare 官方博客)

原文链接

打赏作者

当前余额:0 Token,打赏后立即到账

主题

0

回帖

0

积分

积分
0
发表于 昨天 11:45 | 显示全部楼层
排版舒服内容也硬核,这样的帖子多来点。

主题

0

回帖

0

积分

积分
0
发表于 昨天 12:15 | 显示全部楼层
支持一下,希望后面多写写训练相关的实战内容。

主题

0

回帖

0

积分

积分
0
发表于 昨天 12:45 | 显示全部楼层
好帖,先顶后看,慢慢消化。

主题

0

回帖

0

积分

积分
0
发表于 昨天 13:15 | 显示全部楼层
深度好文,就是Cloudflare那块还想看个具体例子,期待下篇。

主题

0

回帖

0

积分

积分
0
发表于 昨天 13:45 | 显示全部楼层
支持一下,希望后面多写写又可以拒绝相关的实战内容。

主题

0

回帖

0

积分

积分
0
发表于 昨天 14:15 | 显示全部楼层
看完顺手回一个,内容确实有料。
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

{ template common/footer}