news 2026/9/16 19:48:16

ChatGPT成为互联网最受阻止的爬虫机器人

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
ChatGPT成为互联网最受阻止的爬虫机器人

根据Cloudflare发布的2025年度互联网回顾报告,ChatGPT的网络爬虫GPTBot已成为互联网上最受阻止的机器人,而其最大竞争对手谷歌则是最受允许的爬虫。更有趣的是,虽然ChatGPT是最受阻止的机器人,但实际上Anthropic的Claude AI引擎对网站所有者来说是最缺乏互惠价值的服务。

每年,互联网基础设施公司Cloudflare都会发布互联网现状分析报告。今年的重要发现包括:

互联网流量增长19%,星链流量激增130%。谷歌仍是最受欢迎的互联网平台,ChatGPT成为最受欢迎的AI问答引擎。Facebook依然是最受欢迎的社交服务,YouTube在流媒体领域获胜。非人类机器人现在占互联网流量的56.5%,而人类用户仅占43.5%。

机器人使用情况分析

机器人使用量已超过互联网活动的50%。最常见的机器人是谷歌和必应等搜索引擎机器人,但增长最快的是来自AI服务的机器人,它们希望获得谷歌已经掌握的所有信息。GPTBot在夏末的使用量激增了305%。

然而,一些网站所有者不希望AI了解他们提供的所有内容,因此通过robots.txt文件阻止AI爬虫。这是一种简单的方式来表达"不要查看我的内容"。值得注意的是,遵守这一规定完全是自愿的,AI服务Perplexity就被指控忽视robots.txt声明,无视限制继续爬取网站。

爬虫阻止与允许情况

2025年最受阻止的网络爬虫是OpenAI的GPTBot。第二受阻止的是CCBot,由一个声称维护开源网络内容数据库的非营利组织提供。谷歌的爬虫排名第三。

然而,由于人们仍希望从谷歌获得网络流量,谷歌的机器人也是互联网上最受允许的机器人,其次是微软的必应机器人,第三名是OpenAI的GPTBot。

这种看似矛盾的现象反映了不同网站所有者的不同策略。一些网站所有者希望被看到和使用,认为这有助于他们成长;而另一些则选择封闭,认为机器人在没有充分补偿的情况下夺取了价值。

爬取与推荐比率分析

Cloudflare提供的爬取推荐比率图表揭示了公司允许服务爬取其网站时的隐含交易条件。该比率很简单:我的网站被机器人分析或搜索多少次,相对于该服务向我发送多少真实人类用户。

传统搜索引擎在这方面表现最佳,相比AI引擎提供更多回报流量:

谷歌:约10比1(每发送1个访客需要10次爬取)

百度:约1比1

DuckDuckGo:约1比1

微软:约100比1(主要是必应)

Perplexity:约100比1

OpenAI/ChatGPT:约1000比1

Anthropic:约100000比1

作为网站所有者,1比1的爬取推荐比率几乎是理想状态,10比1还不错,100比1甚至1000比1都可以理解。但100000比1意味着大量爬取却几乎没有可察觉的回报。

其他有趣发现

Cloudflare 2025年雷达报告中最奇特的消息是,恶意和垃圾邮件最危险的域名是.christmas。因此在今年庆祝节日时,不要打开任何来自包含"Christmas"字样域名的邮件。

报告还显示,互联网中断的最大原因不是事故或灾难,而是政府指令关闭。美国占全球机器人流量的40%,5.6%的电子邮件包含恶意攻击。

Q&A

Q1:GPTBot为什么成为最受阻止的网络爬虫?

A:GPTBot是ChatGPT的网络爬虫,用于收集互联网信息并转化为知识。许多网站所有者认为AI机器人在没有充分补偿的情况下获取了他们的内容价值,因此选择通过robots.txt文件阻止GPTBot访问。同时,GPTBot的使用量在夏末激增了305%,增加了网站的负担。

Q2:爬取推荐比率是什么意思?

A:爬取推荐比率是指AI服务或搜索引擎爬取网站的次数与向该网站发送真实用户访问次数的比例。例如,谷歌的比率约为10比1,意味着每爬取10次会发送1个用户;而Anthropic的比率高达100000比1,意味着爬取10万次才发送1个用户,这对网站所有者来说价值极低。

Q3:为什么谷歌既是最受阻止也是最受允许的爬虫?

A:这反映了不同网站所有者的不同策略。谷歌作为最大的搜索引擎,一些网站希望被谷歌收录以获得流量,因此允许其爬虫;但另一些网站担心内容被过度利用而选择阻止。谷歌的爬取推荐比率相对合理(约10比1),比AI服务提供更多回报流量。


版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/16 7:09:30

54、多线程与CPU调度:深入解析与对比

多线程与CPU调度:深入解析与对比 多线程信号处理与线程管理 在多线程应用中,信号处理是一个关键环节。需要注意的是, sigwait(3) 、 sigwaitinfo(2) 和 sigtimedwait(2) 这些API无法等待内核同步生成的信号,像 SIGFPE 和 SIGSEGV 这类表示某种故障的信号,只能…

作者头像 李华
网站建设 2026/9/14 16:24:37

57、高级文件 I/O 技术详解

高级文件 I/O 技术详解 1. 缓冲区与内核页缓存 在进行文件 I/O 操作时,如果内存不是限制因素,分配一个中等至较大的缓冲区并通过它执行 I/O 操作会有所帮助。确定缓冲区的大小需要在目标平台上进行一些研究。早期,管道 I/O 使用大小为一页的内核缓冲区,而在现代 Linux 内…

作者头像 李华
网站建设 2026/9/15 9:56:21

预测算法三:LSTM、EMDKPCALSTM等

预测算法三:LSTM、EMDKPCALSTM等 1、采用基础LSTM、EMDLSTM以及采用EMDKPCALSTM,先对数据进行模态分解,对分解后的IMF分量进行主成分分析,最后利用预测算法进行预测,并将三种算法进行对比 2、算法实际应用效果需要与数…

作者头像 李华
网站建设 2026/9/16 5:30:33

Kotaemon本地化部署指南:保障数据安全的最佳实践

Kotaemon本地化部署指南:保障数据安全的最佳实践 在金融、医疗、法律等行业,一个共同的挑战正日益凸显:如何在享受大语言模型(LLM)带来的智能对话能力的同时,确保敏感信息不被泄露?当员工询问“…

作者头像 李华
网站建设 2026/9/16 11:34:13

Kotaemon框架的核心组件及其作用机制

Kotaemon框架的核心组件及其作用机制 在企业智能化转型的浪潮中,构建一个既准确又可靠的智能对话系统,早已不再是简单地“接入大模型”就能解决的问题。许多团队发现,尽管使用了最先进的LLM,生成的回答依然存在幻觉、缺乏依据、无…

作者头像 李华
网站建设 2026/9/16 0:41:48

EmotiVoice语音合成在儿童教育产品中的安全考量

EmotiVoice语音合成在儿童教育产品中的安全考量 在智能教育设备日益普及的今天,越来越多的儿童通过AI语音与虚拟角色互动学习。从会讲故事的智能音箱到能即时反馈的数学练习App,语音合成技术正深刻改变着儿童的学习方式。然而,当一个孩子听到…

作者头像 李华