Mojo Dojo 发布 AI 爬虫索引报告
先了解这件事
2026年10月8日,mojodojo.io 发布实时数据显示,过去30天内AI爬虫占该站点机器人流量的23.8%,其中AI训练类占比16.8%。统计通过比对运营商IP段验证,排除了伪装请求。关键细节在于验证机制的有效性:在所有声称是机器人的访问中,系统识别并过滤了部分伪造IP。
AI 根据报道生成 · 1 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
- Hacker News · AI单站实测显示AI爬虫占24%流量且存在显著IP伪造现象
mojodojo.io 在 2026 年 10 月 8 日发布的实时数据显示,过去 30 天内 AI 爬虫(含训练、搜索及用户代理)占据了该站点 23.8% 的机器人流量,其中 AI 训练类爬虫以 16.8% 的份额成为最大单一类别,远超传统搜索引擎的 25.5%。该统计通过比对运营商公布的 IP 段进行了严格验证,排除了伪装成 Googlebot 或 GPTBot 的无效请求。 关键细节在于验证机制的有效性:在所有声称是机器人的访问中,有 11.4% 被确认为来自错误 IP 的伪造攻击,例如 PerplexityBot 和 ChatGPT-User 均被检测到数十次伪造尝试。此外,不同用途的爬虫行为差异巨大,FacebookBot 作为社交预览工具日均访问 346 次且每页平均抓取 59.4 次,而 AhrefsBot 则覆盖了 3,018 个独立页面,显示出 SEO 工具与 AI 训练模型在资源消耗模式上的根本不同。 这一事实表明,当前 AI 生态中的“爬取”行为已不再是简单的索引构建,而是形成了包含模型训练、实时问答检索和用户代理读取的复杂分层结构。推断部分指出,随着 AI Agent 和 RAG 系统的普及,非人类流量的增长将主要源于这些新场景而非传统 SEO,但 11.4% 的伪造率也意味着现有的 User-Agent 识别机制已失效,必须依赖 IP 白名单等更底层的验证手段来区分真实业务流量与恶意攻击。猜测部分认为,未来网站运营方可能需要针对 AI 训练流量制定专门的计费或限速策略,因为这部分流量目前正以免费方式大规模消耗服务器资源。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。