快讯列表

关于 robots.txt 的快讯列表

时间 详情
2025-11-01
03:59
AI数据抓取收紧2025:网站用诱饵、拦截与付费墙反击 — AI概念股与Web3数据代币的交易要点

据@DeepLearningAI称,网站正通过诱饵、拦截规则和付费墙来对抗AI爬虫,在线数据获取之争升级,被形容为一场“暗战”。来源:DeepLearning.AI 推文,2025年11月1日。 数据供给收紧的直接案例包括纽约时报起诉OpenAI与微软,指称其未经许可使用新闻内容用于模型训练。来源:纽约时报,2023年12月27日。 平台方开始通过授权变现,例如Reddit与谷歌达成合作,向模型训练与搜索提供实时内容。来源:Reddit 新闻稿,2024年2月22日。 开发者知识平台也在签订数据授权协议,例如Stack Overflow与OpenAI合作,将其数据用于模型训练与产品集成。来源:Stack Overflow 新闻稿,2024年5月6日。 对交易者而言,开源网页数据被限制与管道转向授权,意味着AI训练与推理输入成本上升,价值更偏向内容权利方与数据供应商。来源:Reddit 新闻稿,2024年2月22日;Stack Overflow 新闻稿,2024年5月6日。 加密市场方面,围绕合规授权与数据溯源的去中心化数据与算力项目值得关注,包括Ocean Protocol(OCEAN)的代币化数据市场、Render Network(RNDR)的去中心化GPU算力,以及Fetch.ai(FET)的智能体网络。来源:Ocean Protocol 文档;Render Network 文档;Fetch.ai 文档。 一项关键运行风险是更多网站通过robots.txt屏蔽如GPTBot等AI爬虫,这将使合规接入与付费数据源成为默认路径。来源:OpenAI 发布GPTBot与爬虫屏蔽说明,2023年8月7日。

来源