惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Hugging Face - Blog
Hugging Face - Blog
Google DeepMind News
Google DeepMind News
云风的 BLOG
云风的 BLOG
WordPress大学
WordPress大学
Vercel News
Vercel News
Apple Machine Learning Research
Apple Machine Learning Research
T
Tailwind CSS Blog
I
InfoQ
小众软件
小众软件
Recent Announcements
Recent Announcements
博客园 - 【当耐特】
The GitHub Blog
The GitHub Blog
大猫的无限游戏
大猫的无限游戏
美团技术团队
T
The Blog of Author Tim Ferriss
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
酷 壳 – CoolShell
酷 壳 – CoolShell
MongoDB | Blog
MongoDB | Blog
V
V2EX
J
Java Code Geeks
有赞技术团队
有赞技术团队
博客园 - 聂微东
B
Blog RSS Feed
博客园 - 司徒正美

奇客Solidot–传递最新科技情报

NASA 关闭旅行者 1 号的 LECP 仪器以节省电力维持运行 奇客Solidot | 人形机器人打破人类半马世界纪录 奇客Solidot | 卫星无人机图像显示美国四成数据中心可能延期 奇客Solidot | 内存芯片短缺可能持续到 2030 年 奇客Solidot | 果糖不只是糖,它更像是激素 奇客Solidot | Grinex 交易所声称遭敌对国家黑客入侵 奇客Solidot | 大白鲨面临过热风险 奇客Solidot | 暗能量巡天绘制出迄今最大的高分辨率 3D 宇宙地图 微软正式将 FAT32 分区大小从 32GB 增加到 2TB 奇客Solidot | 拼多多美团等被罚 36 亿 奇客Solidot | 英伟达 CEO 反对进一步限制向中国出口芯片 奇客Solidot | 美国科技巨头成功在欧盟法律中将数据中心环境影响列为保密信息 奇客Solidot | 乌克兰军方开始大规模使用地面武装机器人 Firefox 加入了对 Web Serial API 的支持 奇客Solidot | 大自然仍然在铸造人类基因 奇客Solidot | 威尼斯如何应对海平面上升 SpaceX 将发射 ESA 的 Rosalind Franklin 火星漫游车 奇客Solidot | Discourse 强调会继续开源 奇客Solidot | 美国主流媒体封禁互联网档案馆的存档机器人 奇客Solidot | 新研究再次证实 AI 有害大脑 Mozilla 宣布开源可自托管 AI 客户端 Thunderbolt 奇客Solidot | Linux Mint 宣布采用更长的开发周期 奇客Solidot | 人类的噪音在伤害动物,我们会学会安静吗? 奇客Solidot | 帝企鹅因气候变化导致数量减少被列为濒危 奇客Solidot | 抹香鲸的发声沟通方式与人类相似 奇客Solidot | 中国手游如何征服世界 奇客Solidot | IPv6 普及度突破 50% 奇客Solidot | 挪威男子在移植其兄弟的干细胞后治愈 HIV 波士顿动力的机器狗集成了 Google 的 Gemini 模型 奇客Solidot | Cal.com 因 AI 从开源转为闭源
奇客Solidot | 维基基金会称 AI 爬虫导致带宽消耗增加五成
2025-04-03 · via 奇客Solidot–传递最新科技情报

​维基媒体基金会周二表示,无休止抓取内容的 AI 爬虫给其服务器造成了巨大压力。自 2024 年 1 月以来,下载多媒体内容的带宽增长了 50%。​维基媒体基金会托管了维基百科以及维基共享资源,其中维基共享资源提供了 1.44 亿份采用开放许可证的媒体文件,自 2024 年初以来,为获取模型训练数据 AI 公司通过直接抓取、API 和批量下载大幅增加了自动抓取量。非人类流量的指数级增长带来了高昂的技术和财务成本。维基百科的缓存系统是为可预测的人类浏览行为而设计的,但 AI 爬虫会不加区分的抓取内容,会抓取通常人类访问量很少的页面,导致缓存系统失效。维基媒体基金会发现,尽管机器人程序只占总页面浏览量的 35%,但它在其核心基础设施最昂贵的请求中占了 65%。原因是机器人请求的成本远高于人类请求,而且在快速增加。更糟糕的是 AI 爬虫通常不遵守规则,无视 robots.txt,会使用欺骗性的浏览器用户代理伪装成人类访客,甚至会轮流使用家庭 IP 地址以避免被屏蔽。AI 爬虫对网站可靠性团队造成了持续的干扰,团队必须一直阻止爬虫,以免影响人类访客的页面访问速度。

Ars:AI bots strain Wikimedia as bandwidth surges 50%