惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
博客园_首页
雷峰网
雷峰网
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
WordPress大学
WordPress大学
腾讯CDC
T
Tailwind CSS Blog
A
About on SuperTechFans
H
Hackread – Cybersecurity News, Data Breaches, AI and More
The GitHub Blog
The GitHub Blog
T
The Blog of Author Tim Ferriss
G
Google Developers Blog
The Cloudflare Blog
D
DataBreaches.Net
Recent Announcements
Recent Announcements
Engineering at Meta
Engineering at Meta
B
Blog
博客园 - 聂微东
阮一峰的网络日志
阮一峰的网络日志
月光博客
月光博客
博客园 - 司徒正美
MongoDB | Blog
MongoDB | Blog
Google DeepMind News
Google DeepMind News
Apple Machine Learning Research
Apple Machine Learning Research

人工智能

暴论:只把 AI 用来提高工作效率,那么你没有在 AI 浪潮中收益 前阵子看到 4 台 MAC 运行万亿参数模型的新闻,当前大致投入在 30 万 RMB 左右,大家预测一下几年后会实现低成本(5W 以下)本地部署万亿参数的模型? 大家有 AI 焦虑吗? ChatGPT 的细节体验是越来越好了,一天一个样! 计划要给行政办公人员做 AI 培训,内容包括指导如何利用 AI 编写小工具应用 Zcode GLM5.2 思考了 5 分钟不出字,只是我一个人问题吗 GLM5.2 有点豆包那味了 ai 对动漫的影响,爱奇艺动漫《都市古医仙》似乎全转 ai 生成了 一个抢 GLM plan 的方法 v2 上面的这种风格的内容总结图是怎么生成的呢? 分享一下我试用过的几款 AI 套餐 AI 写项目就想熵增 中转站,代充值,这种真是避而远之 cursor 的 auto 模式今天突然使用中文思考 怎么系统学习 AI? copilot 用不了了现在用什么 算力远远不够。 现在有哪个国产大模型可以拿来踏踏实实的写代码了吗? 是不是 claude code 没有 hermers 智能啊? 拍一个 token 自由的短剧咋样,有没有前途 拍一个 token 贬值时代富豪的短剧怎么样? 小米 Mimo MAX 订阅 速蹬 ProofHound - 开源 Prompt 分类任务优化及全生命周期平台 如果问各大 AI,谁被网友们称作畜生 AI 公司公司…… AI 真是太恶心了,本来指望他攻克癌症、可控核聚变等真正造福人类的事情,结果弄个大语言模型淘汰人类脑力工作 为什么进入 aistudio 后 gpu 狂转 [开源免费] 实时数字人 OpenTalking 项目演示 Qwen3.6 MTP GGUF 发布:本地推理 1.4-2.2 倍加速 用 ai 把各大平台的创作声明弹窗自动化了,顺带支持 CLI 和 MCP 现在 20260516,各行各业,真的有很多人用 cc/codex 来重构自己的工作流吗?
我还以为大模型的训练语料早就覆盖了 zlib 或安娜档案这类的...
intoext · 2026-05-30 · via 人工智能

原来不是。 小米自己的回答是这样:

  1. 训练数据的来源构成 主流大模型的语料主要是:

Common Crawl (互联网网页)—— 占大头 新闻、维基百科、Reddit 等网络文本 代码( GitHub 等)

书籍只占一小部分,而且受版权法律限制,不能随意大规模使用

Meta 的 LLaMA 训练数据中确实包含 BookCorpus 等书籍数据集,但远不是"把整个图书馆都吃进去了"。

图书出版商正在起诉 AI 公司,所以各大厂商在书籍数据上其实越来越谨慎。

  1. 模型不等于数据库——"压缩"而非"存储" 大模型是通过梯度下降把训练数据压缩进数十亿个参数的权重中,而不是原文存储。这意味着:

热门书籍(如《哈利波特》《三体》):讨论量大,模型反复见过相关内容,确实能对答如流 冷门书籍(如一本 2005 年出版的日本推理小说):可能只是"见过"甚至"没见过",复述会出错甚至胡编 具体细节:即使是热门书,模型也很容易在页码、引用原文、小配角名字等细节上出错

  1. 一个实验你就可以做 随便从安娜的档案里找一本中等偏冷门的书(比如某本 2010 年代出版的、豆瓣评分人数不到 500 的中文书),然后问大模型:

"这本书的第 3 章主要讲了什么?" "请引用书中第 47 页的原文。" 你会发现模型大概率要么答不上来,要么一本正经地胡说八道。