惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

T
The Blog of Author Tim Ferriss
WordPress大学
WordPress大学
博客园 - Franky
The Cloudflare Blog
T
Tailwind CSS Blog
宝玉的分享
宝玉的分享
小众软件
小众软件
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
Apple Machine Learning Research
Apple Machine Learning Research
月光博客
月光博客
B
Blog
Y
Y Combinator Blog
V
V2EX
有赞技术团队
有赞技术团队
M
MIT News - Artificial intelligence
博客园 - 司徒正美
IT之家
IT之家
G
Google Developers Blog
C
Check Point Blog
Engineering at Meta
Engineering at Meta
Microsoft Security Blog
Microsoft Security Blog
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
GbyAI
GbyAI
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻

Prompt 语宙

kimi-thinking-preview – 月之暗面推出的多模态思考模型 pdf-craft – 开源 PDF 转 Markdown 工具 UltraMem – 字节豆包大模型团队推出的全新超稀疏模型架构 EasyControl – Tiamat AI 联合上海科大等开源的图像生成控制框架 GaussianCity – 南洋理工大学 S-Lab 团队推出的 3D 城市生成框架 X-Prompt – 用于多模态视频目标分割的通用框架 豆包大模型1.5 – 字节跳动推出的最新版大模型 GaussianAnything – 南洋理工 S-Lab 和上海 AI Lab 等推出的 3D 生成框架 Cube 3D – Roblox 推出的 AI 3D 生成模型 OpenMath-Nemotron – 英伟达开源的数学推理系列模型 MAI Transcribe-1.5 – 微软 MAI 推出的语音转文本模型 Seed1.5-Embedding – 字节跳动 Seed 团队推出的向量模型 2026世界杯人机大战引爆!联想携手DeepSeek等顶尖AI大模型,对战亿万球迷预测冠军 高考公平守护战!豆包、文心等主流大模型集体禁用拍题功能 ShotAdapter – Adobe联合UIUC推出的多镜头视频生成框架 Devstral – Mistral AI联合All Hands AI开源的编程专用AI模型 MMaDA – 字节联合普林斯顿大学等推出的多模态扩散模型 Software Copyright Materials Skill – 开源软著资料生成Skill Dulus – 开源的 CLI AI Agent,可驱动多模型工具调用 Reasonix – 专为 DeepSeek 推出的开源终端编程 Agent Mega-ASR – NTU、NUS、上海AI Lab开源的语音识别模型 CodeGraph – 开源代码知识图谱工具,加速代码理解和分析 MiniCPM5-1B – 面壁智能联合清华开源的端侧文本基座模型 Horizon – 开源 AI 信息聚合系统,构建专属新闻雷达 BitCPM-CANN – 面壁智能联合清华开源的端侧大模型 Xiaomi Auto World Model – 小米推出的辅助驾驶世界模型 opera-browser-cli – Opera Neon 开源的命令行工具 omp – 开源的 AI 终端编程智能体,能与 IDE 深度联动 Claude Opus 4.8 – Anthropic 推出的旗舰级大语言模型 Hy-Memory – 腾讯混元推出的 Agent 记忆插件
Karpathy重磅开源nanochat:仅需100美元,从零自建你的ChatGP...
站外新闻 · 2026-06-20 · via Prompt 语宙

💡 站外导读:在AI大模型军备竞赛的当下,高昂的训练成本和复杂的工程栈,将无数开发者、研究者和中小团队挡在门外。人人都在谈论GPT,但如何亲手从零构建一个,仍是横亘在理论与实践之间的巨大鸿沟。正是在此背景下,前OpenAI创始成员、AI领域权威Andrej Karpathy开源了nanochat,旨在为这一核心痛点提供一个优雅的解决方案,将“自建ChatGPT”的门槛降至前所未有的低点。

nanochat是AI领域专家Andrej Karpathy发布的开源项目,以极低成本和高效流程训练小型语言模型,实现类似ChatGPT的对话功能。仅需约100美元(使用8张H100 GPU训练4小时),即可训练出能进行基础对话、创作故事/诗歌、回答简单问题的小型模型。若增加预算至1000美元(训练约41.6小时),模型性能可显著提升,能解决简单数学/代码问题并参与多项选择题测试。项目包含从数据准备、预训练、中期训练、监督微调(SFT)、强化学习(RL)到推理部署的完整流程,约8000行代码实现端到端训练,代码简洁易读,适合学习和实践。

  • nanochat是什么
  • nanochat的主要功能
  • nanochat的技术原理
  • nanochat的项目地址
  • nanochat的应用场景
      • 📝 站长洞察 (Editor’s Insight)

nanochat

nanochat的主要功能

  • 分词器训练:使用Rust语言实现训练分词器,负责将文本转换为符号码本序列。

  • 预训练:在FineWeb数据集上对Transformer架构的大语言模型进行预训练,并通过CORE指标评估模型性能。

  • 中期训练:在SmolTalk用户-助手对话数据集、多项选择题数据集、工具使用数据集上进行中期训练,使模型适应对话场景。

  • 监督微调(SFT):在世界知识多项选择题数据集(ARC-E/C、MMLU)、数学数据集(GSM8K)、代码数据集(HumanEval)上进行监督微调,提升模型在特定任务上的表现。

  • 强化学习微调(RL):使用“GRPO”算法在GSM8K数据集上对模型进行强化学习微调,进一步优化模型性能。

  • 推理部署:实现高效模型推理,支持KV缓存、简易预填充/解码流程、工具使用(轻量级沙箱环境中的Python解释器),并通过CLI或类ChatGPT的WebUI与模型交互。

  • 成绩单生成:生成单一的Markdown格式报告卡,总结整个训练推理流程,并以“游戏化”形式展示结果。

nanochat的技术原理

  • 极简代码架构:整个项目仅约8000行代码,采用单一代码库实现,依赖极少,结构清晰,易于理解和修改。

  • Rust语言分词器:使用Rust语言实现训练分词器,负责将文本转换为符号码本序列,提升分词效率和性能。

  • Transformer架构:基于Transformer架构构建大语言模型,通过预训练学习语言模式和知识。

  • 数据驱动训练:在FineWeb等数据集上进行预训练,通过大量文本数据让模型学习语言表达和知识。

  • 中期训练适配:在SmolTalk等对话数据集上进行中期训练,使模型适应对话场景和特定任务。

  • 强化学习优化:使用“GRPO”算法在特定数据集上进行强化学习微调,进一步优化模型性能。

  • 高效推理引擎:实现带有KV缓存的推理引擎,支持预填充和解码流程,提升推理效率。

  • WebUI交互:提供类ChatGPT的网页界面,用户可以通过WebUI与训练好的模型进行交互。

nanochat的项目地址

  • Github仓库:https://github.com/karpathy/nanochat

nanochat的应用场景

  • 个人与团队:适合网络安全意识强的个人或团队,在内部网络中快速建立加密通讯渠道。

  • 开发者与技术爱好者:作为学习和研究P2P网络、加密技术和命令行应用开发的实战平台。

  • 临时工作小组:如应急响应小组,在没有中央服务器的情况下迅速组建沟通网络。

  • 教育与研究:nanochat为研究人员和学习者提供了一个低成本、易于理解和改进的LLM开发平台。

📝 站长洞察 (Editor’s Insight)

nanochat的意义远超一个技术Demo。在行业热议模型参数与榜单时,Karpathy以“全栈教育”为核心,回归本质——将千亿参数模型的构建过程“降维”解构。这不仅是代码开源,更是对AI研发范式的一次重要祛魅:它证明,通过精巧的架构设计(如Rust分词器)与数据驱动流程,小模型亦能涌现惊人能力。这预示着未来AI创新将更依赖工程优化与数据质量,而非单纯堆算力。对于国内产业而言,这提供了绕过高算力依赖、发展特色小模型与垂直应用的全新思路,值得所有技术决策者深度关注。