惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
爱范儿
爱范儿
博客园 - 三生石上(FineUI控件)
Vercel News
Vercel News
M
MIT News - Artificial intelligence
L
LangChain Blog
大猫的无限游戏
大猫的无限游戏
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
Microsoft Azure Blog
Microsoft Azure Blog
J
Java Code Geeks
Recent Announcements
Recent Announcements
Stack Overflow Blog
Stack Overflow Blog
人人都是产品经理
人人都是产品经理
IT之家
IT之家
F
Fortinet All Blogs
博客园 - 聂微东
U
Unit 42
Martin Fowler
Martin Fowler
腾讯CDC
博客园_首页
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
量子位
阮一峰的网络日志
阮一峰的网络日志
博客园 - Franky

博客园 - Angry_Panda

军事防务 —— 城市反无 —— 无线电侦测设备需要进行攻击目标分配吗?无线电侦测设备的调度在应用中是需要在部署时进行考虑还是在攻击时进行考虑 从一张AI合成的无人机救援图说起 —— 多人机协作的可行性 985大学不相信眼泪,信奉丛林法则;211大学更讲人情味 军事防务 —— 反无激光武器攻后的冷却和充能时间与其攻击的持续时长是否有关系 军事防务 —— 北京顺义李桥镇 (AI大模型生成答案)—— 反无激光武器攻后的冷却和充能时间与其攻击的持续时长是否有关系 军事防务:激光武器的参数 武器装备参数介绍 军事防务:城市反无 —— 无线电干扰设备的攻击范围 百家讲坛 —— 再度翻红 —— 长大后才发现最好的教育早已播下种子,只等阅历浇灌才真正发芽 军事防务 —— AFSim雷达传感器仿真技术 防务 —— 军事建模AFSIM —— 电磁波 为什么倒卖 军火最赚钱 —— 从防务公司的业务发展来看待军费问题 防务:防务业务 —— 武器开火后的返回结果 —— 武器结果:0=开火, 1=命中, 2=未命中 豆包AI回答 —— 为什么城市反无场景下无线电干扰设备即使击中目标也会一直攻击呢 防务:雷达和光电探测设备 —— 无人机的轨迹信息与真实位置信息的差异性,是根据随机函数来实现的吗,比如在真实位置上加一点的随机扰动吗 —— AFsim的手册 北京市顺义区李桥镇 —— 中科星图公司 —— 出行路线交通 —— “东方通勤车”(误区,“东方通勤车”的站点根本就找不到,如果不坐地铁,那么就坐850号公交) 北京市顺义区李桥镇(首都机场附件)—— 中科星图(星图防务) 公司宿舍 【转载】cessium python部署离线版本 ———— 如何使用Python操作三维地图 cessium —— cessium python部署离线版本 如何使用uv安装pytorch 基于GA-BP神经网络的防空导弹实时目标分配方法 【人生哲理】【视频】为什么说该花的钱不花,就会变成灾难呢? 随身移动WiFi ——50元级别的(三网 4G移动网络)—— 网速测试 豆包AI —— 为什么不把离散的状态空间属性用one-shot方式编码而是直接归一化为0到1范围的属性值 dogfight问题中(UAV 无人机空战——狗斗)—— 状态空间设计 为ubuntu系统安装samba网络磁盘,实现局域网中的共享网络磁盘 —— 跨系统文件共享的完整方案 sudo fwupdmgr get-upgrades —— 在 Linux 系统中,用 fwupd 工具查看当前机器所有可升级固件(BIOS/UEFI、SSD、雷电、外设等) git免密认证同步仓库代码报错——git@github.com: Permission denied (publickey) —— 所需的ssh-add加载加密私钥 —— 指定加密私钥存储位置 【转载】 执行 ssh-add 报错 Could not open a connection to your authentication agent —— git免密认证同步仓库代码,所需的ssh-add加载加密私钥 uv python环境管理工具 ubuntu系统python安装pycairo报错:Run-time dependency python found: NO (tried pkgconfig and sysconfig)
DeepSeek复现:TinyZero项目的配置及安装
Angry_Panda · 2026-04-04 · via 博客园 - Angry_Panda

来源:

全球掀DeepSeek复现狂潮!硅谷巨头神话崩塌,30刀见证啊哈时刻

本文使用的是0.5B的大语言模型,根据上面的资料(全球掀DeepSeek复现狂潮!硅谷巨头神话崩塌,30刀见证啊哈时刻)可以知道0.5B的大模型并不会出现思维链,因此无法成功训练出解决问题的模型。

那么为什么这里不使用1.5B或者3B的大语言模型呢,答案就是0.5B的模型就用了80GB的显存,如果是1.5B或者3B的LLMs,那么这个硬件的开销是租都租不起的。

为了完成本文中给出的安装步骤,共花费80元RMB,最终结论就是大模型这东西真不是一般人可以搞的,没钱没法搞,自己贴了小一百块才配置成功环境跑了个0.5B的模型的RL训练。

1. 源码下载:

git clone https://github.com/Jiayi-Pan/TinyZero

2. 升级pip

python3 -m pip install --upgrade pip

3. 安装并配置huggingface

pip install huggingface_hub

4. 安装命令:

注意下面的环境软件版本,python版本 3.9, 3.11均测试成功。

conda create -n zero python=3.9

conda activate zero


install torch [or you can skip this step and let vllm install the correct version for you]

pip install torch==2.4.0 --index-url https://download.pytorch.org/whl/cu121


install vllm

pip3 install vllm==0.6.3 # or you can install 0.5.4, 0.4.2 and 0.3.1

pip3 install ray


verl

pip install -e .


flash attention 2 (5090显卡下可以正常执行)

pip3 install flash-attn --no-build-isolation


quality of life

pip install wandb IPython matplotlib


多次卡死后Ctrl+C中断后重新安装成功。(5060ti显卡下可以成功执行)

pip install flash-attn==2.7.3 --no-build-isolation

安装过程中会进行编译,用时在30分钟以上,需要耐心等待。

实测,2.8.3版本的flash-attn即使安装成功运行后也会报错(5090ti显卡环境下)。

image

关于flash-attn的安装

由于多次安装flash-attn卡死,于是采用直接安装编译后版本而不是从源码开始重新编译(pip的方式为源码编译方式),源码下载地址:

https://github.com/Dao-AILab/flash-attention/releases

由于当前的 flash-attn 的稳定版本为2.8.3,于是选择该版本,同时本机的python为3.11, pytorch为2.4版本,cuda为12.1版本,于是选择具体版本为:

https://github.com/Dao-AILab/flash-attention/releases/download/v2.8.3/flash_attn-2.8.3+cu12torch2.4cxx11abiFALSE-cp311-cp311-linux_x86_64.whl

image

下载该版本到Windows主机上在通过xshell软件上传到nvidia云服务器上:

image

5. huggingface模型下载:

export HF_ENDPOINT=https://hf-mirror.com

hf download Qwen/Qwen2.5-0.5B-Instruct --local-dir Qwen2.5-0.5B-Instruct

image

6. 下载数据集:

export HF_ENDPOINT=https://hf-mirror.com

hf download Jiayi-Pan/Countdown-Tasks-3to4 --local-dir Countdown-Tasks-3to4 --repo-type dataset

image

7. 数据预处理

conda activate zero

python ./examples/data_preprocess/countdown.py --local_dir "../Countdown-Tasks-3to4"

image

image

8. 登录wandb账号

wandb login

输入API key:

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

image

8. 完整的运行命令

export N_GPUS=1
export BASE_MODEL="../Qwen2.5-0.5B-Instruct"
export DATA_DIR="../Countdown-Tasks-3to4"
export ROLLOUT_TP_SIZE=1
export EXPERIMENT_NAME=countdown-qwen2.5-0.5b
export VLLM_ATTENTION_BACKEND=XFORMERS

bash ./scripts/train_tiny_zero.sh

显卡环境:

image

注意显存需要大于50GB,因此只能使用H800、A100 等型号显卡。

image

image

image

硬件平台上需要注意的条件是:


显卡的显存至少需要80GB,因为该程序运行过程中最高的显存需求高于70GB,虽然这个程序使用的模型是0.5B,但是该模型运行过程中加上缓存、优化器等等方面,总的显存峰值不低于70GB,也就是说这个程序你只能使用80GB的显卡来运行(再不修改默认运行参数的情况下)。

image

相关:

深度学习 —— 人工智能 —— 大语言模型(LLM) —— flash-attn 安装卡死

huggingface下载数据集报错:如何解决huggingface的网络问题 —— 代理

本博客是博主个人学习时的一些记录,不保证是为原创,个别文章加入了转载的源地址,还有个别文章是汇总网上多份资料所成,在这之中也必有疏漏未加标注处,如有侵权请与博主联系。 如果未特殊标注则为原创,遵循 CC 4.0 BY-SA 版权协议。