惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

N
News | PayPal Newsroom
IT之家
IT之家
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
大猫的无限游戏
大猫的无限游戏
GbyAI
GbyAI
Threat Intelligence Blog | Flashpoint
Threat Intelligence Blog | Flashpoint
L
LangChain Blog
S
SegmentFault 最新的问题
CTFtime.org: upcoming CTF events
CTFtime.org: upcoming CTF events
Project Zero
Project Zero
P
Privacy & Cybersecurity Law Blog
V
Vulnerabilities – Threatpost
博客园 - 三生石上(FineUI控件)
Recorded Future
Recorded Future
The Hacker News
The Hacker News
C
CXSECURITY Database RSS Feed - CXSecurity.com
C
CERT Recently Published Vulnerability Notes
宝玉的分享
宝玉的分享
aimingoo的专栏
aimingoo的专栏
T
Tor Project blog
T
The Exploit Database - CXSecurity.com
Schneier on Security
Schneier on Security
H
Help Net Security
cs.AI updates on arXiv.org
cs.AI updates on arXiv.org
M
MIT News - Artificial intelligence
W
WeLiveSecurity
P
Proofpoint News Feed
A
About on SuperTechFans
S
Securelist
I
InfoQ
G
Google Developers Blog
博客园 - 司徒正美
博客园 - 叶小钗
Latest news
Latest news
F
Fortinet All Blogs
G
GRAHAM CLULEY
腾讯CDC
Jina AI
Jina AI
S
Schneier on Security
I
Intezer
V
Visual Studio Blog
美团技术团队
V2EX - 技术
V2EX - 技术
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
The Cloudflare Blog
Microsoft Security Blog
Microsoft Security Blog
Blog — PlanetScale
Blog — PlanetScale
P
Proofpoint News Feed
罗磊的独立博客
Y
Y Combinator Blog

博客园 - Angry_Panda

军事防务 —— 城市反无 —— 无线电侦测设备需要进行攻击目标分配吗?无线电侦测设备的调度在应用中是需要在部署时进行考虑还是在攻击时进行考虑 从一张AI合成的无人机救援图说起 —— 多人机协作的可行性 985大学不相信眼泪,信奉丛林法则;211大学更讲人情味 军事防务 —— 反无激光武器攻后的冷却和充能时间与其攻击的持续时长是否有关系 军事防务 —— 北京顺义李桥镇 (AI大模型生成答案)—— 反无激光武器攻后的冷却和充能时间与其攻击的持续时长是否有关系 军事防务:激光武器的参数 武器装备参数介绍 军事防务:城市反无 —— 无线电干扰设备的攻击范围 百家讲坛 —— 再度翻红 —— 长大后才发现最好的教育早已播下种子,只等阅历浇灌才真正发芽 军事防务 —— AFSim雷达传感器仿真技术 防务 —— 军事建模AFSIM —— 电磁波 为什么倒卖 军火最赚钱 —— 从防务公司的业务发展来看待军费问题 防务:防务业务 —— 武器开火后的返回结果 —— 武器结果:0=开火, 1=命中, 2=未命中 豆包AI回答 —— 为什么城市反无场景下无线电干扰设备即使击中目标也会一直攻击呢 防务:雷达和光电探测设备 —— 无人机的轨迹信息与真实位置信息的差异性,是根据随机函数来实现的吗,比如在真实位置上加一点的随机扰动吗 —— AFsim的手册 北京市顺义区李桥镇 —— 中科星图公司 —— 出行路线交通 —— “东方通勤车”(误区,“东方通勤车”的站点根本就找不到,如果不坐地铁,那么就坐850号公交) 北京市顺义区李桥镇(首都机场附件)—— 中科星图(星图防务) 公司宿舍 【转载】cessium python部署离线版本 ———— 如何使用Python操作三维地图 cessium —— cessium python部署离线版本 如何使用uv安装pytorch 基于GA-BP神经网络的防空导弹实时目标分配方法 【人生哲理】【视频】为什么说该花的钱不花,就会变成灾难呢? 随身移动WiFi ——50元级别的(三网 4G移动网络)—— 网速测试 豆包AI —— 为什么不把离散的状态空间属性用one-shot方式编码而是直接归一化为0到1范围的属性值 dogfight问题中(UAV 无人机空战——狗斗)—— 状态空间设计 为ubuntu系统安装samba网络磁盘,实现局域网中的共享网络磁盘 —— 跨系统文件共享的完整方案 sudo fwupdmgr get-upgrades —— 在 Linux 系统中,用 fwupd 工具查看当前机器所有可升级固件(BIOS/UEFI、SSD、雷电、外设等) git免密认证同步仓库代码报错——git@github.com: Permission denied (publickey) —— 所需的ssh-add加载加密私钥 —— 指定加密私钥存储位置 【转载】 执行 ssh-add 报错 Could not open a connection to your authentication agent —— git免密认证同步仓库代码,所需的ssh-add加载加密私钥 uv python环境管理工具 ubuntu系统python安装pycairo报错:Run-time dependency python found: NO (tried pkgconfig and sysconfig) 无人机 —— dogfight —— 经纬度与笛卡尔坐标系的相互转换、方位角的计算 防务:论文《基于 DoDAF 的反无人艇集群作战体系设计》 强化学习奖励函数 —— 双曲惩罚函数 —— 用于奖励函数设计 VR-Forces中发射与毁伤仿真机制 防务:导弹打击毁伤率网格计算法 如何配置远程的ubuntu服务器以使在本地windows电脑上可以进行X11图形转发——ssh远程X11转发的配置 反无人机 —— 三层区域划分 2026年6月19日 成都远程巨科 —— 课程内容 —— 北京竞业达集团(河北张家口启点教育) 2026年6月19日 硬十科技 —— 课程内容 —— 北京竞业达集团(河北张家口启点教育) 2026年5月30日 中科星图 —— 北京顺义区 —— 与财务实习生(小友)—— 顺义区(县、区城市中心)影院观影 2026年6月6日 北京国家博物馆 —— 北京顺义区中科星图公司 uv 工具操作 —— python docker里面安装windows容器 wsl —— 局域网访问wsl下的ubuntu主机 —— 命令行下进行网络配置 【转载】局域网访问WSL 使用镜像模式网络 简单实现 企业公司上班 —— 北京小区(顺义李桥镇)——水电费(卡) uv 创建Python环境 【转载】rpclib: client error C0002: Function ‘simGetImages‘ was called with an invalid number of arguments. TensorFlow1.15报错: W tensorflow/stream_executor/cuda/redzone_allocator.cc:312] Internal: Invoking ptxas not supported on Windows Relying on driver to perform ptx compilation 【转载】Airsim + UE4安装配置遇到的‘/projectfiles‘ 不是内部或外部命令,也不是可运行的程序或批处理文件问题解决 【转载】解决无法安装虚幻引擎错误代码 MD-DL-0 中科星图 —— 北京顺义区李桥镇 —— 星图防务 基于规则模板的深度强化学习决策算法 强化学习 —— Partially Observable Tasks(部分可观测任务): 部分可观测马尔可夫决策过程(POMDP)类 —— 含扰动与时延的鲁棒控制类(Perturbation & Delay)—— 动态系统辨识 + 元强化学习类(Meta-RL / System ID) 强化学习算法 —— 带自适应步长的策略梯度算法(PG算法、Adaptive step size for Adam optimizer) CEM算法出处 —— 交叉熵强化学习算法 —— 强化学习算法中经典的CEM算法 windows11 —— 电源管理 —— 休眠设置 故障检测 —— 电机故障 —— GitHub项目 python报错:raise Exception('ROM is missing for %s, see https://github.com/openai/atari-py#roms for instructions' % (game_name,)) Exception: ROM is missing for pong 神经网络概率编程框架 —— pyro概率编程 强化学习算法 —— 为什么TRPO算法使用状态值(V)而不是动作值进行计算? 强化学习算法 —— 时变基线 —— 时变基线的计算方式为:取批次内所有轨迹,对每个时间步的回报值做平均 强化学习算法 —— TRPO + GAE —— 原始的value function部分的实现算法 强化学习算法 —— TRPO —— KL散度求费雪信息矩阵时的trick —— 用10%数据估算费雪信息矩阵FIM 人工智能论文 —— 数学理论推导重点关键 —— heuristic approximation 具身智能:零一造物_ZERO机械臂 人工智能: 利用物理模型泛化学习机器人操纵 —— Leveraging Physics-Based Models To Learn Generalizable Robotic Manipulation 交叉熵强化学习算法 —— Cross entropy method (CEM) Reinforcement Learning —— RL 算法 人形机器人 —— Hugging Face 与 NVIDIA 加速开源 AI 机器人研发 强化学习 —— 论文:《Optimizing Expectations: From Deep Reinforcement Learning to Stochastic Computation Graphs》—— 作者:John Schulman 人工智能 —— 神经网络 —— Rop(R‑算子)是什么? —— 豆包AI生成 强化学习算法:PPO and TRPO算法实现细节 —— Implementation Matters in Deep RL: A Case Study on PPO and TRPO 利用多張GPU訓練大型語言模型—從零開始介紹DeepSpeed、Liger Kernel、Flash Attention及Quantization —— 【生成式AI時代下的機器學習(2025)】助教課 豆包AI自动生成答案 —— 强化学习算法库baseline中的ppo2算法是什么,与ppo有啥区别? 为什么强化学习算法主流框架是actor-critic而不是将actor-critic合并成只有critic的框架,使用q值通过softmax方法自动生成policy呢? 论文:《面向强化学习的可解释性研究综述》 python报错:ImportError: libGL.so.1: cannot open shared object file: No such file or directory python运行报错:pip安装package报错 —— Expected matching RIGHT_PARENTHESIS for LEFT_PARENTHESIS 纪念 —— 游戏 —— 国产游戏 —— 黑悟空 AI芯片管制是否会延迟中国AI的技术发展? 张Xue峰原话(全网流传最完整版) —— 社会就是一个大筛子 人工智能理论(实证法) —— 神经网络理论 —— 关于“彩票理论”的讨论 神经网络(人工智能)—— CNN模型在训练过程中图片的预处理过程对整体算法训练过程中计算效率的影响? 为什么显卡明明可以放下0.5B、1.5B甚至3B的大模型参数,但是训练的时候就会报显存不足的错误呢? 比赛视频2025年 —— 人形机器人越野避障 —— 机器人百米障碍赛夺冠纪录 如何解决 kagglehub下载速度慢的问题 —— kaggle下载速度慢如何解决 如何撰写发表CCF顶会论文 —— 如何写论文 科技公司的干部年轻化 —— 互联网一线大厂,如果30岁之前还没有做到项目负责人,那么可能就只能原地踏步了 —— 35岁后开启人生职业生涯的下半场 面试注意事项 算法工程师 —— 学人工智能技术找一个算法研发工程师职位的首要条件是什么? 学习工作时的伴听音乐 —— 在线音乐播放 祖籍 历史上哪件兵器最厉害? 辽宁省沈阳市民办高校教师岗位求职面试体验 (十分的不佳)—— 沈阳城市学院 强化学习(岗位招聘)—— 具身深度强化学习运控岗 经典视频 —— 强化学习入门视频 —— David Silver深度强化学习 —— 中文翻译版本(带中文字幕)—— 附:PPT文件(PDF版本) 为什么美国害怕不是第一 大语言模型:MedicalGPT: Training Your Own Medical GPT Model with ChatGPT Training Pipeline. 训练医疗大模型,实现了包括增量预训练(PT)、有监督微调(SFT)、RLHF、DPO、ORPO、GRPO。 豆包AI自动生成:985/211信息学院的人工智能专业的本科生和硕士生的课程内容 深度学习 —— 人工智能 —— 大语言模型(LLM) —— flash-attn 安装卡死
DeepSeek复现:TinyZero项目的配置及安装
Angry_Panda · 2026-04-04 · via 博客园 - Angry_Panda

来源:

全球掀DeepSeek复现狂潮!硅谷巨头神话崩塌,30刀见证啊哈时刻

本文使用的是0.5B的大语言模型,根据上面的资料(全球掀DeepSeek复现狂潮!硅谷巨头神话崩塌,30刀见证啊哈时刻)可以知道0.5B的大模型并不会出现思维链,因此无法成功训练出解决问题的模型。

那么为什么这里不使用1.5B或者3B的大语言模型呢,答案就是0.5B的模型就用了80GB的显存,如果是1.5B或者3B的LLMs,那么这个硬件的开销是租都租不起的。

为了完成本文中给出的安装步骤,共花费80元RMB,最终结论就是大模型这东西真不是一般人可以搞的,没钱没法搞,自己贴了小一百块才配置成功环境跑了个0.5B的模型的RL训练。

1. 源码下载:

git clone https://github.com/Jiayi-Pan/TinyZero

2. 升级pip

python3 -m pip install --upgrade pip

3. 安装并配置huggingface

pip install huggingface_hub

4. 安装命令:

注意下面的环境软件版本,python版本 3.9, 3.11均测试成功。

conda create -n zero python=3.9

conda activate zero


install torch [or you can skip this step and let vllm install the correct version for you]

pip install torch==2.4.0 --index-url https://download.pytorch.org/whl/cu121


install vllm

pip3 install vllm==0.6.3 # or you can install 0.5.4, 0.4.2 and 0.3.1

pip3 install ray


verl

pip install -e .


flash attention 2 (5090显卡下可以正常执行)

pip3 install flash-attn --no-build-isolation


quality of life

pip install wandb IPython matplotlib


多次卡死后Ctrl+C中断后重新安装成功。(5060ti显卡下可以成功执行)

pip install flash-attn==2.7.3 --no-build-isolation

安装过程中会进行编译,用时在30分钟以上,需要耐心等待。

实测,2.8.3版本的flash-attn即使安装成功运行后也会报错(5090ti显卡环境下)。

image

关于flash-attn的安装

由于多次安装flash-attn卡死,于是采用直接安装编译后版本而不是从源码开始重新编译(pip的方式为源码编译方式),源码下载地址:

https://github.com/Dao-AILab/flash-attention/releases

由于当前的 flash-attn 的稳定版本为2.8.3,于是选择该版本,同时本机的python为3.11, pytorch为2.4版本,cuda为12.1版本,于是选择具体版本为:

https://github.com/Dao-AILab/flash-attention/releases/download/v2.8.3/flash_attn-2.8.3+cu12torch2.4cxx11abiFALSE-cp311-cp311-linux_x86_64.whl

image

下载该版本到Windows主机上在通过xshell软件上传到nvidia云服务器上:

image

5. huggingface模型下载:

export HF_ENDPOINT=https://hf-mirror.com

hf download Qwen/Qwen2.5-0.5B-Instruct --local-dir Qwen2.5-0.5B-Instruct

image

6. 下载数据集:

export HF_ENDPOINT=https://hf-mirror.com

hf download Jiayi-Pan/Countdown-Tasks-3to4 --local-dir Countdown-Tasks-3to4 --repo-type dataset

image

7. 数据预处理

conda activate zero

python ./examples/data_preprocess/countdown.py --local_dir "../Countdown-Tasks-3to4"

image

image

8. 登录wandb账号

wandb login

输入API key:

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

image

8. 完整的运行命令

export N_GPUS=1
export BASE_MODEL="../Qwen2.5-0.5B-Instruct"
export DATA_DIR="../Countdown-Tasks-3to4"
export ROLLOUT_TP_SIZE=1
export EXPERIMENT_NAME=countdown-qwen2.5-0.5b
export VLLM_ATTENTION_BACKEND=XFORMERS

bash ./scripts/train_tiny_zero.sh

显卡环境:

image

注意显存需要大于50GB,因此只能使用H800、A100 等型号显卡。

image

image

image

硬件平台上需要注意的条件是:


显卡的显存至少需要80GB,因为该程序运行过程中最高的显存需求高于70GB,虽然这个程序使用的模型是0.5B,但是该模型运行过程中加上缓存、优化器等等方面,总的显存峰值不低于70GB,也就是说这个程序你只能使用80GB的显卡来运行(再不修改默认运行参数的情况下)。

image

相关:

深度学习 —— 人工智能 —— 大语言模型(LLM) —— flash-attn 安装卡死

huggingface下载数据集报错:如何解决huggingface的网络问题 —— 代理

本博客是博主个人学习时的一些记录,不保证是为原创,个别文章加入了转载的源地址,还有个别文章是汇总网上多份资料所成,在这之中也必有疏漏未加标注处,如有侵权请与博主联系。 如果未特殊标注则为原创,遵循 CC 4.0 BY-SA 版权协议。