惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

酷 壳 – CoolShell
酷 壳 – CoolShell
宝玉的分享
宝玉的分享
P
Proofpoint News Feed
I
Intezer
云风的 BLOG
云风的 BLOG
A
About on SuperTechFans
aimingoo的专栏
aimingoo的专栏
Y
Y Combinator Blog
小众软件
小众软件
T
Threatpost
B
Blog
美团技术团队
博客园 - 司徒正美
T
The Exploit Database - CXSecurity.com
T
Tailwind CSS Blog
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
Cyberwarzone
Cyberwarzone
雷峰网
雷峰网
The GitHub Blog
The GitHub Blog
T
Tenable Blog
A
Arctic Wolf
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
Security Archives - TechRepublic
Security Archives - TechRepublic
博客园 - 叶小钗
L
Lohrmann on Cybersecurity
博客园 - 三生石上(FineUI控件)
L
LINUX DO - 热门话题
J
Java Code Geeks
Google DeepMind News
Google DeepMind News
S
Security Affairs
Simon Willison's Weblog
Simon Willison's Weblog
K
Kaspersky official blog
C
CXSECURITY Database RSS Feed - CXSecurity.com
GbyAI
GbyAI
N
News and Events Feed by Topic
Cloudbric
Cloudbric
WordPress大学
WordPress大学
量子位
W
WeLiveSecurity
H
Hacker News: Front Page
Project Zero
Project Zero
S
Security @ Cisco Blogs
Security Latest
Security Latest
Hugging Face - Blog
Hugging Face - Blog
Forbes - Security
Forbes - Security
C
Cybersecurity and Infrastructure Security Agency CISA
人人都是产品经理
人人都是产品经理
U
Unit 42
Know Your Adversary
Know Your Adversary
Google Online Security Blog
Google Online Security Blog

陈少文的网站

巨变与机遇的未来十年 Kubernetes 平台管理软件压力测试方案 使用镜像部署 Hexo 静态页面 终于等到你 - GitHub 镜像仓库服务(ghcr.io) 一起来学 Go --(6)Interface 一起来学 Go --(5)Goroutine 和 Channel 什么是函数式编程 如何在 Kubernetes 集群集成 Kata 柯里化与偏函数 使用 PyGithub 自动创建 Label 软件产品是团队能力的输出 Helm 2 、Helm 3 比较 IoT 变现 Kubernetes 中的 DNS 服务 国内的 Helm 镜像源 Harbor 使用自签证书支持 Https 访问 DevOps 工具链之 Prow 如何使用 kfctl 安装 Kubeflow VS Code 无法下载 Go 插件的工具包 工程师更应具有服务精神 你不知道的 Docker 使用技巧 使用 Docker 运行 Tensorflow 论中国 什么是左移 如何清空 Git 仓库全部历史记录 一禅小和尚 有风吹过厨房 时间的玫瑰 如何在 CentOS 安装 GPU 驱动 开发 Tips(19) 使用 Velero 备份 Kubernetes 集群 Kubernetes Cheat Sheet 开发 Tips(18) 如何构建一个 Java 工程 开发 Tips(17) KubeSpray 安装 Kubernetes 报错 ip in ansible_all_ipv4_addresses 基于 Kubernetes 和 Jenkins 搭建自动化测试系统 在 Kubernetes 上动态创建 Jenkins Slave 使用 Jenkins 进行服务拨测 开发 Tips(16) Kubernetes 签发 Ingress 证书及日常故障运维 Kubernetes 中 Deployment 的基本操作 Kubernetes 中的证书 如何使用 KubeBuilder 开发一个 Operator Kubernetes 1.6.0 安装问题汇总 镜像管理工具 -- Harbor 开发 Tips(15) Docker 如何拉取镜像 开发 Tips(14) 使用 Helm 安装 harbor 开发 Tips(13) 使用 S2I 构建云原生应用 在 Kubernetes 中使用 emptyDir、hostPath、localVolume 开发 Tips(12) 开发 Tips(11) 代码质量分析工具 SonarQube 使用 Kubeadm 安装 Kubernetes 集群 一起来学 Go --(4)常用函数 Kubernetes 中的 Ceph Kubernetes 之 Volumes Kubernetes 之 Labels、Selectors 开发 Tips(10) 开源正在重构商业模式 Kubernetes 之网络 Kubernetes 之 API 使用 Helm 和 Operator 快速部署 Prometheus Kubernetes 复杂有状态应用管理框架 -- Operator Kubernetes 的包管理器 -- Helm 一起来学 Go --(3)Go Modules 如何一步一步地优化博客方案 kubectl 实用指南 Kubernetes 中的基本概念 搭建远程 Kubernetes 开发环境 大公司和小公司的 ToB 思路 开发 Tips(9) Go 入门指南 一起来学 Go --(2)数据与逻辑结构 如何预防 Web 富文本中的 XSS 攻击 django-xss-cleaner 云工作时代 一起来学 Go --(1)背景与特点 SaaS 开发团队的不同阶段 你不知道的 Git 使用技巧 输出既服务 微服务设计 继续奔跑 开发 Tips(8) 从账户安全到二次验证 Django 性能之数据库查询优化 Django 性能之分库分表 敏捷开发之研发流程 打造一致性的团队 开发 Tips(7) Pytest 进阶学习之 Mock PaaS 部署之 buildpack Go 开发配置 领域输出才是 PaaS 的核心竞争力 Pytest 入门学习 开发 Tips(6) 如何使用 Jenkins、Docker、GitLab 搭建 Django 自动化部署流程
如何清理僵尸进程
微信公众号 · 2025-08-07 · via 陈少文的网站

Please enable Javascript to view the contents

如何清理僵尸进程

1. 什么是僵尸进程

进程的创建过程:

  1. 父进程调用 fork() 创建子进程
  2. 子进程执行 exec() 加载新程序
  3. 子进程结束执行,调用 exit() 或返回
  4. 父进程调用 wait()waitpid()

如果父进程没有调用 wait()waitpid(),子进程结束后仍然保留在系统中,成为僵尸进程。

2. 怎么查看僵尸进程

可以使用 ps 命令查看僵尸进程:

1
ps -A -ostat,ppid,pid,cmd | grep -e'^[Zz]'
1
2
3
4
Zl   2062969 2068159 [python] <defunct>
Zl   2062969 2074157 [python] <defunct>
ZNl  2062969 2081477 [ray::WorkerDict] <defunct>
ZNl  2062969 2081478 [ray::WorkerDict] <defunct>

第一列是进程的状态,第二列是父进程 ID (PPID),第三列是僵尸进程的 ID (PID),第四列是命令。

STAT含义
Z僵尸进程
l多线程进程
N低优先级进程

3. 怎么清理僵尸进程

3.1 直接杀死父进程

僵尸进程本身无法被清理,只能清理其父进程来清理。

简单点可以直接 kill 父进程:

也可以批量清理所有僵尸进程的父进程:

1
ps -A -ostat,ppid,pid,cmd | grep -e'^[Zz]' |awk '{print $2}' | xargs kill -9

3.2 恢复父进程回收僵尸进程

给父进程发送 SIGCONT (kill -18) 可以将父进程从暂停中恢复,然后继续 wait() 子进程正常结束。

  • 判断父进程是否挂起
1
ps -p <parent_pid> -o stat

如果状态是 T,表示进程被暂停,可以使用 SIGCONT 恢复。

  • 发送 SIGCONT 信号

3.3 回收进程所在容器

  • 查找父进程所在的容器
1
export parent_pid=2062969
1
cat /proc/${parent_pid}/cgroup
1
0::/kubepods.slice/kubepods-burstable.slice/kubepods-burstable-pod28df2390_283c_4962_b6f6_4efaafe529ec.slice/cri-containerd-c94382533ede3ae949b06562b8f347a0656a7446403722d4b026256c19e6aea1.scope
  • 查看容器信息

截取 containerd 后面的部分字符串用于查找容器。

1
nerdctl -n k8s.io ps -a | grep c94382533
1
c94382533ede    docker.io/3257a037b275eb6ca6f75d86f2bc63b9:v1.0                          "/bin/bash -c bash r…"    14 hours ago    Created             k8s://default/elastic-job-261548-edljob-worker-0/main
  • 删除容器
1
nerdctl -n k8s.io rm -f c94382533ede
  • 清理全部异常容器
1
nerdctl -n k8s.io ps -a | grep -E 'Exited|Created|Dead|Paused' | awk '{print $1}' | xargs -r nerdctl -n k8s.io rm -f

3.4 进程卡存储存储上

  • 查看进程的状态
1
export parent_pid=1203391
1
cat /proc/${parent_pid}/status
1
2
3
4
5
6
Name:   python3.10
State:  D (disk sleep)
Tgid:   1203391
Ngid:   1203391
Pid:    1203391
PPid:   1197458
  • 修复存储问题

这种情况下,可以尝试查看一下 df -h 是不是卡死。如果是,那么清理挂载点即可。

1
opscli task -f ~/.ops/tasks/clear-mount.yaml

3.5 进程卡在设备锁上

  • 查看进程的状态
1
export parent_pid=2062969
1
cat /proc/${parent_pid}/status
1
2
3
4
5
6
Name:   bash
State:  S (sleeping)
Tgid:   2062969
Ngid:   0
Pid:    2062969
PPid:   2062945
  • 查看进程的堆栈
1
cat /proc/${parent_pid}/stack
1
2
3
4
5
6
7
8
[<0>] do_wait+0x1c7/0x230
[<0>] kernel_wait4+0xaf/0x150
[<0>] zap_pid_ns_processes+0x111/0x1b0
[<0>] do_exit+0xa7c/0xac0
[<0>] do_group_exit+0x47/0xb0
[<0>] __x64_sys_exit_group+0x18/0x20
[<0>] do_syscall_64+0x57/0x190
[<0>] entry_SYSCALL_64_after_hwframe+0x44/0xa9
  • 查看子进程的堆栈
1
ps -ef --forest | grep ${parent_pid}
1
2
3
4
5
root     2062969       1  0 02:02 ?        00:00:01 [bash]
root     2068159 2062969 12 02:03 ?        01:43:37  \_ [python] <defunct>
root     2074157 2062969  0 02:03 ?        00:00:29  \_ [python] <defunct>
root     2081477 2062969 39 02:04 ?        05:32:22  \_ [ray::WorkerDict] <defunct>
root     2081478 2062969 36 02:04 ?        05:11:06  \_ [ray::WorkerDict] <defunct>
1
export child_pid=2068159
1
cat /proc/${child_pid}/stack
1
2
3
[<0>] rwsem_down_write_slowpath+0x244/0x4d0
[<0>] os_acquire_rwlock_write+0x35/0x40 [nvidia]
[<0>] _nv042313rm+0x10/0x40 [nvidia]

进程正在尝试获取 nvidia 提供的一个写锁,但是阻塞了。

  • 查看哪些进程在使用 nvidia 设备
  • 批量杀死这些进程
1
fuser -v /dev/nvidia* |awk '{for(i=1;i<=NF;i++)print "kill -9 " $i;}' | sh
1
2
3
                     USER        PID ACCESS COMMAND
/dev/nvidiactl:      root      F.... nvidia-smi
                     root      F.... nvidia-smi

D 状态(Uninterruptible sleep) 意味着进程处于内核阻塞状态,在等待某些资源不能被中断,不能 kill ,可以升级一下驱动版本之后,进行重启。


微信公众号