惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

云风的 BLOG
云风的 BLOG
Security Archives - TechRepublic
Security Archives - TechRepublic
V
Vulnerabilities – Threatpost
C
CXSECURITY Database RSS Feed - CXSecurity.com
P
Proofpoint News Feed
G
GRAHAM CLULEY
P
Privacy International News Feed
The Hacker News
The Hacker News
Forbes - Security
Forbes - Security
U
Unit 42
N
News and Events Feed by Topic
D
Darknet – Hacking Tools, Hacker News & Cyber Security
C
Cyber Attacks, Cyber Crime and Cyber Security
C
Cisco Blogs
A
About on SuperTechFans
cs.CV updates on arXiv.org
cs.CV updates on arXiv.org
D
Docker
I
Intezer
Spread Privacy
Spread Privacy
The Last Watchdog
The Last Watchdog
V2EX - 技术
V2EX - 技术
S
Security @ Cisco Blogs
F
Full Disclosure
S
Secure Thoughts
M
MIT News - Artificial intelligence
Microsoft Security Blog
Microsoft Security Blog
G
Google Developers Blog
aimingoo的专栏
aimingoo的专栏
W
WeLiveSecurity
cs.CL updates on arXiv.org
cs.CL updates on arXiv.org
Project Zero
Project Zero
Recorded Future
Recorded Future
Cyberwarzone
Cyberwarzone
S
Security Affairs
AWS News Blog
AWS News Blog
H
Help Net Security
The GitHub Blog
The GitHub Blog
Hacker News: Ask HN
Hacker News: Ask HN
Vercel News
Vercel News
P
Proofpoint News Feed
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
The Register - Security
The Register - Security
S
Schneier on Security
F
Fortinet All Blogs
C
CERT Recently Published Vulnerability Notes
L
LINUX DO - 最新话题
T
Tor Project blog
T
The Exploit Database - CXSecurity.com
MongoDB | Blog
MongoDB | Blog
Webroot Blog
Webroot Blog

陈少文的网站

巨变与机遇的未来十年 Kubernetes 平台管理软件压力测试方案 使用镜像部署 Hexo 静态页面 终于等到你 - GitHub 镜像仓库服务(ghcr.io) 一起来学 Go --(6)Interface 一起来学 Go --(5)Goroutine 和 Channel 什么是函数式编程 如何在 Kubernetes 集群集成 Kata 柯里化与偏函数 使用 PyGithub 自动创建 Label 软件产品是团队能力的输出 Helm 2 、Helm 3 比较 IoT 变现 Kubernetes 中的 DNS 服务 国内的 Helm 镜像源 Harbor 使用自签证书支持 Https 访问 DevOps 工具链之 Prow 如何使用 kfctl 安装 Kubeflow VS Code 无法下载 Go 插件的工具包 工程师更应具有服务精神 你不知道的 Docker 使用技巧 使用 Docker 运行 Tensorflow 论中国 什么是左移 如何清空 Git 仓库全部历史记录 一禅小和尚 有风吹过厨房 时间的玫瑰 如何在 CentOS 安装 GPU 驱动 开发 Tips(19) 使用 Velero 备份 Kubernetes 集群 Kubernetes Cheat Sheet 开发 Tips(18) 如何构建一个 Java 工程 开发 Tips(17) KubeSpray 安装 Kubernetes 报错 ip in ansible_all_ipv4_addresses 基于 Kubernetes 和 Jenkins 搭建自动化测试系统 在 Kubernetes 上动态创建 Jenkins Slave 使用 Jenkins 进行服务拨测 开发 Tips(16) Kubernetes 签发 Ingress 证书及日常故障运维 Kubernetes 中 Deployment 的基本操作 Kubernetes 中的证书 如何使用 KubeBuilder 开发一个 Operator Kubernetes 1.6.0 安装问题汇总 镜像管理工具 -- Harbor 开发 Tips(15) Docker 如何拉取镜像 开发 Tips(14) 使用 Helm 安装 harbor 开发 Tips(13) 使用 S2I 构建云原生应用 在 Kubernetes 中使用 emptyDir、hostPath、localVolume 开发 Tips(12) 开发 Tips(11) 代码质量分析工具 SonarQube 使用 Kubeadm 安装 Kubernetes 集群 一起来学 Go --(4)常用函数 Kubernetes 中的 Ceph Kubernetes 之 Volumes Kubernetes 之 Labels、Selectors 开发 Tips(10) 开源正在重构商业模式 Kubernetes 之网络 Kubernetes 之 API 使用 Helm 和 Operator 快速部署 Prometheus Kubernetes 复杂有状态应用管理框架 -- Operator Kubernetes 的包管理器 -- Helm 一起来学 Go --(3)Go Modules 如何一步一步地优化博客方案 kubectl 实用指南 Kubernetes 中的基本概念 搭建远程 Kubernetes 开发环境 大公司和小公司的 ToB 思路 开发 Tips(9) Go 入门指南 一起来学 Go --(2)数据与逻辑结构 如何预防 Web 富文本中的 XSS 攻击 django-xss-cleaner 云工作时代 一起来学 Go --(1)背景与特点 SaaS 开发团队的不同阶段 你不知道的 Git 使用技巧 输出既服务 微服务设计 继续奔跑 开发 Tips(8) 从账户安全到二次验证 Django 性能之数据库查询优化 Django 性能之分库分表 敏捷开发之研发流程 打造一致性的团队 开发 Tips(7) Pytest 进阶学习之 Mock PaaS 部署之 buildpack Go 开发配置 领域输出才是 PaaS 的核心竞争力 Pytest 入门学习 开发 Tips(6) 如何使用 Jenkins、Docker、GitLab 搭建 Django 自动化部署流程
模型研发过程中的存储系统建设思路
微信公众号 · 2024-07-23 · via 陈少文的网站

本文内容整理自我在一次内部分享的部分内容。

1. 存储系统的核心要素

1.1 安全

对象存储桶的凭证、使用存储 PVC 时的授权、对访问来源的控制,这些都是安全需要关注的问题。

但这些又非常容易被忽视,出了问题就是大问题。

1.2 生命周期管理

存储系统是为业务使用数据服务的。

业务对数据的生命周期管理,直接影响着存储系统功能上的需求。

数据的产生-清洗-使用-流转-归档,这些流程的背后都需要存储系统及各种组件的支持。

1.3 性能

性能是衡量存储系统的重要指标。各种存储系统中,吞吐、延时、IOPS,这些都是我们需要关注的性能指标。

通过 dd、fio 等工具,我们可以评估各种存储系统的性能。然后,去调优,去修改参数、去提升带宽,以达到最佳性能。

1.4 存储成本

成本能最直接影响决策者的存储选择。

通常,性能越好,存储需要付出的成本越高,而实际需求需要我们自行评估,在性能与成本之间做出平衡决策。

对于很多公司来说,存储成本会占到整个 IT 成本的很大一部分。因此,对大规模使用的存储服务都非常敏感,决策时也会多一层非技术侧的考虑。

1.5 运维成本

由于基础设施的急剧变化,传统的存储系统不一定适合云原生的应用场景。这些存储在 Kubernetes 上使用和运维成本很高,有时,甚至部署这些存储系统也很困难。

适配云原生的存储系统,可能只需要执行一条 helm install 命令就可以完成部署,而且具有良好的可观测性,自愈的特性,这些不是每一个存储系统都具有的。

同时,日常繁琐的业务配置,也非常消耗运维同学的精力和时间,如何降低人力的成本是一个挑战。

2. 存储建设所处的阶段

我们总能找到很多的最佳实践,得到很多的参考建议,但直接按部就班的落地,会困难重重、甚至引发众怒。

这些最佳实践说得对,我们做得也很努力,就是得不到好的结果。因为,所处的阶段不同、人力投入不同、业务形态不同,很多总结最佳实践的人可能自己都忽略掉了这些因素。

成功的总结不是成功的全部,而是其自认为困难的部分。

对存储系统的阶段进行分析,能够准确识别当前最迫切需要关注的问题。

2.1 早期: 运维成本、性能

在项目的早期,从 0 到 1 ,我们并不会考虑太多,只要能快速实现就行,项目着急上线。

这个阶段主要是依赖人工进行运维和配置,运维同学的意见比决策者的意见更重要。

只要性能够好、方便配置,就能先落地试试,其他问题优先级比较低。

2.2 中期: 存储成本、生命周期管理

经过一段时间的试验,大家会对存储的一些特性有所了解,会有很多想要去优化和调整的地方。

而存储规模越来越大,存储成本越来越高,来自老板的压力也越来越大。同时,各种业务功能,跨产品、跨团队的存储、流转需求,也导致存储系统的复杂性升高,推高了维护成本。

此时,最大问题就是要根据数据的冷热分层,根据不同需求对性能的不同要求去降低存储成本。通过 Fluid 等组件对数据进行管理,以应对上层的业务需求。

2.3 后期: 安全,生命周期管理

开始关注数据安全时,存储的规模应该很大了,同时功能上的建设应该也很完善。

数据安全是绕不开的一个问题,其潜藏着巨大的风险。一次大的安全事故,就可能直接导致前面所有的努力白费,甚至相关人员直接离职。

怎样才能避免这些风险是后期迫切需要考虑的问题。

3. 存储系统的演进方向

3.1 面向对象存储的数据交付

目前我们的工作方式是,训练和推理平台直接在 JuiceFS 中共享、拷贝数据。当前的问题是:

  • JuiceFS 存储空间有限,虽然我们购买了 1P、500TB 的企业版存储,但还是不够用
  • JuiceFS 成本比对象存储高
  • JuiceFS 中的数据缺少生命周期管理

而面向对象存储的数据交付,强调的是在交付过程中,我们要对数据进行归档、封板。数据平台、训练平台、推理平台的数据交付,应该基于对象存储,而不是 JuiceFS。

演进之后能解决的问题

  • 各平台按照自己的冷热数据管理 JuiceFS 缓存
  • 有利于解耦平台
  • 解除内网专线的依赖,阿里云直接访问金山云的 JuiceFS
  • 各平台根据云厂使用缓存服务,金山云用 Juicefs、OSS 用 Jindo

3.2 面向集中存储的研发工作流

面向集中存储的研发工作流,强调的是处于中间态的数据,应该集中存储和流转。

研发工作流是一个中间态,具有以下特征:

  • 不用交付数据
  • 不用交付模型
  • 快速迭代

面向 JuiceFS 的研发工作流优势:

  • JuiceFS 的速度有绝对优势
  • 流转效率更高,避免频繁导数据