Roadmap
学习路线
6 个阶段、38 篇课文,约 27 小时。建议按顺序学习;有基础的同学可以直接跳到对应阶段。
你的进度
0 / 38 课已完成
Stage 00 · Prerequisites
启程
看清数据住在哪里
阶段目标:建立存储的整体图景,搭好能随意"折腾坏"的实验环境,知道一次读写在 Linux 里会经过哪些层。
Stage 01 · Beginner
入门
玩转一台机器上的存储
阶段目标:能独立完成单机存储的上盘、分区、组 RAID、建文件系统和挂载,理解数据什么时候才算真正落盘。
- 1.1存储硬件:HDD、SSD 与 NVMe机械盘的寻道与转速,NAND、FTL、写放大与寿命,SATA / SAS / NVMe 接口差异。40 min
- 1.2块设备、分区与 LVMlsblk / udev 设备命名、GPT 分区、LVM 的 PV / VG / LV、在线扩容与快照。40 min
- 1.3RAID 与 mdadmRAID 0/1/5/6/10 的容量、性能与可靠性取舍,重建过程与写洞问题。35 min
- 1.4文件系统:ext4、XFS 与挂载inode、目录、日志与区段分配,mkfs 与挂载选项,fstab 与常见坑。40 min
- 1.5页缓存与持久化语义页缓存、脏页回写、fsync / O_DIRECT / O_SYNC,以及"写成功"到底意味着什么。40 min
- 1.6块、文件、对象:三种存储语义三种接口的抽象与适用场景,iSCSI、NFS、S3 初体验。35 min
Stage 02 · Intermediate
进阶
会测、会看、会调
阶段目标:能用科学的方法测出存储的真实性能,用观测工具定位 I/O 瓶颈,并有依据地调优。
- 2.1性能指标:IOPS、吞吐与延迟三大指标的关系、队列深度与 Little 定律、延迟分布与尾延迟。35 min
- 2.2性能分析方法论USE 方法、负载特征刻画、延迟分析与"没有基线的调优都是玄学"。40 min
- 2.3磁盘 I/O 观测:iostat 到 blktraceiostat 每一列的含义、pidstat / iotop 找进程、blktrace 看请求生命周期。45 min
- 2.4文件系统观测:缓存与延迟free / vmstat / cachestat 看缓存,ext4slower、fileslower 找慢操作。40 min
- 2.5用 BPF 看清 I/OBCC 工具 biolatency / biosnoop / biotop,用 bpftrace 写自己的 I/O 追踪脚本。50 min
- 2.6基准测试:fio 与 elbenchofio 参数与任务文件、结果解读、分布式压测 elbencho,以及常见的测试陷阱。50 min
- 2.7I/O 调优:调度器、队列与内核参数I/O 调度器、队列深度、预读、脏页参数与文件系统挂载选项的调优。40 min
Stage 03 · Advanced
原理
从单机走向分布式
阶段目标:理解网络存储与分布式存储的核心原理,能解释数据如何分布、如何冗余、故障时如何恢复。
- 3.1网络存储:NFS、iSCSI 与 NVMe-oF搭建 NFS 与 iSCSI 服务,理解 NVMe-oF,网络如何改变存储的延迟与故障模型。45 min
- 3.2分布式存储基础数据分布(哈希、一致性哈希、CRUSH)、一致性与法定人数、故障域。45 min
- 3.3副本与纠删码多副本与 EC 的容量效率、写放大、重建代价,以及何时该用哪一种。40 min
- 3.4对象存储与 S3 协议Bucket / Object / Multipart、签名与一致性,用 MinIO / RustFS 动手。40 min
- 3.5元数据与分布式文件系统命名空间与元数据服务、POSIX 语义的代价,JuiceFS、3FS 等不同设计。40 min
- 3.6Ceph 架构:RADOS、CRUSH 与 PGMON / MGR / OSD / MDS / RGW 的分工,CRUSH 规则、PG 与数据的一生。50 min
Stage 04 · Production
生产
部署并运维 Ceph 与 K8s 存储
阶段目标:能规划、部署并长期运维一套生产 Ceph 集群,为 Kubernetes 提供块、文件与对象存储。
- 4.1用 cephadm 部署 Ceph 集群节点准备、bootstrap、添加主机与 OSD、服务规格文件与离线部署。60 min
- 4.2RBD 块存储与 CephFS 文件系统存储池与 RBD 镜像、快照与克隆,CephFS 的 MDS、子卷与客户端挂载。50 min
- 4.3RGW 对象网关部署 RGW、用户与配额、多站点概念、S3 客户端访问与监控指标。45 min
- 4.4Ceph Day-2 运维扩容与替换坏盘、升级、维护模式、参数管理与日常巡检清单。55 min
- 4.5Ceph 故障排查闯关HEALTH_WARN 解读、PG 异常、慢请求、MON / MDS 故障的排查路径。55 min
- 4.6Kubernetes 存储与 CSIPV / PVC / StorageClass、CSI 架构,local、NFS、Ceph CSI 与快照。45 min
- 4.7Rook:在 Kubernetes 上运行 CephRook Operator、CephCluster 规格、块 / 文件 / 对象存储类与 Day-2。50 min
- 4.8存储监控与告警Ceph 与节点指标、Prometheus / Grafana、关键告警规则与容量趋势。40 min
Stage 05 · Expert
专家
高性能存储与 AI 平台
阶段目标:能为 GPU / AI 集群设计高性能存储方案,完成容量与性能规划,并建立可靠的 on-call 体系。
- 5.1高性能网络:RDMA、InfiniBand 与 RoCERDMA 原理、IB 与 RoCE 的差异、无损网络配置与带宽 / 延迟测试。45 min
- 5.2GPFS / Storage Scale 核心概念NSD、文件系统、仲裁、Token 管理、多集群 owning / accessing 模型与 ECE。50 min
- 5.3GPFS ECE 部署与多集群挂载网络规划、安装工具包部署 ECE、创建文件系统与远程集群挂载。60 min
- 5.4GPFS Day-2:快照、租户与调优Fileset 与配额、快照、扩缩容、关键调优参数与 CSI 对接 Kubernetes。50 min
- 5.5AI 训练存储选型训练负载特征与 checkpoint,Weka、VAST、3FS、JuiceFS 等方案对比。50 min
- 5.6容量与性能规划从业务需求拆出容量、IOPS、带宽指标,估算节点与盘数,以及何时不该选 Ceph。50 min
- 5.7On-call、SOP 与故障复盘告警分级、SOP 写法、变更管理、复盘模板,以及持续成长路径。35 min