Storage · 中文教程 · 从零到专业
从第一块磁盘,
到生产级存储集群。
一条循序渐进的存储学习路线。从磁盘与 Linux I/O 栈讲起,逐步深入性能观测、分布式原理、Ceph 生产部署运维,直到 GPFS 与 AI 训练存储。
- 6
- 个阶段
- 38
- 篇课文
- ~27
- 小时学习
$fio --name=randread --rw=randread --bs=4k --iodepth=32 \--direct=1 --ioengine=io_uring --runtime=30 --filename=/dev/nvme0n1read: IOPS=412k, BW=1609MiB/s (1687MB/s)clat percentiles (usec): 50.00th=[ 74], 99.00th=[ 145]$iostat -xz 1 nvme0n1Device r/s rkB/s r_await aqu-sz %utilnvme0n1 411873 1647492 0.08 31.6 100.0$ceph -s | grep -E "health|pgs"health: HEALTH_OKpgs: 1025 active+clean
The I/O Path
一次 I/O,穿过六层
应用发出的每一次读写,都要经过页缓存、文件系统、块层、网络,最后落到设备与集群上。性能问题和数据丢失,都藏在某一层里。这门课就沿着这条路径,一层一层往下走。
先看 I/O 栈全景- L0
应用
read() / write() / fsync() - L1
VFS 与页缓存
缓存命中、脏页回写 - L2
文件系统
ext4 / XFS / CephFS / GPFS - L3
块层
bio、blk-mq、I/O 调度器 - L4
网络
NFS / iSCSI / NVMe-oF / RDMA - L5
设备与集群
NVMe、RAID、副本与纠删码
Roadmap
六个阶段,逐级攀升
每个阶段都有明确的目标。学完一个阶段,你就能独立完成这一层级的工作,再向上一级。
启程 · 看清数据住在哪里
建立存储的整体图景,搭好能随意"折腾坏"的实验环境,知道一次读写在 Linux 里会经过哪些层。
- 学习路线与使用指南
- 存储全景:从寄存器到集群
- 搭建实验环境
- 一次 write() 的旅程:Linux I/O 栈
入门 · 玩转一台机器上的存储
能独立完成单机存储的上盘、分区、组 RAID、建文件系统和挂载,理解数据什么时候才算真正落盘。
- 存储硬件:HDD、SSD 与 NVMe
- 块设备、分区与 LVM
- RAID 与 mdadm
- 文件系统:ext4、XFS 与挂载
- …还有 2 课
进阶 · 会测、会看、会调
能用科学的方法测出存储的真实性能,用观测工具定位 I/O 瓶颈,并有依据地调优。
- 性能指标:IOPS、吞吐与延迟
- 性能分析方法论
- 磁盘 I/O 观测:iostat 到 blktrace
- 文件系统观测:缓存与延迟
- …还有 3 课
原理 · 从单机走向分布式
理解网络存储与分布式存储的核心原理,能解释数据如何分布、如何冗余、故障时如何恢复。
- 网络存储:NFS、iSCSI 与 NVMe-oF
- 分布式存储基础
- 副本与纠删码
- 对象存储与 S3 协议
- …还有 2 课
生产 · 部署并运维 Ceph 与 K8s 存储
能规划、部署并长期运维一套生产 Ceph 集群,为 Kubernetes 提供块、文件与对象存储。
- 用 cephadm 部署 Ceph 集群
- RBD 块存储与 CephFS 文件系统
- RGW 对象网关
- Ceph Day-2 运维
- …还有 4 课
专家 · 高性能存储与 AI 平台
能为 GPU / AI 集群设计高性能存储方案,完成容量与性能规划,并建立可靠的 on-call 体系。
- 高性能网络:RDMA、InfiniBand 与 RoCE
- GPFS / Storage Scale 核心概念
- GPFS ECE 部署与多集群挂载
- GPFS Day-2:快照、租户与调优
- …还有 3 课
How it works
这样学,更扎实
先建地图,再走细节
第一阶段就画出一次 write() 从应用到磁盘的完整路径,之后每一课都在这张地图上定位,知识不会碎成一地。
先测量,再下结论
用 USE 方法、fio、iostat 和 BPF 工具说话。没有基线的调优都是玄学,每个结论都要能被复现。
对齐生产实践
生产与专家阶段取材于真实 GPU / AI 集群的存储建设:cephadm、Rook-Ceph、GPFS ECE、Weka 与 CSI。
Reference 01
Systems Performance, 2nd Edition
Brendan Gregg 的经典著作。性能方法论、文件系统、磁盘、基准测试与 BPF 观测的主要参考。
Reference 02
k8s-in-action 生产实践手册
一线 GPU / AI 集群的存储部署手册:cephadm、Rook-Ceph、GPFS ECE、Weka、VAST 与各类 CSI。
准备好出发了吗?
只需要一台电脑和一台 Linux 虚拟机。第一课 10 分钟,带你看清整条路线。
开始学习