六、AI模拟测试
我们通过调整FIO特定参数,还原3个AI存储使用场景,来测试PE511 12.8TB SSD的性能。
每次测试前,我们都进行2次全盘顺序写入,让SSD进入稳态。
1、模拟 AI 训练的“数据喂料”(Data Ingestion)
多路 GPU 异步从 SSD 读取训练集,属于高并发、高队列深度的纯随机读/混合读。
我们将FIO参数设置为64队列深度、8线程、128KiB 块大小,纯随机读,测试时长1小时,测前预热半小时。
实测在128KiB相对较大的块大小下,PE511 12.8TB跑出了11万的随机读IOPS。这意味着固态硬盘内部的闪存通道并发管理和主控性能极强,完全能够撑起多路GPU并行训练时的数据索取。
在平均读高达13814 MiB/s的情况下,标准差仅有47.29,波动率低到了惊人的0.34%。这意味着盘体在稳态下几乎没有任何衰减和抖动,能够为GPU训练集群提供极致平滑、永不卡顿的“流式数据喂料”。
至于延迟,从clat percentiles来看,99.00%的请求延迟都在4.82ms 以内,而代表最极端卡顿的99.99%的请求延迟也仅仅只有10.29ms,不会出现企业级测试中常见的“秒级”掉速或长尾延迟卡顿。
2、模拟大模型“断点续训”(LLM Checkpointing)
在 LLM 训练中,Checkpointing 表现为大块(Large Block Size)、高并发、纯顺序写入。当训练运行到特定Step时,系统需要将数百亿甚至数万亿参数的权重(Weights)和优化器状态(Optimizer States)以最快速度从 GPU 显存刷写到 SSD 中,以防由于节点故障导致训练中断。
测试前我们已经进行了2次全盘写入,并预热30分钟,确保SSD在进入稳态后才开始时长1小时的测试,仅仅后面1小时稳态测试就连续写入了20.5TB数据。
实测稳态下,平均写入速度5438MiB/s、标准差为109.94 MiB/s,波动率仅为 2.0%。
平均延迟低至 23.49 ms, 99.00% 的写入请求在 34.34 ms 内完成。
整体来说,PE511 12.8TB SSD在大模型“断点续训”测试中,展现了极高吞吐、低延迟、以及几乎零掉速的表现,非常适合用作AI算力节点本地的高性能热数据盘。
3、模拟大模型推理的KV Cache(键值缓存交换)
在LLM推理或训练中,GPU显存往往装不下所有历史对话的KV缓存。此时系统需要将暂时用不到的KV缓存交换(Swap)到SSD中,需要时再读回。这类场景的典型特点是:小数据块(通常为4KiB)、高并发、读写混合(以读为主)。
我们使用4KiB(4k)块大小、70%读/30%写,8线程、每线程128队列深度的极端高并发随机读写配置来模拟KV Cache。
测试前依旧全盘写入2次并预热30分钟,测试时长则是1小时。
实测读取带宽5073MB/s、IOPS=1299K,写入带宽5174MB/s、IOPS=557K,爆发出 185.6万IOPS的混合随机吞吐,这意味着它能够支撑每秒62万个KV缓存切片在SSD和主机之间高频交换,这个吞吐量可以同时支撑数以万计并发用户的Token生成,极大缓解了显存溢出(OOM)问题。
平均读写延迟分别为0.52ms 、 0.56ms,99.99% QoS 尾部延迟极低,控制在1.4ms,最大延迟不超过 4.5 ms,几乎不存在拖慢 Batch 步调的“尾部卡顿”。




