一、前言
在今年3月CFMS闪存峰会上,长江存储同时发布了三款由晶栈Xtacking 4.0技术打造的企业级SSD产品—超大容量QLC的PE501、定位于高性能与高安全的通用主力型PE511,以及主打AI极致性能的PE522。
1个月前我们首先测试了PE501 61.44TB,今天为大家带来的是PE511 12.8TB,另外一款PE522 15.36TB SSD的评测稍后奉上。
PE511采用的是基于长江存储晶栈Xtacking 4.0技术打造的X4-9070闪存,接口速率3.6Gbps,这款发布于两年前的产品,至今仍是行业速率最快的NAND闪存。
我们测试的这款12.8TB读写混合型版本,拥有14000MB/s的顺序读取速度、10000MB/s的顺序写入速度,4K随机读取性能为3200K IOPS、4K随机写入性能为900K IOPS。
作为一款拥有3 DWPD耐写的企业级SSD,PE511 12.8TB拥有极高的OP(Over-Provisioning)预留空间,即使在面对长达数周、不间断的高强度混合读写时,也能将稳定性波动率控制在0.7%以内。
长江存储PE511系列SSD参数如下:
二、图赏
U.2接口,又名SFF-8639,由SATA、SAS衍变而来,在企业级市场上很常见,消费级主板支持的不多,但可以转接为传统的PCIe接口或M.2接口。
拆解下来的散热片(外壳),上面密密麻麻贴满了导热背胶,每颗DRAM、NAND以及主控都有顾及。
正面所有主控和4颗DRAM缓存颗粒。
上边有6颗DRAM缓存,单颗容量2GB,加上另一面的4颗,一共10颗,总容量是16GB。
左边还有一个断电保护电容,规格是1800uF 35V,用于意外断电情况下对尚未写完的数据的保护,避免映射表、用户数据出错。
板载 8 颗 X4-9070 TLC 颗粒,单颗 2TB,总原始闪存容量16TB,其中3.2TB被用于OP预留空间,实际可用容量12.8TB。
三、windows平台性能测试
测试平台如下:
从CrystalDiskinfo可以看到,这块SSD支持PCIe 4.0 x4、NVMe 1.4。
我们拿到的时候,SSD读取量为0,写入量为0,全新出炉。
1、CrystalDiskMark
CrystalDiskMark测试环节,PE511 12.8TB SSD的顺序读取速度达到了13.99GB/s,顺序写入速度则是10085MB/s。
另外64GB的测试对于这种级别的SSD来说毫无压力,大部分数据甚至好于1GB测试。
高并发多任务场景中,Q32T16 4K随机读取达到了218万IOPS,4K随机写入128万IOPS,足以满足海量小文件并发加载,以及实时特效缓存。
2、AS SSD Benchmark
左边是1GB容量的测试,AS SSD Benchmark总分为11078,最高顺序读取、写入速度分别为9878MB/s、7881MB/s,4K随机读写速度为66MB/s、290MB/s。
右边是10GB容量的测试,总分为6537。最高顺序读取、写入速度分别为10223MB/s、8263MB/s,4K随机读写速度分别为65MB/s、284MB/s。
3、ATTO Disk Benchmark

4、3DMark磁盘基准测试
3DMark 磁盘基准测试通过记录流行游戏和游戏相关活动的操作轨迹来衡量真实世界的游戏性能,具体测试项目包括启动加载《战地 5》到游戏主菜单、启动加载《使命召唤:黑色行动 4》到游戏主菜单、玩《守望先锋》时使用 OBS 录制 1080p 60Hz 的游戏视频。
这个测试可以直观展示SSD的游戏加载性能。
3DMark存储测试主要是测试游戏读写表现,PE511 12.8TB总分是3384分,延迟53微秒,移动游戏带宽2108MB/s。
5、温度测试
在不添加风扇纯被动散热的情况下,PE511 12.8TB在10分钟的高负载读写测试中,最高温度60度。
如果将时长延至2小时以上,温度会到65度左右。
四、AIDA64与PCMark 10一致性测试
1、AIDA64 Disk Benchmark Linear Write
AIDA64 Disk Benchmark Linear Write是一项非常严苛和残酷的测试,也是一面照妖镜,目前市面上的消费级/企业级SSD用这个软件都能暴露出真实的缓外速度。
AIDA64 Disk Benchmark Linear Write持续写入了187分钟的数据,写入速度基本上稳定在7000MB/s以上,最高写入速度9002MB/s,最低7057MB/s,平均写入速度7249MB/s。
2、PCMark 10磁盘一致性测试
PCMark 10盘性能一致性测试是Windows系统下的长期高负载测试。它主要考验SSD在初始阶段(空盘)、掉速阶段(开始写入数据),以及稳态阶段(随机写满有效和无效数据)、性能恢复阶段等不同阶段的性能变化。
测试开始前有两次全盘填充过程、结束后有一次全盘填充过程,全部测试环节会循环约20次。
经过了长达6小时的测试,总计写入了约200TB的数据,这就意味着在这段时间内,SSD被全盘反复写入了15次。
总得分是4862,带宽1127MB/s,存取时间50us。
下面我们导出详细测试数据进行分析。
进行纯写入测试时,在降级和稳态阶段,PE511 12.8TB基本上能稳定在7000MB/s的写入速度,进入恢复阶段(recovery_1 ~ recovery_5)后,写入速度稳定在3000MB/s。
进行混合读写测试时,表现出较高的性能一致性。,速度在3000~4300MB/s之间。
在进行零碎小文件盘内拷贝测试时,PE511 12.8TB在各个阶段的表现也相对稳定。。
进行纯写入测试时,速度在920~1080MB/s之间
进行混合读写测试时,速度保持在550~700MB/s之间。
Photoshop重负载测试时,PE511 12.8TB也表现出了高度的一致性,稳定在1100MB/s左右。
五、FIO测试:4K随机读取334万IOPS、随机写入101万IOPS
为了发挥SSD的全部性能,我们使用企业级SSD厂商相同的基准性能测试方法,即基于Linux测试环境,使用FIO进行测试,看看这PE511 12.8TB SSD性能是否达标。
FIO是企业级SSD最为常用的基准性能测试工具,通过配置不同的任务数量、队列深度、不同的测试数据大小,测试范围,以及不同的读写方式、读写占比、测试时长等,可模拟出多种多样的SSD测试方法,而严谨的预处理,也更有助于反映出SSD的真实性能水平。
本次将进行128K顺序读写、4K随机读写、4K随机混合读写测试。每个项目又分别进行QD1、QD8、QD64、QD512的测试。每一项测试开始前会进行两遍的顺序全盘填充,在随机测试开始前,还需要进行相应的随机全盘填充,以4K随机性能测试为例,分为SSD格式化、128K顺序写全盘2遍、4K随机写全盘2遍。预处理、测试无缝衔接,以降低GC等因素带来的影响。
总计51个测试项目,每个项目测试时长1000秒,测试前预热10分钟。
1、4K随机读取
4K随机读使用QD4096,队列深度128、任务数量32,模拟大压力下的并发访问,测试时长1000秒,预热10分钟。
结果显示,PE511 12.8TB最高4K随机读性能达到3465K IOPS,最低为3219K IOPS,平均为3358K IOPS。
2、4K随机写入
4K随机写入测试环节,PE511 12.8TB在稳态下最高随机写速度为1040K IOPS,平均速度1013K IOPS,超越了官方标称900K IOPS。
3、4K随机70:30混合读写测试
4K随机混合测试,选择队列深度64,任务数量8。
可以看到4K随机读取性能达到了509K IOPS,4K随机写也有1187K IOPS,综合起来为 1696K IOPS。
4、128K顺序读取
128K顺序读取测试,选择队列深度512,任务数量1。
PE511 12.8TB的最高顺序读取速度为13823MiB/s,最低顺序读取速度为13728MiB/s,平均顺序读取速度为13808MiB/s。
5、128K顺序写入
PE511 12.8TB的最高顺序写入速度为9929MiB/s,最低顺序写入速度为8703MiB/s,平均顺序写入速度为9599MiB/s。SSD达到稳态后,写速度始终保持在非常平稳的水平。
测试数据汇总如下:
六、AI模拟测试
我们通过调整FIO特定参数,还原3个AI存储使用场景,来测试PE511 12.8TB SSD的性能。
每次测试前,我们都进行2次全盘顺序写入,让SSD进入稳态。
1、模拟 AI 训练的“数据喂料”(Data Ingestion)
多路 GPU 异步从 SSD 读取训练集,属于高并发、高队列深度的纯随机读/混合读。
我们将FIO参数设置为64队列深度、8线程、128KiB 块大小,纯随机读,测试时长1小时,测前预热半小时。
实测在128KiB相对较大的块大小下,PE511 12.8TB跑出了11万的随机读IOPS。这意味着固态硬盘内部的闪存通道并发管理和主控性能极强,完全能够撑起多路GPU并行训练时的数据索取。
在平均读高达13814 MiB/s的情况下,标准差仅有47.29,波动率低到了惊人的0.34%。这意味着盘体在稳态下几乎没有任何衰减和抖动,能够为GPU训练集群提供极致平滑、永不卡顿的“流式数据喂料”。
至于延迟,从clat percentiles来看,99.00%的请求延迟都在4.82ms 以内,而代表最极端卡顿的99.99%的请求延迟也仅仅只有10.29ms,不会出现企业级测试中常见的“秒级”掉速或长尾延迟卡顿。
2、模拟大模型“断点续训”(LLM Checkpointing)
在 LLM 训练中,Checkpointing 表现为大块(Large Block Size)、高并发、纯顺序写入。当训练运行到特定Step时,系统需要将数百亿甚至数万亿参数的权重(Weights)和优化器状态(Optimizer States)以最快速度从 GPU 显存刷写到 SSD 中,以防由于节点故障导致训练中断。
测试前我们已经进行了2次全盘写入,并预热30分钟,确保SSD在进入稳态后才开始时长1小时的测试,仅仅后面1小时稳态测试就连续写入了20.5TB数据。
实测稳态下,平均写入速度5438MiB/s、标准差为109.94 MiB/s,波动率仅为 2.0%。
平均延迟低至 23.49 ms, 99.00% 的写入请求在 34.34 ms 内完成。
整体来说,PE511 12.8TB SSD在大模型“断点续训”测试中,展现了极高吞吐、低延迟、以及几乎零掉速的表现,非常适合用作AI算力节点本地的高性能热数据盘。
3、模拟大模型推理的KV Cache(键值缓存交换)
在LLM推理或训练中,GPU显存往往装不下所有历史对话的KV缓存。此时系统需要将暂时用不到的KV缓存交换(Swap)到SSD中,需要时再读回。这类场景的典型特点是:小数据块(通常为4KiB)、高并发、读写混合(以读为主)。
我们使用4KiB(4k)块大小、70%读/30%写,8线程、每线程128队列深度的极端高并发随机读写配置来模拟KV Cache。
测试前依旧全盘写入2次并预热30分钟,测试时长则是1小时。
实测读取带宽5073MB/s、IOPS=1299K,写入带宽5174MB/s、IOPS=557K,爆发出 185.6万IOPS的混合随机吞吐,这意味着它能够支撑每秒62万个KV缓存切片在SSD和主机之间高频交换,这个吞吐量可以同时支撑数以万计并发用户的Token生成,极大缓解了显存溢出(OOM)问题。
平均读写延迟分别为0.52ms 、 0.56ms,99.99% QoS 尾部延迟极低,控制在1.4ms,最大延迟不超过 4.5 ms,几乎不存在拖慢 Batch 步调的“尾部卡顿”。
七、小结
在长达20小时的FIO测试中,PE511 12.8TB展现出了14 GB/s的顺序读带宽以及10GB/s的顺序写带宽。另外还有超过3300K IOPS的4K随机读性能、1013K IOPS的4K随机写性能。
能在稳态下4K随机写入性能超过1000K IOPS的企业级SSD,目前极为少见。
在生成式AI与LLM(大语言模型)爆发式发展的今天,AI 超算集群对本地存储的性能要求达到了前所未有的高度。
传统的企业级SSD面对海量训练数据的流式喂料尚能应对,但在面对大模型千亿参数状态的高频Checkpoint(断点续训)存档写入,以及长文本推理下极端碎片化的KV Cache(键值缓存交换)时,往往容易陷入高延迟、掉速甚至长尾卡顿的困境,进而拖慢整个GPU计算集群的算力利用率。
依托当今最快的NAND闪存以及长江存储所积累的企业级稳态调度技术,PE511在数据喂料、断点续训以及KV Cache交换等AI场景中,展现了极高吞吐性能、极低的长尾延迟,以及几乎零掉速的表现,完全可以适配大模型训练、长上下文推理等全流程 AI 业务需求。
文章的结尾,将本次测试的主要数据汇总成表格,供大家参考!

































