128GB DDR4跑35B大模型!90分钟就烧坏一根、9天后第二根又告急
  • 黑白
  • 2026年09月30日 09:07
  • 0

快科技9月30日消息,海外用户Future_Fuel_8425分享了一段自己本地跑大模型的经历,其在一台搭载128GB DDR4 ECC内存的工作站上运行35B参数大模型Ornith-1.5-35B-A3B,仅90分钟后就烧坏了一根DDR4内存条,8至9天后第二根也开始报错。

该用户使用的是2019年款ThinkStation P920,配备双路至强处理器和128GB DDR4 ECC内存(16根8GB内存条),显卡为RTX 5070 Ti 16GB。

此前半年该用户一直运行20B及以下的小模型,全部装在显存中,即使长时间高负载运行也没出过问题。

这次因数据库任务需要更大模型,切换到35B的Ornith-1.5后,模型部分溢出到系统内存,90分钟后系统崩溃,日志显示第8插槽的内存条ECC错误堆积,拔掉该内存条后恢复正常。

没想到继续重度使用8至9天后,日志显示另一根内存条也即将失效。

用户强调温度不是问题,CPU从未超过80°C,GPU很少超过65°C,还配备了辅助散热,所有内存条均为同一批次匹配条,推测只是老化严重,经不住长时间高强度的连续读取。

不过用户只提到了CPU和GPU温度,并未展示内存温度数据,DDR4内存老化和长时间连续顺序读取高负载叠加,加上内存条本身散热条件有限,很可能是内存损坏的真实原因。

128GB DDR4跑35B大模型!90分钟就烧坏一根、9天后第二根又告急

文章纠错

  • 好文点赞
  • 水文反对

此文章为快科技原创文章,快科技网站保留文章图片及文字内容版权,如需转载此文章请注明出处:快科技

观点发布 网站评论、账号管理说明
热门评论
查看全部评论
相关报道

最热文章排行查看排行详情

邮件订阅

评论0 | 点赞0| 分享0 | 收藏0