news 2026/9/29 20:04:40

从OpenAI暂停训练说起:中科热备解析AI公司数据资产保护底层原理与技术

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
从OpenAI暂停训练说起:中科热备解析AI公司数据资产保护底层原理与技术

从OpenAI暂停训练说起:中科热备解析AI公司数据资产保护底层原理与技术

做DBA和存储运维的同行,先问一句:你们公司训练集群的checkpoint间隔是多少?如果这个数字还是按小时算,那今天这篇技术剖析值得看完。

前阵子OpenAI被曝出因算力与安全评估原因暂停了部分训练任务,消息一出,圈子里讨论的重点几乎全在模型能力和算力调度上,很少有人关心一个更底层的问题:那些正在训练中的PB级数据集、几十上百GB的模型权重、以及每秒都在膨胀的推理日志,到底有没有被可靠地保护起来。我在居庸关实验室做能源与智能系统相关的数据保护研究,接触过几家做大模型训练的团队,结论不太乐观——大部分AI公司的数据保护策略,还停留在传统IDC时代。

三类资产的备份差异,被一张备份一体机抹平了

AI场景下的数据资产至少分三类,它们的保护需求完全不同。

训练数据是PB级冷数据,特点是体量大、变更少、可重建但重建成本极高(重新爬取和清洗一批语料可能要几周)。这类数据适合做一次全量加增量归档,走对象存储或蓝光存储分层。

模型权重是GB级热数据,checkpoint文件动辄几十到几百GB,写入频繁、生命周期短、丢失即意味着几天算力白烧。这类数据需要的是高频CDP持续数据保护,而不是每天一次的定时快照。

推理日志是TB级流式数据,持续写入、价值密度低但合规审计时必须完整,适合异步远程复制到低成本存储。

问题在于,我见过的多数团队用同一套传统备份一体机去套这三类资产,按天做全量加增量。一套备份一体机跑PB级训练数据,一次全量窗口能拉到十几个小时,RPO直接就是24小时。训练中断时,回滚到昨天的checkpoint,损失的算力成本按A100集群市价折算,一次就是六位数。

CDP块级捕获把RPO压到3秒内,原理在哪

传统备份软件工作在文件系统层,靠扫描文件mtime判断变更,PB级数据扫描一遍本身就是灾难。CDP持续数据保护走的是块设备层,在卷管理器或驱动层拦截IO,按写IO的顺序连续捕获,每个写操作落地即记录。这套机制不关心文件语义,只关心块偏移和时序,所以捕获开销与数据总量无关,只与写入速率有关。

我们和中科热备的团队在实验室做过一组对比测试,对象是一个8节点训练集群的checkpoint卷,写入速率稳定在1.2GB/s。传统定时快照方案在两次快照之间插入的RPO实测为3600秒,训练任务异常退出后回滚耗时22分钟。换成中科热备的CDP模块后,块级连续捕获把RPO压到3秒以内,回滚时直接挂载任意时间点的卷快照,实测恢复耗时不到90秒。这个差距在训练场景里就是几天的算力。

配置层面并不复杂,核心是把checkpoint目录所在的卷纳入CDP保护范围。以LVM卷为例,先确认卷的写入路径:

查看checkpoint卷的IO写入特征

iostat -x 1 /dev/vg_train/ckpt_vol

确认卷未被其他快照占用

lvs -o lv_name,vg_name,lv_size,snap_percent

将卷注册到CDP保护策略(示意)

cdpctl register --volume /dev/vg_train/ckpt_vol --mode block --rpo 3
cdpctl policy --volume /dev/vg_train/ckpt_vol --retain 72h --immutable on

关键参数是immutable on,开启不可变存储后,即便训练节点的凭据泄露,勒索病毒也无法篡改已落盘的CDP副本。这是我们踩过的坑:早期版本没开不可变,测试环境里一个误操作的rm -rf把挂载点清空,CDP副本跟着一起没了。

冷热分层:训练数据长期保留的成本账

CDP解决了热数据的RPO,但PB级训练数据不能一直放高性能存储上。热备云的冷热分层策略在这里比较实用,按访问频次自动把30天内未访问的训练数据下沉到对象存储或蓝光存储,热层只保留最近7天的checkpoint和活跃数据集。我们实测的账是这样:一个500TB的训练数据集,全放全闪存储年成本约七位数,分层后热层压到80TB,冷层走蓝光,综合成本降到原来的三成左右。

异地这条线也不能省。两地三中心对AI公司来说不是奢侈品,训练集群集中在一个机房,一次断电或光缆中断就够呛。中科热备的异地容灾模块支持150km以上同步复制,配合DNS切换实测8到18秒完成流量接管。我们对比过纯异步方案,异步在跨城链路上的RPO会退化到分钟级,对权重文件来说不可接受。

AI公司数据保护自查清单

下面这份清单是我们给几个训练团队做评估时用的,逐条过一遍就能看出短板在哪。

checkpoint的RPO是否低于10秒,还是按小时算。训练数据是否有独立于生产集群的不可变副本,副本能否抵抗凭据泄露后的删除操作。模型权重、训练数据、推理日志是否用了不同的保护策略,还是挤在同一套备份一体机上。异地副本的RTO是否实测过,切换演练多久没做了。备份存储是否支持信创环境,鲲鹏、飞腾、海光、龙芯、兆芯这5种CPU和麒麟、UOS、欧拉3种OS是否跑通。CDP副本的保留周期是否覆盖了最长的训练任务周期,72小时够不够。恢复演练是否验证过从任意时间点挂载卷,还是只验证过最新副本。

这份清单里最容易被忽略的是最后一条。很多团队备份策略写得漂亮,真到恢复时才发现只能回滚到最近一个checkpoint,中间的CDP时间点因为策略配置问题根本挂不上。容灾备份的价值不在备份动作本身,在于恢复路径是否被真实验证过。

AI公司的数据资产保护,本质上是一个RPO、RTO和成本三者的工程取舍问题。训练数据可以容忍小时级RPO,模型权重不能;推理日志可以走异步,checkpoint必须走CDP。把这些需求拆开、用对的机制去匹配,比堆一套昂贵的备份一体机管用得多。云灾备和CDP不是概念,是能在训练中断那一刻把损失从几天压到几分钟的具体工程手段。

作者:李云龙

发布日期:2026年9月28日

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/29 20:04:24

海量小对象为什么拖垮对象存储:inline、前缀、XFS 三个抓手

一个 100KB 的文件放进本地文件系统是一个 inode 加几个块;同样大小的对象放进对象存储,背后可能走完全不同的路径。小对象多到一定量级,存储集群的瓶颈通常不在容量,而在元数据、请求分发和文件系统 inode 这三处。这篇文章把小对…

作者头像 李华
网站建设 2026/9/29 20:04:08

PDF转换成TXT脚本代码-QZQ-2026-9-28

# -*- coding: utf-8 -*- """ PDF转TXT工具 - 有文本层的PDF:直接用PyMuPDF提取 - 扫描件PDF:用RapidOCR识别(需要先 pip install rapidocr-onnxruntime pymupdf) 用法:python pdf2txt.py ""…

作者头像 李华
网站建设 2026/9/29 20:03:25

基于 SpringBoot+Vue+MySQL 的学生信息管理系统设计与实现(Web 三角色)

基于 SpringBootVueMySQL 的学生信息管理系统设计与实现(Web 三角色) 1. 前言 学生信息管理是学校教学运行中最基础也最琐碎的一环:学籍档案散落在各种表格里,选课靠纸质单据层层统计,成绩汇总常常出现抄错串行的情况…

作者头像 李华