OpenSRE 合成事故模拟环境揭秘:开源 RCA 评测与强化学习训练场完整指南
【免费下载链接】opensreBuild your own AI SRE agents. The open source toolkit for the AI era.项目地址: https://gitcode.com/GitHub_Trending/op/opensre
OpenSRE 是一款开源的 AI SRE 智能体框架,它内置的合成事故模拟环境(synthetic incident simulation)是整颗"心脏":既能为根因分析(RCA)提供标准化评测集,也是强化学习训练 AI SRE 智能体的开源训练场。本文带你快速看懂这套环境的设计思路、评测场景构成,以及如何三步跑起你的第一份 RCA 基准报告。
为什么 AI SRE 需要一个"训练场"
写代码的智能体有 SWE-bench,可以大规模训练和明确地获得反馈;但生产事故的排查仍然缺少这样的基础设施——分布式故障更慢、噪声更多、更难模拟。
OpenSRE 的官方定位正是补上这一层:
一个面向智能体基础设施事件响应的开放强化学习环境,附带真实生产故障的端到端测试。
也就是说,它不只是"能查故障的机器人",更是AI SRE 的基准 + 训练场。这一使命写在项目主文档 README.md 中,值得细读。
3 类经典场景:合成事故是怎么"造"出来的
模拟引擎通过mock Grafana 后端与RDS Postgres 场景夹具组合,复现真实数据库故障:指标、日志、WAL 复制行为都是可复现的合成数据,故障发生过程与真实生产几乎一致。
官方内置的基准场景(见 docs/benchmarks/README.md):
| 场景编号 | 名称 | 故障类型 |
|---|---|---|
| 001 | replication-lag | 复制延迟 |
| 002 | connection-exhaustion | 连接池耗尽 |
| 003 | storage-full | 磁盘写满 |
更大的语料是 452 个场景的 cloud-ops-bench 数据集,一次make download-cloudopsbench-hf即可拉取,详见 tests/benchmarks/README.md。
模拟引擎的持续演进记录在 docs/daily-updates/2026-04-02.mdx:根因诊断节点、mock Grafana 后端和复制延迟/连接耗尽场景的一次大幅重构就发生在这一天。
RCA 评测三步走:从安装到生成报告
第一步:拿到代码
git clone https://gitcode.com/GitHub_Trending/op/opensre第二步:拉取评测语料
make install make download-cloudopsbench-hf # 拉取 452 个场景的语料第三步:跑冒烟评测(5 个场景,dev 模式跳过完整性门禁)
uv run python -m tests.benchmarks._framework.cli run \ tests/benchmarks/cloudopsbench/configs/cloudopsbench_smoke.yml --dev评测框架会把结果落在.bench-results/下:
report.json— 机器可读report.md/report.html— 人读摘要,HTML 可直接用浏览器打开provenance.json— 代码 SHA、配置内容、环境、模型版本,保证评测可复现cases/*.json— 每个案例的原始产物
内置的小基准套件更省事,一条make benchmark就跑完 3 个固定场景,并自动把摘要表写回 README。报告关注的指标是:耗时、token 用量、预估 LLM 成本——这正是强化学习奖励信号最关心的部分。
每个场景目录还配有answer.yml(标准答案)与QA_VALIDATION.md(验证说明),例如 006 场景"复制延迟 + CPU 红鲱鱼"专门训练智能体不被无关指标带偏——这是 RCA 评测中最容易失分的陷阱。
端到端测试:训练场如何"打分"
RCA 评测之外,tests/e2e/ 目录承载了跨云端场景的真实端到端测试:Grafana 查询验证、Tempo 本地种子数据、PostHog / Trello 编排、incident.io 事件流等。测试命名遵循"语义化测试目录"规范,e2e 与单测、本地与云端的边界一目了然(规范说明见 tests/README.md)。
这套"场景 + 标准答案 + 可复现产物"的闭环,正是强化学习训练所需的一切:
- 状态:mock 出的指标、日志、事件流
- 动作:智能体的工具调用序列
- 奖励:与
answer.yml比对得出的诊断质量
基准报告还会按工具拆分成本,方便定位"哪一步最烧 token":
生产级评测则要求提交预注册文件(pre-registration),并可直接在 GitHub CI 中触发 Fargate 任务执行,结果落 S3 存档——完整流程见 docs/benchmarks/README.md。
上手路线图:新手 3 件事
- 🎯先跑冒烟:5 场景 dev 模式熟悉产物结构,再上全量
- 📊看 answer.yml:理解每个故障的"标准答案长什么样",这是 RCA 评测的核心
- 🔁对比两次运行:换模型或换配置,比较
report.json中的耗时与成本差异
OpenSRE 把"生产事故"变成了可离线复现、可评分、可迭代的实验对象。无论你想评测自研的运维智能体,还是为强化学习搭建训练环境,这个开源训练场都已就绪。
关键路径速查
- 项目说明与使命:README.md
- 基准运行指南:docs/benchmarks/README.md
- 评测语料与命令:tests/benchmarks/README.md
- 端到端测试:tests/e2e/
- 构建与基准入口:Makefile
【免费下载链接】opensreBuild your own AI SRE agents. The open source toolkit for the AI era.项目地址: https://gitcode.com/GitHub_Trending/op/opensre
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考