feat: 建立可观测性、容量与恢复验证基线
This commit is contained in:
@@ -1118,3 +1118,32 @@ MVP 沿用 IoTDB(现状);TDengine 作为生产规模化候选(先基准
|
||||
- 本任务前分支提交为 `69ef5a0`;回滚可还原 Task 12 提交;
|
||||
- 数据库回滚执行 `000008_governance_effectiveness.down.sql` 可删除意见版本、规则结果、知识审核表和新增列;
|
||||
- Web 页面回滚需还原会诊、知识、溯源页面及对应 DAL,不覆盖旧专家意见。
|
||||
|
||||
## 2026-08-14 整改 Task 13:建立可观测性、容量与恢复验证
|
||||
|
||||
### 做了什么
|
||||
|
||||
- 新增 `X-Request-ID` 中间件:请求 ID 生成或透传、响应头返回、日志记录 `requestId`;query 中 token/password/secret/authorization 自动脱敏;
|
||||
- 新增依赖指标注册表和 `GET /api/v1/ops/metrics`,AI 客户端记录请求数、失败数、最近延迟和 P50/P95;
|
||||
- AI 服务 `/detect` 透传 `X-Request-ID`,并新增响应头测试;
|
||||
- 新增 `docs/operations/slo-and-alerts.md`、`load-test-scenarios.md`、`backup-restore-drill.md`;
|
||||
- `部署指南(物理机).md` 增加可观测性与恢复验证要求。
|
||||
|
||||
### 设计思路与决策依据
|
||||
|
||||
- 全链路追踪从 HTTP 入口开始,先保证请求 ID 和日志脱敏,后续可替换为正式 tracing/APM;
|
||||
- 依赖指标采用内存快照,满足当前单实例观测;多实例或生产规模化后再接入 Prometheus/OTel;
|
||||
- SLO 和告警阈值先给出可执行基线,不把未运行的监控平台写入“已验证”状态;
|
||||
- 备份恢复文档要求真实演练记录 RPO/RTO,避免只在文档里声明可恢复。
|
||||
|
||||
### 验证结果
|
||||
|
||||
- `scripts/verify.ps1` exit 0:Go test/vet/build、Web test/lint/build、小程序 test/typecheck/build、APP typecheck/lint、AI pytest 15/15 均通过;
|
||||
- 新增测试覆盖 requestId 透传/生成、敏感 query 脱敏、AI requestId 响应头;
|
||||
- 未部署开发服务器,未执行 500/1000 用户负载、真实备份恢复演练或告警通道故障演练。
|
||||
|
||||
### 回滚点
|
||||
|
||||
- 本任务前分支提交为 `126c215`;回滚可还原 Task 13 提交;
|
||||
- requestId/日志脱敏可安全保留;若指标采集开销过高,可降低采样频率;
|
||||
- 运维文档和部署指南可直接保留,不删除已记录的恢复演练要求。
|
||||
|
||||
Reference in New Issue
Block a user