---
url: /docs/security/incident-playbook.md
---
# 故障与安全事件处理

## 准备

保留服务版本、发布记录、数据库备份、请求标识及负责人联系方式。确认谁可以停止发布、轮换密钥、撤销会话和恢复数据，提前在隔离环境验证恢复步骤。

## 判断影响

记录首次发现时间、症状、相关环境、受影响接口和版本。区分服务故障、权限绕过、凭据泄露和数据完整性问题。不能把没有观察到异常写成已经证明没有影响。

## 暂时控制

停止相关发布或限制受影响功能；泄露密钥立即轮换，对被盗会话撤销。保留必要日志和数据库证据，避免盲目删除记录或重建生产库。

处理要聚焦真实受影响范围。公开站统计失败不必停用登录；账号权限绕过则需要及时限制相关私有操作。

## 调查与修复

关联请求标识、版本及数据变更，建立事件时间线，在隔离环境复现。修复后验证原复现路径、相邻权限及重复操作。记录已经确认和仍然未知的事实。

发布兼容修复时核对各 Worker 和数据库实际状态。回滚代码不等于恢复数据，也不会撤销第三方支付操作。

## 恢复与沟通

逐步恢复功能，监控错误和越权情况。按实际数据影响与适用义务处理通知，沟通只包含必要事实，不公开可继续利用的细节或个人资料。

## 复盘

记录原因、影响范围、发现渠道、处理时间和改进项。将缺失的权限测试、告警、备份或发布检查补进维护流程，明确负责人和完成标准。
