1.
监控与告警策略总体规划
- 目标:明确SLA、可用性目标与告警等级(信息/警告/严重/紧急)。
- 清单:列出所有实例、IP、应用服务、数据库、负载均衡和存储卷。将每项映射到负责人和联系链。
- 周期:制定巡检频率(例:每日基础巡检,实时告警触发即刻处理)。
2.
初始接入:部署监控代理与权限配置
- Linux示例:SSH登录后执行:curl -sSL <监控厂商安装脚本> | sudo bash,或rpm/deb包安装;确保/usr/local/agent存在并开机自启。
- Windows示例:上传并执行安装包,配置服务账号并放行入站防火墙端口。
- 权限检查:确认云供应商控制台API Key/Token已妥善配置并仅授予监控所需只读或监控权限;不要用root长期运行agent。
3.
关键监控项与阈值建议(按优先级)
- 主机类:CPU平均使用率(1m/5m/15m),阈值:警告70%,严重90%;内存利用率:警告75%,严重90%;磁盘使用率:警告80%,严重90%。
- 服务类:HTTP 5xx比例>1%触发警告;数据库连接数>80%阈值;磁盘IO等待(iowait)>30%触发警告。
- 可用性:端口/TCP healthcheck失败3次或ping丢包率>30%触发告警;SSL证书到期提前30天提醒。
4.
告警通道与分级策略配置
- 通道:邮箱、短信、企业微信/钉钉、Slack/Webhook、PagerDuty/OPSGenie。优先级映射:信息->邮件;警告->群机器人;严重/紧急->短信+电话。
- 去抖与抑制:设置同一故障5分钟内聚合、并设置维护窗口抑制告警;对短暂波动使用一次性抑制规则。
- 上下文:告警内容必须携带主机名、IP、时间戳、指标值、最近日志摘录与建议下一步操作。
5.
告警触发后的标准化处理流程(SOP)
- 接单:值班工程师收到告警后在工单系统登记(时间、接收人、告警ID)。
- 快速验证:1) 登录监控面板确认指标趋势;2) SSH/RDP 登入目标主机;3) 采集关键诊断数据(top, free -m, df -h, iostat -x 1 3, ss -tunlp)。保存输出至工单。
- 临时缓解:若服务不可用,按预案执行:重启服务(systemctl restart xxx)、切换到备用节点或启用旧版本回滚,记录每一步并时间戳。
6.
常见故障逐项排查与具体命令
- 高CPU:top 或 htop 查找占用进程;ps aux --sort=-%cpu | head -20;若为单进程泄露,先执行strace -p PID(5s)采样,再考虑kill -15/kill -9。
- 内存泄露:free -m、ps aux --sort=-%mem;检查oom日志(/var/log/kern.log 或 journalctl -k);若为Java,jmap -heap并分析堆快照。
- 磁盘满:df -h、du -sh /var/log/* | sort -hr | head;清理旧日志、启用logrotate、或扩容云盘并扩展文件系统(resize2fs或xfs_growfs)。
- 网络异常:ping/tracepath到关键依赖,ss -s查看socket状态,tcpdump -i eth0 port 80 -w /tmp/capture.pcap(采样)供排查。
- 应用崩溃:查看应用日志(tail -n 200 /var/log/app.log或journalctl -u app.service -n 200),定位异常堆栈并回滚或重启。
7.
故障样本采集与上报模板(便于厂商/二线协助)
- 必要文件:监控截图、告警ID、采集命令输出(top, df, free, ss, journalctl -u 服务 -n 500)、相关应用日志片段。打包命令:tar czf /tmp/incident_YYYYMMDD.tar.gz /var/log/app.log /tmp/*.log /tmp/capture.pcap。
- 上报要点:说明复现步骤、影响范围、是否已采取缓解措施、是否需要流量切换或回滚,并附上工单编号与联系方式。
8.
故障后复盘与预防措施
- 复盘会议:48小时内完成事故复盘,记录根因分析(RCA)、时间线、影响、恢复步骤与遗漏的监控项。
- 改进项:补充监控指标、调整阈值、优化自动化脚本、增加熔断与限流、制定容量扩容计划,并在配置管理库中提交变更。
9.
问:如何避免误报与告警风暴? 答:
- 问:如何避免误报与告警风暴?
- 答:采用分级阈值与去抖策略(例如:连续3次采样超阈才触发),配置维护窗口与基于服务拓扑的抑制(下游服务故障不必重复触发上游多条告警),并对历史数据做季节性/峰值分析后调整阈值。
10.
问:如何设置告警自愈或自动化缓解? 筂答:
- 问:如何设置告警自愈或自动化缓解?
- 答:先定义安全的自动化动作(如:自动重启服务、清理临时文件、扩展磁盘到预设上限),在低风险环境充分测试并加上幂等性与幂等判断(避免重试风暴),并在动作执行后回写工单与告警日志。
11.
问:遇到台湾云平台网络或区域性故障我应如何快速恢复线上服务? 答:
- 问:遇到台湾云平台网络或区域性故障我应如何快速恢复线上服务?
- 答:启动预先配置的跨可用区/跨区域灾备策略:1) 将流量切换到另一区域的LB或CDN;2) 启用冷备或热备实例(根据RTO/RPO);3) 在切换前确保数据一致性(使用异步复制或回滚点),并向业务方通知故障影响与预计恢复时间。
来源:台湾云服务器租后运维监控报警与故障排查流程建议