(1)基础指标监控:CPU 使用率、内存使用、磁盘 I/O、网络出入带宽、连接数(CONN)与每秒请求数(QPS)。
(2)基线流量与峰值:记录 7 × 24 的 P95/P99 QPS 和带宽,例如常态 2,000 QPS,峰值 45,000 QPS。
(3)缓存命中率:CDN/本地缓存命中率目标 ≥ 90%,低命中率需要优化缓存策略。
(4)错误率与延迟:监控 5xx 错误率与 95th 延迟,阈值 5xx < 0.5%,95th 延迟 < 500ms。
(5)容量阈值定义:例如当 CPU > 70% 或带宽 > 80% 或连接数 > 65% 时触发扩容工单/自动扩容。
(1)垂直扩容(升级 VPS 配置):适合短期突发、状态少的服务。例:从 4vCPU/8GB 升到 8vCPU/16GB。
(2)水平扩容(增加实例):适合无状态 WEB/API,扩展线性好,建议使用负载均衡。例:由 3 台 4vCPU/8GB 扩到 12 台同配。
(3)会话粘滞与状态管理:若存在会话,建议使用 Redis 会话共享或 JWT 无状态验证,避免粘滞导致扩容不可预期。
(4)扩容延迟与冷启动:启动新 VPS 到就绪时间需纳入决策,容器化启动(30–60s)快于传统 VPS(120–300s)。
(5)成本与弹性对比:垂直短期成本高但管理简单,水平长期弹性好且易与 CDN/负载均衡结合。
(1)前端使用多家 CDN(主/备用),主 CDN 缓存静态资源并做流量吸收,备用在主 CDN 故障时接管。
(2)DNS 与负载均衡:采用智能 DNS(Geo DNS)把台湾流量导向就近 POP,并用 L4/L7 负载均衡器分配到后端 VPS 集群。
(3)速率限制与熔断:在边缘与应用层设置 QPS/连接上限,避免冷启动时流量直击 origin。
(4)后端拆分:静态由 CDN、动态由 API 集群、数据库读写分离并使用只读副本减轻主库压力。
(5)监控与告警:Prometheus + Grafana,关键报警:CPU、带宽、QPS、错误率、磁盘 I/O;设置自动化 runbook 与扩容脚本。
(1)边缘防护:优先将流量引至 CDN/清洗(scrubbing)服务,抑制大流量攻击(例如 SYN flood, UDP flood)。
(2)网络层规则:启用防火墙与 ACL,设置速率限制、黑白名单与 TCP SYN cookies。
(3)应用层防护:WAF 规则拦截常见攻击(SQLi、XSS、爬虫行为),并结合行为分析拦截异常流量。
(4)BGP 黑洞与合作通信:与上游带宽供应商协商流量清洗与 BGP 黑洞方案,严重攻击时快速转流到清洗中心。
(5)恢复与演练:定期进行 DDOS 演练与 RTO 测试,确保在攻击时能够切换到备用方案并保持 SLA。
(1)背景:某台湾电商平台常态 2,500 QPS,促销峰值曾达 48,000 QPS,原先 4 台 VPS(4vCPU/8GB/200Mbps)造成 origin CPU 饱和。
(2)应对措施:临时启用多家 CDN 提升缓存率至 93%,启动 8 台额外 8vCPU/16GB VPS 做水平扩容,并在负载均衡上开启会话无粘滞。
(3)结果数据:促销期间 origin QPS 降至 3,500 QPS,95% 请求由 CDN 命中,后端 VPS 平均 CPU 45%,错误率下降到 0.2%。
(4)學到的教訓:事前进行流量压测、缓存穿透保护与数据库读写分离是关键;冷备资源与自动扩容脚本节约宝贵响应时间。
(5)后续优化:将热点商品 API 加入边缘计算逻辑,进一步把动态接口的部分结果缓存 1–5 秒降低 origin 压力。
(1)下面表格展示三种节点在台湾部署时的建议配置与预估并发支持。
(2)说明:预估并发为经 CDN 缓存后到达 origin 的并发量,实际需结合 QPS、请求大小和连接保持时间调整。
(3)建议在部署时设置 Nginx worker_processes auto,worker_connections 4096,ulimit -n 65536,sysctl net.core.somaxconn=65535。
(4)数据库建议主从:主库 16vCPU/64GB/2TB NVMe,读库多副本放台湾/亚太节点;使用连接池(max_connections 500–2000)。
(5)定期评估:每周查看 P95/P99 并调整扩容阈值与弹性策略。
(1)自动扩容脚本:基于监控触发(CPU、带宽、QPS),脚本执行新增/移除实例与负载均衡注册。
(2)蓝绿与滚动发布:减少发布引起的流量冲击,使用滚动更新保证健康检查通过再下线旧实例。
(3)备份与恢复:数据库每天快照、每小时增量日志备份,RTO 与 RPO 明确并演练。
(4)容量评审:促销前 14/7/1 天做容量评估与压测,预留 1.5–2 倍峰值余量。
(5)成本控制:设置预算告警与低优先级抢占型实例作为弹性补位,平衡 SLA 与成本。

(1)面向台湾用户,应优先采用就近 CDN + 多 POP 部署来降低 origin 压力并改善延迟。
(2)对无状态服务优先做水平扩容并结合自动化,状态服务先做状态分离再扩展。
(3)DDoS 防护需从边缘开始,多层结合(CDN、WAF、BGP 清洗)确保高可用。
(4)事前压测、监控与演练比临时救火更重要,设置明确阈值与 runbook。
(5)根据本文示例配置与表格开始制定具体扩容计划,并在预期流量到来前完成演练与资源预留。