运维
VPS上线后要监控什么?小网站也能执行的清单
证据状态:官方文档、明确条件与可重复步骤;页面未标注的数据不视为本站实测。
直接答案:小型VPS至少监控外部可用性、95分位响应、CPU、可用内存、磁盘空间、IO等待、证书到期和备份结果。告警必须对应动作,例如磁盘低于20%先清日志并扩容;只有图表没有处理流程,不能降低故障时间。
从用户能否访问开始
外部监控点定时请求真实页面或API,并记录状态码和响应时间。只监控服务器在线会漏掉数据库故障、证书过期和应用返回错误。
资源指标与动作
| 指标 | 观察方式 | 触发后的动作 |
|---|---|---|
| 可用内存 | 持续趋势和OOM | 定位进程、限制或扩容 |
| 磁盘 | 空间与inode | 清理日志、备份、扩盘 |
| IO等待 | 高峰期持续值 | 定位数据库和日志写入 |
| 响应时间 | 95分位 | 区分网络与应用瓶颈 |
必须监控备份本身
记录最后成功时间、文件大小和校验结果,并定期从备份恢复。备份任务返回成功不代表数据完整,也不代表恢复过程具备全部密钥和依赖。
备份只有恢复成功才算有效
备份成本包括存储、跨地域复制、请求、出口流量和恢复时间。快照与异地备份承担不同职责。
- 定义可接受的数据损失时间和恢复时间。
- 分别备份数据库、用户文件和配置。
- 至少保留一份不与生产实例同故障域的副本。
- 定期在空白服务器完成恢复演练。
free -h
df -h
docker stats --no-stream
docker compose ps命令适用于常见Linux与Docker环境。连续记录高峰数据,单次空载结果不能代表生产负载。
哪些情况下不应这样选
- 只开同账号同地域快照,就认为已经异地容灾。
- 从未恢复过备份,也没有记录恢复依赖。
资料与边界
本文结合官方文档和可重复的验收方法编写。未标注“实测”的数据不作为跑分或线路承诺;价格、资格和产品限制应以购买当天的官方页面为准。
常见问题
CPU偶尔100%需要升级吗?
短暂峰值不一定有问题,应结合持续时间、队列、错误率和响应时间判断。
Swap使用了就是内存不足吗?
不一定,要看持续换入换出和应用延迟;频繁交换通常值得调查。
多久测试一次恢复?
按业务变化和可接受风险决定,至少在重大升级后以及定期恢复到空白环境。