服务器运维时间线

第 1 周
初始化
系统更新、创建非 root 用户、SSH 密钥登录、禁密码、装 fail2ban
第 2 周
基础服务
Caddy 反代、防火墙只放 22/80/443、自动续期证书
第 3 周
监控上线
node_exporter + 告警:CPU > 80% 持续 5 分钟、磁盘 > 85%、内存 available < 10%
第 4 周
第一次故障
磁盘被日志打满,教训:所有服务日志必须有轮转(logrotate)
第 5 周
备份体系
数据库每日 dump + 异地同步,恢复演练跑通一次才算备份
第 6 周
稳定运行
发布流程标准化:diff → 推送 → 留回滚 → 活接口验证

三条最贵的经验

  1. 磁盘写满是最高频故障,logrotate 从第一天就配
  2. 没有恢复演练的备份等于没有备份
  3. 改配置先留回滚,生产上的改动必须可回退

目录

图表