Linux服务器日常运维标准化技术文档
【摘要】 一、日常运维核心总则1. 所有线上操作禁止随意强制执行,高危操作(删库、格式化、重启服务/服务器)必须提前报备、备份数据、避开业务高峰期。2. 运维操作遵循先备份、后操作,先测试、后上线原则,所有变更留存操作记录与日志。3. 日常运维以主动巡检、提前预警、快速排障为核心,被动处理故障转为主动保障稳定性。4. 严格区分测试环境、预发环境、线上环境,禁止跨环境随意操作。二、每日服务器标准化巡检(...
一、日常运维核心总则
1. 所有线上操作禁止随意强制执行,高危操作(删库、格式化、重启服务/服务器)必须提前报备、备份数据、避开业务高峰期。
2. 运维操作遵循先备份、后操作,先测试、后上线原则,所有变更留存操作记录与日志。
3. 日常运维以主动巡检、提前预警、快速排障为核心,被动处理故障转为主动保障稳定性。
4. 严格区分测试环境、预发环境、线上环境,禁止跨环境随意操作。
二、每日服务器标准化巡检(必做)
每日巡检为运维核心基础工作,重点监控服务器资源、服务状态、网络连通性、磁盘状态,提前发现潜在风险。
2.1 系统资源巡检
1. CPU负载监控
核心命令:top、htop、uptime
判定标准:1分钟、5分钟、15分钟负载值,单核服务器负载不超过0.8,多核服务器负载不超过核心数80%;长期高负载需排查进程占用情况,定位异常进程、死循环程序。
2. 内存资源监控
核心命令:free -h、ps -aux
判定标准:内存使用率低于80%为正常;使用率超过90%及时清理缓存、终止无用进程,防止OOM(内存溢出)导致业务宕机。重点排查Java、Python常驻进程内存泄漏问题。
3. 磁盘空间监控
核心命令:df -h、du -sh /*
判定标准:磁盘使用率低于85%为安全阈值;超过90%立即清理日志、垃圾文件、无用备份,禁止磁盘占满导致系统读写异常、服务崩溃。
4. 磁盘IO监控
核心命令:iostat -x 1
判定标准:%util 持续100%为IO阻塞,会导致业务响应缓慢、数据库卡顿,需排查大文件读写、日志疯狂写入、数据库慢查询等问题。
2.2 业务服务巡检
1. 核心服务状态校验:Nginx、MySQL、Redis、Docker、Java业务进程、定时任务等,使用 systemctl status 服务名 校验运行状态。
2. 定时任务巡检:crontab -l 核对定时任务配置,检查任务执行日志,避免任务失效、重复执行、执行报错。
3. 端口监听巡检:netstat -lnp、ss -lnp 检查业务端口是否正常监听,无端口占用冲突、端口关闭问题。
2.3 网络状态巡检
1. 内网/外网连通性测试:ping、telnet 测试服务器与数据库、缓存、负载均衡、第三方接口连通性。
2. 网络延迟与丢包检测:重点排查高峰期网络抖动、丢包问题,保障业务请求正常转发。
三、系统日志排查规范(故障核心依据)
服务器故障、服务异常、业务报错,优先通过日志定位问题,所有日志排查遵循从系统日志到业务日志、从报错信息到堆栈信息的流程。
3.1 系统核心日志路径
1. 系统全局日志:/var/log/messages(CentOS)、/var/log/syslog(Ubuntu)——记录系统启动、重启、内核报错、硬件异常
2. 安全登录日志:/var/log/secure ——记录SSH登录、暴力破解、权限操作记录
3. 定时任务日志:/var/log/cron ——记录所有定时任务执行、报错信息
4. 服务启动日志:/var/log/对应服务目录(nginx、mysql等)
3.2 常用日志排查命令
实时监控日志:tail -f 日志文件路径
筛选报错信息:grep -i error / warn / exception 日志路径
时间段日志筛选:sed、awk 筛选指定时间节点日志,定位故障瞬间异常
四、常见故障标准化排查方案
4.1 服务器卡顿、业务响应慢
排查流程:1. top查看CPU/内存占用 → 2. iostat排查磁盘IO阻塞 → 3. 查看网络延迟与连接数 → 4. 分析业务日志是否存在报错、死锁、慢查询 → 5. 终止异常进程、优化资源配置。
4.2 网站/接口无法访问
排查流程:1. 检测服务器网络连通性 → 2. 检查Nginx服务是否正常启动 → 3. 查看端口是否监听、防火墙是否放行 → 4. 核对域名解析、负载均衡配置 → 5. 排查后端业务进程是否宕机、数据库是否连接异常。
4.3 磁盘空间爆满
排查流程:1. df -h 定位爆满分区 → 2. du -sh 定位大文件/目录 → 3. 清理过期日志、无用备份、缓存文件 → 4. 配置日志切割(logrotate),防止日志无限膨胀 → 5. 超大文件优先归档备份再删除,禁止直接删除正在写入的日志文件。
4.4 SSH登录异常、登录卡顿
排查流程:1. 查看服务器负载与资源占用 → 2. 检查安全日志是否存在暴力破解 → 3. 优化SSH配置、关闭无用认证 → 4. 限制登录IP、修改默认端口,提升安全性。
五、服务器安全运维规范
1. 定期修改服务器密码,密码遵循复杂度规则(字母+数字+特殊符号),禁止弱密码。
2. 关闭服务器不必要端口、禁用无用服务,防火墙严格放行业务端口,拒绝所有非法访问。
3. 禁止root用户直接远程登录,创建普通运维账号,按需分配sudo权限。
4. 定期排查暴力破解、异常登录、恶意访问记录,及时拉黑恶意IP。
5. 系统版本、软件包定期更新修复漏洞,规避系统安全风险。
六、数据备份与容灾规范
1. 核心业务数据(数据库、配置文件、业务代码)每日自动备份,保留7天循环备份记录。
2. 备份文件异地存储,禁止与业务服务器同盘存储,防止磁盘损坏导致数据全部丢失。
3. 每周定期测试备份文件可用性,确保备份可正常恢复,杜绝备份失效问题。
4. 重大操作(系统升级、服务迁移、配置修改)前,手动备份对应配置与数据。
七、系统优化基础规范
1. 配置日志自动切割与定时清理,避免日志占用过多磁盘资源。
2. 优化系统内核参数,调整最大文件连接数、TCP连接参数,适配高并发业务场景。
3. 关闭系统无用自启服务,减少资源占用,提升服务器运行稳定性。
4. 定期清理系统缓存、无效进程、残留垃圾文件,保持服务器资源高效利用。
八、运维记录与复盘规范
1. 所有运维操作、服务变更、故障处理必须记录台账,包含操作时间、操作内容、操作人、操作结果。
2. 线上故障处理完成后,24小时内完成复盘,定位根因、制定优化方案,避免同类问题重复发生。
3. 定期汇总运维问题,沉淀标准化解决方案,优化运维流程。
【声明】本内容来自华为云开发者社区博主,不代表华为云及华为云开发者社区的观点和立场。转载时必须标注文章的来源(华为云社区)、文章链接、文章作者等基本信息,否则作者和本社区有权追究责任。如果您发现本社区中有涉嫌抄袭的内容,欢迎发送邮件进行举报,并提供相关证据,一经查实,本社区将立刻删除涉嫌侵权内容,举报邮箱:
cloudbbs@huaweicloud.com
- 点赞
- 收藏
- 关注作者
评论(0)