Linux服务器日常运维标准化技术文档

举报
yd_213171499 发表于 2026/07/19 08:39:01 2026/07/19
【摘要】 一、日常运维核心总则1. 所有线上操作禁止随意强制执行,高危操作(删库、格式化、重启服务/服务器)必须提前报备、备份数据、避开业务高峰期。2. 运维操作遵循先备份、后操作,先测试、后上线原则,所有变更留存操作记录与日志。3. 日常运维以主动巡检、提前预警、快速排障为核心,被动处理故障转为主动保障稳定性。4. 严格区分测试环境、预发环境、线上环境,禁止跨环境随意操作。二、每日服务器标准化巡检(...

一、日常运维核心总则

1. 所有线上操作禁止随意强制执行,高危操作(删库、格式化、重启服务/服务器)必须提前报备、备份数据、避开业务高峰期。
2. 运维操作遵循先备份、后操作,先测试、后上线原则,所有变更留存操作记录与日志。
3. 日常运维以主动巡检、提前预警、快速排障为核心,被动处理故障转为主动保障稳定性。
4. 严格区分测试环境、预发环境、线上环境,禁止跨环境随意操作。

二、每日服务器标准化巡检(必做)

每日巡检为运维核心基础工作,重点监控服务器资源、服务状态、网络连通性、磁盘状态,提前发现潜在风险。

2.1 系统资源巡检

1. CPU负载监控
核心命令:top、htop、uptime
判定标准:1分钟、5分钟、15分钟负载值,单核服务器负载不超过0.8,多核服务器负载不超过核心数80%;长期高负载需排查进程占用情况,定位异常进程、死循环程序。
2. 内存资源监控
核心命令:free -h、ps -aux
判定标准:内存使用率低于80%为正常;使用率超过90%及时清理缓存、终止无用进程,防止OOM(内存溢出)导致业务宕机。重点排查Java、Python常驻进程内存泄漏问题。
3. 磁盘空间监控
核心命令:df -h、du -sh /*
判定标准:磁盘使用率低于85%为安全阈值;超过90%立即清理日志、垃圾文件、无用备份,禁止磁盘占满导致系统读写异常、服务崩溃。
4. 磁盘IO监控
核心命令:iostat -x 1
判定标准:%util 持续100%为IO阻塞,会导致业务响应缓慢、数据库卡顿,需排查大文件读写、日志疯狂写入、数据库慢查询等问题。

2.2 业务服务巡检

1. 核心服务状态校验:Nginx、MySQL、Redis、Docker、Java业务进程、定时任务等,使用 systemctl status 服务名 校验运行状态。
2. 定时任务巡检:crontab -l 核对定时任务配置,检查任务执行日志,避免任务失效、重复执行、执行报错。
3. 端口监听巡检:netstat -lnp、ss -lnp 检查业务端口是否正常监听,无端口占用冲突、端口关闭问题。

2.3 网络状态巡检

1. 内网/外网连通性测试:ping、telnet 测试服务器与数据库、缓存、负载均衡、第三方接口连通性。
2. 网络延迟与丢包检测:重点排查高峰期网络抖动、丢包问题,保障业务请求正常转发。

三、系统日志排查规范(故障核心依据)

服务器故障、服务异常、业务报错,优先通过日志定位问题,所有日志排查遵循从系统日志到业务日志、从报错信息到堆栈信息的流程。

3.1 系统核心日志路径

1. 系统全局日志:/var/log/messages(CentOS)、/var/log/syslog(Ubuntu)——记录系统启动、重启、内核报错、硬件异常
2. 安全登录日志:/var/log/secure ——记录SSH登录、暴力破解、权限操作记录
3. 定时任务日志:/var/log/cron ——记录所有定时任务执行、报错信息
4. 服务启动日志:/var/log/对应服务目录(nginx、mysql等)

3.2 常用日志排查命令

实时监控日志:tail -f 日志文件路径
筛选报错信息:grep -i error / warn / exception 日志路径
时间段日志筛选:sed、awk 筛选指定时间节点日志,定位故障瞬间异常

四、常见故障标准化排查方案

4.1 服务器卡顿、业务响应慢

排查流程:1. top查看CPU/内存占用 → 2. iostat排查磁盘IO阻塞 → 3. 查看网络延迟与连接数 → 4. 分析业务日志是否存在报错、死锁、慢查询 → 5. 终止异常进程、优化资源配置。

4.2 网站/接口无法访问

排查流程:1. 检测服务器网络连通性 → 2. 检查Nginx服务是否正常启动 → 3. 查看端口是否监听、防火墙是否放行 → 4. 核对域名解析、负载均衡配置 → 5. 排查后端业务进程是否宕机、数据库是否连接异常。

4.3 磁盘空间爆满

排查流程:1. df -h 定位爆满分区 → 2. du -sh 定位大文件/目录 → 3. 清理过期日志、无用备份、缓存文件 → 4. 配置日志切割(logrotate),防止日志无限膨胀 → 5. 超大文件优先归档备份再删除,禁止直接删除正在写入的日志文件。

4.4 SSH登录异常、登录卡顿

排查流程:1. 查看服务器负载与资源占用 → 2. 检查安全日志是否存在暴力破解 → 3. 优化SSH配置、关闭无用认证 → 4. 限制登录IP、修改默认端口,提升安全性。

五、服务器安全运维规范

1. 定期修改服务器密码,密码遵循复杂度规则(字母+数字+特殊符号),禁止弱密码。
2. 关闭服务器不必要端口、禁用无用服务,防火墙严格放行业务端口,拒绝所有非法访问。
3. 禁止root用户直接远程登录,创建普通运维账号,按需分配sudo权限。
4. 定期排查暴力破解、异常登录、恶意访问记录,及时拉黑恶意IP。
5. 系统版本、软件包定期更新修复漏洞,规避系统安全风险。

六、数据备份与容灾规范

1. 核心业务数据(数据库、配置文件、业务代码)每日自动备份,保留7天循环备份记录。
2. 备份文件异地存储,禁止与业务服务器同盘存储,防止磁盘损坏导致数据全部丢失。
3. 每周定期测试备份文件可用性,确保备份可正常恢复,杜绝备份失效问题。
4. 重大操作(系统升级、服务迁移、配置修改)前,手动备份对应配置与数据。

七、系统优化基础规范

1. 配置日志自动切割与定时清理,避免日志占用过多磁盘资源。
2. 优化系统内核参数,调整最大文件连接数、TCP连接参数,适配高并发业务场景。
3. 关闭系统无用自启服务,减少资源占用,提升服务器运行稳定性。
4. 定期清理系统缓存、无效进程、残留垃圾文件,保持服务器资源高效利用。

八、运维记录与复盘规范

1. 所有运维操作、服务变更、故障处理必须记录台账,包含操作时间、操作内容、操作人、操作结果。
2. 线上故障处理完成后,24小时内完成复盘,定位根因、制定优化方案,避免同类问题重复发生。
3. 定期汇总运维问题,沉淀标准化解决方案,优化运维流程。

【声明】本内容来自华为云开发者社区博主,不代表华为云及华为云开发者社区的观点和立场。转载时必须标注文章的来源(华为云社区)、文章链接、文章作者等基本信息,否则作者和本社区有权追究责任。如果您发现本社区中有涉嫌抄袭的内容,欢迎发送邮件进行举报,并提供相关证据,一经查实,本社区将立刻删除涉嫌侵权内容,举报邮箱: cloudbbs@huaweicloud.com
  • 点赞
  • 收藏
  • 关注作者

评论(0

0/1000
抱歉,系统识别当前为高风险访问,暂不支持该操作

全部回复

上滑加载中

设置昵称

在此一键设置昵称,即可参与社区互动!

*长度不超过10个汉字或20个英文字符,设置后3个月内不可修改。

*长度不超过10个汉字或20个英文字符,设置后3个月内不可修改。