监控系统负载与CPU、内存、硬盘、登录用户数，超出警戒值则发邮件告警。

[email protected]:~$ cat warning.sh
#!/bin/bash

#监控系统负载与CPU、内存、硬盘、登录用户数，超出警戒值则发邮件告警。    前提安装mail服务

[email protected]
#提取本服务器的IP地址信息
IP=`ifconfig eth0 | grep "inet addr" | cut -f 2 -d ":" | cut -f 1 -d " "`

# 1、监控系统负载的变化情况，超出时发邮件告警：

   #抓取cpu的总核数
   cpu_num=`grep -c ‘model name‘ /proc/cpuinfo`
    #抓取当前系统15分钟的平均负载值
    load_15=`uptime | awk -F"," ‘{print $5}‘| cut -f1 -d","`

     #计算当前系统单个核心15分钟的平均负载值，结果小于1.0时前面个位数补0。
     average_load=`echo "scale=2;a=$load_15/$cpu_num;if(length(a)==scale(a)) print 0;print a" | bc`

      #取上面平均负载值的个位整数
      average_int=`echo $average_load | cut -f 1 -d "."`

       #设置系统单个核心15分钟的平均负载的告警值为0.70(即使用超过70%的时候告警)。
       load_warn=0.70
        #当单个核心15分钟的平均负载值大于等于1.0（即个位整数大于0），直接发邮件告警；如果小于1.0则进行二次比较
        if [ $average_int -gt 0 ];then
        echo "$IP服务器15分钟的系统平均负载为$average_load，超过警戒值1.0，请立即处理！！！" | mail -s "$IP 服务器系统负载严重告警！！" $MAil
           else
         #当前系统15分钟平均负载值与告警值进行比较（当大于告警值0.70时会返回1，小于时会返回0 ）
        # load_now=`expr $average_load \> $load_warn`
          load_now=`echo "$average_load>$load_warn"|bc`
          #如果系统单个核心15分钟的平均负载值大于告警值0.70（返回值为1），则发邮件给管理员
          if [ $load_now -eq 0 ];then
          echo "$IP 服务器15分钟的系统平均负载达到 $average_load，超过警戒值0.70，请及时处理。"| mail -s "$IP 服务器系统负载告警" $Mail
        # $Mail
          fi

           fi
           echo 1end
            # 2、监控系统cpu的情况，当使用超过80%的时候发告警邮件：

             #取当前空闲cpu百份比值（只取整数部分）
             cpu_idle=`top -b -n 1 | grep Cpu | awk ‘{print $5}‘ | cut -f 1 -d "."`
             echo 空闲cpu：$cpu_idle%
              #设置空闲cpu的告警值为20%，如果当前cpu使用超过80%（即剩余小于20%），立即发邮件告警
              if [ $cpu_idle -ge 20 ]; then
             echo "$IP服务器cpu剩余$cpu_idle%，使用率已经超过80%，请及时处理。" | mail -s "$IP 服务器CPU告警" $Mail
              fi
              echo 2end
               # 3、监控系统交换分区swap的情况，当使用超过80%的时候发告警邮件：

                #系统分配的交换分区总量
                swap_total=`free -m | grep Swap | awk ‘{print $2}‘`

                 #当前剩余的交换分区free大小
                 swap_free=`free -m | grep Swap | awk ‘{print $4}‘`

                  #当前已使用的交换分区used大小
                  swap_used=`free -m | grep Swap | awk ‘{print $3}‘`
#echo $swap_free
                   if [ $swap_used -eq 0 ]; then # -ne 0
                   #如果交换分区已被使用，则计算当前剩余交换分区free所占总量的百分比，用小数来表示，要在小数点前面补一个整数位0
                   swap_per=0`echo "scale=2;$swap_free/$swap_total" | bc`
                 # echo swap_per$swap_per
                    #设置交换分区的告警值为20%(即使用超过80%的时候告警)。
                    swap_warn=0.20

                     #当前剩余交换分区百分比与告警值进行比较（当大于告警值(即剩余20%以上)时会返回1，小于(即剩余不足20%)时会返回0 ）
                     swap_now=`echo "$swap_per>$swap_warn"|bc`
#                    echo "swap_now:${swap_now}"

                      #如果当前交换分区使用超过80%（即剩余小于20%，上面的返回值等于0），立即发邮件告警
                    if [ $swap_now -ne 0 ];then # if (($swap_now != 0)); then
                      echo swapfree:${swap_free}M
                      echo "$IP服务器swap交换分区只剩下 $swap_free M 未使用，剩余不足20%，使用率已经超过80%，请及时处理。" | mail -s "$IP 服务器内存告警" $Mail
                      fi

                       fi
                       echo 3end
                        # 4、监控系统硬盘根分区使用的情况，当使用超过80%的时候发告警邮件：

                         #取当前根分区（/dev/sda1）已用的百份比值（只取整数部分）
                         disk_sda1=`df -h | grep /dev/sda1 | awk ‘{print $5}‘ | cut -f 1 -d "%"`

                          #设置空闲硬盘容量的告警值为80%，如果当前硬盘使用超过80%，立即发邮件告警
                          if (($disk_sda1 > 1)); then   #设置 >80
echo "$IP 跟分区使用率已经超过1 达到 ${disk_sda1}%"
                          echo "$IP 服务器 /根分区使用率已经超过1%，达到 $disk_sda1请及时处理。" | mail -s "$IP 服务器硬盘告警" $Mail
                          fi
                           echo 4end
                           #5、监控系统用户登录的情况，当用户数超过3个的时候发告警邮件：

                            #取当前用户登录数（只取数值部分）
                            users=`uptime | awk -F"," ‘{print $3}‘|awk ‘{print $1}‘`

                             #设置登录用户数的告警值为3个，如果当前用户数超过3个，立即发邮件告警
                     if [ $users -ge 1 ]; then # -ge 3
echo "$IP 用户数达到$users 请处理"
                             echo "$IP 服务器用户数已经达到$users个，请及时处理。" | mail -s "$IP 服务器用户数告警" $Mail
                             fi
                          echo 5end

~~~~~~~~~~~~~~~~~~~~~~~~~~

二、加入任务计划：每十分钟检测一次，有告警则立即发邮件(十分钟发一次)。

复制代码代码示例:

# crontab -e
*/10 * * * * /scripts/sys-warning.sh
# service crond restart

时间： 2024-08-02 11:25:39

监控系统负载与CPU、内存、硬盘、登录用户数，超出警戒值则发邮件告警。

监控系统负载与CPU、内存、硬盘、登录用户数，超出警戒值则发邮件告警。的相关文章

shell脚本监控系统负载、CPU和内存使用情况

监测linux系统负载与CPU、内存、硬盘、用户数的shell脚本

Linux 查看机器配置,及cpu/内存/硬盘使用率

VPS性能测试:CPU内存,硬盘IO读写,带宽速度,UnixBench和压力测试

Windows 性能监视器的基本指标（CPU,内存,硬盘参数）

shell脚本使用 uptime 命令监控系统负载

【Python运维脚本】Python监控系统负载

一个统计 CPU 内存硬盘使用率的shell脚本

linux系统下获取cpu、硬盘、内存使用率