监控系统负载与CPU、内存、硬盘、登录用户数,超出警戒值则发邮件告警。

[email protected]:~$ cat warning.sh 
#!/bin/bash

#监控系统负载与CPU、内存、硬盘、登录用户数,超出警戒值则发邮件告警。    前提安装mail服务
 
 [email protected]
 #提取本服务器的IP地址信息
 IP=`ifconfig eth0 | grep "inet addr" | cut -f 2 -d ":" | cut -f 1 -d " "`
 
  # 1、监控系统负载的变化情况,超出时发邮件告警:
  
   #抓取cpu的总核数
   cpu_num=`grep -c ‘model name‘ /proc/cpuinfo`
    #抓取当前系统15分钟的平均负载值
    load_15=`uptime | awk -F"," ‘{print $5}‘| cut -f1 -d","`
    
     #计算当前系统单个核心15分钟的平均负载值,结果小于1.0时前面个位数补0。
     average_load=`echo "scale=2;a=$load_15/$cpu_num;if(length(a)==scale(a)) print 0;print a" | bc`
     
      #取上面平均负载值的个位整数
      average_int=`echo $average_load | cut -f 1 -d "."`
      
       #设置系统单个核心15分钟的平均负载的告警值为0.70(即使用超过70%的时候告警)。
       load_warn=0.70
        #当单个核心15分钟的平均负载值大于等于1.0(即个位整数大于0) ,直接发邮件告警;如果小于1.0则进行二次比较
        if  [ $average_int -gt 0 ];then
        echo "$IP服务器15分钟的系统平均负载为$average_load,超过警戒值1.0,请立即处理!!!" | mail -s "$IP 服务器系统负载严重告警!!" $MAil
           else        
         #当前系统15分钟平均负载值与告警值进行比较(当大于告警值0.70时会返回1,小于时会返回0 )
        # load_now=`expr $average_load \> $load_warn`
          load_now=`echo "$average_load>$load_warn"|bc`
          #如果系统单个核心15分钟的平均负载值大于告警值0.70(返回值为1),则发邮件给管理员
          if [ $load_now -eq 0 ];then
          echo "$IP 服务器15分钟的系统平均负载达到 $average_load,超过警戒值0.70,请及时处理。"| mail -s "$IP 服务器系统负载告警" $Mail
        # $Mail
          fi
          
           fi
           echo 1end
            # 2、监控系统cpu的情况,当使用超过80%的时候发告警邮件:
            
             #取当前空闲cpu百份比值(只取整数部分)
             cpu_idle=`top -b -n 1 | grep Cpu | awk ‘{print $5}‘ | cut -f 1 -d "."`
             echo 空闲cpu:$cpu_idle%
              #设置空闲cpu的告警值为20%,如果当前cpu使用超过80%(即剩余小于20%),立即发邮件告警
              if [ $cpu_idle -ge 20 ]; then
             echo "$IP服务器cpu剩余$cpu_idle%,使用率已经超过80%,请及时处理。" | mail -s "$IP 服务器CPU告警" $Mail
              fi
              echo 2end
               # 3、监控系统交换分区swap的情况,当使用超过80%的时候发告警邮件:
               
                #系统分配的交换分区总量
                swap_total=`free -m | grep Swap | awk ‘{print $2}‘`
                
                 #当前剩余的交换分区free大小
                 swap_free=`free -m | grep Swap | awk ‘{print $4}‘`
                 
                  #当前已使用的交换分区used大小
                  swap_used=`free -m | grep Swap | awk ‘{print $3}‘`
#echo $swap_free                  
                   if [ $swap_used -eq 0 ]; then  # -ne 0
                   #如果交换分区已被使用,则计算当前剩余交换分区free所占总量的百分比,用小数来表示,要在小数点前面补一个整数位0
                   swap_per=0`echo "scale=2;$swap_free/$swap_total" | bc`
                 #  echo swap_per$swap_per                   
                    #设置交换分区的告警值为20%(即使用超过80%的时候告警)。
                    swap_warn=0.20
                    
                     #当前剩余交换分区百分比与告警值进行比较(当大于告警值(即剩余20%以上)时会返回1,小于(即剩余不足20%)时会返回0 )
                     swap_now=`echo "$swap_per>$swap_warn"|bc`
#                    echo "swap_now:${swap_now}"
                     
                      #如果当前交换分区使用超过80%(即剩余小于20%,上面的返回值等于0),立即发邮件告警
                    if [ $swap_now -ne 0 ];then #  if (($swap_now != 0)); then
                      echo swapfree:${swap_free}M
                      echo "$IP服务器swap交换分区只剩下 $swap_free M 未使用,剩余不足20%,使用率已经超过80%,请及时处理。" | mail -s "$IP 服务器内存告警" $Mail
                      fi
                      
                       fi
                       echo 3end
                        # 4、监控系统硬盘根分区使用的情况,当使用超过80%的时候发告警邮件:
                        
                         #取当前根分区(/dev/sda1)已用的百份比值(只取整数部分)
                         disk_sda1=`df -h | grep /dev/sda1 | awk ‘{print $5}‘ | cut -f 1 -d "%"`
                         
                          #设置空闲硬盘容量的告警值为80%,如果当前硬盘使用超过80%,立即发邮件告警
                          if (($disk_sda1 > 1)); then   #设置 >80
echo "$IP 跟分区使用率已经超过1 达到  ${disk_sda1}%"
                          echo "$IP 服务器 /根分区 使用率已经超过1%,达到 $disk_sda1请及时处理。" | mail -s "$IP 服务器硬盘告警" $Mail
                          fi
                           echo 4end
                           #5、监控系统用户登录的情况,当用户数超过3个的时候发告警邮件:
                           
                            #取当前用户登录数(只取数值部分)
                            users=`uptime | awk -F"," ‘{print $3}‘|awk ‘{print $1}‘`
                            
                             #设置登录用户数的告警值为3个,如果当前用户数超过3个,立即发邮件告警
                     if [ $users  -ge 1 ]; then  # -ge 3
echo "$IP 用户数达到$users 请处理"
                             echo "$IP 服务器用户数已经达到$users个,请及时处理。" | mail -s "$IP 服务器用户数告警" $Mail
                             fi
                          echo 5end

~~~~~~~~~~~~~~~~~~~~~~~~~~

二、加入任务计划:每十分钟检测一次,有告警则立即发邮件(十分钟发一次)。

复制代码代码示例:

# crontab -e
*/10 * * * *  /scripts/sys-warning.sh 
# service crond restart

时间: 2024-08-02 11:25:39

监控系统负载与CPU、内存、硬盘、登录用户数,超出警戒值则发邮件告警。的相关文章

shell脚本监控系统负载、CPU和内存使用情况

#一.编写系统负载监控的脚本文件#!/bin/bash #########################################################################This scripts is checking the system load,vision 0.1#Author:HeJunyi#E-mail:158****[email protected]###################################################

监测linux系统负载与CPU、内存、硬盘、用户数的shell脚本

本节主要内容: 利用Shell脚本来监控Linux系统的负载.CPU.内存.硬盘.用户登录数. 一.linux系统告警邮件脚本 # vim /scripts/sys-warning.sh #!/bin/bash #site: www.jquerycn.cn #监控系统负载与CPU.内存.硬盘.登录用户数,超出警戒值则发邮件告警. #提取本服务器的IP地址信息 IP=`ifconfig eth0 | grep "inet addr" | cut -f 2 -d ":"

Linux 查看机器配置,及cpu/内存/硬盘使用率

Linux下怎样查看机器配置啊?cpu/内存/硬盘 dmesg显示开机信息.kernel会将开机信息存储在ring buffer中.您若是开机时来不及查看信息,可利用dmesg来查看.开机信息亦保存在/var/log目录中,名称为dmesg的文件里 dmesg|grep hd硬盘dmesg|grep cpucpudmesg|grep proc内存dmesg|grep redhat操作系统dmesg|more更多信息uname -a操作系统版本 查看linux cpu和内存利用率2008-07-1

VPS性能测试:CPU内存,硬盘IO读写,带宽速度,UnixBench和压力测试

现在便宜的VPS主机越来越多了,一些美国的VPS主机甚至给出1美元一月的VPS,堪比虚拟主机还要便宜,巨大的价格优势吸引不少人购买和使用,而近些年来国内的主机商也开始意识到便宜的VPS对草根站长的诱惑力,纷纷推出了低价VPS,其中突出的代表就是阿里云. 所谓“一分钱一分货”,把VPS当成虚拟主机来卖的如果不是做慈善事业就是超售严重,买回来的VPS到底值不值这个价钱,我们一般需要对VPS主机进行一番性能测试,涉及的项目主要有CPU内存,硬盘IO读写,带宽速度,UnixBench和压力测试等等. 本

Windows 性能监视器的基本指标(CPU,内存,硬盘参数)

转载:http://kms.lenovots.com/kb/article.php?id=7045 Windows 性能监视器的基本指标(CPU,内存,硬盘参数) 作为一个系统工程师来说,要看懂监控的数据至关重要,关系着优化和分析出现的问题,因此,今天给出Windows 性能监视器的一些基本指标(CPU,内存,硬盘参数),希望对大家将来优化和分析问题提供帮忙. Windows -Processor 指标名称 指标描述 指标范围 指标单位 CPU利用率(% Processor Time) % Pr

shell脚本 使用 uptime 命令监控系统负载

#!/bin/bash #Author:yanconggod #date:2017-01-19 #version:1.0 # 使用 uptime 命令监控系统负载 POSTFIX_PATH="/usr/sbin/postfix" MAILX_PATH="/usr/bin/mailx" Email="[email protected]" # 获取本机IP地址 IP=`ifconfig enp2s0|grep '\binet\b'|awk '{pri

【Python运维脚本】Python监控系统负载

#!/usr/bin/env python # -*- coding=utf-8 -*- #Using GPL v2.7 #Author: [email protected]126.com #Python监控系统负载 """ 1.实现原理:通过SNMP协议获取系统信息,再进行相应的计算和格式化,最后输出结果 2.特别注意:被监控的机器上需要支持snmp.yum install -y net-snmp*安装 """ #!/usr/bin/pytho

一个统计 CPU 内存 硬盘 使用率的shell脚本

一个统计 CPU 内存 硬盘 使用率的shell脚本,供大家学习参考 #!/bin/bash #This script is use for describle CPU Hard Memery Utilization total=0 idle=0 system=0 user=0 nice=0 mem=0 vmexec=/usr/bin/vmstat which sar > /dev/null 2>&1 if [ $? -ne 0 ] then ver=`vmstat -V | awk

linux系统下获取cpu、硬盘、内存使用率

1.linux上安装snmp服务 第一步:在公司192.168.100.171 Linux虚拟机上安装snmp服务. 第二步:通过HOST-RESOURCES-MIB库中的节点获取对应的值. 第三步:只能通过:1.3.6.1.2.1.25.1.1.0节点对象获取到系统运行时间,无法获取到其他节点的值. 第四步:修改/etc/snmp/snmpd.conf文件 添加一行:view    systemview    included   .1 第五步:修改完配置之后重启snmp服务. 2.cpu.硬