Linux里的CPU负载 - 编程开发

查看Nagios警报信息，发现其中一台服务器CPU负载过重，机器为CentOS系统。信息如下：2011-2-15 (星期二) 17:50WARNING – load average: 9.73, 10.67, 10.49

还有前两个小时发出的警报信息：

2011-2-15 (星期二) 16:50WARNING – load average: 10.52, 10.10, 10.062011-2-15 (星期二) 15:40WARNING – load average: 8.27, 9.23, 9.48

一、警报信息的三个参数到底是什么意思？

9.73、10.67、10.49分别代表前一分钟，五分钟，十五分钟的平均CPU负载，最重要的指标是最后一个数字，即前15分钟的平均CPU负载，这个数字越小越好。所谓CPU负载指的是一段时间内任务队列的长度，通俗的讲，就是一段时间内一共有多少任务在使用或等待使用CPU。

二、除了Nagios，还有哪些工具可以查看CPU负载？

可以使用top命令、uptime命令，特别是top命令，功能强大，不仅仅可以用来查看CPU负载。

三、CPU负载怎么理解？是不是CPU利用率？

这里要区别CPU负载和CPU利用率，它们是不同的两个概念，但它们的信息可以在同一个top命令中进行显示。CPU利用率显示的是程序在运行期间实时占用的CPU百分比，而CPU负载显示的是一段时间内正在使用和等待使用CPU的平均任务数。CPU利用率高，并不意味着负载就一定大。网上有篇文章举了一个有趣比喻，拿打电话来说明两者的区别，我按自己的理解阐述一下。

某公用电话亭，有一个人在打电话，四个人在等待，每人限定使用电话一分钟，若有人一分钟之内没有打完电话，只能挂掉电话去排队，等待下一轮。电话在这里就相当于CPU，而正在或等待打电话的人就相当于任务数。

在电话亭使用过程中，肯定会有人打完电话走掉，有人没有打完电话而选择重新排队，更会有新增的人在这儿排队，这个人数的变化就相当于任务数的增减。为了统计平均负载情况，我们5秒钟统计一次人数，并在第1、5、15分钟的时候对统计情况取平均值，从而形成第1、5、15分钟的平均负载。

有的人拿起电话就打，一直打完1分钟，而有的人可能前三十秒在找电话号码，或者在犹豫要不要打，后三十秒才真正在打电话。如果把电话看作CPU，人数看作任务，我们就说前一个人（任务）的CPU利用率高，后一个人（任务）的CPU利用率低。

当然， CPU并不会在前三十秒工作，后三十秒歇着，只是说，有的程序涉及到大量的计算，所以CPU利用率就高，而有的程序牵涉到计算的部分很少，CPU利用率自然就低。但无论CPU的利用率是高是低，跟后面有多少任务在排队没有必然关系。

四、了解了CPU负载的含义，我们如何来降低服务器的CPU负载呢？

最简单办法的是更换性能更好的服务器，不要想着仅仅提高CPU的性能，那没有用，CPU要发挥出它最好的性能还需要其它软硬件的配合。

在服务器其它方面配置合理的情况下，CPU数量和CPU核心数（即内核数）都会影响到CPU负载，因为任务最终是要分配到CPU核心去处理的。两块CPU要比一块CPU好，双核要比单核好。

因此，我们需要记住，除去CPU性能上的差异，CPU负载是基于内核数来计算的！有一个说法，“有多少内核，即有多少负载”。

五、那么，本文开头的CPU负载分担到每个CPU上的负载是多少呢？那就要看我这台服务器有一共有多少个内核了。

Linux里有一个/proc目录，存放的是当前运行系统的虚拟映射，其中有一个文件为cpuinfo，这个文件里存放着CPU的信息。我们可以直接打开查看，或者过滤关键字进行查看，因为文件内容比较多，所以一般我们需要过滤关键字。

/proc/cpuinfo文件按逻辑CPU而非真实CPU分段落显示信息，每个逻辑CPU的信息占用一个段落，第一个逻辑CPU标识从0开始。我们首先要明白这一点，至于什么是逻辑CPU，下面会提到。要理解该文件中的CPU信息，有几个相关的概念要知道：

processor：逻辑CPU的标识

model name：真实CPU的型号信息

physical id：真实CPU和标识

cpu cores：真实CPU的内核数

生活若剥去了理想梦想幻想，那生命便只是一堆空架子

相关文章：

你感兴趣的文章：

标签云：