IT学习网 - 爱学习 - 最具影响力综合资讯网站 -- 中国IT界的领航者!
热门关键字:      88888  as  xxx
站外
广告
站外
广告

使用sysdig监控和排除Linux系统服务器故障的方法

发布时间:2015-10-06 13:07文章来源:网络整理文章作者: 学习网点击次数:
这篇文章主要介绍了使用sysdig监控和排除Linux系统服务器故障的方法,sysdig基于命令行进行操作,本文介绍了其的一些基础命令,需要的朋友可以参考下

当你需要追踪某个进程产生和接收的系统调用时,首先浮现在你脑海中的是什么?你可能会想到strace,那么你是对的。你会使用什么样的命令行工具来监控原始网络通信呢?如果你想到了tcpdump,你又作出了一个极佳的选择。而如果你碰到必须追踪打开的文件(在Unix意义上:一切皆文件)的需求,可能你会使用lsof。

strace、tcpdump以及lsof,确实是些伟大的工具,它们应该成为每个系统管理员工具集之中的一部分,而这也正是你为什么应该爱上sysdig的原因。它是一个强大的开源工具,用于系统级别的勘察和排障,它的创建者在介绍它时称之为“strace+tcpdump+lsof+上面点缀着lua樱桃的绝妙酱汁”。抛开幽默不说,的最棒特性之一在于,它不仅能分析Linux系统的“现场”状态,也能将该状态保存为转储文件以供离线检查。更重要的是,你可以自定义sysdig的行为,或者甚至通过内建的(你也可以自己编写)名为凿子(chisel)的小脚本增强其功能。单独的凿子可以以脚本指定的各种风格分析sysdig捕获的事件流。
在本教程中,我们将探索sysdig的安装及其基本用法,在Linux上实施系统监控和排障。
安装Sysdig

对于本教程,由于为了简便、缩短安装流程以及版本的不可知,我们将选择使用官方网站提供的自动化安装过程。在自动化过程中,安装脚本会自动检测操作系统并安装必需的依赖包。

以root身份运行以下命令来从官方apt/yum仓库安装sysdig:

   
复制代码代码如下:# curl -s https://s3.amazonaws.com/download.draios.com/stable/install-sysdig | bash
  2015616165613346.jpg (640×184)

    安装完成后,我们可以通过以下方法调用sysdig来感受一下它:

   
复制代码代码如下:# sysdig

我们的屏幕将马上被系统上发生的所有事件填满,对于这些信息,不便于我们做更多操作。要进一步处理,我们可以运行:

   
复制代码代码如下:# sysdig -cl | less

来查看可用的凿子列表。
2015616165633568.jpg (571×273)

默认有以下类目可用,各个类目中分布有多个内建的凿子。

  •     CPU Usage:CPU使用量
        Errors:错误
        I/O
        Logs:日志
        Misc:混杂
        Net:网络
        Performance:性能
        Security:安全
        System State:系统状态

要显示指定凿子上的信息(包括详细的命令行用法),运行以下命令:

   
复制代码代码如下:# sysdig -cl [凿子名称]

例如,我们可以检查“网络”类目下关于spy_port凿子的信息:

   
复制代码代码如下:# sysdig -i spy_port
2015616165652187.jpg (602×253)

    凿子可以通过过滤器(可同时应用于实时数据和记录文件)组合,以获取更多有用的输出。

过滤器遵从“类.字段”结构。例如:

  •     fd.cip:客户端IP地址。
        evt.dir:事件方向,可以是‘>’用于进入事件,或‘<’用于退出事件。

完整的过滤器列表可以通过以下命令显示:

   
复制代码代码如下:# sysdig -l

在本教程剩余部分,我将演示几个sysdig的使用案例。
Sysdig实例: 服务器性能排障

假定你的服务器发生了性能问题(如,没有回应,或者重大的回应延迟)。你可以使用瓶颈凿子来显示当前10个最慢系统调用的列表。

使用以下命令在存活服务器上进行实时检查。“-c”标识,后跟凿子名称告诉sysdig运行指定的凿子。

   
复制代码代码如下: # sysdig -c bottlenecks

或者,你可以离线对服务器实施性能分析。在此种情况下,你可以保存完整的sysdig记录到文件,然后像下面这样针对记录运行瓶颈凿子。

首先,保存sysdige记录(使用Ctrl+c来停止收集):

   
复制代码代码如下:# sysdig -w trace.scap

收集完记录后,你可以运行以下命令来检查捕获间隔中最慢的系统调用:

   
复制代码代码如下:# sysdig -r trace.scap -c bottlenecks
2015616165711890.jpg (640×148)

你需要关注栏#2,#3和#4,这些分别表示执行时间、进程名和PID。
Sysdig实例: 监控交互用户活动

假定你作为系统管理员想要监控系统中交互的用户活动(如,用户在命令行输入了什么命令,以及用户去了什么目录),这时spy_user凿子就派上用场了。

让我们首先通过一些额外选项来收集一个sysdig记录。


使用sysdig监控和排除Linux系统服务器故障的方法
本文由 IT学习网 整理,转载请注明“转自IT学习网”,并附上链接。
原文链接:http://www.ourlove520.com/system/Linux/128396.html

标签分类:

Linux 故障
上一篇:上一篇:在Linux系统中检查glibc版本信息的方法
下一篇: 下一篇:Linux通过netstat命令查看80端口连接数的方法
无觅关联推荐,快速提升流量