目錄
- 排查順序
- 方法論
- 性能分析工具
- CPU分析思路
- 記憶體分析思路
- IO分析思路
- 網絡分析思路
- 基準測試工具
排查順序
整體情況:
- top/htop/atop指令檢視程序/線程、CPU、記憶體使用情況,CPU使用情況;
- dstat 2檢視CPU、磁盤IO、網絡IO、換頁、中斷、切換,系統I/O狀态;
- vmstat 2檢視記憶體使用情況,記憶體狀态;
- iostat -d -x 2檢視所有磁盤的IO情況,系統I/O狀态;
- iotop檢視IO靠前的程序,系統的I/O狀态;
- perf top檢視占用CPU最多的函數,CPU使用情況;
- perf record -ag -- sleep 15;perf report檢視CPU事件占比,調用棧,CPU使用情況;
- sar -n DEV 2檢視網卡的吞吐,網卡狀态;
- /usr/share/bcc/tools/filetop -C檢視每個檔案的讀寫情況,系統的I/O狀态;
- /usr/share/bcc/tools/opensnoop顯示正在被打開的檔案,系統的I/O狀态;
- mpstat -P ALL 1 單核CPU是否被打爆;
- ps aux --sort=-%cpu 按CPU使用率排序,找出CPU消耗最多程序;
- ps -eo pid,comm,rss | awk '{m=$3/1e6;s["*"]+=m;s[$2]+=m} END{for (n in s) printf"%10.3f GB %s\n",s[n],n}' | sort -nr | head -20 統計前20記憶體占用;
- awk 'NF>3{s["*"]+=s[$1]=$3*$4/1e6} END{for (n in s) printf"%10.1f MB %s\n",s[n],n}' /proc/slabinfo | sort -nr | head -20 統計核心前20slab的占用;
程序分析,程序占用的資源:
- pidstat 2 -p 程序号檢視可疑程序CPU使用率變化情況;
- pidstat -w -p 程序号 2檢視可疑程序的上下文切換情況;
- pidstat -d -p 程序号 2檢視可疑程序的IO情況;
- lsof -p 程序号檢視程序打開的檔案;
- strace -f -T -tt -p 程序号顯示程序發起的系統調用;
協定棧分析,連接配接/協定棧狀态:
- ethtool -S 檢視網卡硬體情況;
- cat /proc/net/softnet_stat/ifconfig eth1 檢視網卡驅動情況;
- netstat -nat|awk '{print awk $NF}'|sort|uniq -c|sort -n檢視連接配接狀态分布;
- ss -ntp或者netstat -ntp檢視連接配接隊列;
- netstat -s 檢視協定棧情況;
方法論
RED方法:監控服務的請求數(Rate)、錯誤數(Errors)、響應時間(Duration)。Weave Cloud在監控微服務性能時提出的思路。
USE方法:監控系統資源的使用率(Utilization)、飽和度(Saturation)、錯誤數(Errors)。

性能分析工具
Linux 核心的各個子系統出發,彙總了對各個子系統進行性能分析時,你可以選擇的工具。不過,雖然這個圖是性能分析最好的參考資料之一,它其實還不夠具體。比如,當你需要檢視某個性能名額時,這張圖裡對應的子系統部分,可能有多個性能工具可供選擇。但實際上,并非所有這些工具都适用,具體要用哪個,還需要你去查找每個工具的手冊,對比分析做出選擇。
CPU分析思路
首先,從 CPU 的角度來說,主要的性能名額就是 CPU 的使用率、上下文切換以及 CPU Cache 的命中率等。下面這張圖就列出了常見的 CPU 性能名額。
記憶體分析思路
接着我們來看記憶體方面。從記憶體的角度來說,主要的性能名額,就是系統記憶體的配置設定和使用、程序記憶體的配置設定和使用以及 SWAP 的用量。下面這張圖列出了常見的記憶體性能名額。
IO分析思路
從檔案系統和磁盤 I/O 的角度來說,主要性能名額,就是檔案系統的使用、緩存和緩沖區的使用,以及磁盤 I/O 的使用率、吞吐量和延遲等。下面這張圖列出了常見的 I/O 性能名額。
網絡分析思路
從網絡的角度來說,主要性能名額就是吞吐量、響應時間、連接配接數、丢包數等。根據 TCP/IP 網絡協定棧的原理,我們可以把這些性能名額,進一步細化為每層協定的具體名額。這裡我同樣用一張圖,分别從鍊路層、網絡層、傳輸層和應用層,列出了各層的主要名額。
基準測試工具
- 在檔案系統和磁盤 I/O 子產品中,我們使用 fio 工具,測試了磁盤 I/O 的性能。
- 在網絡子產品中,我們使用 iperf、pktgen 等,測試了網絡的性能。
- 而在很多基于 Nginx 的案例中,我們則使用 ab、wrk 等,測試 Nginx 應用的性能。