CPU 100% 異常排查實踐與總結

阿新 • • 發佈：2019-01-21

1、問題背景

昨天下午突然收到運維郵件報警，顯示資料平臺伺服器cpu利用率達到了98.94%，而且最近一段時間一直持續在70%以上，看起來像是硬體資源到瓶頸需要擴容了，但仔細思考就會發現咱們的業務系統並不是一個高併發或者CPU密集型的應用，這個利用率有點太誇張，硬體瓶頸應該不會這麼快就到了，一定是哪裡的業務程式碼邏輯有問題。

2、排查思路

2.1 定位高負載程序 pid

首先登入到伺服器使用top命令確認伺服器的具體情況，根據具體情況再進行分析判斷。

通過觀察load average，以及負載評判標準（8核），可以確認伺服器存在負載較高的情況；

觀察各個程序資源使用情況，可以看出程序id為682的程序，有著較高的CPU佔比

2.2 定位具體的異常業務

這裡咱們可以使用 pwdx 命令根據 pid 找到業務程序路徑，進而定位到負責人和專案：

可得出結論：該程序對應的就是資料平臺的web服務。

2.3 定位異常執行緒及具體程式碼行

傳統的方案一般是4步：

top oder by with P：1040 // 首先按程序負載排序找到 maxLoad(pid)
top -Hp 程序PID：1073 // 找到相關負載執行緒PID
printf “0x%x\n”執行緒PID： 0x431 // 將執行緒PID轉換為 16進位制，為後面查詢 jstack 日誌做準備
jstack 程序PID | vim +/十六進位制執行緒PID - // 例如：jstack 1040|vim +/0x431 -

但是對於線上問題定位來說，分秒必爭，上面的 4 步還是太繁瑣耗時了，之前介紹過淘寶的oldratlee 同學就將上面的流程封裝為了一個工具：show-busy-java-threads.sh，可以很方便的定位線上的這類問題：

可得出結論：是系統中一個時間工具類方法的執行cpu佔比較高，定位到具體方法後，檢視程式碼邏輯是否存在效能問題。

※ 如果線上問題比較緊急，可以省略 2.1、2.2 直接執行 2.3，這裡從多角度剖析只是為了給大家呈現一個完整的分析思路。

3、根因分析

經過前面的分析與排查，最終定位到一個時間工具類的問題，造成了伺服器負載以及cpu使用率的過高。

異常方法邏輯：是把時間戳轉成對應的具體的日期時間格式；

上層呼叫：計算當天凌晨至當前時間所有秒數，轉化成對應的格式放入到set中返回結果；
邏輯層：對應的是資料平臺實時報表的查詢邏輯，實時報表會按照固定的時間間隔來，並且在一次查詢中有多次（n次）方法呼叫。

那麼可以得到結論，如果現在時間是當天上午10點，一次查詢的計算次數就是 10*60*60*n次=36,000*n次計算，而且隨著時間增長，越接近午夜單次查詢次數會線性增加。由於實時查詢、實時報警等模組大量的查詢請求都需要多次呼叫該方法，導致了大量CPU資源的佔用與浪費。

4、解決方案

定位到問題之後，首先考慮是要減少計算次數，優化異常方法。排查後發現，在邏輯層使用時，並沒有使用該方法返回的set集合中的內容，而是簡單的用set的size數值。確認邏輯後，通過新方法簡化計算（當前秒數-當天凌晨的秒數），替換呼叫的方法，解決計算過多的問題。上線後觀察伺服器負載和cpu使用率，對比異常時間段下降了30倍，恢復至正常狀態，至此該問題得已解決。

5、總結

在編碼的過程中，除了要實現業務的邏輯，也要注重程式碼效能的優化。一個業務需求，能實現，和能實現的更高效、更優雅其實是兩種截然不同的工程師能力和境界的體現，而後者也是工程師的核心競爭力。
在程式碼編寫完成之後，多做 review，多思考是不是可以用更好的方式來實現。
線上問題不放過任何一個小細節！細節是魔鬼，技術的同學需要有刨根問題的求知慾和追求卓越的精神，只有這樣，才能不斷的成長和提升。

CPU 100% 異常排查實踐與總結

1、問題背景

2、排查思路

2.1 定位高負載程序 pid

2.2 定位具體的異常業務

2.3 定位異常執行緒及具體程式碼行

3、根因分析

4、解決方案

5、總結

CPU 100% 異常排查實踐與總結

CPU負載過高異常排查實踐與總結

Spring Boot Tomcat 容器化部署實踐與總結

Linux(2)---記錄一次線上服務 CPU 100%的排查過程

BiLSTM+CRF(三）命名實體識別實踐與總結

看透設計模式-實踐與總結

常見的軟體異常場景分析與總結

再一次生產 CPU 高負載排查實踐

《分布式服務框架原理與實踐》- 總結一下吧

Druid出現DruidDataSource - recyle error - recyle error java.lang.InterruptedException: null異常排查與解決

服務器CPU繁忙或內存壓力引起網絡掉包的淺析與總結

Netty堆外記憶體洩露排查與總結

Promise專案實踐與異常處理方式

Atitit 計算機網路體系結構原理與實踐attilax總結目錄 1. 計算機網路體系結構 1 1.1. Wmi 1 1.2. IPMI與BMC 1 1.3. Tcp/udp 2 1.4. 代理

記一次yarn導致cpu飆高的異常排查經歷

java CPU 100% 排查（轉載）

java cpu高達100%問題排查

深入理解Java虛擬機器JVM高階特性與最佳實踐閱讀總結—— 第十二章 Java記憶體模型與執行緒

記錄一次cpu 100%線上問題排查

放棄Dubbo，選擇最流行的Spring Cloud微服務架構實踐與經驗總結

CPU 100% 異常排查實踐與總結

1、問題背景

2、排查思路

2.1 定位高負載程序 pid

2.2 定位具體的異常業務

2.3 定位異常執行緒及具體程式碼行

3、根因分析

4、解決方案

5、總結

相關推薦