エントリーの編集
エントリーの編集は全ユーザーに共通の機能です。
必ずガイドラインを一読の上ご利用ください。
Disk I/O Budget 枯渇と監視を作り直した話 - kickflow Tech Blog
記事へのコメント0件
- 注目コメント
- 新着コメント
このエントリーにコメントしてみましょう。
注目コメント算出アルゴリズムの一部にLINEヤフー株式会社の「建設的コメント順位付けモデルAPI」を使用しています
- バナー広告なし
- ミュート機能あり
- ダークモード搭載
関連記事
Disk I/O Budget 枯渇と監視を作り直した話 - kickflow Tech Blog
新規事業本部でバックエンドエンジニアをしている渡辺です。 本記事では、検証用の Preview 環境で起き... 新規事業本部でバックエンドエンジニアをしている渡辺です。 本記事では、検証用の Preview 環境で起きたDB障害の調査と、監視を作り直すまでの記録をまとめます。 ひとことで言えば、DB が急に詰まってログインなどが不安定になった障害です(本番の実ユーザーへの影響はありません)。 学びが多かったのは復旧よりも、主要メトリクスが正常に見えて原因特定に遠回りした過程でした。 1. 前提となるアーキテクチャ Disk I/O Budget という別軸のリソース上限 2. 何が起きたのか(症状) 3. なぜ「DB は正常」と読み違えたか 4. ログとメトリクスを時系列で突き合わせる 5. 仮説としての障害の連鎖 確度の整理 6. 実施した対応と、残した課題 7. 監視を異常が判断できる形に作り直す Before / After 8. おわりに 1. 前提となるアーキテクチャ 障害の話に入る前に、

