可用性の数字の読み方|99.9%と99.99%の運用の差
99.9%と99.99%の差は0.09ポイントでも、止まってよい時間は10分の1です。ナインを時間に直す表、検知と復旧の上限、依存先のナイン、測り方の違いをSRE本と論文でまとめました。
SRE99.9%と99.99%の差は0.09ポイントでも、止まってよい時間は10分の1です。ナインを時間に直す表、検知と復旧の上限、依存先のナイン、測り方の違いをSRE本と論文でまとめました。
Tech Lead障害のあとに書くポストモーテムは、犯人探しをしないことで初めて学びに変わります。Google SRE本と公開資料をもとに、書くきっかけ・中身・アクションアイテムの立て方をまとめました。
Tech Lead障害対応の指揮役は、技術に一番詳しい人とは限りません。Google SRE本とPagerDutyの公開マニュアルから、役割分担・宣言の基準・引き継ぎの型を整理しました。
SRESREが言うトイルは「面倒な作業」ではなく、6つの性質で判定できる測定対象です。Google SRE本の定義と50%上限、減らす順番の考え方を一次情報から整理しました。
SRESLO を決めた時点で自動的に決まる「落としてよい量」がエラーバジェット。Google SRE 本の定義と 30 日で 43 分という具体例、バーンレートで減り方を見るアラート設計までを整理しました。
SRESREの基本であるSLIとSLOの違い、100%を目指してはいけない理由とエラーバジェット、目標値を決めるときの5つの注意をGoogle SRE本とSRE Workbookをもとに整理しました。
SRESREを「インフラ担当の新しい呼び方」で終わらせないための整理です。Googleが定めた運用作業50%の上限とエラーバジェット、そしてDevOpsとの関係を、SRE本とWorkbookの記述をもとに解説します。