可用性の数字の読み方|99.9%と99.99%の運用の差
99.9%と99.99%の差は0.09ポイントでも、止まってよい時間は10分の1です。ナインを時間に直す表、検知と復旧の上限、依存先のナイン、測り方の違いをSRE本と論文でまとめました。
SRE99.9%と99.99%の差は0.09ポイントでも、止まってよい時間は10分の1です。ナインを時間に直す表、検知と復旧の上限、依存先のナイン、測り方の違いをSRE本と論文でまとめました。
Tech Leadデプロイとリリースを分けて考えると、出す速さと安全さを両立しやすくなります。フィーチャーフラグの4分類、カナリアリリースの考え方、テックリードが先に決めておくルールをまとめました。
Tech Lead障害のあとに書くポストモーテムは、犯人探しをしないことで初めて学びに変わります。Google SRE本と公開資料をもとに、書くきっかけ・中身・アクションアイテムの立て方をまとめました。
SRESREが言うトイルは「面倒な作業」ではなく、6つの性質で判定できる測定対象です。Google SRE本の定義と50%上限、減らす順番の考え方を一次情報から整理しました。
SRESREの基本であるSLIとSLOの違い、100%を目指してはいけない理由とエラーバジェット、目標値を決めるときの5つの注意をGoogle SRE本とSRE Workbookをもとに整理しました。
SRESREを「インフラ担当の新しい呼び方」で終わらせないための整理です。Googleが定めた運用作業50%の上限とエラーバジェット、そしてDevOpsとの関係を、SRE本とWorkbookの記述をもとに解説します。
Tech外部APIの一時的な失敗に雑なリトライで応じると、かえって障害を広げかねません。指数バックオフとジッターの仕組み、よくある落とし穴、運用のコツを整理します。