可用性管理と容量管理は SLA を達成する基幹プロセス。指標とプロセスを押さえます。
可用性管理 はサービスが必要時に利用できる状態を維持するプロセス。
稼働率・MTBF・MTTR を継続監視し、SLA を満たすよう設計・運用します。
じゃあ 容量管理 は何やるの?
需要予測とリソース計画を行うプロセスよ。
CPU・メモリ・ディスク・帯域の使用率トレンドから将来の需要を予測して、リソースを増強する計画を立てていくの。
稼働率 99.9% って、具体的にはどれくらい止まっていいんですかぁ?
1 年で約 8.76 時間ね。
99.99% (フォーナイン) なら約 52.6 分、99.999% (ファイブナイン) なら約 5.26 分。
SLA の値が一桁上がるごとに、設計の難易度もぐっと上がるの。
AP では『稼働率からダウンタイムを計算する問題』と『容量管理の3レベル (戦略・戦術・運用)』が頻出よ。
稼働率と許容停止時間を計算する
稼働率は MTBF ÷ (MTBF+MTTR) です。平均故障間隔が990時間、平均修復時間が10時間なら、990÷1,000=0.99、つまり99%です。SLAから停止時間を求めるときは、対象期間に停止率を掛けます。月30日、稼働率99.9%なら、30×24×60×(1−0.999)=43.2分です。年換算の8.76時間を、そのまま月の許容停止時間と取り違えないよう対象期間を先にそろえます。
直列構成では、両方が動かなければサービスを提供できないので稼働率を掛けます。稼働率99%の装置を2台直列にすると0.99×0.99=0.9801、98.01%です。独立した2台の並列冗長でどちらか一方が動けばよいなら、両方が停止する確率を引き、1−(1−0.99)²=0.9999、99.99%です。ただし共通電源や共通回線があれば独立ではなく、この単純式を使えません。
容量不足を需要・サービス・構成要素に分ける
容量管理では、売上計画や利用者増加を扱う事業容量、応答時間や同時接続数を扱うサービス容量、CPU・メモリ・回線など個別資源を扱うコンポーネント容量を結び付けます。たとえば現在のピークが毎秒400件、月5%成長、許容使用率70%なら、6か月後の需要は約400×1.05⁶=536件/秒です。1台が安全に毎秒200件を処理できるなら、536÷200=2.68なので少なくとも3台が必要です。さらに障害時も目標を満たすなら予備1台を含める判断が必要です。
典型誤答は、平均使用率だけを見てピーク時の不足を見落とすこと、CPU増強だけでDBロックや帯域のボトルネックも解消すると考えること、計画保守を停止時間から除外してよいと決めつけることです。SLAの測定条件を確認し、時系列の95パーセンタイル、待ち時間、キュー長など複数指標で原因を絞ります。
確認クイズ
稼働率 99.99% (フォーナイン) のサービスで、年間に許容される最大ダウンタイムとして最も近い値はどれか。
- 約 8.76 時間
- 約 52.6 分
- 約 5.26 分
- 約 0.5 分
こたえを見る
正解: 2. 約 52.6 分
99.99% = 0.0001 の停止時間 = 365×24×60×0.0001 ≒ 52.6 分。99.9% は約 8.76 時間、99.999% (ファイブナイン) は約 5.26 分です。SLA 設計時にこの数字を覚えておくと議論が早くなります。