ZAIKETZ / automação soberana

監視とアラート

静かなことは、無事なこととは限りません

多くの監視システムは、自分自身が止まったときにそれを知らせることができません。静かなまま、すべて正常と表示し続けるため、問題ないと思い込んでしまいます — 実はアラームが数週間前から止まっていたと、ダッシュボードではなくお客様からの連絡で気づくまでは。

インフラはお客様の管理下に

構築する内容

外部からの見守り

監視は、お客様自身のサーバー上では動かしません。些細なことに見えますが、これが最も重要な点です。インフラの内部で動く監視は、そのインフラが止まったことを知らせることができません — 同時に止まってしまい、その沈黙は「正常です」という表示とまったく見分けがつきません。だからこそ、見守り役は別の場所に置きます。別のプロバイダー、別の国、別の障害ドメインです。

生存信号

お客様のシステムは、一定間隔で生存信号を送ります。理由を問わず — 見守り役自体の故障を含めて — 信号が止まれば、独立したサービスがアラームを発報します。これは、お客様側のすべてが同時に止まっても生き残る層です。

人に届くアラート

通知は携帯電話と、チームがすでに確認しているチャンネルに届きます。作業完了とみなす前に、実際の端末で受信を確認します。サーバー上に留まったままのメッセージは、アラートとは呼びません。

自分の故障を報告するアラート

通知が届かなかった場合、その失敗は記録され、見える形で残ります — 黙って捨てられることはありません。これは珍しい仕組みで、まさにこのページの冒頭で述べた問題から生まれたものです。自分のエラーを飲み込むシステムは、遅かれ早かれ、何も問題がないのに「大丈夫」だと思い込ませます。


実際の体験

起きること

アラート疲れは設計の失敗であり、避けられないものではありません。 アラートは状態が変化したときにのみ発報し、繰り返しません。常に通知してくるシステムは、いずれ無視されるようになります — そして無視されたアラームは、何もないよりも悪い結果を招きます。費用がかかるうえに、何ももたらさないからです。


対象範囲

監視する対象

バックアップについて、特に

バックアップが実行されたかを確認するのは簡単な部分で、多くの設定はそこで止まっています。弊社では、それが復元できるか、そして復元元が現在の本番システムであるかまで確認します。

この2つは別の問いであり、高くつく落とし穴はその間に潜んでいます。バックアップ処理は毎晩問題なく実行され、すべての確認をパスしていながら、数か月前にアプリケーションが使わなくなったデータベースを律儀に保存し続けている、ということが起こり得ます。


進め方


正直に

これではないもの


始め方

3つのステップ

  1. 診断 — 現状を確認し、既に故障している部分も含め、実際に何が動いているかをご報告します。この段階だけで何かが見つかることがよくあります。
  2. 導入 — 多層のアラートを、お客様の前で端から端まで確認しながら構築します。
  3. 引き渡し — 手順書、認証情報、そしてご自身で実行できる配信テストをお渡しします。

診断だけでも価値があります。 監視体制がすでに万全であれば、その旨をお伝えします。

相談する →