コンテンツにスキップ

可観測性・SLO・障害調査

ユーザーは遅いと言っていますがCPUアラートはありません。どの観測から調査を始めますか?

詳細な解説や模範解答を読む前に、まず自分の仮定と判断を口頭で説明する。

  • Learn:ユーザー影響とSLIを、自分の言葉と小さな例で説明する。
  • Practice:最初の問いについて、要件確認 → 初案 → 理由 → 代替案を説明する。
  • Interview:平均は正常で一部顧客のp99だけ悪化している場合は?
  • Production:query → DB buffer → OS cache → I/Oまで、どの証拠があれば掘り下げますか?

判断を見直す観点:ユーザー影響とSLI/metrics・logs・traces/検知と原因調査の役割。

ChatGPT開始文
tech2026 の CHATGPT.md と reviews/architecture-observability.yaml、
src/content/docs/topics/architecture/observability.md を読み、architecture-observability の interview を始めてください。
最初はこのページの最初の一問だけを出し、私の回答を待ってください。
以降は回答に応じて条件を一つずつ変え、理由とtrade-offを聞いてください。
終了時は実際の回答を根拠に、CHATGPT.mdと既存テンプレートに従ってYAML+Session narrativeを含む [Session Sync] GitHub IssueをMFQWKMR4/tech2026に作成し、URLを返してください。作成できない場合は未作成と明示し、コピー可能なタイトルと本文を返してください。

基礎からなら interviewlearn、設計練習なら practice に変更する。口頭で15〜20分を目安に、一回は一つの判断に絞る。 GitHubを読めない場合は npm run session:pack -- architecture-observability の出力を貼る。

公式資料 — 利用者に見える症状と内部の原因を分けて監視する観点を確認する。

資料確認日:2026-09-07。これは出題の入口で、学習済み・実験済みを意味しない。 AIは未提示の要件を事実として補わず、回答後に必要な資料を確認する。