Launch Atlas logoLaunch.Atlas
#51OperateDevOps · SRE架構師資料庫管理

Capacity Planning · 容量規劃

在洪峰來臨前先把『撐不撐得住』算清楚

Capacity Planning · 容量規劃 · 卡片插圖
CHOOSE YOUR MODE

先決定你現在是要學,還是要在專案裡做

網站負責解釋與分發工作包;真正的 Repository 掃描、缺口判斷與文件產出交給 Coding Agent。

SDLC 實作課 · 交付物練習

先理解這份文件替你消除什麼不確定

在洪峰來臨前先把『撐不撐得住』算清楚

擴容靠經驗很貴。Capacity Planning 用歷史 SLI、業務預估、單位成本,把「需要幾台、何時加、加哪一層」變成可審查決策。

OWNER & HANDOFF

誰負責、交給誰

主責: DevOps / SRE + Architect

協作: PO 提供業務預估、Finance 對齊預算

下游收件: Cost Monitor、ADR(擴容策略)、Release Plan

WHEN TO USE

何時值得做

REQUIRED

必要時機: 流量成長 ≥ 20%、季節活動、新區域擴展

SKIP

不需要時: 流量穩定、autoscaling 已足夠

CAUTION

常見誤用: 只看 CPU;忽略 DB/queue/external quota;無 headroom 假設

看懂6 段骨架知道每段要留下哪一種判斷
看會雙版本範本先用輕量版練習,再讀完整版
做出自己的草稿手動貼到 Claude Code、Codex 或其他 Agent
  1. 01讀大綱
  2. 02比範本
  3. 03填素材
  4. 04貼提示詞
  5. 05對照驗收

Anatomy · 文件解剖

輕量版先回答 6 個核心章節

章節名稱可以因團隊調整,但每一段要求的判斷不能被省略。先讀問題,再看格式。

  1. 01

    Executive Summary

    範本必要章節

    3-5 行,主管 30 秒讀完。內容:forecast horizon、最快撐不住的資源、預估擴容月份、cost delta

  2. 02

    Forecast Horizon & Growth Model

    範本必要章節

    horizon 對應預算週期(3m / 6m / 12m);growth model 必須附公式與信賴區間

  3. 04

    Headroom per Resource

    範本必要章節

    輕量版至少 4 維度(CPU / RAM / DB / queue);headroom_target ≥ 30%;status breach 必須對應一條 bottleneck

  4. 05

    Scaling Triggers

    範本必要章節

    每個 breach / warn 資源都要列 trigger;含 auto + manual + lead_time

  5. 07

    Cost Envelope

    範本必要章節

    必填 current / forecast / delta / error band;無預算文件寫 _TODO_

  6. 09

    Decision Log(key 2-3 條)

    範本必要章節

    每條必含 chosen + 至少 1 個 rejected + 拒絕原因

Study · 對照學習

同一份交付物,先練核心,再看完整深度

輕量範本適合第一次練習與 MVP;完整範本保留跨職能交棒需要的細節。兩者都要求未知事項保持可見。

SmartTrip 實例待補

這張卡目前提供已審定的輕量與完整範本;不以 AI 臨時生成的內容冒充實際案例。

LIGHT TEMPLATE

30 分鐘內先完成核心章節。

---
doc_type: "capacity-planning"
variant: "light"
status: "draft"
owner: "<your-name>"
last_updated: "YYYY-MM-DD"
upstream:
  required: ["slo", "historical-metrics"]
  optional: ["business-forecast"]
---

# Capacity Planning: <service-name>

**Status:** Draft v0.X · **Owner:** <SRE name> · **Last updated:** YYYY-MM-DD

> [!IMPORTANT]
> **AI 填寫規則:** 本範本 6 段(編號 1, 2, 4, 5, 7, 9),全部必填——刻意沿用完整版章節編號讓兩版可對照。每結論行內加 `(依據:metric §XXX / forecast §YYY)`;每量化欄位帶 `[H]/[M]/[L]` confidence badge;缺資料寫 `_TODO: 需要 XXX_` 不編造;headroom 必須 ≥ 30%(洪峰緩衝);至少涵蓋 CPU / RAM / DB / queue 四維度。

---

## 1. Executive Summary

<!-- ai-fill: 3-5 行,主管 30 秒讀完。內容:forecast horizon、最快撐不住的資源、預估擴容月份、cost delta -->

<3-5 行說明>

> **TL;DR:** <一句話:N 月內,X 資源會先撐不住,建議 Y 動作>

---

## 2. Forecast Horizon & Growth Model

<!-- ai-rule: horizon 對應預算週期(3m / 6m / 12m);growth model 必須附公式與信賴區間 -->

| Field | Value | Confidence |
|---|---|---|
| **Forecast horizon** | <3m / 6m / 12m> | **[H]** |
| **Growth model** | linear / exponential / seasonal / step | **[M]** |
| **MoM growth rate** | <e.g. +12%> | **[M]** |
| **Peak multiplier** | <e.g. 黑五 ×3.5> | **[L]** |
| **Confidence interval** | <e.g. ±15%> | **[M]** |

---

## 4. Headroom per Resource

<!-- ai-rule: 輕量版至少 4 維度(CPU / RAM / DB / queue);headroom_target ≥ 30%;status breach 必須對應一條 bottleneck -->

| Resource | Current p95 | Forecast p95 | Headroom target | Status | Confidence |
|---|---|---|---|---|---|
| <checkout-api CPU> | 62% | 88% | ≥ 30% | warn | **[H]** |
| <checkout-api RAM> | ... | ... | ≥ 30% | safe | **[H]** |
| <payment-db conn> | ... | ... | ≥ 30% | breach | **[M]** |
| <order-queue depth> | ... | ... | ≥ 30% | safe | **[M]** |

---

## 5. Scaling Triggers

<!-- ai-rule: 每個 breach / warn 資源都要列 trigger;含 auto + manual + lead_time -->

| Resource | Auto scale-up | Auto scale-down | Manual review | Lead time |
|---|---|---|---|---|
| <checkout-api> | p95 CPU > 70% for 5m | p95 CPU < 30% for 30m | forecast headroom < 30% | 4 weeks |

---

## 7. Cost Envelope

<!-- ai-rule: 必填 current / forecast / delta / error band;無預算文件寫 _TODO_ -->

| Field | Value | Confidence |
|---|---|---|
| **Current monthly** | $X | **[H]** |
| **Forecast at horizon** | $Y | **[M]** |
| **Delta** | +Z% | **[M]** |
| **RI / SP saving** | $W | **[L]** |
| **Forecast error band** | ±15% | **[M]** |

---

## 9. Decision Log(key 2-3 條)

<!-- ai-rule: 每條必含 chosen + 至少 1 個 rejected + 拒絕原因 -->

| Date | Decision | Options | Chosen | Rejected why | Confidence |
|---|---|---|---|---|---|
| YYYY-MM-DD | <vertical vs horizontal scale> | vertical / horizontal / sharding | horizontal | vertical (碰到 instance ceiling)、sharding (lead time 不足) | **[H]** |

---

> [!CAUTION]
> **輸出前 AI 自檢:**
> - [ ] 6 段 H2 章節齊全(編號 1, 2, 4, 5, 7, 9)
> - [ ] Headroom 表至少 4 維度(CPU / RAM / DB / queue)
> - [ ] 每個 headroom 行含 `[H/M/L]` badge + status
> - [ ] 每個 breach / warn 資源有對應 scaling trigger
> - [ ] Cost envelope 含 error band
> - [ ] Decision Log ≥ 1 條,每條有 rejected reason
> - [ ] 無 YAML / JSON schema 輸出(capacity plan 是給人讀的 markdown)

Practice · 換你試做

先用自己的話交代素材,不需要先學會工程術語

確定的就寫,不確定的留白。下一步要做的是請 Agent 找缺口,不是讓它替你猜一套合理答案。

可以先留白;複製提示詞後再到 Coding Agent 裡補充。

AI Practice · 手動三步

先問、再寫、最後審,不把整條流程鎖死

每一步都是獨立工作包。你可以停下補資料、修改限制或重做某一步,不需要服從固定的 Agent 接力流程。

STEP 01

只找阻擋文件成立的未知

先補會改變範圍、判斷或驗收結果的資訊,不急著寫文件。

我要製作「Capacity Planning · 容量規劃」。先不要產出文件。

請根據我的素材,找出會影響這份文件正確性或可執行性的未知事項,一次最多問 5 題。

每題請包含:
1. 問題
2. 為什麼現在必須知道
3. 它會影響哪個章節或決定

已經回答的事不要重問;可以延後的事標成「待決策」;不要替我猜答案。

本文件的核心章節:Executive Summary、Forecast Horizon & Growth Model、Headroom per Resource、Scaling Triggers、Cost Envelope、Decision Log(key 2-3 條)

複製後,請在標示位置貼上自己的素材。

Review · 自己驗收

文件存在,不代表下一個角色真的能使用

逐條檢查 Agent 的輸出。人類負責需求、限制與驗收,也必須能說明重要結論從哪裡來。

CHECKED0 / 6
NEXT HANDOFF

帶著這份文件,繼續到「Cost Monitor · 成本監控」

下一張卡會接住新的決策問題;不用一次把整條 SDLC 全做完。

前往下一張卡