Launch Atlas logoLaunch.Atlas
#44OperateDevOps · SRE

SLO · 服務等級目標

把『可用性』從感覺變成可量化的合約

SLO · 服務等級目標 · 卡片插圖
CHOOSE YOUR MODE

先決定你現在是要學,還是要在專案裡做

網站負責解釋與分發工作包;真正的 Repository 掃描、缺口判斷與文件產出交給 Coding Agent。

SDLC 實作課 · 交付物練習

先理解這份文件替你消除什麼不確定

把『可用性』從感覺變成可量化的合約

「我們系統很穩」是無法 reviewable 的形容詞。SLO 把可用性與延遲定義為可量測 SLI + 閾值 + 觀察窗,是 error budget、告警、容量規劃的共同源頭。

OWNER & HANDOFF

誰負責、交給誰

主責: DevOps / SRE

協作: PO 對齊使用者體驗、Architect 對齊系統能力

下游收件: Error Budget、告警、Capacity Planning

WHEN TO USE

何時值得做

REQUIRED

必要時機: 使用者直接依賴、SLA 對外承諾、跨服務相互調用

SKIP

不需要時: 內部一次性工具、無使用者直接依賴

CAUTION

常見誤用: 把 100% 當目標;SLI 量錯點(server side 而非 user side)

看懂6 段骨架知道每段要留下哪一種判斷
看會雙版本範本先用輕量版練習,再讀完整版
做出自己的草稿手動貼到 Claude Code、Codex 或其他 Agent
  1. 01讀大綱
  2. 02比範本
  3. 03填素材
  4. 04貼提示詞
  5. 05對照驗收

Anatomy · 文件解剖

輕量版先回答 6 個核心章節

章節名稱可以因團隊調整,但每一段要求的判斷不能被省略。先讀問題,再看格式。

  1. 01

    Executive Summary

    範本必要章節

    3-5 行,PO + SRE 30 秒讀完。只寫「保護哪個使用者體驗、SLO 數字、為何選這個數字」

  2. 02

    SLI Definition

    範本必要章節

    輕量版至少 1 條 SLI(latency 或 availability 擇一必填)。where_measured 必須 user-side / edge / synthetic 三選一

  3. 03

    SLO Target

    範本必要章節

    target 必須 < 100%;window 至少 28d rolling;rationale 必須對應抱怨頻率或競品基準

  4. 06

    Dependency SLOs

    範本必要章節

    列出至少 1 條上游依賴的 SLO(math: 我們的 SLO 不能高於依賴 SLO)

  5. 10

    Decision Log(key 2-3 條)

    範本必要章節

    每條必含 chosen + 至少 1 個 rejected + 拒絕原因

  6. 12

    Confidence & Sources & TODO

    範本必要章節

    把已確認的內容、判斷依據與仍待補充的資訊清楚分開。

Study · 對照學習

同一份交付物,先練核心,再看完整深度

輕量範本適合第一次練習與 MVP;完整範本保留跨職能交棒需要的細節。兩者都要求未知事項保持可見。

SmartTrip 實例待補

這張卡目前提供已審定的輕量與完整範本;不以 AI 臨時生成的內容冒充實際案例。

LIGHT TEMPLATE

30 分鐘內先完成核心章節。

---
doc_type: "slo"
variant: "light"
status: "draft"
owner: "<your-name>"
last_updated: "YYYY-MM-DD"
upstream:
  required: ["user-complaints", "journey-map"]
  optional: ["existing-metrics", "dependency-slos"]
---

# SLO: <service-name>

**Status:** Draft v0.X · **Owner:** <SRE name> · **Last updated:** YYYY-MM-DD

> [!IMPORTANT]
> **AI 填寫規則:** 本範本 6 段(編號 1, 2, 3, 6, 10, 12),全部必填——刻意沿用完整版的章節編號讓兩版可對照。每結論行內加 `(依據:tickets §XXX / journey §YYY)`;每量化欄位加 `[H]/[M]/[L]` confidence badge;缺資料寫 `_TODO: 需要 XXX_` 不編造;**SLI 必須量在 user side**(不能只量 server side);**SLO target 必須 < 100%**(100% 不是 SLO 是承諾失敗)。

---

## 1. Executive Summary

<!-- ai-fill: 3-5 行,PO + SRE 30 秒讀完。只寫「保護哪個使用者體驗、SLO 數字、為何選這個數字」 -->

<3-5 行說明>

> **TL;DR:** <一句話:本服務的核心 SLI 與 SLO 目標>

---

## 2. SLI Definition

<!-- ai-rule: 輕量版至少 1 條 SLI(latency 或 availability 擇一必填)。where_measured 必須 user-side / edge / synthetic 三選一 -->

| SLI ID | Name | What measured | Where measured | Aggregation | Confidence |
|---|---|---|---|---|---|
| SLI-001 | <e.g. checkout-success-rate> | <user-observable event> | user-side / edge / synthetic | <e.g. successful / total over 5m> | **[H]** |

---

## 3. SLO Target

<!-- ai-rule: target 必須 < 100%;window 至少 28d rolling;rationale 必須對應抱怨頻率或競品基準 -->

| SLI ref | Target | Window | Rationale | Confidence |
|---|---|---|---|---|
| SLI-001 | 99.9% | 28d rolling | <為何這個數字:對應抱怨頻率 / 競品 / 商業影響> | **[H]** |

> **Error budget:** 0.1% = 40.3 min / 28d

---

## 6. Dependency SLOs

<!-- ai-rule: 列出至少 1 條上游依賴的 SLO(math: 我們的 SLO 不能高於依賴 SLO) -->

| Dependency | Their SLO | Our max SLO | Note |
|---|---|---|---|
| <upstream service> | <number or TODO> | <cannot exceed their SLO> | <說明> |

---

## 10. Decision Log(key 2-3 條)

<!-- ai-rule: 每條必含 chosen + 至少 1 個 rejected + 拒絕原因 -->

| Date | Decision | Options | Chosen | Rejected why | Confidence |
|---|---|---|---|---|---|
| YYYY-MM-DD | SLO target 99.9% vs 99.95% | 99.0% / 99.9% / 99.95% | 99.9% | 99.0% (超過抱怨門檻)、99.95% (X 倍成本只減 Y% 抱怨) | **[H]** |

---

## 12. Confidence & Sources & TODO

- **整份文件最低 confidence 欄位:** <列出所有 [L] 與 [M]>
- **Fabricated assumptions(推測但 input 未明說):**
  - <假設 1>
- **Highest-value next input:** <下一份最該補的資料:過去 90 天 user-side latency 分佈 / 競品 benchmark>

### TODO(缺資料)

- _TODO: 需要 90d user-side latency 分佈校準 SLI-001 閾值_

---

> [!CAUTION]
> **輸出前 AI 自檢:**
> - [ ] 6 段 H2 章節齊全(編號 1, 2, 3, 6, 10, 12,刻意不連號)
> - [ ] 每個 SLI / SLO 帶 inline `[H/M/L]` badge
> - [ ] SLI where_measured 必為 user-side / edge / synthetic(不接受純 server-side)
> - [ ] SLO target < 100%
> - [ ] Window 至少 28d rolling
> - [ ] Dependency SLO 段已列「我們的 SLO 不能高於依賴」的數學檢查
> - [ ] Decision Log ≥ 1 條,每條有 rejected reason
> - [ ] 無 YAML / JSON schema 輸出(SLO 是給人讀的 markdown)

Practice · 換你試做

先用自己的話交代素材,不需要先學會工程術語

確定的就寫,不確定的留白。下一步要做的是請 Agent 找缺口,不是讓它替你猜一套合理答案。

可以先留白;複製提示詞後再到 Coding Agent 裡補充。

AI Practice · 手動三步

先問、再寫、最後審,不把整條流程鎖死

每一步都是獨立工作包。你可以停下補資料、修改限制或重做某一步,不需要服從固定的 Agent 接力流程。

STEP 01

只找阻擋文件成立的未知

先補會改變範圍、判斷或驗收結果的資訊,不急著寫文件。

我要製作「SLO · 服務等級目標」。先不要產出文件。

請根據我的素材,找出會影響這份文件正確性或可執行性的未知事項,一次最多問 5 題。

每題請包含:
1. 問題
2. 為什麼現在必須知道
3. 它會影響哪個章節或決定

已經回答的事不要重問;可以延後的事標成「待決策」;不要替我猜答案。

本文件的核心章節:Executive Summary、SLI Definition、SLO Target、Dependency SLOs、Decision Log(key 2-3 條)、Confidence & Sources & TODO

複製後,請在標示位置貼上自己的素材。

Review · 自己驗收

文件存在,不代表下一個角色真的能使用

逐條檢查 Agent 的輸出。人類負責需求、限制與驗收,也必須能說明重要結論從哪裡來。

CHECKED0 / 6
NEXT HANDOFF

帶著這份文件,繼續到「Error Budget · 誤差預算」

下一張卡會接住新的決策問題;不用一次把整條 SDLC 全做完。

前往下一張卡