01 / 05
OVERVIEW & POSITIONING
從雲端基礎設施到邊緣系統
建構穩定、可視與自動化的 SRE 維運平台
基本資料
Candidate
- 應徵者:江源盛 (Jack Chiang)
- 應徵職務:Site Reliability Engineer (SRE)
- 核心範疇:AWS EKS、GitOps、系統監控、Linux 維運、自動化腳本
- 聯繫信箱:qpowjohn@gmail.com | 台北市
10 分鐘簡報大綱
Agenda
- 01–03 分:個人簡介與真實工作經歷說明
- 03–05 分:事故應變原則(先復原服務、後根因分析)
- 05–08 分:基礎能力如何對接 Angible 全新場景
- 08–10 分:融入團隊的 90 天行動計畫與 Q&A
Angible SRE Interview Deck
Jack Chiang
02 / 05
WORK EXPERIENCE & TROUBLESHOOTING
個人簡介與硬核技術實績
8 年以上系統維運、平台工程與跨層故障診斷經驗
夕煇
Platform / SRE
- 全平台上雲與 GitOps:3 個月將 20 微服務遷移至 AWS EKS,建置 ArgoCD + Helm + KEDA。
- CoreDNS UDP 丟包治本:
force_tcp於 45 秒內 0 timeout 止血。 - JVM Thread Dump:
kill -3定位 MySQL 殭屍交易根治服務卡死。 - 全方位 Infra 成本調優:Graviton3 ARM64 Spot + Lambda 自動復原(省 60% 費用)、DB Slow Query 優化避免擴容、防範 Cross-AZ 網路流量開銷、監控 Log/Metric Retention 治理。
17LIVE
SRE
- 維護直播平台,優化 CI 流程,DockerHub 依賴全數遷移至 GCP。
- 優化既有 Alertmanager 告警品質,降低無效告警風暴達 80%。
- 自動化檢閱 300+ 域名憑證並設定 Datadog 監控。
互動資通
SRE & Developer
- 維護日發 2,500 萬次、尖峰 500 TPS 簡訊發送平台。
- 異常反應時間從客戶通知降低至 1 分鐘內主動處置。
- 開發自動審核系統與備份備援機制。
Track Record & Troubleshooting Excellence
Slide 2 of 5
03 / 05
INCIDENT MANAGEMENT
事故應變原則與實戰處置
先復原止血、後根因分析,落實變更安全防護機制
事故處置階段一:第一時間先止血
線上事故發生時,以優先復原服務與限制影響範圍為最高原則,保障業務與使用者權益,避免在線上盲目排查而延誤服務恢復。
事故處置階段二:事後徹底根因分析
服務恢復穩定後,進行詳細事後檢討 (Post-Mortem),釐清系統癥結與加固,確保同類問題不再重複發生。
事故處置與變更安全實務
Practices
- 20+ 起線上事故處置經驗:主導正式環境事故應變與修復,多數以零停機或極低影響方式解決。
- 變更前置影響確認:針對資料庫、儲存與網路等破壞性變更落實前置影響範圍確認。
- Middleware / Application 分段推送:分開 commit/push 變更,確保 MySQL/Redis Ready 後服務才開跑,徹底防範 ArgoCD 連鎖失敗與 Java CrashLoop。
Incident Management & Safety Guidelines
Slide 3 of 5
04 / 05
ROLE ALIGNMENT
核心能力對接 Angible 全新場景
運用 SRE 概念遷移(Mental Model Bridging),提供即戰力支援
| Angible 核心場景 | SRE 概念對接與底層邏輯 | 能發揮的即戰力與支援 |
|---|---|---|
| Teleport 存取與資安 | Linux SSH CA + Short-lived 憑證 + RBAC | 憑藉 Linux 權限控管與 Bastion Audit 經驗,快速掌握零信任架構,落實安全變更。 |
| 邊緣 AI 設備監控 | 離線網路容錯 + 輕量 Agent + OTA 安全 | 融入團隊既有 Prometheus/Grafana 體系,優化四大指標,建立邊緣斷線心跳預警機制。 |
| Agentic Workflow 維護 | API Retry (Circuit Breaker) + OTel Tracing | 利用 Python 腳本與可觀測性經驗,協助維護內部自動化工具連線與 Task Queue 穩定。 |
Mental Model Bridging & Adaptability
Slide 4 of 5
05 / 05
ONBOARDING & QA
融入 Angible 的 90 天行動計畫
一步一腳印熟悉既有流程,為團隊提供可靠支援與架構加固
Phase 1 / 01–30 Days
建立安全與可視基線
- 掌握邊緣與雲端 (EKS) 拓樸現況。
- 熟悉 Teleport 零信任權限與配置。
- 參與事故輪值與設備心跳 SLO。
Phase 2 / 31–60 Days
部署安全與告警降噪
- 盤點 Prometheus / Alertmanager 告警。
- 利用 Inhibitor 降噪 80% 無效告警。
- 落實 Middleware/App 分段推送規範。
Phase 3 / 61–90 Days
架構加固與成本調優
- 評估 AWS Graviton / Spot 成本調優。
- 推動邊緣斷線 Chaos 容錯測試。
- 落實 Post-Mortem 事後檢討文化。
Q & A — 感謝各位面試官,期待接下來的交流
Slide 5 of 5