Angible Inc. / Site Reliability Engineer 面試簡報
01 / 05 OVERVIEW & POSITIONING

從雲端基礎設施到邊緣系統

建構穩定、可視與自動化的 SRE 維運平台

基本資料 Candidate
  • 應徵者:江源盛 (Jack Chiang)
  • 應徵職務:Site Reliability Engineer (SRE)
  • 核心範疇:AWS EKS、GitOps、系統監控、Linux 維運、自動化腳本
  • 聯繫信箱:qpowjohn@gmail.com | 台北市
10 分鐘簡報大綱 Agenda
  • 01–03 分:個人簡介與真實工作經歷說明
  • 03–05 分:事故應變原則(先復原服務、後根因分析)
  • 05–08 分:基礎能力如何對接 Angible 全新場景
  • 08–10 分:融入團隊的 90 天行動計畫與 Q&A
02 / 05 WORK EXPERIENCE & TROUBLESHOOTING

個人簡介與硬核技術實績

8 年以上系統維運、平台工程與跨層故障診斷經驗

夕煇 Platform / SRE
  • 全平台上雲與 GitOps:3 個月將 20 微服務遷移至 AWS EKS,建置 ArgoCD + Helm + KEDA。
  • CoreDNS UDP 丟包治本force_tcp45 秒內 0 timeout 止血
  • JVM Thread Dumpkill -3 定位 MySQL 殭屍交易根治服務卡死。
  • 全方位 Infra 成本調優:Graviton3 ARM64 Spot + Lambda 自動復原(省 60% 費用)、DB Slow Query 優化避免擴容、防範 Cross-AZ 網路流量開銷、監控 Log/Metric Retention 治理。
17LIVE SRE
  • 維護直播平台,優化 CI 流程,DockerHub 依賴全數遷移至 GCP。
  • 優化既有 Alertmanager 告警品質,降低無效告警風暴達 80%
  • 自動化檢閱 300+ 域名憑證並設定 Datadog 監控。
互動資通 SRE & Developer
  • 維護日發 2,500 萬次、尖峰 500 TPS 簡訊發送平台。
  • 異常反應時間從客戶通知降低至 1 分鐘內主動處置。
  • 開發自動審核系統與備份備援機制。
03 / 05 INCIDENT MANAGEMENT

事故應變原則與實戰處置

先復原止血、後根因分析,落實變更安全防護機制

事故處置階段一:第一時間先止血
線上事故發生時,以優先復原服務與限制影響範圍為最高原則,保障業務與使用者權益,避免在線上盲目排查而延誤服務恢復。
事故處置階段二:事後徹底根因分析
服務恢復穩定後,進行詳細事後檢討 (Post-Mortem),釐清系統癥結與加固,確保同類問題不再重複發生。
事故處置與變更安全實務 Practices
  • 20+ 起線上事故處置經驗:主導正式環境事故應變與修復,多數以零停機或極低影響方式解決。
  • 變更前置影響確認:針對資料庫、儲存與網路等破壞性變更落實前置影響範圍確認。
  • Middleware / Application 分段推送:分開 commit/push 變更,確保 MySQL/Redis Ready 後服務才開跑,徹底防範 ArgoCD 連鎖失敗與 Java CrashLoop。
04 / 05 ROLE ALIGNMENT

核心能力對接 Angible 全新場景

運用 SRE 概念遷移(Mental Model Bridging),提供即戰力支援

Angible 核心場景 SRE 概念對接與底層邏輯 能發揮的即戰力與支援
Teleport 存取與資安 Linux SSH CA + Short-lived 憑證 + RBAC 憑藉 Linux 權限控管與 Bastion Audit 經驗,快速掌握零信任架構,落實安全變更。
邊緣 AI 設備監控 離線網路容錯 + 輕量 Agent + OTA 安全 融入團隊既有 Prometheus/Grafana 體系,優化四大指標,建立邊緣斷線心跳預警機制。
Agentic Workflow 維護 API Retry (Circuit Breaker) + OTel Tracing 利用 Python 腳本與可觀測性經驗,協助維護內部自動化工具連線與 Task Queue 穩定。
05 / 05 ONBOARDING & QA

融入 Angible 的 90 天行動計畫

一步一腳印熟悉既有流程,為團隊提供可靠支援與架構加固

Phase 1 / 01–30 Days
建立安全與可視基線
  • 掌握邊緣與雲端 (EKS) 拓樸現況。
  • 熟悉 Teleport 零信任權限與配置。
  • 參與事故輪值與設備心跳 SLO。
Phase 2 / 31–60 Days
部署安全與告警降噪
  • 盤點 Prometheus / Alertmanager 告警。
  • 利用 Inhibitor 降噪 80% 無效告警。
  • 落實 Middleware/App 分段推送規範。
Phase 3 / 61–90 Days
架構加固與成本調優
  • 評估 AWS Graviton / Spot 成本調優。
  • 推動邊緣斷線 Chaos 容錯測試。
  • 落實 Post-Mortem 事後檢討文化。
口述講稿 (Speaker Notes)