天命的觀測性:將朝鮮王朝的宮廷徵兆映射至 SRE Principles

在網站可靠性工程(SRE)的世界中,我們對訊號極度著迷:延遲、錯誤率和飽和度。我們建立儀表板來監控系統健康狀況,當指標偏離基準值時向我們發出警報,以便我們在發生全面故障之前進行干預。但如果你將這種思維模型應用於 14 世紀王朝的治理時,會發生什麼事呢?

一個引人入勝的專案 omen.ops 將朝鮮王朝(1392–1897)的歷史記錄重新想像為大規模的系統日誌流,而非敘事性歷史。透過將「天命」框架化為系統運行時間(uptime)指標,該專案將天體異常、自然災害和動物入侵轉化為需要修復和事後檢討(post-mortems)的營運事件。

古代觀測性的架構

朝鮮宮廷的核心是 Gwansanggam(皇家天文與氣象局)。以現代術語來說,Gwansanggam 扮演著國家主要遙測(telemetry)來源的角色。他們的「日誌」由每晚對天空的觀測組成,經過細緻記錄並呈報給國王。

當一顆「客星」(新星或超新星)出現在先前不存在恆星的區域時,這不僅僅是一個天文奇觀,而是一個 P1 事件。在 omen.ops 框架中,這被視為一個「非預期天體」且「持續時間超過預期停留」,從而觸發主動的事件報告。

將徵兆映射至 SRE 概念

這種框架的精妙之處在於它如何將古代政治神學映射到現代技術營運:

1. 天命波動指數

該專案引入了「天命波動指數」而非 CPU 平均負載。這是一個將監控訊號類別歸一化至統治時期基準值的綜合指標。當指數飆升時,表示「系統」(王朝)正經歷高度不穩定。

2. SLOs 與運行時間

該專案追蹤「天命運行時間」,定義為宮廷持有天命且未受干擾的統治時期比例。這是根據 99.0% 的服務水準目標(SLO)進行衡量的。當穩定性數值降至此閾值以下時,該統治時期會被標記為關鍵狀態。

3. 修復與 MTTR

在 SRE 中,我們力求降低平均修復時間(MTTR)。朝鮮王朝對特定的「事件」有其自身的修復協議。對於乾旱,協議是 Giuje(國家降雨祭祀)。

有趣的是,記錄顯示了對流程的嚴格遵守。其中一項記錄描述了一次「事後檢討」,當時一名首席皇家秘書因降雨祭祀所需的墊子和轎子未及時準備就緒——這本質上是未能滿足祭祀流程的 SLA。

4. 事件升級

並非所有異常都是平等的。該專案按嚴重程度對事件進行分類:

  • INFO: 單次彗星觀測。
  • WARN: 與新年第一天同時發生的日食。
  • P1/CRITICAL: 持續存在的客星,或使金堤平原看起來「像大海一樣」的大規模洪水。

「儀表板外」的事件

觀測性極限最令人感慨的例子之一是對壬辰倭亂(1592–1598)的處理。雖然宮廷繼續提交徵兆報告並監控天體訊號,但實際的日本入侵——首都陷落與國王逃往北方——卻被標記為「OFF-DASHBOARD」。

這突顯了歷史與系統中的一個根本真理:你可以對你的訊號擁有完美的遙測數據,但如果你忽視了物理層正在發發生的災難性故障,你的儀表板僅僅是一種分心。

《朝鮮王朝實錄》作為黃金數據集

正如社群成員所指出的,該專案利用了《朝鮮王朝實錄》(Joseon Wangjo Sillok)。這些記錄以其細粒度與完整性而聞名。由於史官獨立於國王的直接控制,這些記錄不僅捕捉了王朝的輝煌,也捕捉了君主制的尷尬時刻。

「朝鮮王朝對保存歷史極度著迷。甚至國王也無法干涉它。事實上,有一位國王在狩獵時從馬背上摔落,然後叫他們不要寫下來。但我們知道這發生了,因為他們把那個命令寫下來了。」

這種不可變日誌(immutable logging)的層級,正是現代工程師在建立稽核軌跡(audit trails)與分佈式追蹤(distributed tracing)時所追求的目標。Sillok 代表了人類歷史中最早期且最全面的「系統日誌」,提供了足以透過現代觀測性視角進行分析的豐富數據集。

透過將歷史視為數據,omen.ops 提醒我們,監控、警報與修復的渴望,並非雲端時代的現代發明,而是人類對自然界混沌狀態的基本反應。

Sources