Odaily 星球日報訊 Coinbase 發布 7 月 14 日服務中斷事件復盤報告,表示此次事故由一次例行配置更新引發的關鍵網路組件錯誤配置導致,影響持續約 50 分鐘,期間用戶資金始終安全。
Coinbase 表示,北京時間 7 月 14 日 12:34(美國東部時間 12:34),公司向承載核心基礎設施服務的共享生產 Kubernetes 集群部署了一項例行配置變更。該更新原計畫用於遷移至新的服務部署模式,以提升系統效能和可靠性。
然而,由於資源名稱衝突未被預生產環境檢測機制發現,此次配置修改意外影響了集群中的 Istio 入口閘道(Ingress Gateway)相關 Kubernetes 資源,導致該網路組件不可用。約 3 分鐘後,集群所有入站流量中斷,使內部服務無法存取多個基礎設施組件。
Coinbase 指出,由於大量非同步工作流程依賴這些基礎設施服務,包括交易結算、資金轉帳和卡片交易授權等流程,因此多個事業線受到影響。受影響服務包括:
零售用戶無法完成鏈外交易、充值和提現,部分處理中的交易顯示卡住,並在服務恢復後完成;
Coinbase Card 借記卡交易暫時失敗,信用卡支付未受影響,但部分卡片管理功能不可用;
Coinbase DEX 在 Base 和 Solana 上的鏈上兌換服務暫停;
Coinbase Exchange 和 Prime 機構客戶出現轉帳及結算失敗或延遲;
Coinbase Developer Platform 客戶無法完成開戶、資金轉移及入金服務。
Coinbase 表示,入口閘道於美國東部時間 13:20 恢復,事件於 13:23 得到緩解。隨後系統開始處理積壓任務,大部分服務很快恢復正常,剩餘佇列在之後數小時內完成處理。在恢復過程中,Coinbase 遇到兩項額外挑戰。首先,部署工具本身依賴受影響的入口閘道運行,導致常規回滾流程無法執行,形成「故障影響修復工具」的循環相依。其次,緊急恢復流程(break-glass access)雖然有效,但權限驗證和人工審核流程增加了恢復時間。
Coinbase 表示,此次事件未涉及資產安全風險,但暴露出大型金融基礎設施在自動化部署、系統相依和災難復原機制方面仍需持續優化。公司將進一步加強系統韌性建設,以降低類似事件再次發生的機率。
15.54萬 熱度
7.19萬 熱度
1.18億 熱度
119.17萬 熱度
99萬 熱度
Coinbase 復盤 7 月 14 日服務中斷事件:設定錯誤導致 50 分鐘故障,使用者資金未受影響
Odaily 星球日報訊 Coinbase 發布 7 月 14 日服務中斷事件復盤報告,表示此次事故由一次例行配置更新引發的關鍵網路組件錯誤配置導致,影響持續約 50 分鐘,期間用戶資金始終安全。
Coinbase 表示,北京時間 7 月 14 日 12:34(美國東部時間 12:34),公司向承載核心基礎設施服務的共享生產 Kubernetes 集群部署了一項例行配置變更。該更新原計畫用於遷移至新的服務部署模式,以提升系統效能和可靠性。
然而,由於資源名稱衝突未被預生產環境檢測機制發現,此次配置修改意外影響了集群中的 Istio 入口閘道(Ingress Gateway)相關 Kubernetes 資源,導致該網路組件不可用。約 3 分鐘後,集群所有入站流量中斷,使內部服務無法存取多個基礎設施組件。
Coinbase 指出,由於大量非同步工作流程依賴這些基礎設施服務,包括交易結算、資金轉帳和卡片交易授權等流程,因此多個事業線受到影響。受影響服務包括:
零售用戶無法完成鏈外交易、充值和提現,部分處理中的交易顯示卡住,並在服務恢復後完成;
Coinbase Card 借記卡交易暫時失敗,信用卡支付未受影響,但部分卡片管理功能不可用;
Coinbase DEX 在 Base 和 Solana 上的鏈上兌換服務暫停;
Coinbase Exchange 和 Prime 機構客戶出現轉帳及結算失敗或延遲;
Coinbase Developer Platform 客戶無法完成開戶、資金轉移及入金服務。
Coinbase 表示,入口閘道於美國東部時間 13:20 恢復,事件於 13:23 得到緩解。隨後系統開始處理積壓任務,大部分服務很快恢復正常,剩餘佇列在之後數小時內完成處理。在恢復過程中,Coinbase 遇到兩項額外挑戰。首先,部署工具本身依賴受影響的入口閘道運行,導致常規回滾流程無法執行,形成「故障影響修復工具」的循環相依。其次,緊急恢復流程(break-glass access)雖然有效,但權限驗證和人工審核流程增加了恢復時間。
Coinbase 表示,此次事件未涉及資產安全風險,但暴露出大型金融基礎設施在自動化部署、系統相依和災難復原機制方面仍需持續優化。公司將進一步加強系統韌性建設,以降低類似事件再次發生的機率。