打造即時特徵儲存庫:Jumio 以百毫秒以下延遲完成機器學習預測
在身份驗證與防詐領域,即時性與準確性是服務成敗的關鍵。Jumio 作為全球領先的身分驗證供應商,必須讓機器學習(ML)模型在毫秒級別內取得最新特徵,才能即時偵測詐騙、建立數位信任。為解決資料重複、特徵工程碎片化、特徵一致性不足、手動部署與高延遲等痛點,Jumio 在 AWS 上建置了一套 即時特徵儲存庫(Real‑Time Feature Store),實現了 <100 ms 的預測延遲。
背景與架構概覽
Jumio 的特徵儲存需求橫跨五個相互關聯的維度:資料來源、即時處理、離線批次、特徵一致性與跨區域可用性。為滿足這些需求,系統採用了 串流優先(streaming‑first) 的設計,部署於三個 AWS 區域:美國東部(N. Virginia)、歐洲(法蘭克福)與亞太(新加坡),確保全球使用者皆能獲得低延遲服務。
即時資料流
-
Amazon Kinesis Data Streams 接收來自前端驗證服務的事件。
-
Amazon Managed Service for Apache Flink(Flink)即時擷取、清洗並豐富(enrich)資料,將計算後的特徵直接寫入 Amazon SageMaker Feature Store。
離線資料流
-
Amazon Kinesis Data Firehose 把同樣的事件批次傳送至 Amazon S3。
-
S3 觸發 Amazon EMR(Elastic MapReduce)作業,將資料轉換為 Iceberg 表格,供模型訓練使用。
此雙向管線確保即時特徵與離線特徵在同一套治理框架下保持一致性,同時避免資料重複寫入與手動同步的成本。
設計權衡與效益
| 項目 | 設計選擇 | 影響 | |------|----------|------| | 延遲 | 使用 Flink 於串流中即時計算 | 預測延遲降至 80 ms 左右,滿足百毫秒以下需求 | | 可擴展性 | 多區域部署 + Kinesis 分片 | 隨流量自動擴增,支援全球高併發驗證請求 | | 一致性 | Feature Store 同時供即時與離線使用 | 減少特徵漂移(feature drift)風險,提升模型準確度 | | 成本 | 以伺服器無狀態服務(Flink、Kinesis)取代自建叢集 | 運維負擔下降,資源使用更具彈性 |
透過上述配置,Jumio 從原本碎片化、效率低下的特徵工程流程,轉變為集中、可重用的特徵平台。機器學習模型不再因特徵延遲或不一致而產生誤判,詐騙偵測的成功率顯著提升。
未來展望與讀者啟示
即時特徵儲存庫已成為高頻率、低延遲 ML 應用的基礎建設。對於希望在 AWS 上快速構建類似平台的企業,關鍵在於:
-
選擇串流優先的資料管線:Kinesis + Flink 能在資料進入即完成特徵計算。
-
統一特徵治理:將即時與離線特徵納入同一 Feature Store,避免資料孤島。
-
跨區域佈局:依照使用者分布部署多區域,確保全球低延遲。
隨著 5G 與邊緣運算的普及,未來的機器學習預測將更趨向「即時即決」。Jumio 的案例證明,透過 AWS 原生服務的組合與精心的架構設計,企業完全可以在百毫秒以下的時效內,提供可靠的 AI 驅動防詐服務。
