
Photo by Margerretta on Pexels
預計閱讀 1 分鐘原文來源
AWS 把 DuckDB 嵌入 Aurora PostgreSQL,直接查詢 S3 Iceberg 與 Parquet
AWS 今日宣布,將 DuckDB(一款嵌入式分析查詢引擎)整合至 Aurora PostgreSQL,讓開發者能在同一個 PostgreSQL 連線與 SQL 語法下,直接讀取 Amazon S3 中的 Apache Iceberg 與 Parquet 檔案,並與 Aurora 內部的交易資料即時合併處理,無需先將歷史資料搬入資料庫。
為何需要此功能?
企業通常把近期高頻交易資料保存在關聯式資料庫,較舊的歷史紀錄則存放於 S3 資料湖。過去若要同時分析兩者,往往必須建立 ETL(抽取、轉換、載入)流程,將所需的歷史檔案複製到資料庫,既耗時又增加成本。現在 Aurora PostgreSQL 內建 DuckDB 後,使用者只要在 Aurora 中建立指向 S3 的 外部資料表,即可像查詢本地表格一樣,直接存取資料湖中的檔案。
技術運作概況
- 查詢分工:Aurora 處理本機資料,DuckDB 負責讀取 S3 中的 Iceberg 與 Parquet。
- 外部表格:使用者先於 Aurora 建立對應 S3 檔案的外部表格,之後的 SELECT 語句可同時引用本機與外部表格。
- 支援的目錄:除了原生 Parquet 與 Iceberg,還支援 S3 Tables 以及由 AWS Glue Data Catalog 管理的 Iceberg 表格,甚至可透過 Glue 連接相容 Iceberg REST Catalog 的外部目錄。
- 效能最佳化:Aurora 會先根據查詢條件裁剪需要讀取的檔案範圍,只抓取必要欄位,常用資料會被快取,以降低不必要的 S3 讀取量。查詢可在主節點或唯讀副本上執行,企業可將分析工作分流至唯讀副本,同時保留原生 Aurora 表格的毫秒級回應。
影響與未來展望
此功能自 Aurora PostgreSQL 17.11 與 18.6 起提供,已在所有 AWS 商業區域以及 AWS GovCloud(US) 上線。對於需要即時結合交易與歷史資料的金融、電商與媒體業者而言,省去資料搬移的時間與成本,將大幅提升資料驅動決策的速度。未來若 AWS 持續擴充對其他資料湖格式(如 Delta Lake)的原生支援,Aurora 可能演進成同時支援 OLTP(線上交易處理)與 OLAP(線上分析處理)的混合平台,成為企業資料架構的核心樞紐。
讀者提示:若您已在使用 Aurora PostgreSQL,建議先評估現有資料湖的檔案格式與 Glue 目錄設定,利用外部表格快速驗證查詢效能,逐步將歷史分析工作遷移至此新模式。
分享