spitfireuptown/datalinkx
🔥🔥DatalinkX异构数据源之间的数据同步系统,支持海量数据的增量或全量同步,同时支持HTTP、Oracle、MySQL、ES等数据源之间的数据流转,支持中间transform算子如SQL算子、大模型算子,底层依赖Flink、Seatunnel引擎,提供流转任务管理、任务级联配置、任务日志采集等功能🔥🔥
What it solves
DatalinkX 是一個數據同步服務,旨在於不同異構數據源之間遷移數據。它將同步任務和日誌管理集中化,減少了跨部門數據協作(例如:將爬蟲數據移入數據倉庫)所需的手動工作量。
How it works
該系統提供了一個基於 Web 的界面來配置數據源和同步任務。它利用 Flink 和 SeaTunnel 等高性能計算引擎來執行數據遷移。它支持批量任務(在數據庫之間遷移數據)、實時任務(專門針對 Kafka)以及允許使用 transform 運算符進行數據轉換的計算任務。調度通過 xxl-job 使用 cron 表達式進行處理。
Who it’s for
它適用於具有大規模數據需求、不同團隊需要在各種數據庫類型之間共享數據,並希望有一種集中化的方式來管理和維護這些流水線的組織。
Highlights
- High-Performance Engines: 使用 Flink 和 SeaTunnel 進行高效數據處理。
- Plugin-based Architecture: 通過根據固定規則開發驅動程序來支持自定義數據源。
- Visual Configuration: 允許用戶通過 GUI 而非手動編碼來創建數據源和同步任務。
- Task Lineage and Cascading: 包含用於追蹤任務關係和配置任務序列的功能。
- **AI Integration: 集成 Ollama 以進行 LLM 執行,並集成 Solon 以獲得 MCP (Model Context Protocol) 能力。