spitfireuptown/datalinkx
🔥🔥DatalinkX异构数据源之间的数据同步系统,支持海量数据的增量或全量同步,同时支持HTTP、Oracle、MySQL、ES等数据源之间的数据流转,支持中间transform算子如SQL算子、大模型算子,底层依赖Flink、Seatunnel引擎,提供流转任务管理、任务级联配置、任务日志采集等功能🔥🔥
What it solves
DatalinkX 是一个数据同步服务,旨在于不同异构数据源之间迁移数据。它将同步任务和日志管理集中化,减少了跨部门数据协作(例如:将爬虫数据移入数据仓库)所需的手动工作量。
How it works
该系统提供了一个基于 Web 的界面来配置数据源和同步任务。它利用 Flink 和 SeaTunnel 等高性能计算引擎来执行数据迁移。它支持批量任务(在数据库之间迁移数据)、实时任务(专门针对 Kafka)和允许使用 transform 算子进行数据转换的计算任务。调度通过 xxl-job 使用 cron 表达式进行处理。
Who it’s for
它适用于具有大规模数据需求、不同团队需要在各种数据库类型之间共享数据,并希望有一种集中化的方式来管理和维护这些流水线。
Highlights
- High-Performance Engines: 使用 Flink 和 SeaTunnel 进行高效数据处理。
- Plugin-based Architecture: 通过开发根据固定规则开发的驱动程序来支持自定义数据源。
- Visual Configuration: 使用 GUI 而非手动编码来创建数据源和同步任务。
- Task Lineage and Cascading: 包含用于追踪任务关系和配置任务序列的功能。
- AI Integration: 集成 Ollama 以进行 LLM 执行,并集成 Solon 以获得 MCP (Model Context Protocol) 能力。