spitfireuptown/datalinkx

🔥🔥DatalinkX异构数据源之间的数据同步系统,支持海量数据的增量或全量同步,同时支持HTTP、Oracle、MySQL、ES等数据源之间的数据流转,支持中间transform算子如SQL算子、大模型算子,底层依赖Flink、Seatunnel引擎,提供流转任务管理、任务级联配置、任务日志采集等功能🔥🔥

What it solves

DatalinkX는 서로 다른 이종 데이터 소스 간에 데이터를 이동하기 위해 설계된 데이터 동기화 서비스입니다. 동기화 작업 및 로그 관리를 중앙 집중화하여, 부서 간 데이터 협업(예: 크롤러 데이터를 데이터 웨어하우스로 이동)에 필요한 수동 작업을 줄여줍니다.

How it works

시스템은 데이터 소스를 구성하고 동기화 작업을 설정하기 위한 웹 기반 인터페이스를 제공합니다. Flink와 SeaTunnel과 같은 고성능 컴퓨팅 엔진을 사용하여 데이터 이동을 실행합니다. 배치 작업(데이터베이스 간 데이터 이동), 실시간 작업(특히 Kafka용), 그리고 transform 연산자를 사용하여 데이터 변환을 가능하게 하는 계산 작업을 지원합니다.

Scheduling is handled via xxl-job using cron expressions.

Who it’s for

대규모 데이터가 필요한 조직을 대상으로 합니다. 다양한 팀이 다양한 데이터베이스 유형을 통해 데이터를 공유해야 하며, 이러한 파이프라인을 중앙 집중식으로 관리하고 유지 관리하고자 하는 조직에 적합합니다.

Highlights

  • High-Performance Engines: Flink와 SeaTunnel을 사용하여 효율적인 데이터 처리를 수행합니다.
  • Plugin-based Architecture: 고정된 규칙에 따라 드라이버를 개발하여 커스텀 데이터 소스를 지원합니다.
  • Visual Configuration: 사용자가 수동 코딩 대신 GUI를 통해 데이터 소스를 구성하고 동기화 작업을 생성할 수 있습니다.
  • Task Lineage and Cascading: 작업 관계를 추적하고 작업 순서를 구성하는 기능을 포함합니다.
  • AI Integration: LLM 실행을 위한 Ollama와 MCP (Model Context Protocol) 기능을 위한 Solon을 통합합니다.