Basekick-Labs/arc

Open, SQL-native time-series database for telemetry you need to keep. 34M+ records/sec ingestion, 8M+ rows/sec queries. InfluxDB Line Protocol and Telegraf compatible. Open Parquet on your storage. Single binary. S3/Azure native. Air-gap ready. AGPL-3.0.

解决的问题

Arc 是一个专为高吞吐量遥测数据设计的 SQL 原生时序数据库。它通过使用开放的 Parquet 存储引擎,解决了「保留悬崖」问题——即团队因存储成本被迫删除或降采样旧数据。该方案允许团队在自有基础设施(本地磁盘、S3、Azure 或 MinIO)上保留完整分辨率的历史数据,而无需将热数据和冷数据路径分开处理。

工作原理

Arc 作为一个单一的静态链接二进制文件运行,集成了数据摄取管道、Parquet 存储引擎以及基于 DuckDB 的 SQL 查询层。它支持多种摄取协议,包括 InfluxDB Line Protocol 和 MessagePack,并通过后台压缩系统自动将小的 Parquet 文件合并为更大的优化文件,从而减少存储空间并提升查询速度。它提供分析型 SQL 功能(CTE、窗口函数、JOIN),并通过保留策略和持续查询管理数据生命周期。

适用人群

主要为航空航天遥测而构建,但也适用于任何机器持续产生数据的环境,例如工业物联网、制造、能源、车队遥测和通用可观测性。

核心亮点

  • 高性能摄取:使用 MessagePack Columnar 可实现每秒超过 3400 万条记录的摄取能力。
  • 开放存储:以标准 Apache Parquet 文件格式存储数据,避免供应商锁定。
  • SQL 原生:使用标准分析型 SQL,而非专有查询语言。
  • 零依赖:以单个二进制文件部署,无需 JVM、Python 或外部集群。
  • 广泛兼容:兼容 InfluxDB Line Protocol 和 Telegraf,支持低风险迁移。
  • 企业就绪:提供可选的 FIPS 140-3 构建版本,适用于受监管环境,并支持 S3/Azure 存储后端。

相关

  • 项目
  • Dispatch
  • Dispatch
  • Dispatch
  • 项目