Basekick-Labs/arc

Open, SQL-native time-series database for telemetry you need to keep. 34M+ records/sec ingestion, 8M+ rows/sec queries. InfluxDB Line Protocol and Telegraf compatible. Open Parquet on your storage. Single binary. S3/Azure native. Air-gap ready. AGPL-3.0.

何を解決するか

Arcは、高スループットのテレメトリデータ向けに設計されたSQLネイティブな時系列データベースです。ストレージコストによる「リテンションの崖」問題——つまり、古いデータを削除またはダウンサンプリングせざるを得ない状況——を、オープンなParquetストレージエンジンを使用することで解決します。これにより、チームは自社のインフラ(ローカルディスク、S3、Azure、MinIOなど)上で完全解像度の履歴データを保持でき、ホットデータとコールドデータの処理パスを分ける必要がありません。

動作方法

Arcは、インジェストパイプライン、Parquetストレージエンジン、DuckDBを基盤とするSQLクエリレイヤーを統合した単一のスタティックリンクバイナリとして動作します。InfluxDB Line ProtocolやMessagePackなど、複数のインジェストプロトコルをサポートしており、バックグラウンドのコンパクションシステムにより、小さなParquetファイルを自動的に大きな最適化されたファイルにマージすることで、ストレージサイズを削減し、クエリ速度を向上させます。分析用SQL機能(CTE、ウィンドウ関数、ジョイン)を提供し、リテンションポリシーと継続的クエリによりデータライフサイクルを管理します。

対象ユーザー

主に航空宇宙分野のテレメトリ向けに開発されていますが、産業用IoT、製造業、エネルギー、フリートテレメトリ、一般的なオブザーバビリティなど、機械が継続的にデータを生成する環境であれば、すべてに適しています。

特徴

  • 高パフォーマンスなインジェスト: MessagePack Columnarを使用して、1秒間に3400万件以上のレコードをインジェスト可能。
  • オープンストレージ: 標準のApache Parquetファイルとしてデータを保存し、ベンダー固定を回避。
  • SQLネイティブ: 専用のクエリ言語ではなく、標準的な分析用SQLを使用。
  • 依存関係ゼロ: JVM、Python、外部クラスタなど、追加の依存関係なしに単一バイナリでデプロイ可能。
  • 広範な互換性: InfluxDB Line ProtocolおよびTelegrafと互換性があり、リスクの低い移行を可能に。
  • エンタープライズ対応: 規制環境向けにオプションのFIPS 140-3ビルドを提供し、S3/Azureストレージバックエンドもサポート。

関連

  • プロジェクト
  • Dispatch
  • Dispatch
  • Dispatch
  • プロジェクト