ccfos/huatuo

eBPF-based Linux kernel observability 🚀🚀

解決する課題

HUATUOは、Linuxカーネルとハードウェアのパフォーマンスを、大きなオーバーヘッドを導入せずに深くリアルタイムに可視化することの難しさに対処します。クラウドネイティブおよびAIインフラストラクチャにおける「パフォーマンスのジッター」(CPUスパイクやI/Oサージなど)の問題を、アプリケーションコードの変更を必要としない自動トレーシングと継続的プロファイリングによって解決します。

仕組み

eBPFやその他のLinuxカーネル動的トレーシング技術(kprobe、tracepoint、ftrace)を使用して、ゼロインストルメンテーションの可観測性を実装します。メモリ管理、CPUスケジューリング、ネットワーキングなどのカーネルサブシステムを監視し、イベント駆動型メカニズムを使用して、「スローパス」(ページフォールトやスケジューリング遅延など)がトリガーされたときにランタイムコンテキストを自動的にキャプチャします。

対象ユーザー

システム障害のトラブルシューティングと高可用性およびパフォーマンスの最適化が必要な、大規模なクラウドネイティブコンピューティング環境、AIコンピューティングクラスター、ベアメタルインフラストラクチャの運用者向けに設計されています。

ハイライト

  • 低オーバーヘッド: BPFを使用してパフォーマンスへの影響を1%未満に維持します。
  • AutoTracing: CPUシステムスパイクやLoadavgスパイクなどの一時的なパフォーマンス問題を診断するために、スナップショットを自動的に保持します。
  • ハードウェアサポート: CPUやメモリだけでなく、PCIeインターコネクト、ネットワークアダプター、AIアクセラレーター(GPUおよびNPU)も監視します。
  • エコシステム対応: Prometheus、Grafana、Pyroscope、Elasticsearchと統合し、データをKubernetesコンテナラベルに自動的にマッピングします。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト