Linfeng-Tang/Image-Fusion

Deep Learning-based Image Fusion: A Survey

何を解決するか

このリポジトリは、複数のソース画像(赤外線と可視光、多露光、多焦点画像など)を1つの合成画像に統合する画像融合のプロセスに関する、包括的な研究論文、データセット、実装のコレクションを提供します。各画像から最も顕著な特徴を保持した合成画像を生成します。

仕組み

このプロジェクトは、主な目的と技術的アプローチに基づいて分類された、膨大な画像融合手法のライブラリを整理しています。

  • マルチモーダル融合: 紅外線(熱)画像と可視光画像など、異なるセンサー種類を統合するもので、主に目標検出や監視に使用されます。
  • デジタル写真融合: 動的範囲や焦点深度を向上させるために、多露光および多焦点融合を含みます。
  • リモートセンシング融合: 衛星画像の解像度を向上させるためのパンシャープニングをカバーします。
  • 技術フレームワーク: 卷積ニューラルネットワーク(CNN)、Transformer、生成的対抗ネットワーク(GAN)、拡散モデル、視覚言語モデル(VLM)など、さまざまなアーキテクチャを用いた手法を追跡しています。

対象読者

  • コンピュータビジョン研究者: 低レベルビジョン、画像処理、マルチモーダルデータ統合を研究している方。
  • AIエンジニア: ロボット工学、監視、医療画像処理などに向けた最先端(SOTA)の画像融合アルゴリズム実装を探している開発者。
  • 学生: 早期のオートエンコーダから現代の拡散ベースの制御可能融合まで、分野の体系的な調査を求める学習者。

特徴

  • 包括的な分類体系: 視覚指向型、意味指向型、結合登録・融合型、劣化耐性型の融合手法を分類しています。
  • VLMの統合: 大規模視覚モデルと言語駆動プロンプトを用いた制御可能画像融合の最新トレンドを追跡しています。
  • 包括的なリソース: CVPR、TPAMI、NeurIPSなど、多数の高影響力論文の論文とコードへの直接リンクを提供しています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト