chflame163/ComfyUI_LayerStyle_Advance

The nodes detached from [ComfyUI Layer Style](https://github.com/chflame163/ComfyUI_LayerStyle) are mainly those with complex requirements for dependency packages.

解決する課題

このプロジェクトは、重い依存パッケージを必要とする複雑な画像処理タスクを処理するために特別に設計された、高度なComfyUIカスタムノードセットを提供します。高品質な画像キャプション生成、視覚言語モデル(VLM)推論、および高度な画像合成機能を追加することで、ComfyUIの基本機能を拡張します。

仕組み

さまざまな専門的なAIモデルやAPIをComfyUIのノードベースのワークフローに統合します。これには以下が含まれます:

  • ローカルVLM推論: Llama 3.2 Vision、JoyCaption2、SmolVLMなどのモデルを実装し、画像からテキストへの変換タスクを実行します。
  • API統合: DeepSeek、Gemini、ZhipuGLM4、Jimengなどの外部サービスに接続し、テキストおよび視覚推論を行います。
  • 画像操作: 画像コラージュを作成するためのツールを提供し、SAM2 (Segment Anything Model 2) を利用して正確なオブジェクトマスキングを行います。
  • 専門的な処理: Florence-2などのモデルを使用して、オブジェクト認識やクロッピングを行います。

対象ユーザー

  • 画像から詳細なプロンプトを自動生成(image-to-prompt)したいComfyUIユーザー。
  • ノードベースのワークフロー内で高度なレイヤー、マスキング、画像合成ツールを必要とするデジタルアーティストやAIクリエイター。
  • 最先端のVLMやLLMを画像生成パイプラインに統合したいユーザー。

ハイライト

  • 高度なキャプション生成: JoyCaption2を搭載し、非常に詳細でカスタマイズ可能な画像説明(照明、カメラアングル、美的品質の指定など)を生成します。
  • マルチモデルサポート: Llama 3.2 Vision、Qwen、Gemini 2.0 Flashを含む、幅広いローカルおよびAPIベースのモデルをサポートしています。
  • スマート合成: コラージュノードは、Florence-2を使用して、画像グリッドを作成する際にインテリジェントなオブジェクト認識とクロッピングを行うことができます。
  • 効率的なリソース管理: モデル読み込みノードを分割(JoyCaption2Splitなど)することで、複数のノード間でモデルを共有し、VRAM使用量を削減します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト