liustack/modlens

ModLensは、DeepSeek Harness(および他のローカルAIアシスタント)用のプラグインで、テキストのみのLLMに視覚能力を追加します。ユーザーは画像をチャットに直接貼り付けます。プラグインはそれを設定可能なビジョンエンジン(Gemini、OpenAI互換、Anthropic、Antigravity CLI、Claude/Kimi CLI、またはローカルエージェント)に転送し、モデルが引用できる構造化された文字起こしを返します。インストールは単一の`npx`コマンドまたは`skills.sh`経由で、ゼロ設定のデフォルトと自動キーローテーション/フェイルオーバーを備えています。プロジェクトはMITライセンスで、重いラッパーではなく軽量な統合に焦点を当てています。

royshil/obs-backgroundremoval

物理的なグリーンバックを必要とせず、ニューラルネットワークを使用してポートレートの背景を削除し、低照度ビデオをリアルタイムで強化するOBS Studioプラグイン。

lyuwenyu/RT-DETR

検出Transformer(DETR)アーキテクチャに基づくリアルタイムオブジェクト検出フレームワーク。速度と精度の両面でYOLOモデルを上回ることを目指しています。

MaaEnd/MaaEnd

画面認識を使用して戦闘、資源収集、日常管理タスクを自動化するゲームEndfield用の自動化アシスタント。

microsoft/MoGe

MoGeは、単一のオープンドメイン画像から正確な3Dジオメトリ、特にメトリックな深度マップとポイントマップを復元するためのモデルです。

sparkjsdev/spark

THREE.js用の高度な3Dガウススプラッティングレンダラーで、スプラットベースの3Dシーンの高性能かつクロスデバイスなレンダリングを可能にします。

MaaXYZ/MaaFramework

内部APIが利用できないソフトウェアの自動化テストに特化した、画像認識を活用した低コードパイプラインプロトコルを用いた自動化フレームワーク。

beixiaocai/rebucca

YOLO検出とLLM検証を組み合わせ、構造化されたアラートを提供するマルチチャネル動画分析プラットフォーム。

davidakpele/wifi-densepose

カメラを使わずに姿勢を検出する、WiFiチャネル状態情報(CSI)と機械学習を利用したプライバシー保護型の人体姿勢推定システム。

nerfstudio-project/gsplat

3Dガウス分布のラスタライズ用にCUDA加速されたライブラリで、公式の実装と比較して、より高速でメモリ効率の高いラディアンスフィールドのレンダリング方法を提供します。

aloshdenny/reverse-SynthID

Google Gemini が生成した画像に埋め込まれた不可視の SynthID 水印を、スペクトル解析と多段階の敵対的パイプラインを用いて検出・除去するリバースエンジニアリング・プロジェクトです。

wasserth/TotalSegmentator

CTおよびMR画像における主要な解剖学的構造をセグメンテーションするための自動化ツールであり、詳細な解剖学的マスクと身体統計情報を提供します。

valkia/aramgg_client

『リーグ・オブ・レジェンズ』ARAMモード向けのWindowsデスクトップアシスタントで、チャンピオン選択のアドバイスを提供し、ゲーム内でのハクステックオーガメントをOCRで認識して最適なビルドを提案します。

google-deepmind/alphafold3

生体分子相互作用の正確な3D構造予測のための、AlphaFold 3 推論パイプラインの実装。

isl-org/Open3D

Open3Dは、点群およびメッシュの操作、可視化、3D機械学習に最適化されたツールを提供する、3Dデータ処理のためのモダンなライブラリです。

open-edge-platform/anomalib

画像や動画における視覚アノマリー検出に重点を置いた、アノマリー検出アルゴリズムのベンチマークとデプロイメントのための深層学習ライブラリ。

pynicolas/FairScan

ローカルの機械学習を活用して、自動文書検出と透視補正を行い、プライベートなPDFを作成するオープンソースのAndroid文書スキャナー。

freemocap/freemocap

高価なプロプライエタリハードウェアを必要とせず、研究レベルの追跡を提供する無料でオープンソースのモーションキャプチャプラットフォームです。

lightly-ai/lightly-train

DINOv3 や LTDETRv2 などの最先端モデルを、オブジェクト検出やセグメンテーションなどのタスク向けに事前学習、微調整、知識蒸留するためのコンピュータビジョンフレームワーク。

huggingface/pytorch-image-models

最先端のコンピュータビジョン・バックボーンと事前学習済み重みの膨大な大な集合を提供し、AIプロジェクトへの統合を容易にする、包括的なPyTorchライブラリです。

WebODM/WebODM

ドローン画像を地理的に参照されたマップ、点群、3Dモデル、ガウシアンスプラットに変換する商用グレードのソフトウェア。

ZhengPeng7/BiRefNet

BiRefNetは、さまざまな解像度の画像に対して、最先端の背景削除およびオブジェクトセグメンテーションを提供する、高解像度の二値画像セグメンテーションモデルです。

vllm-project/llm-compressor

LLM Compressor は、大規模言語モデルを `compressed-tensors` 形式に量子化・剪定する Python ライブラリで、vLLM でのメモリ効率の良いデプロイを可能にします。多くの低精度フォーマット(NVFP4、FP8、INT4 など)、複数の PTQ/GPTQ アルゴリズム、DDP およびディスクオフロードによる巨大モデル対応、人気 LLM の事前量子化チェックポイントを提供します。

NVIDIA/DLSS

NVIDIA DLSS SDK は、DX11、DX12、Vulkan に対応したゲーム向けに、高性能な画像スケーリングおよびシャープニングのツールを提供します。

opengeos/geoai

AIフレームワークと地理空間データ分析を統合し、衛星画像の処理、モデルのトレーニング、および推論のためのツールを提供するPythonパッケージ。

realsenseai/librealsense

RealSense 深度カメラ用のクロスプラットフォーム SDK。深度とカラーのストリーミングを可能にし、コンピュータビジョンやロボティクス用の校正データを提供します。

voxel51/fiftyone

視覚的なデータ探索、ラベリング、モデル評価を提供することで、高品質なコンピュータビジョンデータセットとモデルの構築を支援するオープンソースツールです。

NVlabs/Fast-FoundationStereo

知識蒸留、ニューラルアーキテクチャ探索、構造的プルーニングを活用することで、強力なゼロショット一般化を実現するリアルタイムステレオマッチングアーキテクチャのファミリー。

opendatalab/OmniDocBench

現実世界のシナリオにおけるドキュメント解析の評価に向けた包括的なベンチマークで、レイアウト検出、OCR、テーブル、数式認識のための豊富なアノテーションを備えています。

apple-aiml-research/ml-sharp

SHARPは、1秒未満で単一の画像からメトリックな3Dガウス表現を生成する高速な単眼ビュー合成ツールです。ニューラルネットワークを用いて実現しています。

Pointcept/Pointcept

様々な3Dバックボーンと自己教師あり事前学習フレームワークを統合した、点群認識研究のための強力で柔軟なコードベース。

prs-eth/Marigold

Stable Diffusionなどの事前学習済み拡散モデルを再利用して、高解像度の単眼深度、表面法線、および内在画像解析を行う条件付き生成モデルのファミリー。

roboflow/trackers

任意の検出モデルに対応する、複数のオブジェクト追跡アルゴリズムのベンチマーク実装を提供する即時接続型Pythonライブラリ。

alicevision/Meshroom

3D 再構築とコンピュータビジョン向けのノードベースのビジュアルプログラミングフレームワークで、AI とフォトグラメトリを用いて複雑なデータ処理パイプラインを構築できます。

roryclear/clearcam

任意のRTSPセキュリティカメラにオブジェクト検出、追跡、AI生成のイベント要約機能を追加するAI駆動のNVRシステムです。

Tencent/YOLO-Master

シーンの複雑さに応じて計算を動的に割り当てるMixture-of-Experts(MoE)を活用した、リアルタイム物体検出向けのYOLOスタイルフレームワーク。より高い精度と低いレイテンシを実現。

vietanhdev/anylabeling

YOLOv8 と Segment Anything を統合し、コンピュータビジョンデータセットに自動ラベル付けを提供するための AI 駆動型画像アノテーションツール。

facebookresearch/map-anything

単一のTransformerモデルを使用して、さまざまな入力の組み合わせから複数の3Dタスクを処理する、ユニバーサルなメトリック3D再構成のためのオープンソース研究フレームワーク。

Breakthrough/PySceneDetect

シーン変化を自動的に識別して、動画を個々のショットに分割するか、フレームを抽出するための動画カット検出・分析ツール。

google/GNM

GNM Headから始まる、人間の形状と外見を高精度に表現するための、パラメトリック統計的3D人間モデルのファミリー。

kornia/kornia

PyTorch向けの微分可能なコンピュータビジョンライブラリで、古典的な画像処理および幾何学的ビジョンアルゴリズムをディープラーニングパイプラインに統合します。

Audiveris/audiveris

オープンソースの光学楽譜認識(OMR)アプリケーションで、楽譜画像を再生・編集可能な記号的デジタル形式に変換します。

datalab-to/surya

91言語をカバーする高精度なテキスト認識、レイアウト分析、テーブル抽出を実現する650MパラメータのOCRモデル。

torinmb/mediapipe-touchdesigner

外部のインストールを必要とせず、リアルタイムのコンピュータビジョンタスク(ポーズや手のトラッキングなど)を実行できる、GPUアクセラレーテッドなMediaPipeプラグイン。

Faceplugin-ltd/Open-Source-Face-Recognition-SDK

WindowsおよびLinux向けのオープンソースの顔認識SDKで、ディープラーニングを使用してオンプレミスでの顔検出、ランドマーク検出、類似性比較を提供します。

1bananachicken/MaaNTE

ゲーム *異環* (The Ring) の反復プレイやミニゲームを、画像認識と音声認識を使って自動化するツールです。

pixpark/gpupixel

OpenGL/ES を使用した高パフォーマンスでクロスプラットフォーム対応の C++ ライブラリ。画像および動画のビューティフィルタを実装。

ucam-eo/tessera

TESSERAは、雲によって破損した衛星時系列データを、地球の表現と分析のためのコンパクトな128次元の埋め込みに変換するオープンな地理空間基盤モデルです。