liustack/modlens
ModLensは、DeepSeek Harness(および他のローカルAIアシスタント)用のプラグインで、テキストのみのLLMに視覚能力を追加します。ユーザーは画像をチャットに直接貼り付けます。プラグインはそれを設定可能なビジョンエンジン(Gemini、OpenAI互換、Anthropic、Antigravity CLI、Claude/Kimi CLI、またはローカルエージェント)に転送し、モデルが引用できる構造化された文字起こしを返します。インストールは単一の`npx`コマンドまたは`skills.sh`経由で、ゼロ設定のデフォルトと自動キーローテーション/フェイルオーバーを備えています。プロジェクトはMITライセンスで、重いラッパーではなく軽量な統合に焦点を当てています。
royshil/obs-backgroundremoval
物理的なグリーンバックを必要とせず、ニューラルネットワークを使用してポートレートの背景を削除し、低照度ビデオをリアルタイムで強化するOBS Studioプラグイン。
lyuwenyu/RT-DETR
検出Transformer(DETR)アーキテクチャに基づくリアルタイムオブジェクト検出フレームワーク。速度と精度の両面でYOLOモデルを上回ることを目指しています。
MaaEnd/MaaEnd
画面認識を使用して戦闘、資源収集、日常管理タスクを自動化するゲームEndfield用の自動化アシスタント。
microsoft/MoGe
MoGeは、単一のオープンドメイン画像から正確な3Dジオメトリ、特にメトリックな深度マップとポイントマップを復元するためのモデルです。
sparkjsdev/spark
THREE.js用の高度な3Dガウススプラッティングレンダラーで、スプラットベースの3Dシーンの高性能かつクロスデバイスなレンダリングを可能にします。
MaaXYZ/MaaFramework
内部APIが利用できないソフトウェアの自動化テストに特化した、画像認識を活用した低コードパイプラインプロトコルを用いた自動化フレームワーク。
beixiaocai/rebucca
YOLO検出とLLM検証を組み合わせ、構造化されたアラートを提供するマルチチャネル動画分析プラットフォーム。
davidakpele/wifi-densepose
カメラを使わずに姿勢を検出する、WiFiチャネル状態情報(CSI)と機械学習を利用したプライバシー保護型の人体姿勢推定システム。
nerfstudio-project/gsplat
3Dガウス分布のラスタライズ用にCUDA加速されたライブラリで、公式の実装と比較して、より高速でメモリ効率の高いラディアンスフィールドのレンダリング方法を提供します。
aloshdenny/reverse-SynthID
Google Gemini が生成した画像に埋め込まれた不可視の SynthID 水印を、スペクトル解析と多段階の敵対的パイプラインを用いて検出・除去するリバースエンジニアリング・プロジェクトです。
wasserth/TotalSegmentator
CTおよびMR画像における主要な解剖学的構造をセグメンテーションするための自動化ツールであり、詳細な解剖学的マスクと身体統計情報を提供します。
valkia/aramgg_client
『リーグ・オブ・レジェンズ』ARAMモード向けのWindowsデスクトップアシスタントで、チャンピオン選択のアドバイスを提供し、ゲーム内でのハクステックオーガメントをOCRで認識して最適なビルドを提案します。
google-deepmind/alphafold3
生体分子相互作用の正確な3D構造予測のための、AlphaFold 3 推論パイプラインの実装。
isl-org/Open3D
Open3Dは、点群およびメッシュの操作、可視化、3D機械学習に最適化されたツールを提供する、3Dデータ処理のためのモダンなライブラリです。
open-edge-platform/anomalib
画像や動画における視覚アノマリー検出に重点を置いた、アノマリー検出アルゴリズムのベンチマークとデプロイメントのための深層学習ライブラリ。
pynicolas/FairScan
ローカルの機械学習を活用して、自動文書検出と透視補正を行い、プライベートなPDFを作成するオープンソースのAndroid文書スキャナー。
freemocap/freemocap
高価なプロプライエタリハードウェアを必要とせず、研究レベルの追跡を提供する無料でオープンソースのモーションキャプチャプラットフォームです。
lightly-ai/lightly-train
DINOv3 や LTDETRv2 などの最先端モデルを、オブジェクト検出やセグメンテーションなどのタスク向けに事前学習、微調整、知識蒸留するためのコンピュータビジョンフレームワーク。
huggingface/pytorch-image-models
最先端のコンピュータビジョン・バックボーンと事前学習済み重みの膨大な大な集合を提供し、AIプロジェクトへの統合を容易にする、包括的なPyTorchライブラリです。
WebODM/WebODM
ドローン画像を地理的に参照されたマップ、点群、3Dモデル、ガウシアンスプラットに変換する商用グレードのソフトウェア。
ZhengPeng7/BiRefNet
BiRefNetは、さまざまな解像度の画像に対して、最先端の背景削除およびオブジェクトセグメンテーションを提供する、高解像度の二値画像セグメンテーションモデルです。
vllm-project/llm-compressor
LLM Compressor は、大規模言語モデルを `compressed-tensors` 形式に量子化・剪定する Python ライブラリで、vLLM でのメモリ効率の良いデプロイを可能にします。多くの低精度フォーマット(NVFP4、FP8、INT4 など)、複数の PTQ/GPTQ アルゴリズム、DDP およびディスクオフロードによる巨大モデル対応、人気 LLM の事前量子化チェックポイントを提供します。
NVIDIA/DLSS
NVIDIA DLSS SDK は、DX11、DX12、Vulkan に対応したゲーム向けに、高性能な画像スケーリングおよびシャープニングのツールを提供します。
opengeos/geoai
AIフレームワークと地理空間データ分析を統合し、衛星画像の処理、モデルのトレーニング、および推論のためのツールを提供するPythonパッケージ。
realsenseai/librealsense
RealSense 深度カメラ用のクロスプラットフォーム SDK。深度とカラーのストリーミングを可能にし、コンピュータビジョンやロボティクス用の校正データを提供します。
voxel51/fiftyone
視覚的なデータ探索、ラベリング、モデル評価を提供することで、高品質なコンピュータビジョンデータセットとモデルの構築を支援するオープンソースツールです。
NVlabs/Fast-FoundationStereo
知識蒸留、ニューラルアーキテクチャ探索、構造的プルーニングを活用することで、強力なゼロショット一般化を実現するリアルタイムステレオマッチングアーキテクチャのファミリー。
opendatalab/OmniDocBench
現実世界のシナリオにおけるドキュメント解析の評価に向けた包括的なベンチマークで、レイアウト検出、OCR、テーブル、数式認識のための豊富なアノテーションを備えています。
apple-aiml-research/ml-sharp
SHARPは、1秒未満で単一の画像からメトリックな3Dガウス表現を生成する高速な単眼ビュー合成ツールです。ニューラルネットワークを用いて実現しています。
Pointcept/Pointcept
様々な3Dバックボーンと自己教師あり事前学習フレームワークを統合した、点群認識研究のための強力で柔軟なコードベース。
prs-eth/Marigold
Stable Diffusionなどの事前学習済み拡散モデルを再利用して、高解像度の単眼深度、表面法線、および内在画像解析を行う条件付き生成モデルのファミリー。
roboflow/trackers
任意の検出モデルに対応する、複数のオブジェクト追跡アルゴリズムのベンチマーク実装を提供する即時接続型Pythonライブラリ。
alicevision/Meshroom
3D 再構築とコンピュータビジョン向けのノードベースのビジュアルプログラミングフレームワークで、AI とフォトグラメトリを用いて複雑なデータ処理パイプラインを構築できます。
roryclear/clearcam
任意のRTSPセキュリティカメラにオブジェクト検出、追跡、AI生成のイベント要約機能を追加するAI駆動のNVRシステムです。
Tencent/YOLO-Master
シーンの複雑さに応じて計算を動的に割り当てるMixture-of-Experts(MoE)を活用した、リアルタイム物体検出向けのYOLOスタイルフレームワーク。より高い精度と低いレイテンシを実現。
vietanhdev/anylabeling
YOLOv8 と Segment Anything を統合し、コンピュータビジョンデータセットに自動ラベル付けを提供するための AI 駆動型画像アノテーションツール。
facebookresearch/map-anything
単一のTransformerモデルを使用して、さまざまな入力の組み合わせから複数の3Dタスクを処理する、ユニバーサルなメトリック3D再構成のためのオープンソース研究フレームワーク。
Breakthrough/PySceneDetect
シーン変化を自動的に識別して、動画を個々のショットに分割するか、フレームを抽出するための動画カット検出・分析ツール。
google/GNM
GNM Headから始まる、人間の形状と外見を高精度に表現するための、パラメトリック統計的3D人間モデルのファミリー。
kornia/kornia
PyTorch向けの微分可能なコンピュータビジョンライブラリで、古典的な画像処理および幾何学的ビジョンアルゴリズムをディープラーニングパイプラインに統合します。
Audiveris/audiveris
オープンソースの光学楽譜認識(OMR)アプリケーションで、楽譜画像を再生・編集可能な記号的デジタル形式に変換します。
datalab-to/surya
91言語をカバーする高精度なテキスト認識、レイアウト分析、テーブル抽出を実現する650MパラメータのOCRモデル。
torinmb/mediapipe-touchdesigner
外部のインストールを必要とせず、リアルタイムのコンピュータビジョンタスク(ポーズや手のトラッキングなど)を実行できる、GPUアクセラレーテッドなMediaPipeプラグイン。
Faceplugin-ltd/Open-Source-Face-Recognition-SDK
WindowsおよびLinux向けのオープンソースの顔認識SDKで、ディープラーニングを使用してオンプレミスでの顔検出、ランドマーク検出、類似性比較を提供します。
1bananachicken/MaaNTE
ゲーム *異環* (The Ring) の反復プレイやミニゲームを、画像認識と音声認識を使って自動化するツールです。
pixpark/gpupixel
OpenGL/ES を使用した高パフォーマンスでクロスプラットフォーム対応の C++ ライブラリ。画像および動画のビューティフィルタを実装。
ucam-eo/tessera
TESSERAは、雲によって破損した衛星時系列データを、地球の表現と分析のためのコンパクトな128次元の埋め込みに変換するオープンな地理空間基盤モデルです。