ruvnet/RuView
カメラやウェアラブル機器、クラウド接続なしで、人の存在、生命体徴、ポーズを推定するWiFiセンシングプラットフォーム。
roboflow/supervision
データロード、可視化、およびデータセット管理のためのモデルに依存しないビルディングブロックを提供する、コンピュータビジョンツールキットです。ビジョン・アプリケーションの開発を加速させます。
immich-app/immich
AI駆動の顔認識とCLIPベースの検索を備えた、高パフォーマンスな自己ホスティング型写真・動画管理ソリューション。
img2threejs/img2threejs
img2threejs は、LLM が単一の参照画像からプロシージャルな Three.js モデルを作成できるようにする Python バックエンドのスキルです。Spec を作成し、ゲート付きの視覚的レビュー・ループを実行し、プリミティブとシェーダーからオブジェクトを再構築する TypeScript コードを生成し、アニメーションーション可能な状態にしています。システムはドメイン・プラグイン (例: CS2 weapon skins) を通じて拡張可能であり、ライブ・デモ・ギャラリーが含まれています。
baidu/Unlimited-OCR
複数ページの複雑なドキュメント、PDF、マルチページ画像のワンショット長距離解析向けマルチモーダルOCRモデル。
PaddlePaddle/PaddleOCR
PaddleOCRは、画像やPDFを構造化されたLLM対応テキスト、表、Markdown/JSONに変換するオープンソースのOCRおよびドキュメントAIツールキットです。PP-OCRv6による多言語シーンテキスト認識モデルと、PaddleOCR-VL / PP-StructureV3による軽量な視覚言語モデルを提供し、最先端の精度、高速なCPU/GPU推論、DockerからブラウザSDKまで幅広いデプロイオプションを備えています。DifyやRAGFlowなどのRAGプラットフォームと統合されており、AIエージェントや検索拡張生成パイプラインのデータエンジンとして活用されます。
om-ai-lab/VLX-Seek
VLX‑Seek は、エッジデバイスエージェント向けのオープンソース視覚言語モデルです。細粒度の認識を実現し、領域提案を生成し、各領域を特別なトークンにエンコードし、言語モデルがこれらのトークンを選択することで、検出、参照表現理解、OCR、数え上げ、VQA などのタスクに適したコンパクトで解析可能な出力を生成します。リポジトリには推論コード、Python API、および 10 B チェックポイント(Hugging Face にホスト)が含まれます。
huawei-bayerlab/marigold-v2
Marigold V2 は、事前学習済みの拡散変換器(Qwen‑Image‑Edit‑2509)を再利用し、単眼深度、透過深度、表面法線、アルベドのための高速で単一ステップの予測器に変換する研究用コードベースです。1台の32 GB GPUで約5日間の低コストファインチューニングが可能で、最先端のベンチマーク結果を達成し、即座に利用可能な推論/評価スクリプト、および新しい密なビジョンタスクに拡張可能なモジュール式YAML駆動型学習フレームワークを提供しています。
playcanvas/supersplat
3D Gaussian Splats を検査、編集、および最適化するためのブラウザベースのオープンソースツールです。
ultralytics/ultralytics
リアルタイムの物体検出、セグメンテーション、分類、姿勢推定のためのYOLOモデルを特徴とする包括的なコンピュータビジョンフレームワーク。
blakeblackshear/frigate
Home Assistant と密接に統合された、IPカメラ向けのローカルNVRで、リアルタイムAI物体検出を実現。
julyx10/lap
macOS、Windows、Linux向けのプライベートでローカル最優先の写真管理ツール。クラウドアップロードを必要とせず、ローカルAIを活用して検索と顔クラスタリングを実現。
viettranx/3dviz-pro-max
3Dviz Pro Maxは、大規模言語モデルが自然言語の記述を完全なThree.jsシーンに変換できるAIエージェントスキルです。10ステップのワークフロー、223のレシピカタログ、22の検証済みThree.jsキットブループリント、スタイルデフォルト、およびPythonヘルパーを提供し、ヘッドレスChromiumでシーンをレンダリングし、PNGフレームをキャプチャしてモデルにフィードバックします。Claude CodeまたはCodexに`skills/3dviz-pro-max/`フォルダをリンクしてインストールし、Viteでバンドルされた37の実行可能なデモを実行します。プロジェクトはMITライセンスで、完全なレンダリングを主張するのではなく、再現可能で証拠に基づく3D可視化に焦点を当てています。
wilsjo2/OptiScaler-DLSSNR-PreSR-Multipass
NVIDIA AI を使用して、対応ゲームの照明、詳細、色を強化するゲームMODで、カスタマイズ可能なニューラルレンダリング効果を提供します。
ooolabdev/ooosplat
ローカルのデスクトップアプリで、周囲視野動画または画像シーケンスを、自動化されたローカルパイプラインを通じて3Dガウススプラッティングモデルに変換します。
amap-cvlab/ABot-Recon
ABot-Reconは、長時間の動画ストリームからグローバルな軌道とポイントクラウドを構築するために、固定された12フレームの局所コンテキストを使用するストリーミング3D再構成システムであり、長距離の持続的メモリを必要としない。
MaaAssistantArknights/MaaAssistantArknights
画像認識とOCRを活用して、日常タスク、資源農場、拠点管理を自動化するアーネイツ用の自動化アシスタント。
gazijarin/itsgiving
リアルタイムで顔の表情や手のジェスチャーを検出し、それに応じてミームオーバーレイをトリガーするウェブカメラアプリ。ビデオ通話で使用可能なバーチャルカメラを備えています。
facebookresearch/vggt-omega
VGGT-Omegaは、画像からカメラの姿勢と深度を予測するコンピュータビジョンモデルであり、3Dシーンの再構成を可能にする。
ika-rwth-aachen/ros2-depth-anything-v3-trt
Depth Anything V3とTensorRT加速を用いたリアルタイムメトリック深度推定およびポイントクラウド生成のためのROS 2ノード。
tesseract-ocr/tesseract
Tesseractは、100以上の言語に対応するテキスト画像からマシンリーダブルなテキストへの変換を行う、オープンソースのOCRエンジンおよびコマンドラインツールです。
StarTrail-org/PixelRAG
PixelRAGは、Webページ、PDF、画像をスクリーンショットタイルにレンダリングし、視覚言語モデルで埋め込み、FAISS/Qdrantでベクトルインデックスを構築。その後、LLMが視覚的レイアウトに基づいて情報を取得できる検索API(またはClaudeプラグイン)を提供します。
harry7557558/spirula-studio
Python、PyTorch、COLMAPを必要とせず、写真や動画を3Dモデルに変換する自己完結型の3D Gaussian Splattingパイプライン。
hacksider/Deep-Live-Cam
1枚のソース画像を使用して、動画やライブWebカメラ映像の顔をリアルタイムで交換するディープフェイクツールです。
agamrossen/VolAnti
無線信号ではなく、プロペラの高調波音によってマルチローター・ドローンを検出するオープンソースの音響ドローン検出システム。
ace-trump-tech/DeltaForce-OBS-Locker
YOLOv14を用いたリアルタイムオブジェクト検出とターゲットロックシステム。環境の誤検出をフィルタリングし、Delta Forceゲーム内のキャラクターを識別する。
ocrmypdf/OCRmyPDF
スキャンされた PDF に OCR テキストレイヤーを追加するコマンドラインツールで、画像品質を維持しながら検索可能かつコピー&ペースト可能なドキュメントにします。
colmap/colmap
COLMAP は、写真のコレクションを自動的に 3D モデルに変換するオープンソースの構造から運動(SfM)およびマルチビュー ステレオ(MVS)パイプラインです。GUI、コマンドラインツール、Python バインディング、GPU による特徴抽出、クロスプラットフォームバイナリを備えており、コンピュータビジョン、ロボティクス、AR/VR、カメラポーズと密なシーン幾何学が必要なあらゆるワークフローにおいて、研究や応用の基盤として広く使われています。
Robbyant/lingbot-map
LingBot‑Map は、Geometric Context Transformer を通じてビデオフレームをストリーミングし、ページ化されたKVキャッシュ(FlashInfer)を用いてメモリを低く抑えるフィードフォワード3D再構成モデルです。中程度のGPUで約20 fpsで動作し、キーフレーム間隔またはウィンドウ化推論により非常に長いシーケンスをサポート。HuggingFace/ModelScopeに事前学習済みチェックポイントを含み、実行可能なデモとオフラインバッチレンダラを同梱しています。
opencv/opencv
OpenCVは、AIおよび視覚知覚開発のためのツールとアルゴリズムを提供するオープンソースのコンピュータビジョンライブラリです。
RapidAI/RapidOCR
PaddleOCRモデルをONNX形式に変換し、複数のプラットフォームと言語で高速でリソース消費が少ないオフラインデプロイメントを実現するオープンソースOCRツール。
roboflow/rf-detr
RF‑DETR は、DINOv2 バックボーンに基づくリアルタイムトランスフォーマー基盤のビジョンモデルセット(検出、セグメンテーション、キーポイント)です。`rfdetr` Python パッケージとして提供され、Nano‑2XL の複数サイズバリアントを備え、コア部分は Apache‑2.0、XL/2XL は PML 1.0 ライセンスで利用可能です。COCO および RF100‑VL における最先端の精度‑レイテンシトレードオフを示すベンチマークテーブルを含みます。インストールは `pip install rfdetr` で行い、`model.predict(...)` 1 行で使用可能。`supervision` ライブラリでオプションの可視化も可能。Roboflow プラットフォームではカスタムアーキテクチャ探索用の NAS パイプラインも提供されています。
facebookresearch/sam3
SAM 3(Concepts with Segment Anything)は、Metaの848Mパラメータの基礎モデルで、自由なテキスト(または視覚的例)で画像や動画にプロンプトを送信し、*すべての一致するオブジェクト*に対してマスク、ボックス、スコアを返すことができます。DETRスタイルの検出器とSAM 2スタイルの追跡器を統合し、細かいプロンプトの区別に役立つプレゼンストークンを導入。400万以上もの自動アノテーションされた概念で訓練されており、27万概念の新しいSA‑COベンチマークを提供。リポジトリにはインストール手順、例ノートブック、評価用の新ベンチマークが含まれます。
cvat-ai/cvat
コンピュータビジョンのための高品質な視覚的データセットを構築するための、オープンソースのデータアノテーションプラットフォームです。画像、動画、3Dアノテーションをサポートしています。
aoguai/LiYing
AIを使用して顔検出、背景置換、レイアウト配置を行い、プロフェッショナル品質の証明写真を作成する自動ID写真処理ツール。
jeremyipark/vision-demos
vision‑demosは、最先端の姿勢推定(`vitpose-plus-large`)とセグメンテーション(`sam3.1`)モデルを日常の活動に適用する4つの具体的なPythonデモのセットです。ダンスの同期、チンアップのカウント、ボウルディングルートの分析、ランニングカデンスの測定が含まれます。各デモにはREADME、セットアップ手順、視覚的な例が含まれており、リポジトリ全体はApache‑2.0の下でリリースされています。
deepinsight/insightface
2Dおよび3Dのディープフェイス解析用具として、顔認識、顔検出、顔のアライメント用として、最先端のアルゴリズムを提供。
ultralytics/yolov5
YOLOv5は、Ultralyticsが提供するPyTorchベースのオープンソースの物体検出/セグメンテーション/分類モデルスイートです。複数のモデルサイズ、簡単なPython/CLI推論、1行のコマンドでのトレーニング、および多くの展開展開用フォーマットへのエクスポートが可能です。
yakhyo/uniface
UniFaceは、15種類の顔分析タスク(検出、ランドマーク、3Dメッシュ、解析、マッティング、注視、頭部姿勢、人口統計、感情、品質、アンチスプーフィング、認識、匿名化、およびFAISSベースの類似度検索)を、単一のインストールが容易なパッケージ(CPU, Apple Silicon, または CUDA)に統合したPythonライブラリです。一貫貫したAPI、自動モデル重みのダウンロード、豊富なドキュメント、ノートブック、およびコミュニティDiscordを提供します。
oncologylab/histopia
連続断面ヒストロジーおよびプロテオミクス画像の解析を支援する計算研究ツールで、組織断面間で3D再構成と空間トポロジー解析を可能にします。
MrNeRF/LichtFeld-Studio
トレーニング、リアルタイム可視化、編集、エクスポートを1つのネイティブアプリケーションで統合するモジュール式のワークステーション。
jayin92/Skyfall-GS
Skyfall-GS は、衛星画像から得られるジオメトリ情報と diffusion モデルによる高品質テクスチャを組み合わせて、大規模で没入感のある 3D 都市シーンを合成するフレームワークです。
ArthurBrussee/brush
WebGPUとBurnフレームワークを使用したクロスプラットフォーム3D再構築エンジン。macOS、Windows、Linux、Android、およびブラウザで動作します。
serengil/deepface
顔認識と顔属性分析のための軽量なPythonフレームワークで、複数の最先端モデルをラップし、本人確認と人口統計予測を行います。
pq-yang/MatAnyone2
実世界の状況下でも高い堅牢性を発揮し、髪の毛やエッジなどの細部を保持する人物を動画から抽出するためのマッティングフレームワークです。
facebookresearch/boxer
Boxerは、ポーズ付き画像と準密な点群を活用して、オープンワールドの2Dオブジェクト検出を室内シーンの3Dオリエンテッドバウンディングボックスに引き上げるシステムです。
ByteDance-Seed/Depth-Anything-3
単一または複数の画像から空間的に一貫した3Dジオメトリ、深度マップ、カメラポーズを、統一された深度-レイ表現を用いて予測するモデル。
microsoft/OmniParser
GUIスクリーンショットを構造化された要素に変換するスクリーン解析ツールで、視覚ベースのAIエージェントがインターフェースコンポーネントを正確に識別し、操作できるようにします。