gazijarin/itsgiving
リアルタイムで顔の表情や手のジェスチャーを検出し、それに応じてミームオーバーレイをトリガーするウェブカメラアプリ。ビデオ通話で使用可能なバーチャルカメラを備えています。
img2threejs/img2threejs
img2threejs は、LLM が単一の参照画像からプロシージャルな Three.js モデルを作成できるようにする Python バックエンドのスキルです。Spec を作成し、ゲート付きの視覚的レビュー・ループを実行し、プリミティブとシェーダーからオブジェクトを再構築する TypeScript コードを生成し、アニメーションーション可能な状態にしています。システムはドメイン・プラグイン (例: CS2 weapon skins) を通じて拡張可能であり、ライブ・デモ・ギャラリーが含まれています。
ruvnet/RuView
カメラやウェアラブル機器、クラウド接続なしで、人の存在、生命体徴、ポーズを推定するWiFiセンシングプラットフォーム。
PaddlePaddle/PaddleOCR
PaddleOCR は、画像や PDF を構造化された LLM 用の JSON または Markdown に変換するオープンソースの OCR および Document‑AI ツールキットです。多言語シーンテキストモデル (PP‑OCRv6)、表、数式、および古文書のための軽量 Vision‑Language 解析器 (PaddleOCR‑VL‑1.6)、および構造化パイプライン (PP‑StructureV3) を提供します。モデルは CPU, GPU, XPU, NPU または ONNX/TensorRT 経由で動作し、Dify や RAGFlow といった RAG/エージェントプラットフォームと連携可能です。
immich-app/immich
AI駆動の顔認識とCLIPベースの検索を備えた、高パフォーマンスな自己ホスティング型写真・動画管理ソリューション。
roboflow/rf-detr
RF-DETR は、DINOv2 バックボーン上に構築されたリアルタイム トランスフォーマー アーキテクチャで、物体検出、インスタンス セグメンテーション、およびキーポイント検出に使用されます。
baidu/Unlimited-OCR
複数ページの複雑なドキュメント、PDF、マルチページ画像のワンショット長距離解析向けマルチモーダルOCRモデル。
julyx10/lap
ローカルAIを活用した検索と顔認識により、プライバシーを重視したクラウド写真サービスの代替となるオープンソースでローカルファーストの写真管理ツール。
ultralytics/ultralytics
リアルタイムの物体検出、セグメンテーション、分類、およびポーズ推定のためにYOLOモデルを実装する、高性能なコンピュータビジョンフレームワーク。
MaaAssistantArknights/MaaAssistantArknights
画像認識とOCRを活用して、日常タスク、資源農場、拠点管理を自動化するアーネイツ用の自動化アシスタント。
amap-cvlab/ABot-Recon
ABot-Reconは、長時間の動画ストリームから、恒常的な長距離メモリを必要とせずに、効率的にグローバルな軌道とポイントクラウドを構築するストリーミング3D再構成システムです。固定の12フレームの局所コンテキストを使用しています。
om-ai-lab/VLX-Seek
VLX‑Seek は、エッジデバイスエージェント向けのオープンソース視覚言語モデルです。細粒度の認識を実現し、領域提案を生成し、各領域を特別なトークンにエンコードし、言語モデルがこれらのトークンを選択することで、検出、参照表現理解、OCR、数え上げ、VQA などのタスクに適したコンパクトで解析可能な出力を生成します。リポジトリには推論コード、Python API、および 10 B チェックポイント(Hugging Face にホスト)が含まれます。
blakeblackshear/frigate
Home Assistant と密接に統合された、IPカメラ向けのローカルNVRで、リアルタイムAI物体検出を実現。
ooolabdev/ooosplat
ローカルのデスクトップアプリで、周囲視野動画または画像シーケンスを、自動化されたローカルパイプラインを通じて3Dガウススプラッティングモデルに変換します。
Faceplugin-ltd/Open-Source-Face-Recognition-SDK
WindowsおよびLinux向けのオープンソースの顔認識SDKで、ディープラーニングを使用してオンプレミスでの顔検出、ランドマーク検出、類似性比較を提供します。
MaaXYZ/MaaFramework
内部APIが利用できないソフトウェアの自動化テストに特化した、画像認識を活用した低コードパイプラインプロトコルを用いた自動化フレームワーク。
hacksider/Deep-Live-Cam
1枚のソース画像を使用して、動画やライブWebカメラ映像の顔をリアルタイムで交換するディープフェイクツールです。
tesseract-ocr/tesseract
Tesseractは、100以上の言語に対応するテキスト画像からマシンリーダブルなテキストへの変換を行う、オープンソースのOCRエンジンおよびコマンドラインツールです。
Yuliang-Liu/MonkeyOCRv2
MonkeyOCRv2 は、Document AI 向けのオープンソース視覚テキスト基盤モデルです。ViT ベースのビジョンエンコーダーと多言語解析・理解ヘッド(約 0.6-1.8 B パラメータ)を搭載し、17 言語の OCR、レイアウト解析、VQA、数式認識において最先端のスコアを達成しています。モデルは Hugging Face/ModelScope で利用可能で、Transformers や vLLM で実行でき(CPU サポートと DFlash アクセラレーションはオプション)、大規模な MonkeyDoc v2 事前学習データセットが付属しています。
facebookresearch/vggt-omega
VGGT-Omegaは、画像からカメラの姿勢と深度を予測するコンピュータビジョンモデルであり、3Dシーンの再構成を可能にする。
Robbyant/lingbot-map
動画からリアルタイムに点群とカメラ軌道を生成できるフィードフォワード型3Dファウンデーションモデル。
roboflow/supervision
データ読み込み、可視化、データセット管理のためのモデルに依存しないビルディングブロックを提供し、ビジョンアプリケーションの開発を加速させるコンピュータビジョンツールキット。
opencv/opencv
OpenCVは、AIおよび視覚知覚開発のためのツールとアルゴリズムを提供するオープンソースのコンピュータビジョンライブラリです。
ace-trump-tech/DeltaForce-OBS-Locker
YOLOv14を用いたリアルタイムオブジェクト検出とターゲットロックシステム。環境の誤検出をフィルタリングし、Delta Forceゲーム内のキャラクターを識別する。
MaaEnd/MaaEnd
ゲーム Endfield のための自動化アシスタントで、画面認識を使用して戦闘、資源農業、毎日の管理タスクを自動化します。
RapidAI/RapidOCR
PaddleOCRモデルをONNX形式に変換し、複数のプラットフォームと言語で高速でリソース消費が少ないオフラインデプロイメントを実現するオープンソースOCRツール。
deepinsight/insightface
2Dおよび3Dのディープフェイス解析用具として、顔認識、顔検出、顔のアライメント用として、最先端のアルゴリズムを提供。
playcanvas/supersplat
3D Gaussian Splats を検査、編集、最適化、および公開するための、ブラウザベースのオープンソースエディタ。
duy-phamduc68/TrafficLab-3D
コンピュータビジョンとカスタムキャリブレーションパイプラインを使用して、CCTV映像と衛星地図から3Dデジタルツインを生成するエンドツーエンドの交通分析ツールキット。
BigBodyCobain/Shadowbroker
60以上のリアルタイムOSINTフィードを統合し、グローバルな脅威監視用に1つのマップインターフェースに集約する分散型地理空間インテリジェンスプラットフォーム。
harry7557558/spirula-studio
Python や PyTorch を必要とせず、写真や動画を 3D スプラットおよびメッシュに変換する自己完結型の 3D ガウシアンスプラッティングパイプライン。
oncologylab/histopia
連続断面ヒストロジーおよびプロテオミクス画像の解析を支援する計算研究ツールで、組織断面間で3D再構成と空間トポロジー解析を可能にします。
facebookresearch/sam3
SAM 3(Concepts with Segment Anything)は、Metaの848Mパラメータの基礎モデルで、自由なテキスト(または視覚的例)で画像や動画にプロンプトを送信し、*すべての一致するオブジェクト*に対してマスク、ボックス、スコアを返すことができます。DETRスタイルの検出器とSAM 2スタイルの追跡器を統合し、細かいプロンプトの区別に役立つプレゼンストークンを導入。400万以上もの自動アノテーションされた概念で訓練されており、27万概念の新しいSA‑COベンチマークを提供。リポジトリにはインストール手順、例ノートブック、評価用の新ベンチマークが含まれます。
ByteDance-Seed/Depth-Anything-3
単一または複数の画像から空間的に一貫した3Dジオメトリ、深度マップ、カメラポーズを、統一された深度-レイ表現を用いて予測するモデル。
roflcoopter/viseron
自宅やオフィスの監視に最適な、自己ホスト型でローカル専用のNVRおよびAIコンピュータビジョンソフトウェア。オブジェクトと顔認識を備えています。
ocrmypdf/OCRmyPDF
スキャンされた PDF に OCR テキストレイヤーを追加するコマンドラインツールで、画像品質を維持しながら検索可能かつコピー&ペースト可能なドキュメントにします。
freemocap/freemocap
高価なプロプライエタリハードウェアを必要とせず、研究レベルの追跡を提供する無料でオープンソースのモーションキャプチャプラットフォームです。
colmap/colmap
画像コレクションから3D構造を再構築するための汎用的なStructure-from-MotionおよびMulti-View Stereoパイプライン。
suzuran0y/CCTV-Smartphone-AI-Monitoring
SentinelはオープンソースのLAN専用システムで、Androidスマートフォンをリアルタイムカメラノード、Python/FlaskベースのPCサーバーをライブプレビュー、セグメント録画、AIトリガー監視ダッシュボードに変換します。モーション検出により外部ビジョンモデルを呼び出し、構造化されたJSONイベントを出力し、すべてのデータをローカルに保持することで、プライバシー重視の監視やデータ収集研究に最適です。
nerfstudio-project/gsplat
3Dガウス分布のラスタライズ用にCUDA加速されたライブラリで、公式の実装と比較して、より高速でメモリ効率の高いラディアンスフィールドのレンダリング方法を提供します。
cvat-ai/cvat
コンピュータビジョンのための高品質な視覚的データセットを構築するための、オープンソースのデータアノテーションプラットフォームです。画像、動画、3Dアノテーションをサポートしています。
beixiaocai/rebucca
YOLO検出とLLM検証を組み合わせ、構造化されたアラートを提供するマルチチャネル動画分析プラットフォーム。
microsoft/MoGe
MoGeは、単一のオープンドメイン画像から正確な3Dジオメトリ、特にメトリックな深度マップとポイントマップを復元するためのモデルです。
datalab-to/surya
91言語をカバーする高精度なテキスト認識、レイアウト分析、テーブル抽出を実現する650MパラメータのOCRモデル。
open-edge-platform/anomalib
画像および動画内の欠陥を識別・局所化するための、ベンチマーク、開発、デプロイに適したディープラーニングライブラリ。
mkturkcan/DART
TensorRTの最適化と蒸留されたバックボーンを使用して、SAM3をリアルタイムのマルチクラス・オープンボキャブラリー検出器に変換する、トレーニング不要のフレームワーク。
sparkjsdev/spark
THREE.js 用の高度な 3D Gaussian Splatting レンダラー。幅広いデバイス サポートにより、Web 上で高性能かつフォトリアルな 3D シーンを実現します。
ZhengPeng7/BiRefNet
BiRefNetは、さまざまな解像度の画像に対して、最先端の背景削除およびオブジェクトセグメンテーションを提供する、高解像度の二値画像セグメンテーションモデルです。