google/cameratrapai

オブジェクト検出器と種分類器を使用して、カメラトラップ画像における野生生物種の分類を自動化するAIモデルのアンサンブルです。

mprib/caliscope

3Dモーションキャプチャ向けのマルチカメラキャリブレーションツールで、カメラの内在パラメータと空間位置を推定し、正確な3D三角測量を可能にする。

linwhitehat/ET-BERT

事前学習と微調整を通じてデータグラムの文脈的関係を学ぶ、暗号化ネットワークトラフィック分類のTransformerベースのモデル

allenv0/AirPosture

AirPodsのヘッドトラッキングとローカルAIを使用して、首の負担を軽減するためのリアルタイムな姿勢コーチングと通知を提供するiOSアプリ。

LiteReality/LiteReality

LiteRealityは、モバイルデバイスからのRGB-Dスキャンを、物理ベースレンダリング(PBR)マテリアルを備えたグラフィックス対応3Dシーンに変換するシステムで、高精細な再構築を実現します。

3dem/relion

RELIONは、クライオ電子顕微鏡における3D再構成および2Dクラス平均の最大後验確率(Maximum A Posteriori)精査のためのソフトウェアプログラムです。

cvg/glue-factory

A library for training and evaluating deep neural networks that extract and match local visual features, supporting state-of-the-art models like LightGlue and GlueStick.

cvg/limap

点、線、面、およびパラメータ化されたプリミティブを共同で最適化することで、より正確な 3D 再構成を行うための、ホリスティックな 3D マッピングと SfM (Structure from Motion) のツールボックスです。

nvpro-samples/vk_gaussian_splatting

3Dガウススプラッティングモデル用の高性能Vulkanベースのビューアおよびテストベッドで、ラスタライゼーション、レイトレーシング、ハイブリッドレンダリング技術を比較できます。

OschAI/VisioFirm

SAM2 と YOLO などのモデルを使用して、コンピュータビジョン用データセットの半自動的事前ラベル付けを提供する、AI駆動の画像・動画アノテーションツール。

PRBonn/RAP

点群の流れマッチングを用いて、複数の未姿勢スキャンを共通フレームに整列する3D点群登録フレームワーク。登録を条件付き生成タスクとして扱う。

UB-Mannheim/zotero-ocr

Zotero ライブラリ内のスキャンされた PDF に検索可能なテキストレイヤーを追加するために Tesseract OCR を使用する Zotero プラグイン。

Linketic/CityGaussian

ガウシアンスプラッティングを用いた高品質で大規模な3Dシーン再構成のためのフレームワーク。マルチGPU対応と幾何学的に正確なレンダリングを特徴とする。

drivelineresearch/openbiomechanics

野球の投球および打撃分析に向けた、クリーンなモーションキャプチャファイル、時系列バイオメカニクス、および身体的評価メトリクスを提供する公開研究データセット。

ScrollPrize/villa

Vesuvius Challenge向けの機械学習およびコンピュータビジョンツールのコレクション。CTスキャンから古代ヘルクランネムの巻物を仮想的に展開し、読むことを可能にする。

dstl/Stone-Soup

Stone Soupは、ターゲット・トラッキングおよび状態推定アルゴリズムの開発とテストのためのフレームワークです。

SubhamTyagi/android-ocr

120以上の言語でオフライン光学式文字認識(OCR)を実行する、プライバシー重視のAndroidアプリ。

hmorimitsu/ptlflow

最先端の光学フロー推定モデルの広範なコレクションを訓練および評価するための統合された PyTorch Lightning フレームワーク。

oliverbravery/PrintGuard

3Dプリントの失敗をリアルタイムで検出し、プリンターを自動的に一時停止してユーザーに警告することで、フィラメントの無駄を防ぐローカルビジョンベースの監視システム。

inspatio/querysplat

QuerySplatは、画像からの3Dシーン再構成の品質を向上させるために、幾何学と外観の表現を分離する3D Gaussian Splatting予測フレームワークです。

bytedeco/javacv

OpenCVやFFmpegなどの一般的なコンピュータビジョンおよびビデオ処理ライブラリのJavaラッパーであり、JavaおよびAndroid上で高性能な画像・動画操作を可能にします。

tomas-gajarsky/facetorch

効率的な推論を可能にするために、オープンソースのモデルを収集し、ポータブルな torch.export モデルとしてパッケージ化する Python ライブラリ。

ch-sa/labelCloud

ポイントクラウド用の軽量 3D バウンディングボックスラベリングツールで、3D オブジェクト検出と 6D ポーズ推定のトレーニングデータを生成します。

databricks-industry-solutions/pixels

MONAIを活用したSQLベースのメタデータ分析とAI駆動の画像セグメンテーションを可能にする、DICOMファイルをインジェスト・インデックス化する医療画像ソリューションアクセラレータです。

fastvideo/gpu-camera-sample

リアルタイムのraw画像処理とISPパイプラインのための、高性能なGPU加速カメラアプリケーション。幅広い産業用カメラをサポート。

jamjamjon/usls

10億パラメータ未満の視覚および視覚言語モデルの効率的な推論を実現する、ONNX Runtime を搭載したクロスプラットフォーム Rust ライブラリ。

pymatting/pymatting

トリマップを使用して前面オブジェクトの透明度を推定するPythonライブラリ。正確な背景除去と合成を可能にする。

apple-aiml-research/ml-hypersim

Hypersimは、約77,000枚のHDR画像(1.9TB)を含む大規模な合成屋内データセットで、ピクセル単位の幾何学、セマンティクス、素材チャンネルを備え、V‑Rayベースのツールキットにより類似データの生成・編集が可能。深度、法線、セグメンテーション、内在画像分解などのシーン理解モデルの学習・評価に最適化されており、事前に用意されたtrain/val/test分割を含む。

apple-aiml-research/ml-hugs

HUGS は、ガウススプラッティングを使用して、単一の動画からアニメーション可能な人間とその周囲の背景シーンを再構築するリファレンス実装です。

jasongzy/Make-It-Animatable

3Dメッシュから関節位置とスキンニングウェイトを予測することで、アニメーション対応の3Dキャラクターの作成を自動化する効率的なフレームワーク。

nmwsharp/polyscope

スカラーおよびベクトルデータを伴うメッシュや点群を、迅速に可視化するための軽量な C++/Python 3D ビューアーと UI。

Anttwo/Surflo

Surflo は、グローバル状態とフローマッチングを使用して、少数のポーズなし RGB ビューを詳細な 3D メッシュに変換する 3D サーフェスフローモデルです。

amebalabs/TRex

任意の画面領域から選択できないテキストを OCR で抽出し、クリップボードに直接コピーする macOS ユーティリティ。

rtr46/meikipop

ゲーム、マンガ、動画を含む、画面上のあらゆるコンテンツから即座に単語を検索できる、汎用的な日本語OCRポップアップ辞書。

deepdoctection/deepdoctection

レイアウト解析、OCR、およびトークン分類をオーケストレーションして、PDFやスキャンデータから構造化データを抽出する、ドキュメント理解のためのPythonライブラリ。

nutonomy/nuscenes-devkit

nuScenes および nuImages データセット用のソフトウェア開発キットで、自律走行研究におけるマルチモーダルセンサーデータの読み込み、分析、評価を支援するツールを提供します。

espressif/esp-who

Espressifチップ向けに、顔・歩行者検知およびQRコード認識のサンプルを提供する画像処理開発プラットフォーム。

facebookresearch/OrienterNet

OpenStreetMapなどの2D公開マップと照合することで、画像の位置と向きを決定する深層ニューラルネットワーク。

mjkwon2021/CAT-Net

JPEG圧縮アーティファクトを分析することで画像改ざんを検出・局所化するネットワークであり、画像フォレンジック研究のためのツールを提供する。

Project-MONAI/MONAILabel

放射線科、病理学、内視鏡検査において、インタラクティブかつ自動化されたラベル付けを可能にする、サーバー・クライアントアーキテクチャを採用したAI支援型医療画像アノテーションのためのインテリジェントなオープンソースエコシステム。

yihong1120/Construction-Hazard-Detection

リアルタイムカメラ映像からYOLOを使用してPPE違反と接近危険を検出するAI駆動型建設現場安全監視システム。

zae-bayern/elpv-dataset

電気発光画像 2,624 枚の注釈付きデータセットで、電力効率を低下させる欠陥の視覚的識別に使用されます。

Climate-Vision/ClimateVision

ディープラーニングと衛星画像を使用して、森林伐採、北極氷の融解、洪水を自動的に検出するオープンソースの機械学習プラットフォームです。

cuevhv/mamma

MAMMA はマーカーレスのマルチパーソン 3D 動作取得システムで、マルチビュー映像から正確な人体ポーズを再構築します。

emgucv/emgucv

OpenCV ライブラリのためのクロスプラットフォーム .NET ラッパー。OpenCV の画像処理機能を .NET 互換言語で使用可能にします。

tianrun-chen/SAM-Adapter-PyTorch

カモフラージュ、影、医療画像などの難しいシーンでの性能向上を目的とした Segment Anything Model (SAM) の適応フレームワーク。

cameraui/camera.ui

ユーザー所有のハードウェア上に映像を保持しながら、ライブ表示、録画、およびオンデバイスAI検出を提供するセルフホスト型セキュリティカメラプラットフォーム。

facebookresearch/ocean

Oceanは、モバイル、デスクトップ、Meta Questを含むさまざまなプラットフォーム上でコンピュータビジョンおよび拡張現実アプリケーションを構築するためのC++フレームワークです。