llm-beginner: スクラッチ実装を通じてLLMとAIエージェントを習得するための段階的なハンズオン・カリキュラム
mini-GPTの構築からコーディングエージェントの作成まで、6つの段階的な実装タスクを通じて、初心者がLLMとAIエージェントを学ぶための包括的なハンズオン・チュートリアル・シリーズ。
SkillOpt: ディープラーニングスタイルの最適化ループを用いた自己進化型エージェントスキルのためのエグゼクティブ戦略
SkillOptは、エージェントのスキルドキュメントを学習可能な状態として扱い、ディープラーニングスタイルの最適化ループを使用して、モデルの重みを変更することなくエージェントのパフォーマンスを進化させ、改善するためのフレームワークです。
mrpt: SLAM、ナビゲーション、3D可視化機能を備えたモバイルロボティクス向け包括的なC++フレームワーク
SLAM、ナビゲーション、およびセンサー統合のための不可欠なツールを提供する、モバイルロボティクス向けの堅牢でモジュール式のC++フレームワーク。
unrealcv: Unreal EngineとAIフレームワークを橋渡しし、合成コンピュータビジョン環境を構築するためのブリッジ
UnrealCVは、Unreal Engine用のプラグインであり、コンピュータビジョン研究者が仮想世界とプログラムによって対話して合成データを生成することを可能にし、PyTorch/Tensorflowとの統合を提供します。
paperlib: AIによる要約とセマンティックなライブラリ検索を備えたオープンソースの学術論文マネージャー
LLMによる要約とセマンティック検索を特徴とし、メタデータのスクレイピングと整理を簡素化する、オープンソースの学術論文管理ツール。
bgslibrary: ビデオストリームにおける前景・背景分離のための包括的なC++フレームワーク
コンピュータビジョンにおける背景差分法のための包括的なC++フレームワークであり、ビデオストリーム内の動いているオブジェクトを検出するために40以上のアルゴリズムを提供します。
emgucv: OpenCV画像処理ライブラリ用のクロスプラットフォーム .NETラッパー
OpenCV画像処理ライブラリ用のクロスプラットフォーム .NETラッパー。 .NET互換言語を使用して、複数のオペレーティングシステムにわたってOpenCV関数を使用することを可能にします。
MaaNTE: 異環における反復タスクを簡素化するための画像・音声認識ベースの自動化ツール
画像と音声の認識を使用してユーザー操作をシミュレートし、反復的なゲームプレイを簡素化する、ゲーム *異環* (The Ring) 用の自動化ツール。
stitching: 高速で堅牢な画像スティッチングとパノラマ作成のための Python パッケージ
OpenCV を使用して複数の重なり合う画像を単一のパノラマに結合する、高速で堅牢な画像スティッチングのための Python パッケージ。
CV-CUDA: AI前処理パイプラインのための高スループットGPU加速コンピュータビジョンライブラリ
AIパイプライン向けに高スループットかつ低レイテンシの画像およびビデオ処理を提供する、NVIDIAのGPU加速コンピュータビジョンライブラリ。
comic-translate: LLMとインペインティングを活用してコミックパネル内のテキストを翻訳するAI搭載コミック翻訳機
LLM、OCR、およびインペインティングを使用して、元の絵を維持しながら多言語のコミックを翻訳するAI搭載コミック翻訳機。
habitat-lab: 室内環境における具現化 AI エージェントの訓練と評価のためのモジュラー フレームワーク
具現化 AI のエンドツーエンド開発のためのモジュラーなハイレベルライブラリで、室内環境でタスクを実行するエージェントの訓練と評価に使用されます。
WebPlotDigitizer: データ可視化の画像から数値データを抽出するためのコンピュータビジョン支援ツール
WebPlotDigitizerは、研究者や科学者のために、データ可視化の画像から数値データを抽出するコンピュータビジョン支援ツールです。
ComputeLibrary: Armハードウェア向けに最適化された低レベル機械学習関数のコレクション
Arm Cortex-A、Neoverse、およびMali GPUアーキテクチャ向けに最適化された、高性能なML推論を提供するための低レベル機械学習関数のコレクション。
LichtFeld-Studio: 3D Gaussian Splatting シーンのトレーニング、編集、および自動化のためのモジュール式ワークステーション
3D Gaussian Splatting のトレーニング、リアルタイム可視化、編集、およびエクスポートを、単一のネイティブアプリケーションに統合したモジュール式ワークステーション。
anylabeling: YOLOv8とSegment Anythingによる自動ラベル付け機能を備えたAI支援型画像アノテーションツール
YOLOv8とSegment Anything Model (SAM) ファミリーを統合し、コンピュータビジョンのためのデータラベル付けを自動化および高速化するAI搭載型画像アノテーションツール。
AliceVision: 3D再構成とカメラトラッキングのためのフォトグラメトリ・コンピュータビジョン・フレームワーク
写真やビデオから3D再構成とカメラトラッキングのためのアルゴリズムを提供する、フォトグラメトリ・コンピュータビジョン・フレームワーク。
habitat-sim: エンボディードAI研究向けの高性能物理対応3Dシミュレータ
エンボディードAI研究向けの高性能物理対応3Dシミュレータで、リアルな3D環境でエージェントを訓練するための高速レンダリングと剛体ダイナミクスを提供します。
scenic: 大規模なアテンションベースのコンピュータビジョンモデルをプロトタイプするためのJAXベースのリサーチライブラリ
画像、ビデオ、オーディオにわたるアテンションベースのモデルを開発するための、スケーラブルなライブラリとプロジェクトテンプレートを提供する、JAXおよびFlaxベースのコンピュータビジョン研究用ライブラリ。
torchgeo: 多スペクトル地理空間およびリモートセンシングデータを用いたディープラーニングのための PyTorch ドメインライブラリ
地理空間およびリモートセンシングデータ向けに特別に設計されたデータセット、サンプラー、および学習済みモデルを提供する PyTorch ドメインライブラリ。
VLMEvalKit: 70以上のベンチマークをサポートする大規模視覚言語モデル向け統合評価ツールキット
70以上のベンチマークと200以上のモデルにわたって、一つのコマンドで評価を可能にする、大規模視覚言語モデル向けのオープンソース評価ツールキット。
MaaFramework: ローコードなブラックボックス自動化ツールを構築するためのクロスプラットフォーム画像認識フレームワーク
ローコード・パイプラインを使用して、視覚的な駆動による自動化ツールを作成できる、ブラックボックステスト用の画像認識ベースの自動化フレームワーク。
obs-backgroundremoval: OBS Studio 用の仮想グリーンバックおよび低照度強化プラグイン
ニューラルネットワークを使用して、ポートレートビデオや画像に対して仮想グリーンバックの背景削除および低照度強化を提供する OBS Studio 用のプラグイン。
webots: 機械システムのモデリングとプログラミングのためのオープンソース・ロボットシミュレータ
ロボット、車両、および機械システムのモデリング、プログラミング、およびシミュレーションを行うための完全な開発環境を提供するオープンソースのロボットシミュレータ。
ceres-solver: 大規模な非線形最小二乗法および一般的な最適化問題を解くための成熟したC++ライブラリ
Ceres Solverは、大規模で複雑な非線形最小二乗法および一般的な制約なしの最適化問題をモデル化して解決するためのC++ライブラリです。
sparrow: 構造化データ抽出とエージェント型ワークフローのためのAPIファーストなドキュメントインテリジェンスプラットフォーム
Vision LLMsとエージェント型ワークフローを使用して、請求書、領収書、および明細書を構造化されたJSONに変換する、エンタープライズ向けドキュメントインテリジェンスのためのAPIファーストなプラットフォーム。
Chinese-CLIP: クロスモーダル検索とゼロショット画像分類のための大規模中国語ビジョン・ランゲージ・モデル
2億組の画像・テキストペアで学習された、クロスモーダル検索とゼロショット画像分類のためのCLIPモデルの中国語版。
scikit-image: 科学的な画像処理および解析のための包括的なPythonライブラリ
scikit-imageは、画像の解析および操作のためのアルゴリズムのコレクションを提供する、画像処理用のPythonライブラリです。
Final2x: カスタムモデルとNvidia 50シリーズGPUをサポートするクロスプラットフォーム画像超解像ツール
AIモデルを使用して画像をアップスケールし、解像度を向上させるクロスプラットフォーム画像超解像ツール。
gocv: OpenCV 4 コンピュータビジョンライブラリ用の Go 言語バインディング
GoCV は OpenCV 4 の Go 言語バインディングを提供し、Go 開発者が高度なコンピュータビジョンとハードウェアアクセラレーションによる画像処理をアプリケーションに統合できるようにします。
librealsense: RealSenseカメラから深度およびカラーデータをストリーミングするためのクロスプラットフォームライブラリ
RealSense深度カメラ用のクロスプラットフォームSDKであり、深度およびカラーのストリーミングを可能にし、コンピュータビジョンやロボティクス用のキャリブレーションデータを提供します。
rerun: 物理AIおよびロボティクス向けのマルチモーダル・データレイヤーおよびビジュアル・デバッガー
物理AIのためのマルチモーダル・データレイヤーおよびビジュアル・デバッガー。開発者がマルチレートのセンサー・データをリアルタイムでログに記録、クエリ、および可視化することを可能にします。
pcl: 0
2D/3D画像とポイントクラウド処理のための大規模オープンソースライブラリ。ロボティクスや3D認識への活用が広く lte_id: 0
segmentation_models.pytorch: 800以上の学習済みエンコーダーを備えた画像セマンティックセグメンテーション用のハイレベルPyTorchライブラリ
幅広い学習済みエンコーダーとアーキテクチャを使用して、画像セマンティックセグメンテーション・モデルを簡単に作成・トレーニングできるハイレベルAPIを提供するPyTorchライブラリ。
colmap: 3D再構成のための汎用的な Structure-from-Motion および Multi-View Stereo パイライン
画像集合から 3D 構造を再構成するための、汎用的な Structure-from-Motion および Multi-View Stereo パイプラインです。
Meshroom: 3D再構成およびコンピュータビジョン・パイプラインのためのノードベースのビジュアルプロジュアルプログラミング・フレームワーク
3D再構成およびコンピュータビジョン用のノードベースのビジュアルプログラミング・フレームワーク。AIとフォトグラメトリを使用して、ユーザーが複雑なデータ処理パイプラインを構築することを可能にします。
open_clip: 大規模な対照学習型言語・画像および音声・テキストモデルのトレーニングとデプロイのためのオープンソースフレームワーク
OpenAIのCLIPのオープンソース実装であり、ゼロショット分類や検索のために大規模な対照学習型言語・画像モデルのトレーニングと使用を可能にします。
carla: 自動運転システムのトレーニングと検証のためのオープンソースの都市走行シミュレータ
自動運転研究のためのオープンソースのシミュレータ。シミュレートされた都市環境において、自動運転システムの開発、トレーニング、および検証に使用されます。
labelme: AI支援マスキングとマルチフォーマット・データセット・エクスポート機能を備えたグラフィカルな画像アノテーションツール
さまざまな形状やAI支援ツールを使用して画像をラベル付けし、コンピュータビジョン・モデル用のデータセットを作成できる、グラフィカルな画像アノテーションツール。
cvat: 高品質なコンピュータビジョン用データセット構築のためのプロフェッショナルなデータアノテーションプラットフォーム
コンピュータビジョン向けの高品質な視覚的データセットを構築するためのオープンソースのデータアノテーションプラットフォーム。画像、ビデオ、および3Dアノテーションをサポート。
AirSim: 自律走行車両およびAI研究のための高忠実度な視覚・物理シミュレータ
Unreal Engine上に構築されたドローンおよび車両用のオープンソースシミュレータであり、ディープラーニング、コンピュータビジョン、および強化学習におけるAI研究のためのプラットフォームとして設計されています。
MaaAssistantArknights: Arknightsの日常タスクと基地管理を自動化する画像認識ベースの自動化アシスタント
画像認識とディープラーニングを使用して、Arknightsの日常タスク、基地管理、およびリソース稼ぎを自動化するArknights用自動化アシスタント。
vit-pytorch: PyTorchで実装されたVision Transformer (ViT) とその派生モデルの包括的なコレクション
オリジナルのVision Transformer (ViT) と、画像分類のための数十種類の高度な派生モデルを実装した包括的なPyTorchライブラリ。
label-studio: マルチモーダルなオープンソースデータラベリングツール(ML支援の事前ラベリングとアクティブラーニング付き)
オープンソースのデータラベリングツールで、音声、テキスト、画像、動画にアノテーションを付け、機械学習モデルの学習データを作成または改善できます。
espnet: ASR、TTS、および話し言葉の理解のための包括的なエンドツーエンド音声処理ツールキット
PyTorchを使用して、ASR、TTS、音声翻訳、および音声強調のための統一されたフレームワークを提供するエンドツーエンドの音声処理ツールキット。
leon: エージェント実行機能とローカルファーストのプライバシーを備えたオープンソースのパーソナルAIアシスタント
ツール、メモリ、およびエージェント実行機能を使用してタスクを実行し、プライバシーのためにローカルAIモデルをサポートするオープンソースのパーソナルAIアシスタント。
HunyuanVideo-1.5: コンシューマー向けGPUで高品質な合成を実現する軽量8.3Bパラメータ動画生成モデル
コンシューマー向けGPUで高品質なtext-to-videoおよびimage-to-videoの合成を可能にする、軽量な8.3Bパラメータの動画生成モデル。
OpenMontage: リサーチ、スクリプト作成、編集を統合してフルプロダクションパイプラインを実現するエージェント型ビデオ制作システム
リサーチ、スクリプト作成、アセット生成、および編集をオーケストレーションして、自然言語のプロンプトからプロフェッショナルなビデオを制作する、オープンソースのエージェント型ビデオ制作システム。
genai-processors: 非同期かつ構成可能なマルチモーダルAIパイプラインを構築するためのモジュール式フレームワーク
マルチモーダルコンテンツの処理とストリーミングを統一する、モジュール式、非同期、かつ構成可能なAIパイプラインを構築するための軽量なPythonライブラリ。
instill-core: データ処理、パイプライン・オーケストレーション、およびモデルホスティングのためのエンドツーエンドAIインフラストラクチャプラットフォーム
非構造化データ、AIパイプライン、およびモデルデプロイのオーケストレーションを簡素化し、RAGやAIファーストなアプリケーションを構築するためのエンドツーエンドAIプラットフォーム。