651

llm-beginner: スクラッチ実装を通じてLLMとAIエージェントを習得するための段階的なハンズオン・カリキュラム

mini-GPTの構築からコーディングエージェントの作成まで、6つの段階的な実装タスクを通じて、初心者がLLMとAIエージェントを学ぶための包括的なハンズオン・チュートリアル・シリーズ。

652

SkillOpt: ディープラーニングスタイルの最適化ループを用いた自己進化型エージェントスキルのためのエグゼクティブ戦略

SkillOptは、エージェントのスキルドキュメントを学習可能な状態として扱い、ディープラーニングスタイルの最適化ループを使用して、モデルの重みを変更することなくエージェントのパフォーマンスを進化させ、改善するためのフレームワークです。

653

mrpt: SLAM、ナビゲーション、3D可視化機能を備えたモバイルロボティクス向け包括的なC++フレームワーク

SLAM、ナビゲーション、およびセンサー統合のための不可欠なツールを提供する、モバイルロボティクス向けの堅牢でモジュール式のC++フレームワーク。

654

unrealcv: Unreal EngineとAIフレームワークを橋渡しし、合成コンピュータビジョン環境を構築するためのブリッジ

UnrealCVは、Unreal Engine用のプラグインであり、コンピュータビジョン研究者が仮想世界とプログラムによって対話して合成データを生成することを可能にし、PyTorch/Tensorflowとの統合を提供します。

655

paperlib: AIによる要約とセマンティックなライブラリ検索を備えたオープンソースの学術論文マネージャー

LLMによる要約とセマンティック検索を特徴とし、メタデータのスクレイピングと整理を簡素化する、オープンソースの学術論文管理ツール。

656

bgslibrary: ビデオストリームにおける前景・背景分離のための包括的なC++フレームワーク

コンピュータビジョンにおける背景差分法のための包括的なC++フレームワークであり、ビデオストリーム内の動いているオブジェクトを検出するために40以上のアルゴリズムを提供します。

657

emgucv: OpenCV画像処理ライブラリ用のクロスプラットフォーム .NETラッパー

OpenCV画像処理ライブラリ用のクロスプラットフォーム .NETラッパー。 .NET互換言語を使用して、複数のオペレーティングシステムにわたってOpenCV関数を使用することを可能にします。

658

MaaNTE: 異環における反復タスクを簡素化するための画像・音声認識ベースの自動化ツール

画像と音声の認識を使用してユーザー操作をシミュレートし、反復的なゲームプレイを簡素化する、ゲーム *異環* (The Ring) 用の自動化ツール。

659

stitching: 高速で堅牢な画像スティッチングとパノラマ作成のための Python パッケージ

OpenCV を使用して複数の重なり合う画像を単一のパノラマに結合する、高速で堅牢な画像スティッチングのための Python パッケージ。

660

CV-CUDA: AI前処理パイプラインのための高スループットGPU加速コンピュータビジョンライブラリ

AIパイプライン向けに高スループットかつ低レイテンシの画像およびビデオ処理を提供する、NVIDIAのGPU加速コンピュータビジョンライブラリ。

661

comic-translate: LLMとインペインティングを活用してコミックパネル内のテキストを翻訳するAI搭載コミック翻訳機

LLM、OCR、およびインペインティングを使用して、元の絵を維持しながら多言語のコミックを翻訳するAI搭載コミック翻訳機。

662

habitat-lab: 室内環境における具現化 AI エージェントの訓練と評価のためのモジュラー フレームワーク

具現化 AI のエンドツーエンド開発のためのモジュラーなハイレベルライブラリで、室内環境でタスクを実行するエージェントの訓練と評価に使用されます。

663

WebPlotDigitizer: データ可視化の画像から数値データを抽出するためのコンピュータビジョン支援ツール

WebPlotDigitizerは、研究者や科学者のために、データ可視化の画像から数値データを抽出するコンピュータビジョン支援ツールです。

664

ComputeLibrary: Armハードウェア向けに最適化された低レベル機械学習関数のコレクション

Arm Cortex-A、Neoverse、およびMali GPUアーキテクチャ向けに最適化された、高性能なML推論を提供するための低レベル機械学習関数のコレクション。

665

LichtFeld-Studio: 3D Gaussian Splatting シーンのトレーニング、編集、および自動化のためのモジュール式ワークステーション

3D Gaussian Splatting のトレーニング、リアルタイム可視化、編集、およびエクスポートを、単一のネイティブアプリケーションに統合したモジュール式ワークステーション。

666

anylabeling: YOLOv8とSegment Anythingによる自動ラベル付け機能を備えたAI支援型画像アノテーションツール

YOLOv8とSegment Anything Model (SAM) ファミリーを統合し、コンピュータビジョンのためのデータラベル付けを自動化および高速化するAI搭載型画像アノテーションツール。

667

AliceVision: 3D再構成とカメラトラッキングのためのフォトグラメトリ・コンピュータビジョン・フレームワーク

写真やビデオから3D再構成とカメラトラッキングのためのアルゴリズムを提供する、フォトグラメトリ・コンピュータビジョン・フレームワーク。

668

habitat-sim: エンボディードAI研究向けの高性能物理対応3Dシミュレータ

エンボディードAI研究向けの高性能物理対応3Dシミュレータで、リアルな3D環境でエージェントを訓練するための高速レンダリングと剛体ダイナミクスを提供します。

669

scenic: 大規模なアテンションベースのコンピュータビジョンモデルをプロトタイプするためのJAXベースのリサーチライブラリ

画像、ビデオ、オーディオにわたるアテンションベースのモデルを開発するための、スケーラブルなライブラリとプロジェクトテンプレートを提供する、JAXおよびFlaxベースのコンピュータビジョン研究用ライブラリ。

670

torchgeo: 多スペクトル地理空間およびリモートセンシングデータを用いたディープラーニングのための PyTorch ドメインライブラリ

地理空間およびリモートセンシングデータ向けに特別に設計されたデータセット、サンプラー、および学習済みモデルを提供する PyTorch ドメインライブラリ。

671

VLMEvalKit: 70以上のベンチマークをサポートする大規模視覚言語モデル向け統合評価ツールキット

70以上のベンチマークと200以上のモデルにわたって、一つのコマンドで評価を可能にする、大規模視覚言語モデル向けのオープンソース評価ツールキット。

672

MaaFramework: ローコードなブラックボックス自動化ツールを構築するためのクロスプラットフォーム画像認識フレームワーク

ローコード・パイプラインを使用して、視覚的な駆動による自動化ツールを作成できる、ブラックボックステスト用の画像認識ベースの自動化フレームワーク。

673

obs-backgroundremoval: OBS Studio 用の仮想グリーンバックおよび低照度強化プラグイン

ニューラルネットワークを使用して、ポートレートビデオや画像に対して仮想グリーンバックの背景削除および低照度強化を提供する OBS Studio 用のプラグイン。

674

webots: 機械システムのモデリングとプログラミングのためのオープンソース・ロボットシミュレータ

ロボット、車両、および機械システムのモデリング、プログラミング、およびシミュレーションを行うための完全な開発環境を提供するオープンソースのロボットシミュレータ。

675

ceres-solver: 大規模な非線形最小二乗法および一般的な最適化問題を解くための成熟したC++ライブラリ

Ceres Solverは、大規模で複雑な非線形最小二乗法および一般的な制約なしの最適化問題をモデル化して解決するためのC++ライブラリです。

676

sparrow: 構造化データ抽出とエージェント型ワークフローのためのAPIファーストなドキュメントインテリジェンスプラットフォーム

Vision LLMsとエージェント型ワークフローを使用して、請求書、領収書、および明細書を構造化されたJSONに変換する、エンタープライズ向けドキュメントインテリジェンスのためのAPIファーストなプラットフォーム。

677

Chinese-CLIP: クロスモーダル検索とゼロショット画像分類のための大規模中国語ビジョン・ランゲージ・モデル

2億組の画像・テキストペアで学習された、クロスモーダル検索とゼロショット画像分類のためのCLIPモデルの中国語版。

678

scikit-image: 科学的な画像処理および解析のための包括的なPythonライブラリ

scikit-imageは、画像の解析および操作のためのアルゴリズムのコレクションを提供する、画像処理用のPythonライブラリです。

679

Final2x: カスタムモデルとNvidia 50シリーズGPUをサポートするクロスプラットフォーム画像超解像ツール

AIモデルを使用して画像をアップスケールし、解像度を向上させるクロスプラットフォーム画像超解像ツール。

680

gocv: OpenCV 4 コンピュータビジョンライブラリ用の Go 言語バインディング

GoCV は OpenCV 4 の Go 言語バインディングを提供し、Go 開発者が高度なコンピュータビジョンとハードウェアアクセラレーションによる画像処理をアプリケーションに統合できるようにします。

681

librealsense: RealSenseカメラから深度およびカラーデータをストリーミングするためのクロスプラットフォームライブラリ

RealSense深度カメラ用のクロスプラットフォームSDKであり、深度およびカラーのストリーミングを可能にし、コンピュータビジョンやロボティクス用のキャリブレーションデータを提供します。

682

rerun: 物理AIおよびロボティクス向けのマルチモーダル・データレイヤーおよびビジュアル・デバッガー

物理AIのためのマルチモーダル・データレイヤーおよびビジュアル・デバッガー。開発者がマルチレートのセンサー・データをリアルタイムでログに記録、クエリ、および可視化することを可能にします。

683

pcl: 0

2D/3D画像とポイントクラウド処理のための大規模オープンソースライブラリ。ロボティクスや3D認識への活用が広く lte_id: 0

684

segmentation_models.pytorch: 800以上の学習済みエンコーダーを備えた画像セマンティックセグメンテーション用のハイレベルPyTorchライブラリ

幅広い学習済みエンコーダーとアーキテクチャを使用して、画像セマンティックセグメンテーション・モデルを簡単に作成・トレーニングできるハイレベルAPIを提供するPyTorchライブラリ。

685

colmap: 3D再構成のための汎用的な Structure-from-Motion および Multi-View Stereo パイライン

画像集合から 3D 構造を再構成するための、汎用的な Structure-from-Motion および Multi-View Stereo パイプラインです。

686

Meshroom: 3D再構成およびコンピュータビジョン・パイプラインのためのノードベースのビジュアルプロジュアルプログラミング・フレームワーク

3D再構成およびコンピュータビジョン用のノードベースのビジュアルプログラミング・フレームワーク。AIとフォトグラメトリを使用して、ユーザーが複雑なデータ処理パイプラインを構築することを可能にします。

687

open_clip: 大規模な対照学習型言語・画像および音声・テキストモデルのトレーニングとデプロイのためのオープンソースフレームワーク

OpenAIのCLIPのオープンソース実装であり、ゼロショット分類や検索のために大規模な対照学習型言語・画像モデルのトレーニングと使用を可能にします。

688

carla: 自動運転システムのトレーニングと検証のためのオープンソースの都市走行シミュレータ

自動運転研究のためのオープンソースのシミュレータ。シミュレートされた都市環境において、自動運転システムの開発、トレーニング、および検証に使用されます。

689

labelme: AI支援マスキングとマルチフォーマット・データセット・エクスポート機能を備えたグラフィカルな画像アノテーションツール

さまざまな形状やAI支援ツールを使用して画像をラベル付けし、コンピュータビジョン・モデル用のデータセットを作成できる、グラフィカルな画像アノテーションツール。

690

cvat: 高品質なコンピュータビジョン用データセット構築のためのプロフェッショナルなデータアノテーションプラットフォーム

コンピュータビジョン向けの高品質な視覚的データセットを構築するためのオープンソースのデータアノテーションプラットフォーム。画像、ビデオ、および3Dアノテーションをサポート。

691

AirSim: 自律走行車両およびAI研究のための高忠実度な視覚・物理シミュレータ

Unreal Engine上に構築されたドローンおよび車両用のオープンソースシミュレータであり、ディープラーニング、コンピュータビジョン、および強化学習におけるAI研究のためのプラットフォームとして設計されています。

692

MaaAssistantArknights: Arknightsの日常タスクと基地管理を自動化する画像認識ベースの自動化アシスタント

画像認識とディープラーニングを使用して、Arknightsの日常タスク、基地管理、およびリソース稼ぎを自動化するArknights用自動化アシスタント。

693

vit-pytorch: PyTorchで実装されたVision Transformer (ViT) とその派生モデルの包括的なコレクション

オリジナルのVision Transformer (ViT) と、画像分類のための数十種類の高度な派生モデルを実装した包括的なPyTorchライブラリ。

694

label-studio: マルチモーダルなオープンソースデータラベリングツール(ML支援の事前ラベリングとアクティブラーニング付き)

オープンソースのデータラベリングツールで、音声、テキスト、画像、動画にアノテーションを付け、機械学習モデルの学習データを作成または改善できます。

695

espnet: ASR、TTS、および話し言葉の理解のための包括的なエンドツーエンド音声処理ツールキット

PyTorchを使用して、ASR、TTS、音声翻訳、および音声強調のための統一されたフレームワークを提供するエンドツーエンドの音声処理ツールキット。

696

leon: エージェント実行機能とローカルファーストのプライバシーを備えたオープンソースのパーソナルAIアシスタント

ツール、メモリ、およびエージェント実行機能を使用してタスクを実行し、プライバシーのためにローカルAIモデルをサポートするオープンソースのパーソナルAIアシスタント。

697

HunyuanVideo-1.5: コンシューマー向けGPUで高品質な合成を実現する軽量8.3Bパラメータ動画生成モデル

コンシューマー向けGPUで高品質なtext-to-videoおよびimage-to-videoの合成を可能にする、軽量な8.3Bパラメータの動画生成モデル。

698

OpenMontage: リサーチ、スクリプト作成、編集を統合してフルプロダクションパイプラインを実現するエージェント型ビデオ制作システム

リサーチ、スクリプト作成、アセット生成、および編集をオーケストレーションして、自然言語のプロンプトからプロフェッショナルなビデオを制作する、オープンソースのエージェント型ビデオ制作システム。

699

genai-processors: 非同期かつ構成可能なマルチモーダルAIパイプラインを構築するためのモジュール式フレームワーク

マルチモーダルコンテンツの処理とストリーミングを統一する、モジュール式、非同期、かつ構成可能なAIパイプラインを構築するための軽量なPythonライブラリ。

700

instill-core: データ処理、パイプライン・オーケストレーション、およびモデルホスティングのためのエンドツーエンドAIインフラストラクチャプラットフォーム

非構造化データ、AIパイプライン、およびモデルデプロイのオーケストレーションを簡素化し、RAGやAIファーストなアプリケーションを構築するためのエンドツーエンドAIプラットフォーム。