trvon/yams

コンテンツアドレス付きストレージとハイブリッド検索を用いたローカル優先の永続的メモリシステムで、コードとドキュメントを整理・検索します。

Ahmet-Dedeler/ai-llm-comparison

複数の LLM プロバイダーのリアルタイムな価格と機能の比較を提供する、オープンソースの AI モデル比較ツールです。

ZHangZHengEric/Sage

タスク実行と自動化のための本番環境対応のエージェントプラットフォームであり、ブラウザのワークフローを統合し、複数のIMチャネルを通じて結果を配信します。

z-lab/paroquant

ParoQuantは、学習されたペアワイズ回転を使用して重みの外れ値を低減し、効率的な推論中に高い精度を維持するためのINT4量子化フレームワークです。

MoonshotAI/checkpoint-engine

LLM 推論エンジン向けのミドルウェアで、大規模 GPU クラスタ上で迅速かつインプレースにモデル重みを更新でき、強化学習に不可欠です。

microsoft/MInference

MInferenceは、動的なスパース・アテンション・パターンを活用することで、単一のA100 GPU上で最大10倍の高速化を実現し、長文脈LLMのプリフィリング(pre-filling)段階を加速します。

RealCorebb/bbTalkie

ESP32‑S3 上の組み込みニューラルネットワークを使用し、音声を自動検出してキーワードを認識する DIY ポータブル・ハンズフリーウォーキートーキー。

csdcorp/speech_to_text

Android、iOS、および web で、短い音声コマンドやフレーズを使用するために、アプリがネイティブデバイスの音声認識機能にアクセスできるようにする Flutter プラグインです。

Picovoice/leopard

Leopard は、複数のプラットフォームにわたってプライバシーを保護し、正確で、計算効率の高い音声文字起こしを提供するデバイス内音声文字起こしエンジンです。

Picovoice/cheetah

デバイス上で動作するストリーミング音声認識エンジンで、プライバシーを保護しながら複数プラットフォームでリアルタイム音声文字起こしを提供します。

jitsi/jiwer

Word Error Rate (WER) や Character Error Rate (CER) などの指標を用いて、自動音声認識システムを評価するための高速な Python パッケージです。

innovatorved/whisper.api

whisper.cpp をベースとした、Deepgram と互換性のある、自己ホスト型で高性能な音声文字起こし API です。簡単に統合できます。

noahgsolomon/brainrot.js

Groq、OpenAI、Speechify を使用して、著名人の声クローンと生成コンテンツを組み合わせた AI 生成動画を自動作成するツール。

THU-BPM/MarkDiffusion

潜在拡散モデル(LDM)の生成メディアに対するオープンソースのPythonツールキットで、AI生成画像および動画に水印を埋め込み、検出および評価するためのツールを提供します。

OpenImagingLab/AnyRecon

AnyReconは、動画拡散モデルを用いて、撮影ビューのセットから任意視点の高品質な3D再構成を生成する3D再構成フレームワークです。

nachifur/RDDM

高品質な画像復元と生成のための残差去噪拡散モデルフレームワーク。降雨除去やぼかし除去などのタスクをサポートします。

rohitgandikota/sliders

LoRA アダプタを作成するためのフレームワークで、スライダーとして機能し、Stable Diffusion や FLUX などの拡散モデルにおいて特定のビジュアル概念を正確に制御できます。

helblazer811/Diffusion-Explorer

拡散モデルとフローベース生成モデルの背後にある幾何学的な直感的な理解を助ける、教育目的のインタラクティブな可視化ツールです。

viiika/Meissonic

Meissonicは、コンシューマー向けGPUで動作するように設計された、効率的な高解像度テキストから画像への合成のための非自己回帰型マスク生成トランスフォーマーです。

Karine-Huang/T2I-CompBench

テキストから画像を生成するモデル(text-to-image generation models)の、複雑な構成要素、属性の結合、および空間的関係を扱う能力に焦点を当てた、包括的なベンチマークおよび評価スイートです。

LHRLAB/HyperGraphRAG

ハイパーグラフ構造の知識表現を用いて、エンティティ間の複雑な関係をより適切に捉える、Retrieval‑Augmented Generation(RAG)フレームワークです。

neuml/rag

txtai をバックエンドにした Streamlit アプリケーションで、ベクトルとグラフの RAG を実装し、事実に基づく LLM 応答を提供します。

LightningRAG/LightningRAG

ビジュアルエージェント・オーケストレーション・キャンバスと Webhook コネクタを備え、AI エージェントをサードパーティのメッセージングプラットフォームにデプロイするためのフルスタック RAG フレームワーク。

DataScienceUIBK/Rankify

検索、リランキング、および RAG のための包括的な Python ツールキット。最先端のモデルを実験・展開・デプロイするための統一インターフェースを提供します。

graniet/llm

複数の LLM バックエンドとやり取りするための統一 API を提供する Rust ライブラリで、マルチステップチェーン、エージェントワークフロー、標準化された REST API を実現します。

Farzad-R/LLM-Zero-to-Hundred

RAG、エージェント型ワークフロー、マルチモーダル・チャットボット、およびファインチューニング・パイプラインを網羅する、基礎から高度なAIアプリケーション開発へと移行するためのLLMプロジェクトとチュートリアルのコレクションです。

maze-agent/Maze

異種リソーススケジューリングと自動モデルサービングを備えたLLMエージェント用分散フレームワーク。エージェントプログラムを観測可能なワークフローに変換します。

suyoumo/ClawProBench

OpenClaw ランタイム内で AI エージェントの能力とパフォーマンスを評価するための透明性のあるライブ実行ベンチマークハーネスで、決定論的採点を実現します。

OpenManus/OpenManus-RL

強化学習を用いて LLM エージェントの推論、ツール使用、意思決定能力を最適化するオープンソースフレームワーク。

mkalten/reacTIVision

フィデリティマーカーとマルチタッチ指の追跡を可能にし、実体ユーザーインターフェースの作成を支援するクロスプラットフォームのコンピュータビジョンフレームワークです。

frgfm/holocron

コンピュータビジョンタスクのための、最新のディープラーニングのテクニックとモデルアーキテクチャの高品質なPyTorch実装ライブラリです。

rapidsai/cucim

cuCIM は、バイオメディカル、ジオスペーシャル、リモートセンシング用途で使用される大規模な多次元画像向けに設計された、GPU 加速のコンピュータビジョンおよび画像処理ライブラリです。

commaai/rednose

センサーフュージョン、視覚的オドメトリ、およびSLAMのためのKalman filterフレームワーク。Jacobian計算を自動化し、ESKFやMSCKFなどの高度なフィルタをサポートします。

theICTlab/3DUNDERWORLD-SLS-GPU_CPU

パターン化された光で照射された対象物の画像から 3D ポイントクラウドを再構築する構造光スキャンツールで、CPU と GPU の両方でアクセラレーションが可能です。

alicevision/popsift

CUDA で高速化された SIFT アルゴリズムの実装で、リアルタイムの画像特徴抽出が可能です。

thp/psmoveapi

Linux、macOS、Windows に対応したオープンソースライブラリで、PC が Sony Move モーションコントローラにアクセスできるようにし、AR/VR アプリケーションでの 3D トラッキングとセンサーフュージョンを実現します。

rgeirhos/Stylized-ImageNet

Stylized-ImageNet を作成するためのツールです。テクスチャを歪めて ImageNet のバージョンを作り、CNN がテクスチャよりもオブジェクトの形状を優先するように促し、ロバスト性を向上させます。

Fabric-Project/Fabric

macOS上で、インタラクティブな3Dグラフィックス、画像/動画処理、AI強化ビジュアルの迅速なプロトタイピングのためのビジュアルノードベースのクリエイティブコーディング環境。

VSLAM-LAB/VSLAM-LAB

統一された設定とベンチマークを通じて、Visual SLAMシステムの開発、評価、応用を簡素化する包括的なフレームワークです。

askui/python-sdk

ビジョンベースの自動化を使用して、壊れやすい UI selector を使用せずに、AI agent がデスクトップやモバイルデバイスを制御可能にする Python SDK です。

l3p-cv/lost

柔軟なウェブベースの協働画像アノテーションフレームワークで、半自動パイプラインをサポートし、機械学習データセットのラベリングを高速化します。

roboflow/roboflow-python

Roboflowの公式Pythonパッケージ。開発者がモデル、データセット、プロジェクトとプログラム的にやり取りし、コンピュータビジョンモデルを自動で構築・デプロイできるようにします。

genicam/harvesters

GenICam準拠のデバイスに対して統一インターフェースを提供することで、コンピュータビジョンアプリケーションにおける画像取得を簡化化するPythonライブラリです。

zju3dv/Diffuman4D

Diffuman4Dは、疎な視点からのビデオから自由視点レンダリングを可能にする、高忠実度で4D一貫性のある人間視点合成のための時空拡散モデルです。

open-edge-platform/datumaro

AIデータセットの構築、変換、および分析に使用されるデータセット管理フレームワークおよび CLI ツールです。特に、さまざまなアノテーション形式間の変換に焦点を当てています。

basler/pypylon

Basler pylon C++ APIの公式Pythonバインディング。PythonアプリケーションからBaslerマシンビジョンカメラを制御し、画像処理タスクを実行できるようにします。

10up/classifai

クラウドベースとローカルの AI サービスを統合し、コンテンツ生成、画像処理、サイト管理タスクを自動化する WordPress プラグインです。

cyrusbehr/YOLOv8-TensorRT-CPP

TensorRT を使用した C++ 実装の YOLOv8 で、高性能 GPU 推論を実現し、物体検出、セマンティックセグメンテーション、ポーズ推定をサポートします。