datacurve-ai/deep-swe
DeepSWEは、実世界のオープンソースリポジトリから抽出された113の長期的課題を用いて、コーディングエージェントの性能を測定するベンチマークです。
jfrog/boost
Boostは、AIコーディングエージェントのためのコマンドラッパーで、ノイズの多いシェル出力を構造化されたコンテキストに圧縮し、トークンコストを削減しながらタスクのパフォーマンスを維持します。
guardrails-ai/guardrails
入出力リスク検証を強制し、LLMが構造化データを生成することを保証することで、信頼性の高いAIアプリケーションを構築するためのPythonフレームワークです。
juliye2025/evil-read-arxiv
arXivとSemantic Scholarから学術論文を検索、レコメンド、分析し、結果をObsidianノートに直接統合する自動化された研究ワークフロー。
feast-dev/feast
オフラインのトレーニングセットから低レイテンシのオンライン推論までのデータフローを管理する、機械学習用のオープンソースのフィーチャーストア。
google-research/android_world
実世界の多数のアプリケーションでAndroidデバイスを制御できる自律エージェントの構築とテストに適した環境とベンチマーク。
KMnO4-zx/agentic-rl-lab
最先端のLLM強化学習アルゴリズムの簡潔な再現を集めたもので、Agentic-RL研究におけるGPUとコードの複雑さの壁を低くすることを目的としています。
ryfineZ/codex-session-patcher
セキュリティテストや CTF コンペティション中に拒否応答を回避するために設計された、AI コーディングアシスタント(Codex、Claude Code、OpenCode)用のセッションクリーナーおよびプロンプトインジェクションツール。
Kong/kong
Kongは、マイクロサービス、LLM、Model Context Protocol (MCP) トラフィックのルーティング、セキュリティ、オーケストレーションを統合的に管理するクラウドネイティブAPIおよびAIゲートウェイです。
ggml-org/ggml
機械学習向けに高効率かつクロスプラットフォーム互換性を重視した、軽量で依存関係のないC/C++テンソルライブラリ。
sunblaze-ucb/cybergym
AIエージェントが現実世界の脆弱性分析およびPoC(概念実証)エクスプロイト生成を実行する能力を評価するための、大規模な評価フレームワーク。
skalesapp/skales
Skalesは、クラウドにデータを送信せずに、ローカルで実行される閉鎖ソースのAIデスクトップおよびモバイルエージェントです。チャット、複数ステップの目標自動化、コード編集、デザイン/メディア資産の生成、カレンダー管理、記憶保持が可能。Windows/macOS/Linux/Android/iOSでワンクリックインストールでき、15以上のLLMプロバイダーまたは完全オフラインモデルに対応しています。
DavidCarliez/trustmebro
AIエージェントからのコマンドライン呼び出しを傍受し、レッドチームテストやガードレール回避評価のために架空または変更された応答を提供するプロキシツール。
simonw/llm
リモートAPIとローカルインストール、その両方を通じて複数のLLMと対話するためのCLIツールおよびPythonライブラリ。組み込みのロギングと構造化データ抽出機能を備えています。
mark3labs/mcp-go
LLMアプリケーションが標準化されたインターフェースを使用して、外部データソースやツールと統合できるようにする、Model Context Protocol (MCP) のGo実装。
kdlbs/kandev
並列タスク実行、リモートランタイム、統合されたレビュー優先ワークスペースを可能にするオープンソースのAIコーディングエージェントオーケストレーター。
raindrop-ai/workshop
AIエージェント向けのローカルデバッガーで、リアルタイムのトレースストリーミングと、エージェントのバグを修正するための自己修復型評価ループを提供します。
agentclientprotocol/claude-agent-acp
Agent Client Protocol (ACP) を遵守する任意のクライアントと連携できるように、Claude Agent SDK を対応させるアダプタです。
Manavarya09/design-extract
任意のライブウェブサイトから完全なデザインシステムを抽出し、開発者向けのトークン、Tailwind設定、Figma変数を生成するツール。
datajuicer/data-juicer
200以上のモジュール型オペレータを備えたマルチモーダルデータ処理フレームワークで、基礎モデル用の大規模データセットのクリーニング、重複除去、キュレーションを実現します。
Helldez/BigMoeOnEdge
フラッシュストレージからエキスパートをリアルタイムでストリーミングすることで、デバイスのRAMを超える大規模なMixture-of-Experts (MoE) モデルの実行を可能にする推論エンジン
laravel/ai
Laravel向けの統合AI SDKで、エージェント、画像、音声の操作に使える一貫したAPIを提供するOpenAI、Anthropic、Geminiなどのプロバイダーに対応しています。
databrickslabs/ontobricks
LLMを活用したオントロジー設計とマッピングにより、Databricksのテーブルを物質化されたグラフに変換する知識グラフビルダー
yetone/kill-ai-slop
ウェブプロジェクトから一般的でAI生成されたデザインパターン(AIスロップ)を識別・除去するためのツールとフィールドガイド。
shadcn/improve
高コストで高知能なAIモデルによる繰り返しのコーディングタスクの非効率性を解消するエージェントスキル。コードベースを監査し、安価なモデルが実行可能な自己完結型の実装計画を生成します。
thedivergentai/GD-Agentic-Skills
AIコーディングエージェントが専門的なパターンとベストプラクティスを用いて、Godot 4.7+ でプロフェッショナルなゲームを開発できる、高密度の知識ライブラリとツールセット。
toon-format/toon
LLM プロンプトにおけるトークン使用量を最小化しつつ、高い検索精度を維持することを目的とした、コンパクトで人間に読みやすい JSON データモデルのエンコーディング。
anthropics/jacobian-lens
内部言語モデルの活性化を語彙トークンに変換して内部表現を分析するための参考実装。
Armur-Ai/Pentest-Swarm-AI
Pentest Swarm AIは、Postgresブラックボードとフェロモンベースのスタイグメルギーにより、数十の自律的なLLM駆動エージェントを並列で実行するオープンソースGoツールです。Claude、Together AI、OpenAI互換、Ollamaなど、任意のLLMプロバイダーに対応し、ProjectDiscoveryライブラリ(subfinder、httpx、nuclei、naabu、katana、dnsx、gau)およびnmapアダプタをバンドル。インタラクティブなターミナルUIとWebダッシュボードを提供。実際のホストやバンドルされた脆弱なラボをターゲットにでき、スコープを強制し、証拠に基づいたレポートを生成。コア機能は安定。スウォームスケジューラはアルファ段階で、今後メタスプロイット、sqlmap、ZAP、Burp用のアダプタおよびファインチューニングモデルの計画あり。
danielealbano/android-remote-control-mcp
アクセシビリティサービスとスクリーンショットキャプチャを活用して、AIモデルがリモートでAndroidデバイスを完全に制御できるAndroidアプリ。
open-mercato/open-mercato
アーキテクチャを意識したAIエンジニアリング基盤フレームワーク。アーキテクチャを意識したハーネスとモジュール化されたビジネスコンポーネントを提供し、AIが生成したコードの一貫性とアーキテクチャの健全性を確保します。
poloclub/transformer-explainer
ブラウザ上でライブ GPT-2 モデルを動作させ、Transformer ベースのモデルがどのようにテキストを予測するのかをユーザーが学習できるインタラクティブな可視化ツールです。
builderz-labs/mission-control
AI エージェントの運用に向けた自己ホスト型コントロールプレーンで、ユーザーは1つのダッシュボードからタスクのディスパッチ、コストの追跡、複数のエージェントランタイムの調整が可能になります。
nrslib/takt
隔離されたワークツリーと明示的なレビュー・ループを備えた、再現可能なYAML定義の開発ワークフローにAIコーディングエージェントをオーケストレーションするCLIツール。
huggingface/huggingface_hub
The official Python client for the Hugging Face Hub, enabling users to download, upload, and manage open-source ML models, datasets, and demo apps.
lance-format/lance
マルチモーダルAI向けのオープン・レイクハウス・フォーマットであり、高性能なベクトル検索、ランダムアクセス、および画像、動画、音声のネイティブな保存を提供します。
leigest519/OpenGame
OpenGameは、自然言語プロンプト1つで完全なWebゲームを生成するオープンソースでNodeベースのフレームワークです。専用のコードLLM(GameCoder‑27B)を活用し、再利用可能な*Game Skill*(テンプレート選択+自動デバッグ)、ヘッドレス生成用CLI(`opengame`)、プレイ可能성을測定する評価ツール(OpenGame‑Bench)を提供します。システムはPhaserなどのエンジンでプロジェクトを構築し、サンドボックスで実行し、統合エラーを修正して、プレイ可能なHTML/JSゲームを出力します。
containers/kubernetes-mcp-server
Kubernetes MCP Serverは、Goで構築されたモデルコンテキストプロトコルサーバーであり、AIアシスタントやエージェントがkubectlやhelmをラップすることなく、KubernetesおよびOpenShiftクラスタをKubernetes API経由で直接検査・管理できるようにします。ポッド、ネームスペース、イベント、Helmリリース、Tektonパイプライン、KubeVirt VMなど、さまざまなツールを提供し、外部のコマンドライン依存なしに複数クラスタを扱えます。
HG-ha/MTools
GPUアクセラレーションを活用した画像処理、音声/動画編集、およびローカルAIツールを統合した現代的なクロスプラットフォームデスクトップツールセット。
addyosmani/web-quality-skills
Google Lighthouseなどのツールを活用して、AIコーディングエージェントがウェブプロジェクトのパフォーマンス、アクセシビリティ、SEOを測定・最適化できる、測定を最優先するエージェントスキルのコレクションです。
DrCatHicks/learning-opportunities
エビデンスに基づく学習科学を活用した、Claude CodeおよびCodex向けのプラグイン群。インタラクティブな演習を提供し、AI支援コーディング中のスキルの衰退を防ぎます。
ConardLi/easy-dataset
非構造化ドキュメントを高品質な構造化 QA ペアと評価セットに変換して、LLM のファインチューニングデータセットを作成するツールです。
KimGLee/Cambium
LLMエージェントによって管理されるナレッジリポジトリ向けのガバナンス標準およびツールセットであり、決定論的な作業、再開可能性、および明確なオペレーターとエージェントの境界を保証します。
happier-dev/happier
AIコーディングエージェントのクロスデバイス用コンパニオンアプリおよびクライアント。ローカルでセッションを実行し、モバイル、Web、デスクトップからリモートで制御可能。
mudler/vllm.cpp
vllm.cppは、わずか約66 MiBのサイズでありながら、vLLM Pythonサーバーのパフォーマンスと機能を備えた純粋なC++推論エンジンです。GGUF量子化されたLLM(およびマルチモーダルモデル)をCPU、CUDA、Metal、Vulkanなどで実行でき、token-for-tokenで完全に一致する出力、継続的バッチング、投機的デコーディング、OpenAI互換のHTTP APIを提供します。Pythonランタイムを一切必要としません。
zexadev/gemini-web2api-go
Google GeminiのWeb UIプロトコルを逆プロキシするGoサーバーで、OpenAI互換API(チャット、モデル、ストリーミング、動画、画像、音楽、Web検索)として公開。匿名またはGoogle Cookie付きで動作可能。レート制限、プロキシおよびCookieプール、SQLite/MySQL永続化、軽量な管理UIを備える。
skfolio/skfolio
scikit-learn をベースにしたポートフォリオ最適化とリスク管理のための Python ライブラリ。因子モデルの構築と ML ベースのモデル選択ツールを提供します。
carloslfu/slotstream
slotstream は、Apple-silicon Mac 上で 1250 億パラメータの Qwen‑3.8‑Flash‑Next モデルを実行できる Swift ベースの推論エンジンです。4 ビット量子化された重みを SSD からストリーミングし、RAM キャッシュに保持することで、48 GB の Mac で約 12 トークン/秒の速度を実現します。CLI、Ollama 互換および OpenAI 互換の HTTP API、オプションのビジョン対応、予測デコード、アプリへの埋め込み用 Swift パッケージを提供しています。