datacurve-ai/deep-swe

DeepSWE 是一個基準測試,用於衡量 113 個來自真實世界開源倉庫的長期軟體工程任務上的編碼代理性能。

jfrog/boost

Boost 是一個命令包裝器,可將嘈雜的 shell 輸出壓縮為 AI 編碼代理的結構化上下文,降低 token 成本,同時不犧牲任務效能。

guardrails-ai/guardrails

透過強制執行輸入/輸出風險驗證並確保 LLM 產生結構化資料,建構可靠 AI 應用的 Python 框架。

juliye2025/evil-read-arxiv

一個自動化的研究工作流,用於搜尋、推薦和分析來自 arXiv 和 Semantic Scholar 的學術論文,並將結果直接整合到 Obsidian 筆記中。

feast-dev/feast

一個用於機器學習的開源特徵儲存,負責管理從離線訓練集到低延遲線上推理的數據流。

google-research/android_world

一個用於建構與測試能控制各種真實世界應用中 Android 裝置的自主代理的環境與基準。

KMnO4-zx/agentic-rl-lab

一系列前沿LLM強化學習演算法的簡潔重現,旨在降低研究Agentic-RL時的GPU和程式碼複雜性門檻。

ryfineZ/codex-session-patcher

專為安全測試和 CTF 競賽設計的 AI 編碼助手(Codex、Claude Code、OpenCode)會話清理器與提示注入工具,旨在繞過拒絕回應。

Kong/kong

Kong 是一個雲原生 API 與 AI 網關,可集中管理微服務、LLM 與 Model Context Protocol (MCP) 流量的路由、安全與編排。

ggml-org/ggml

專為機器學習設計的輕量級、無依賴的 C/C++ 張量庫,著重於高效性與跨平台可移植性。

sunblaze-ucb/cybergym

用於評估 AI Agent 執行現實世界漏洞分析與 PoC(概念驗證)漏洞利用生成能力的規模化評估框架。

skalesapp/skales

Skales 是一個閉源、本地運行的 AI 桌面與行動代理,可聊天、自動化多步驟目標、編輯程式碼、產生設計/媒體資產、管理行事曆並保留記憶——所有操作均不將資料傳送至雲端。它支援 Windows/macOS/Linux/Android/iOS 的單一按鍵安裝,並兼容 >15 個 LLM 提供者或完全離線模型。

DavidCarliez/trustmebro

一個工具輸出代理,可攔截 AI 代理的命令列呼叫,為紅隊測試與防護機制繞過評估提供偽造或修改的回應。

simonw/llm

一個用於與多個 LLM 進行互動的 CLI 工具和 Python 函式庫,支援透過遠端 API 和本地安裝進行互動,並具備內建的日誌記錄與結構化數據提取功能。

mark3labs/mcp-go

Model Context Protocol (MCP) 的 Go 實作,使 LLM 應用程式能夠使用標準化介面與外部數據源和工具進行整合。

kdlbs/kandev

一個開源的 AI 編碼代理協調器,支援並行任務執行、遠端執行環境,以及整合式的審查優先工作區。

raindrop-ai/workshop

專為 AI Agent 設計的本地除錯器,提供即時追蹤流與用於修復 Agent 錯誤的自癒式評估迴圈。

agentclientprotocol/claude-agent-acp

一個使 Claude Agent SDK 能與任何遵循 Agent Client Protocol (ACP) 的客戶端協同使用的適配器。

Manavarya09/design-extract

從任意即時網站中提取完整設計系統,生成開發者可用的權杖、Tailwind 設定與 Figma 變數的工具。

datajuicer/data-juicer

一個提供 200 多個模組化運算子的多模態資料處理框架,用於清洗、去重與整理大規模資料集,以供基礎模型使用。

Helldez/BigMoeOnEdge

一個推理引擎,透過即時從快閃記憶體中串流專家模型,讓能夠執行大於裝置 RAM 的混合專家模型 (MoE)

laravel/ai

適用於 Laravel 的統一 AI SDK,為代理、影像和音訊提供一致的 API,支援 OpenAI、Anthropic 和 Gemini 等提供者。

databrickslabs/ontobricks

一個基於 LLM 驅動的本體設計與映射,將 Databricks 表轉換為物質化圖譜的知識圖譜建構工具

yetone/kill-ai-slop

一款用於識別並移除網頁專案中通用AI生成設計模式(AI垃圾)的工具與現場指南。

shadcn/improve

一項代理技能,用於審計程式碼庫並為低成本 AI 模型生成詳細、自包含的實作計畫,解決高成本模型執行重複性編碼任務的低效率問題。

thedivergentai/GD-Agentic-Skills

一個高密度的知識庫與工具集,讓 AI 編碼代理能運用專家級模式與最佳實務,為 Godot 4.7+ 建構專業級遊戲。

toon-format/toon

一種緊湊且易於閱讀的 JSON 資料模型編碼,旨在於降低 LLM 提示中的 token 使用量,同時保持高檢索準確度。

anthropics/jacobian-lens

用於將語言模型內部激活解碼為詞彙標記以分析內部表示的參考實作。

Armur-Ai/Pentest-Swarm-AI

Pentest Swarm AI 是一個開源 Go 工具,可並行執行數十個自主的 LLM 驅動代理,透過共享的 Postgres 黑板與費洛蒙驅動的協同作用進行協調。支援任何 LLM 提供商(Claude、Together AI、OpenAI 相容、Ollama 等),內建偵察/利用工具鏈(ProjectDiscovery 庫、nmap),並提供互動式終端 UI 與 Web 仪表板。蜂群可針對真實主機或內建的脆弱實驗室,強制執行範圍,並產出證據支援的報告。核心功能穩定;蜂群排程器處於 Alpha 階段,後續計畫支援 Metasploit、sqlmap、ZAP、Burp 等適配器及微調模型。

danielealbano/android-remote-control-mcp

一個 Android 應用,作為 MCP 伺服器運作,利用可存取性服務與螢幕截圖擷取,使 AI 模型能遠端完全控制裝置。

open-mercato/open-mercato

一個 AI 工程基礎框架,提供具備架構感知能力的工具架構與模組化業務組件,以確保 AI 生成的程式碼保持一致性並符合架構設計。

poloclub/transformer-explainer

一個在瀏覽器中運行實時 GPT-2 模型,幫助用戶學習 Transformer 模型如何預測文本的互動式視覺化工具。

builderz-labs/mission-control

一個用於操作 AI 代理的自托管控制平面,允許使用者從單一儀表板分派任務、追蹤支出,並協調多個代理執行環境。

nrslib/takt

一個 CLI 工具,將 AI 編碼代理編排為可重複的、由 YAML 定義的開發工作流程,具備隔離的工作樹與明確的審查循環。

huggingface/huggingface_hub

The official Python client for the Hugging Face Hub, enabling users to download, upload, and manage open-source ML models, datasets, and demo apps.

lance-format/lance

一種為多模態 AI 設計的開源 lakehouse 格式,提供高性能的向量搜索、隨機存取、以及圖像、視頻和音頻的原生支持。

leigest519/OpenGame

OpenGame 是一個開源、基於 Node 的框架,使用專用程式碼 LLM(GameCoder‑27B)從單一自然語言提示生成完整的 Web 遊戲。它提供可重複使用的 *Game Skill*(模板選擇 + 自動調試)、用於無頭生成的 CLI(`opengame`),以及用於衡量可玩性的評估套件(OpenGame‑Bench)。該系統使用 Phaser 等引擎搭建專案,在沙箱中執行,修復整合錯誤,並輸出可直接播放的 HTML/JS 遊戲。

containers/kubernetes-mcp-server

Kubernetes MCP Server 是一個基於 Go 的模型上下文協定伺服器,讓 AI 助手與代理能直接透過 Kubernetes API 檢查與管理 Kubernetes 與 OpenShift 叢集,而非包裝 kubectl 或 helm。它提供對 Pod、命名空間、事件、Helm 發布、Tekton 流水線、KubeVirt 虛擬機等的工具支援,並可在無外部命令列依賴的情況下跨多個叢集運作。

HG-ha/MTools

一個現代跨平台桌面工具集,整合影像處理、音訊/影片編輯與本地 AI 工具,並支援 GPU 加速。

addyosmani/web-quality-skills

一組以測量為先的 AI 編碼代理技能,使代理能利用 Google Lighthouse 等工具對 Web 專案進行效能、可存取性與 SEO 的審查與優化。

DrCatHicks/learning-opportunities

一套基於實證學習科學的插件,專為 Claude Code 與 Codex 所設計,透過互動式練習防止 AI 輔助編程過程中的技能退化。

ConardLi/easy-dataset

一個透過將非結構化文件轉換為高品質結構化問答對與評估集,來建立 LLM 微調資料集的工具。

KimGLee/Cambium

一套治理標準與工具組,適用於由 LLM 代理維護的知識儲存庫,確保確定性的工作流程、可恢復性以及明確的操作員與代理邊界。

happier-dev/happier

AI 編碼代理的跨裝置配套應用與客戶端,可於本地執行會話,並透過行動、網頁或桌面端遠端控制。

mudler/vllm.cpp

vllm.cpp 是一個純 C++ 推論引擎,其效能與功能與資源密集的 vLLM Python 伺服器一致,但體積僅約 66 MiB。它可在 CPU、CUDA、Metal、Vulkan 等平台上執行 GGUF 量化 LLM(及多模態模型),提供逐 token 相同的輸出、連續批次處理、預測解碼,以及 OpenAI 兼容的 HTTP API,且完全不需 Python 執行時環境。

zexadev/gemini-web2api-go

一個 Go 伺服器,反向代理 Google Gemini 的網頁 UI 協定,並以 OpenAI 相容 API(聊天、模型、串流、影片、影像、音樂、網頁搜尋)形式公開。支援匿名或使用 Google Cookie,包含速率限制、代理與 Cookie 池、SQLite/MySQL 持久化,以及輕量級管理 UI。

skfolio/skfolio

一個基於 scikit-learn 的 Python 程式庫,用於投資組合優化與風險管理,提供因子模型建構與基於機器學習的模型選擇工具。

carloslfu/slotstream

slotstream 是一個基於 Swift 的推論引擎,可在 Apple Silicon Mac 上執行 1250 億參數的 Qwen‑3.8‑Flash‑Next 模型。它會從 SSD 流式傳輸 4 位元量化權重至 RAM 快取,使 48 GB Mac 可達每秒約 12 個 token 的速度。該工具提供 CLI、與 Ollama 兼容及 OpenAI 兼容的 HTTP API、可選的視覺支援、預測解碼功能,並提供 Swift 套件以嵌入應用程式。