MINT-SJTU/Evo-1

Evo-1 是一款用於機器人操作的輕量級視覺-語言-動作 (VLA) 模型,能將視覺與文字指令轉換為機器人動作,適用於各種模擬環境與真實硬體。

linus-sch/Mind-Map-Wizard

一個利用 LLM 和自訂 SVG 渲染引擎,將主題或檔案轉換為互動式視覺思維導圖的 AI 工具。

NEKOparapa/ReaDreamAI

一個自動化小說創作的 AI 平台,包括文字生成、一致的角色插圖和影片改編。

pyt-team/TopoModelX

一個用於在拓撲領域(如單體複形)進行深度學習的 Python 模組,適用於科學與工程領域。

Ammaar-Alam/minebench

MineBench 是一個基於網頁的基準測試工具,透過讓 LLM 對『中世紀城堡』等提示輸出體素座標,來評估其三維空間推理能力。它可視化生成結果,支援人類進行頭對頭對比,並使用 Bradley-Terry 系統對模型進行排名。平台包含成對投票用的 Arena、自訂建構用的 Sandbox、社群提示的 Gallery,以及 GLB、STL、.vox、.schem 等格式的匯出功能。支援主流 LLM 提供商,可透過 Node.js、pnpm 和 Docker 在本地執行。

Jasonzzt/ComfyUI-CacheDiT

一個透過智慧快取加速 Diffusion Transformer (DiT) 模型的 ComfyUI 延伸模組,為圖像與影片生成提供 1.4x 到 2.0x 的速度提升。

onyx-dot-app/onyx-foss

Onyx 是一個開源 AI 平台,作為 LLM 的應用層,提供 Agentic RAG、深度研究與自訂代理等進階功能。

supermemoryai/memorybench

一個使用標準化資料集與判斷模型,對不同提供者之間的 AI 記憶與上下文系統進行評估與比較的可插入基準框架。

runpod/runpod-python

RunPod 官方 Python 函式庫,提供用於建立 Serverless AI Worker 的 SDK 以及用於管理 GPU 雲 Pod 和端點的 REST API 包裝器。

PackmindHub/packmind

一個集中式工程手冊,可在多個 AI 編碼代理與倉儲之間同步編碼標準與指示。

microsoft/ai-dev-gallery

為 Windows 開發者提供的互動式 AI 範例庫,可探索本地 AI 模型並將其匯出為 C# Visual Studio 專案。

vitoplantamura/OnnxStream

一個記憶體優化的推論庫,透過權重串流與注意力切片,讓 Stable Diffusion 和 LLM 等大型 AI 模型能在超低記憶體裝置上執行。

UWMILab/UniWM

UniWM 是一種統一的、記憶增強的世界模型,適用於視覺導航,它在單一多模態自回歸骨幹中整合了自我中心視覺預測與規劃。

microsoft/LatentSpatialMemory

一個用於視訊世界模型的框架,將 3D 場景內容儲存為潛在表示,透過避免重複的 RGB 渲染來提升生成速度並減少記憶體開銷。

Ma-Zhuang/OmniNWM

OmniNWM 是一個研究用程式碼庫,建構用於自動駕駛模擬的全景多模態世界模型。它從車輛軌跡聯合生成 RGB、語意、深度與 3D 佔用圖,使用歸一化 Plücker 射線圖實現精確控制,並提供基於佔用的密集獎勵以支援封閉迴路策略評估。該倉儲包含安裝步驟(含對 `transformers` 的手動修補)、nuScenes 資料準備說明、預訓練檢查點下載連結,以及用於推論、分布外測試與分階段訓練的腳本。

TencentARC/VerseCrafter

VerseCrafter 是一個可控影片世界模型,透過 4D 幾何控制與 GeoAdapter,為真實影片中的相機與多物件運動提供精確且可解釋的控制。

nvidia-cosmos/cosmos-predict1

一套專為未來狀態預測設計的世界基礎模型,能從文字或影片提示生成視覺模擬,以支援 Physical AI 的開發。

Tencent-Hunyuan/HY-WorldPlay

HY-World 1.5 是一個即時互動式世界建模框架,利用串流影片擴散技術,根據使用者輸入生成幾何一致的 3D 環境。

jamubc/gemini-mcp-tool

一個將 AI 助手連接到 Gemini/Antigravity CLI 的 MCP 伺服器,支援大規模程式碼庫分析與沙箱化程式碼執行。

justrach/kuri

一個為 AI agent 設計的輕量級瀏覽器自動化工具,以單一 Zig 二進位檔實現,無需 Node.js 依賴。

0xranx/golembot

GolemBot 是一個 Node.js 執行階段,為現有的編碼代理(Cursor, Claude Code, OpenCode, Codex)提供聊天機器人「身體」。透過單一的 `golembot gateway` 指令,您可以在 Slack、Telegram、Discord、Feishu、DingTalk、WeCom、WeChat 或自訂 HTTP API 上公開該代理,並透過微小的 YAML 設定檔切換 LLM 提供者(OpenRouter、MiniMax、DeepSeek 等)。它整合了 ClawHub 市場(13 k+ 社群技能),使代理能即時獲得新能力。功能包括內建儀表板、cron 排程器、艦隊管理,以及最小化的 JavaScript SDK(`createAssistant`)。透過 `npm i -g golembot` 安裝,執行 `golembot onboard` 進行設定,然後執行 `golembot gateway` 上線。採用 MIT 授權。

OpenEnvision/WorldFoundry

一個開源基礎設施,為影片生成、3D/4D 表示與具身 AI 提供統一的推論、資產階段化與基準評估堆疊。

nndeploy/nndeploy

一個使用視覺化工作流程在桌面、行動與邊緣裝置上部署 AI 模型的高性能 AI 部署框架。

evilmartians/agent-prism

用於視覺化 AI Agent 追蹤軌跡的 React 組件庫,將複雜的 JSON 日誌轉換為層級視覺圖表,讓除錯更加容易。

Cranot/roam-code

roam‑code 是一個本地靜態分析 CLI(及可選 MCP 伺服器),可建立程式碼庫的符號圖,讓 AI 編碼代理無需任何遠端 API 呼叫即可查詢定義、呼叫者、測試影響與風險(爆炸半徑)。它提供預飛行檢查、健康摘要、驗證門禁與 Claude 特定鈎子,全部開源且保護隱私。

mit-ll-responsible-ai/hydra-zen

一個 Python 函式庫,透過消除 Hydra 專案中手寫的 YAML 設定檔,簡化可配置且可擴展工作流程的建立。

expectedparrot/edsl

一種針對計算社會科學與市場研究的領域專屬語言,讓使用 AI 代理與大型語言模型(LLM)設計與執行調查與實驗變得簡單。

iflytek/astron-rpa

一款企業級開源 RPA 桌面應用,支援低程式碼自動化桌面軟體與網頁,具備與 AI 代理的深度整合。

aristoteleo/PantheonOS

一個可演化的多代理框架,能自動化並擴展資料科學,專注於端對端的單細胞生物學分析。

microsoft/MInference

MInference 透過利用動態稀疏注意力模式,在單個 A100 GPU 上實現高達 10 倍的加速,藉此加速長文本 LLM 的預填充(pre-filling)階段。

imagej/imagej2

ImageJ2 是一個科學成像框架,它擴展了原始的 ImageJ,以支援多維圖像數據以及跨多種程式語言的無頭處理。

unrealcv/unrealcv

一個為 Unreal Engine 設計的外掛程式,讓電腦視覺研究人員能利用 PyTorch 和 TensorFlow 等外部 AI 框架建立虛擬世界並與其互動。

Tencent-Hunyuan/HunyuanVideo-1.5

一個輕量級的 8.3 億參數影片生成模型,能在消費級 GPU 上實現高品質的文字轉影片與圖像轉影片合成。

buildingjoshbetter/TrueMemory

一個本地優先的長期記憶系統,為 AI 代理自動捕捉與更新使用者偏好與事實,跨會話消除 AI 健忘症。

Mohamedelrefaie/DrivAerNet

一個包含 8,150 個高保真 CFD 汽車設計的全面性多模態數據集與基準測試,用於訓練用於空氣動力學優化與性能預測的 AI 模型。

RobotecAI/rai

一個靈活的 AI agent 框架,用於開發與部署具身智能 (Embodied AI) 功能,使機器人能夠利用生成式 AI 進行推理、多模態交互與複雜任務執行。

giselles-ai/giselle

一個用於透過視覺化建構器與 GitHub 整合來建立與執行代理型工作流的開源 AI agent studio。

alexiglad/EBT

一個針對能量基礎變壓器(EBTs)的框架,能在文字、圖像與影片等多模態上實現可擴展的推理與 System 2 思考。

NVIDIA/DALI

一個用於數據加載和預處理的 GPU 加速庫,旨在消除深度學習流水線中圖像、視頻和音頻數據的 CPU 瓶頸。

memodb-io/Acontext

一個開源的 AI 代理技能記憶層,會自動從代理執行中捕捉學習內容,並以人類可讀的 Markdown 檔案儲存。

vakra-dev/reader

一個生產等級的網頁爬蟲引擎,為 AI 代理與大型語言模型(LLM)提供乾淨的 Markdown 輸出與反機器人繞過功能。

HyperGAN/HyperGAN

一個基於 PyTorch 的可組合 GAN 框架,讓開發者與藝術家能輕鬆訓練、分享與部署生成對抗網路。

ra1nty/DXcam

一個高效能的 Windows 螢幕擷取程式庫,為 Python 提供低延遲、高幀率的畫面,適用於 AI 代理和電腦視覺工作負載。

winfunc/opcode

一個用於 Claude Code 的 GUI 應用程式與工具組,提供視覺化工作階段管理、自訂代理建立以及使用分析。

potamides/DeTikZify

DeTi*k*Zify 是一個開源的多模態 LLM,可將草圖或點陣科學圖形轉換為可編輯的 TikZ 程式碼。它支援影像轉 TikZ、透過 Ti*k*Zero 適配器進行文字轉 TikZ,以及使用蒙地卡羅樹搜尋進行迭代最佳化。可透過 pip 安裝,需要完整的 TeX Live、Ghostscript 和 Poppler 安裝,並可在 GPU(8‑b 模型)或 CPU(1‑b)上執行。此儲存庫提供 CLI/Web UI、Python API 範例、Hugging Face 上的模型權重,以及重建訓練資料集的腳本。

mrpulor-gh/nuphus-mcp

該倉儲是一個關於 AI 桌面與瀏覽器自動化的真實軟體專案,提供一個基於 Rust 的 MCP 伺服器,透過標準輸入輸出的 JSON-RPC 與 AI 代理通訊,使 AI 代理能夠控制本機電腦,支援本地 OCR 與可選的視覺模型整合。

NaomiProject/Naomi

Naomi 是一個開源、持續在線的語音助理平台(Python,Linux/Raspberry Pi),可讓你控制家庭裝置、查詢資訊,並透過簡單的 Python 模組新增自訂「技能」。

tidyverts/fable

一個提供時間序列預測模型集合的 R 套件,包含 ARIMA 與指數平滑法,並與 tidyverse 工作流程整合。