notepower2k1/CapCap

一款用於影片在地化處理的 Windows 應用程式,利用 Faster-Whisper 等 AI 模型與各種 TTS 引擎來自動化逐字稿製作、翻譯與配音。

dabit3/react-native-ai

一個用於建構跨平台行動AI應用的全端框架,內建支援即時LLM串流與影像生成。

Kazama-Suichiku/Houdini-Agent

基於 Meshy AI 的自主 AI 助手,可自動化節點網路建立、VEX/Python 編碼與 3D 資產生成,專為 SideFX Houdini 所設計。

oracle/mcp

Model Context Protocol (MCP) 伺服器的參考實作,讓基於 LLM 的工具能與 Oracle Cloud 服務互動。提供多語言(Python, Node.js, Java)伺服器、stdio 或 HTTP 傳輸方式,並支援容器化以及適用於 Cline、Cursor 和 mcphost 的客戶端設定片段。

OpenMOSS/MOVA

MOVA 是一個開源模型,可從文字提示(可選參考影像)生成同步的視頻+音訊。它採用雙塔視頻音訊架構,提供 360p/720p 檢查點、推理腳本、LoRA 微調流程、評估程式碼,以及與 SGLang、ComfyUI 和託管 API 的整合。

MaxBittker/rs-sdk

RS‑SDK 是一個開源、基於 TypeScript 的起始套件,模擬 RuneScape 風格 MMO 以進行機器人研究。它整合了伺服器模擬器、網頁客戶端、閘道與類型安全 SDK,讓你可撰寫非同步腳本(或 LLM 生成程式碼)來控制機器人,實驗目標導向合成、多代理競爭與市場經濟。示範伺服器開箱即用;你也可透過可調 tickrate 在本機主機執行。MIT 授權,並由 Discord 社群支援。

xandergos/terrain-diffusion-mc

一個 Minecraft Fabric 模組,使用擴散模型生成高度多樣且逼真的地形與景觀。

OpenVGLab/OmniLottie

OmniLottie 是一個多模態 AI 生成器,使用預訓練的視覺‑語言模型,從文字、圖像或影片輸入產生複雜的向量 Lottie 動畫。

HELPMEEADICE/TE-Speed-MiniMaxH3-OSS

一個 ComfyUI 自訂節點,透過 DiT 區塊的殘差快取機制,將 MiniMax H3 模型推論速度提升高達 45%。

Ariescar/anyCreature

一個 AI 驅動的管道,透過多階段設計與驗證流程,將文字描述轉換為遊戲就緒的動畫 3D 生物(GLB 格式)。

bquenin/interpreter

一款用於日本復古遊戲的離線螢幕翻譯器,利用 OCR 和本地 LLM 透過浮動覆蓋層提供即時英文字幕。

merveenoyan/smol-vision

一系列用於縮小、優化和客製化前沿視覺與多模態 AI 模型的食譜,以提升效率與效能。

pwilkin/trellis.cpp

使用 GGML 的獨立 C++ 實作,可在不使用 Python 的情況下,從圖像生成帶紋理的 3D 模型。

microsoft/unilm

微軟提供的一套全面的基礎模型與架構集合,專注於在文字、視覺、語音與多模態任務上實現大規模自監督預訓練。

oxbshw/watch-skill

一個將影片、音訊與螢幕活動轉化為時間戳證據的感知與驗證引擎,具備決定性驗證系統與專用代理工作區。

tegnike/aituber-kit

一個支援多種 LLM、TTS 引擎與 2D/3D 偵像的全方位工具包,用於建立可互動的 AI 角色(AITuber)

1038lab/ComfyUI-QwenVL

一個 ComfyUI 擴充功能,整合 Qwen-VL 視覺語言模型用於圖像和影片理解,具備雙 HF 和 GGUF 後端及 GPU 最佳化推理功能。

bkingfilm/lapian-notes

一款本地優先的電影分析工具,可提取畫面與字幕,生成 AI 支援的敘事結構樹、劇情泳道與情緒曲線。

NVIDIA-BioNeMo/bionemo-agent-toolkit

一個為 AI 代理提供專業化生命科學技能的工具包,使其能利用 NVIDIA 的模型與程式庫執行蛋白質摺疊、分子對接與基因組分析等任務。

fangwei123456/spikingjelly

SpikingJelly 是一個基於 PyTorch 的開源庫,用於建構、訓練與部署脈衝神經網路。它提供神經元模組、ANN 到 SNN 的轉換、多後端加速(torch、CuPy、Triton)、大規模訓練工具、類腦資料集載入器、效能分析工具,以及類腦硬體的匯出介面。需要 Python ≥ 3.11 與 PyTorch ≥ 2.6,採用 Open-Intelligence Open Source License 發布。

facebookresearch/VLM3

VLM³ 是一個框架,僅透過文字輸出與資料縮放,即可使標準視覺語言模型執行深度估計與相機位姿估計等 3D 視覺任務。

sakalond/StableGen

一個整合 TRELLIS.2 與 ComfyUI 的 Blender 增強模組,可從文字或圖像生成 3D 網格,並為現有模型應用 AI 驅動的貼圖。

katanaml/sparrow

一個面向企業文件智能的 API-first 平台,利用 Vision LLMs 和代理工作流將發票、收據和對帳單轉換為結構化的 JSON。

BIT-DataLab/Edit-Banana

一個使用 SAM 3 和多模態大語言模型,將圖表與流程圖的靜態影像轉換為可編輯 DrawIO XML 檔案的工具。

ZJU4HealthCare/HealthGPT

一個統一醫療文字、2D 圖像和 3D 體積的醫療多模態大語言模型家族,實現高階醫療理解與生成。

microsoft/Biodiversity

一套開源 AI 工具,用於生物多樣性監測,提供相機陷阱影像、聲音生物測量、航空視角與側掃聲納的動物偵測模型。

NX-AI/xlstm

xLSTM 是一種新穎的循環神經網路架構,透過引入指數門控與矩陣記憶,擴展了 LSTM,使其能支援大規模語言模型(例如,一個 70 億參數的模型)。該倉儲提供 PyTorch 程式碼、透過 `mlstm_kernels` 套件提供的自訂 CUDA/Triton 內核、單一檔案 70 億參數實作、設定工具,以及 Hugging Face 上的預訓練權重。安裝透過 conda + pip 完成,該庫可在 NVIDIA GPU(使用快速 Triton 內核)上運作,並為 AMD 或 Apple Silicon 提供回退方案。

catlog22/maestro-flow

Maestro‑Flow 是一個 TypeScript/Node.js 框架,可將自然語言意圖轉化為由多個 LLM 智能體(Claude、Gemini、Codex 等)執行的全棧開發流水線。其 Ralph 引擎將意圖分類為 40 多種命令鏈,在「決策」檢查點動態判斷是否繼續、回滾或插入修復迴圈,並將發現的模式自動儲存在 SQLite 知識圖譜中,後續執行時自動注入。支援四種協調模式(Delegate、Team、Wave、Swarm),透過 Odyssey 命令實現長時間自主循環,並具備精確的字面量/語意程式碼搜尋能力。安裝方式為 `npm i -g maestro-flow`,並提供豐富的 CLI 與 Web 仪表板文件。

VILA-Lab/FigMirror

FigMirror 是一個代理式工具,可自動將使用者資料以指定參考科學圖的風格生成 Matplotlib 程式碼。

OFA-Sys/Chinese-CLIP

一個針對跨模態檢索與零樣本圖像分類訓練的中文版 CLIP 模型,使用了 2 億對圖像-文本對。

anysearch-ai/anysearch-mcp-server

AnySearch MCP Server 是一個即時、MCP 相容的後端,提供通用網路搜尋、垂直領域搜尋、並行批次搜尋與 URL 內容擷取功能。它可透過簡單的 JSON 設定與 OpenCode、Claude Code、Cursor、VS Code、Windsurf、Cline 等主流 AI 助手 IDE 集成,支援可選的 API 金鑰認證以提升速率限制,也支援匿名使用。README 詳細說明了註冊流程、金鑰管理、客戶端特定設定片段,以及四個工具端點(`search`、`get_sub_domains`、`batch_search`、`extract`)的使用方法。

jtydhr88/ComfyTV

一個基於畫布的媒體工作台,將 AI 生成與專業級編輯工具整合,適用於影像、影片、音訊、音樂與 3D 資產。

valentinfrlch/ha-llmvision

LLM Vision 是一個 Home Assistant 集成,使用多模態大型語言模型(OpenAI, Anthropic, Gemini, Ollama 等)來分析圖像、影片片段、即時攝影機畫面和 Frigate 事件。它會返回自然語言描述、記住已識別的人、寵物或物體,並將每次分析結果存儲在時間軸中,可顯示在儀表板上或透過 Assist 進行查詢。可透過 HACS 安裝,配置 LLM 提供者,並可選擇添加提供的 Blueprint 以獲得 AI 摘要的攝影機通知。

NoizAI/HelixWorld

HelixWorld 是一個即時互動式音訊視覺世界模型,它生成可導航的環境,其中聲音和視覺會根據使用者移動同步更新。

tryonlabs/opentryon

一個用於時尚科技的開源 AI 工具包,為虛擬試穿、圖像/影片生成和多模態理解提供統一的介面。

CronusL-1141/AI-company

AI Team OS 是一個開源平台,可將類Claude的LLM轉化為持續運行的「CEO」。它持續運行,協調專業代理、任務牆、研究管道和雙層記憶系統。FastAPI + React儀表板即時展示工作流、決策軌跡和所有備忘錄的統一搜尋。適合希望實現AI優先、自主運行工作流的技術創辦人或研究團隊。

om-ai-lab/VLM-R1

VLM-R1 是一個使用 GRPO 訓練 R1 風格大型視覺語言模型的框架,旨在提升在視覺定位、數學與目標偵測等任務中的推理與泛化能力。

StanfordMIMI/Merlin

Merlin是一個用於電腦斷層掃描的3D視覺語言基礎模型和資料集,將CT掃描與電子健康記錄和放射學報告相結合,用於醫學分析。

OpenBMB/MiniCPM-V-Apps

一系列適用於 iOS、Android 和 HarmonyOS 的裝置端示範應用程式,允許 MiniCPM-V 系列多模態和文字模型透過 llama.cpp 完全在本機執行。

Intent-Lab/VisionClaw

一款利用 Gemini Live 即時感知視覺與聽覺,並透過 OpenClaw 集成執行動作的即時 AI 助手。

TinyLLaVA/TinyLLaVA_Factory

一個模組化程式碼庫,用於建構與訓練小規模大型多模態模型,支援多種 LLM、視覺塔與連接器。

Anionex/agent-vision-toolkit

一個透過任務感知視覺工具與無縫代理整合,為僅支援文字的 LLM 代理賦予圖像問答與 GUI 自動化能力的工具包。

fruitbars/simple-one-api

simple‑one‑api 是一個開源的 Go 閘道器,它透過 OpenAI 相容的端點將多個 LLM 供應商統一化,並增加了容量感知的金鑰排程、四層速率限制、內建的 React 聊天 UI、視覺化配置控制台,以及 Wails 桌面客戶端。它可以作為單一二進位檔、Docker 容器或桌面應用程式運行,並將配置儲存在 SQLite 中。

nikkigallery/Whimbox

一個利用 LLM 與影像識別技術,透過螢幕截圖與輸入模擬來自動化《Infinity Nikki》遊戲中日常任務、導航與活動的 AI 代理。

MooreThreads/torch_musa

torch_musa 是一個 PyTorch 擴充,為 Moore Threads GPU 加入了 **MUSA** 後端。它鏡像了標準 PyTorch API,因此您只需將 `cuda` 替換為 `musa`。該套件包含建構 C/C++ 擴充的工具、透過 **mccl** 後端進行分散式訓練的功能,以及用於快速設定的 Docker 鏡像。它還提供 torchvision、torchaudio 以及一系列其他熱門 PyTorch 套件的 MUSA 相容建構版本。可透過預建構的 wheel 安裝,或在安裝 MUSA SDK 後從原始碼建構。此專案採用 BSD 許可證。

crisng95/flowboard

一個僅限本地的無限畫布工作區,採用基於圖的方法,透過 Google Flow 將一致的角色和產品組合成圖像和影片。

kyutai-labs/unmute

透過將文本 LLM 包裝在低延遲語音轉文字與文字轉語音模型中,使文本型 LLM 能夠實現聽與說的系統。

Episkey-G/GrokSearch-rs

GrokSearch‑rs 是一個基於 Rust 的 MCP 伺服器,為 LLM 代理新增即時、帶引用的網路搜尋工具。它可以透過 stdio 在本機執行,也可以作為多租戶 HTTP 服務公開。伺服器查詢可設定的提供者鏈(Tavily、Exa、TinyFish、Firecrawl),並包含針對 GitHub、StackExchange、arXiv 和 Wikipedia 的無金鑰專用擷取器。功能包括回應預算、快取、對 Grok 的 OAuth 支援以及健康檢查 `doctor` 工具。透過 npm(預先建置二進位檔)或 Docker 安裝,使用環境變數或全域 TOML 檔案設定,並透過 MCP 協定與 Claude 風格助手整合。