lycohana/BiliSum

BiliSum 是一款視頻轉知識工具,可將 Bilibili、YouTube 及本地視頻轉換為轉錄內容、視覺筆記,以及本地 RAG 驅動的知識庫。

death34018-hue/AionsHome

整合多模態聊天、智慧攝影機監控與基於 RAG 的記憶的本地主機 AI 伴侶系統,打造主動式個人助理。

google-labs-code/stitch-sdk

一個 TypeScript SDK,可從文字提示生成與編輯 UI 預覽畫面,提供 HTML 與截圖以實現快速原型設計與 AI 代理整合。

omicverse/omicverse

OmicVerse 是一個Python函式庫,統一了批量RNA-seq、單細胞與空間轉錄體學分析。它捆綁了數十個成熟的生物資訊學工具,標準化了 anndata/mudata 資料結構,並新增AI輔助代理(J.A.R.V.I.S.)與MCP伺服器,使您能透過自然語言指令或LLM整合執行工作流程。可選擴充提供合成生物學建模與GPU加速分子動力學工作流。

xandergos/terrain-diffusion

一種學習型的 Perlin 噪聲繼承者,利用擴散模型產生無限、確定且可隨機存取的即時地形與氣候資料。

oil-oil/wolfcha

Wolfcha 是一款網頁遊戲,讓一名人類玩家與滿桌由 AI 控制的角色進行狼人殺遊戲。AI 會記住過去的對話,帶著意圖行動,並實時生成語音台詞(可選語音),無需其他人類玩家即可重現混亂的社交推理體驗。

PunithVT/ai-avatar-system

一個支援即時唇形同步、零樣本語音克隆與多LLM的生產就緒型AI虛擬形象建構平台。

LC044/TrailSnap

一款 AI 驅動的自架相簿,透過票證 OCR、人臉識別和地理足跡映射,自動整理旅行記憶。

ashuoAI/SHUO-Canvas

SHUO Canvas是一款桌面端、基於節點的畫布,讓創作者能將文字、影像、影片與音訊與AI生成(透過OpenAI相容、RunningHub、ComfyUI等)結合,建構腳本、故事板、角色替換影片、360°全景圖、配音與3D場景——所有內容皆在一個視覺化工作流中完成。

MashiroSaber03/Saber-Translator

一個 AI 驅動的漫畫翻譯與管理套件,可自動化文字檢測、OCR、翻譯和圖像修復,配備基於 RAG 的劇情分析引擎。

jipraks/yt-short-clipper

一款使用 LLM 識別 YouTube 影片高光並自動轉換為帶字幕的 9:16 縱向剪輯的 Windows 桌面應用。

vanloctech/youwee

一個開源 GUI,支援從 1,800 多個網站下載影片,整合 AI 影片摘要、自然語言編輯與 AI 驅動的字幕生成。

openstory-so/openstory

一個AI驅動的影片製作平台,能將劇本轉換為具有一致角色與視覺風格的影片序列。

Softeria/ms-365-mcp-server

一個 Node.js 伺服器,將 Microsoft 365 Graph API 作為 MCP 工具暴露給 LLM,支援個人和組織帳戶、多帳戶使用、權限過濾,以及實驗性的節省 token 的 TOON 輸出格式。

google-deepmind/alphagenome_research

AlphaGenome 是一個統一的 DNA 序列模型,可預測調控性遺傳變異對基因表現、剪接和染色質特徵在單鹼基對解析度下的影響。

facebookresearch/eb_jepa

一個用於在影像與影片之間學習預測與規劃表示的輕量級程式庫,基於能量基聯合嵌入預測架構。

huangjunsen0406/py-xiaozhi

py‑xiaozhi 是一個基於 Python 的非同步優先框架,用於構建可以傾聽、說話、觀察並控制硬體的多模態 AI 助手。

NVlabs/FastGen

基於 PyTorch 的框架,利用多種蒸餾與加速技術加速圖像與影片生成的擴散模型。

ogkalu2/comic-translate

一個自動化的漫畫翻譯工具,利用 LLM、OCR 和修復技術,將多種語言的漫畫和漫畫翻譯的同時保留原始視覺佈局。

microsoft/skills-for-copilot-studio

Skills for Copilot Studio 是一個外掛程式(適用於 Claude Code、GitHub Copilot CLI 和 VS Code),可讓您使用 YAML 檔案建立、編輯、同步、測試 Microsoft Copilot Studio「標準」代理程式並取得設計建議——全部在終端機或編輯器中完成。

NVIDIA/TransformerEngine

NVIDIA Transformer Engine 是一個專注於 GPU 的函式庫,提供 FP8/MXFP8/NVFP4 混合精度支援、融合核心以及適用於 PyTorch 與 JAX 的簡單 autocast API,從而實現大語言模型與 MoE 模型更快速、低記憶體消耗的訓練與推論。

Alos21750/UAV-Downloader

UAV Downloader 是一款專注於 Windows 的影片下載工具,支援 JableTV、MissAV、SupJav 與 Hanime1,可利用本地語音辨識(ReazonSpeech K2 v2 或 Whisper)與翻譯模型(FuguMT、OPUS-MT)自動產生日文、英文與繁體中文字幕。提供三種操作模式——互動式 GUI(UAV Browser)、無人值守排程器(UAV Watcher)與無頭 Docker/CLI 版本,支援代理、平行下載及可選的 LLM 翻譯。專案採 Apache 2.0 授權,預設離線運作。

tianjiangqiji/nova-image-studio

一個允許使用者導入自有模型並透過插件系統擴展功能的自托管 AI 圖像與影片生成工作台。

wassermanproductions/motion-previs-studio

一款為電影製作人設計的桌面應用程式,可從參考影片中提取姿勢、深度與相機運動資料,以建立 AI 影片生成流水線的控制套件。

FlowElement-xinliuyuansu/m_flow

M-flow 是一種記憶系統,專為 AI 代理設計,透過在知識圖譜中對證據路徑進行評分來檢索資訊,其運作方式類似於認知記憶系統,而非僅依賴相似度搜尋。

visualbruno/ComfyUI-Trellis2

ComfyUI‑Trellis2 是一個自訂節點套件,將微軟的 TRELLIS.2 3D 擴散模型整合至視覺程式設計介面 ComfyUI 中。它提供數十個節點,可從單張或多張影像(或影片)生成、精煉、紋理化與渲染網格。安裝需 Windows、Python 3.11、PyTorch 2.7/2.8 + CUDA,以及 Facebook DINOv3 檢查點。倉庫提供原生擴展的預建輪子,並包含範例工作流程。這是一個活躍的、真實的 AI/ML 專案,專注於 3D 生成。

Asad-Ismail/MoneyPrinterTurbo-Extended

一個自動化影片生成工具,可生成腳本、使用本地語音克隆合成語音,並匹配相關影片片段,實現同步的逐字字幕。

opentokenz/mcpx

MCPX 是一個基於 Go 的本地伺服器,實作 MCP 協定,讓 LLM 代理(ChatGPT、Claude 等)能安全地讀取、編輯、執行、管理註冊的本地工作區中的檔案、命令、計畫與產物。它提供持續的遠端會話、細粒度的安全政策、儲存在 SQLite 的審計日誌,並可透過技能與自訂工具進行擴充。

jangles-byte/Pythia

一個本地、群智智能的全球預測系統,融合40多個即時資料流,建構3D智慧地球以預測世界事件

NVIDIA-BioNeMo/Proteina-Complexa

一種用於原子級蛋白質結合物設計的生成模型,透過統一生成建模與幻覺,為蛋白質與小分子配體生成結合物。

aurekaresearch/OpenDDE

一個所有原子的生物分子基礎模型,利用共摺疊進行藥物發掘中的結構預測、設計與優化。

OpenBMB/MiniCPM-o-Demo

MiniCPM-o 4.5 的示範系統,讓 AI 可即時、全雙工地同時看、聽、說,實現真正的多模態互動

mynaparrot/plugNmeet-server

基於 LiveKit 建構的可擴展、開源網路會議系統,提供自托管視訊會議功能,支援 AI 驅動的語音轉錄與摘要。

bytedance/SALMONN

一套先進的多模態 LLM,為大型語言模型提供通用聽覺能力與整合音視覺感知能力。

mcp-router/mcp-router

MCP Router 是一款已停用的開源桌面應用(Windows/macOS),用於本地管理 Model Context Protocol (MCP) 伺服器。它允許使用者將伺服器分組為專案與工作區,逐一切換工具,檢視請求日誌與基本分析資料,並與主流 AI 前端整合。所有資料均保留在使用者機器上;最後發布版本為 v0.6.4(支援終止日:2026年9月)

NVIDIA-NeMo/Megatron-Bridge

NeMo Megatron Bridge 是一個 PyTorch 原生函式庫,用於連接 Hugging Face 模型檢查點與 NVIDIA 的 Megatron‑Core 訓練引擎。它提供雙向檢查點轉換、驗證和高吞吐量訓練(張量/管線並行、FP8/BF16/FP4)。該儲存庫附帶數十種 LLM、VLM 和擴散模型的現成配方(例如 Llama 3.2、Nemotron‑3 Ultra、K‑EXAONE‑2),並支援 SFT/LoRA 微調。可透過官方 NeMo Docker 容器或從原始碼安裝,並使用提供的快速入門腳本進行模型轉換、訓練或匯出。

tl2012tl/TE_MAN

TE MAN 是一個 ComfyUI 插件,新增無限畫布工作流程、資源庫、音訊/影片/影像節點、3D 導演、批次提示工具與整合式 AI 助手聊天面板,支援本地模型推論與遠端 API 使用,適用於影像、影片與多模態生成。

nagadomi/nunif

一組基於 PyTorch 的工具,用於圖像超解析度、VR 用 2D 到 3D 影片轉換,以及資料集過濾的圖像品質評估。

ysr666/dsh-vision-router

DeepSeek Harness 的視覺路由插件,使代理可透過工具呼叫與影像像素互動,並提供內建的無密鑰免費視覺備用方案。

tracel-ai/cubecl

CubeCL 是一種基於 Rust 過程宏的語言,讓您用 Rust 編寫單一計算內核,並將其 JIT 編譯為 CUDA、HIP、Metal、WebGPU(WGSL/SPIR-V)或 CPU SIMD。它用四個軸(向量、平面、立方體維度、立方體數量)對並行性進行建模,支援編譯時特化、自動向量化和執行時自動調校,並構成 Rust 深度學習框架 Burn 和內核函式庫 cubek 的低階基礎。

nicolasvonluetzow/GaussianGPT

GaussianGPT 是一種基於 Transformer 的模型,透過下一個標記預測生成 3D 高斯場景,支援可控的 3D 場景生成、補全與外繪。

MiniMax-AI/MiniMax-MCP

一個官方的 Model Context Protocol (MCP) 伺服器,讓 Claude 和 Cursor 等 AI 客戶端能利用 MiniMax API 生成語音、克隆語音,並創造圖像與影片。

InternLM/Intern-S1

一系列針對科學智能和長程智能體優化的多模態基礎模型,能夠在化學和生物學等複雜科學領域進行推理。

ZeroTang05/cyber-doctor

一個利用 RAG、知識圖譜與語音互動進行疾病診斷與醫療紀錄分析的多模態 AI 健康助手。

ACEsuit/mace

MACE 是一個開源的 PyTorch 庫,用於等變圖神經網路原子間勢能。它提供快速訓練/評估、多 GPU 與 Apple-Silicon 支援、可選 CUDA 加速,以及材料與有機化學的預訓練基礎模型目錄。透過 `pip install mace-torch` 安裝,使用 `mace_run_train` CLI(或 YAML 設定)訓練,使用 `mace_eval_configs` 評估。包含文件、Colab 教學與 Weights & Biases 集成。v0.3 線穩定,而重大 v1.0 重構正在進行中。

danilo-znamerovszkij/draw-your-font

一個開源工具,透過本機處理與可選的AI視覺進行字元標記,將手寫照片轉換為可安裝的TTF/WOFF字型。

tracefinity/tracefinity

一款利用 AI 驅動的輪廓追蹤與比例校準技術,從工具照片生成客製化 Gridfinity 3D 列印儲存箱的工具。

Mobile-Artificial-Intelligence/maid

Maid 是一個開源的 Android 應用程式(React Native),可透過 llama.cpp 在本機執行 GGUF LLM 模型,並連接到多個遠端 LLM API。它提供一鍵模型下載、對話管理、可調整的生成設定、可選的雲端同步,以及附屬的語音合成應用程式(Maise)。可從 GitHub 發布版本或 Google Play 安裝,也可自行建置 APK。