MoonshotAI/Kimi-K3

Kimi K3 是一個擁有 2.8T 參數的開源權重原生多模態 MoE 模型,專為長週期編碼、深度研究和複雜的智能體知識工作而設計。

modelscope/DiffSynth-Studio

一個開源的擴散模型引擎,可在消費級 GPU 上實現影像、影片與音訊生成模型的高效能推論與訓練。

solidSpoon/DashPlayer

一款專為英語學習者打造的 AI 增強影片播放器,提供本地 AI 字幕生成、句子拆解和詞彙工具,以促進沉浸式語言學習。

flyteorg/flyte

Flyte 2 是一個用於定義、編排和提供 ML 流水線與 AI agent 服務的開源 Python 框架。它讓您能夠將普通的 Python 函數作為任務,將其組合成工作流,並在本地或未來的 Kubernetes-native 後端上執行。該專案包含 CLI、以開發者為中心的 TUI,以及對 FastAPI 模型服務化的原生支持。

Jamailar/Beav

Beav(前身為 RedBox)是一款專為自媒體創作者設計的跨平台桌面 AI 工作站。它讓您能夠收集網頁與社群媒體素材、儲存至本地知識庫、利用 AI 生成文字、圖片與影片、編輯配音剪輯、添加動畫並排程發布,所有功能皆整合於單一介面。該應用程式隨附 Chrome/Edge 網頁擷取工具、每日營運報告、可重複使用的圖片模板、多軌影片編輯器,並可選擇整合外部 Agent。它支援 macOS、Windows 與 Linux,可使用內建 AI 服務或任何相容 OpenAI 的端點,並以 MIT-NC(非商業)授權發布。

smixs/visual-skills

一套AI代理技能工具包,應用專業電影製作和戲劇學原理,為AI影片和圖像模型生成高精度提示。

ErickWendel/localstudio

一款瀏覽器原生、以本地為首的簡報編輯器,利用 Web AI 與 WebGPU 提供無後端的 AI 驅動簡報生成、翻譯與簡報工具。

verl-project/verl-omni

一個適用於多模態生成模型的通用 RL 訓練框架,提供快速滾動與穩定的後訓練,適用於擴散模型與多模態模型。

ModernRelay/omnigraph

Omnigraph 是一個基於 Rust 的湖倉式圖資料庫,將資料以欄式 Lance 格式儲存在任何 S3 相容物件儲存中。專為 AI 代理艦隊設計:每個代理可寫入其隔離分支,然後提交變更以供審查和 Git 風格合併。查詢在單一執行時中融合圖遍歷、向量 ANN 和全文搜尋,Cedar 策略對每次變更強制執行細粒度安全。專案提供 CLI、Axum HTTP 伺服器、TypeScript SDK 和 LLM 主機用的「MCP」橋接器,是代理記憶、企業腦知識圖譜、開發圖自動化和版本化 ML 資料層的全棧解決方案。

NVIDIA/cosmos

一個開放平台,提供全模態世界模型與工具,用於建構物理AI,支援機器人與自主系統對文字、視覺、音訊與動作序列的聯合處理與生成。

TrenTorch/TrenTorch

Tren⚡Torch 是一個教育性質的、僅依賴 NumPy 的深度學習框架,重現 TinyTorch 並新增 20 個進階模組——從張量與自動微分到 CNN、Transformer、量化與基準測試——還包含 CLI 與歷史里程碑腳本,支援實作學習。

Yuliang-Liu/MonkeyOCRv2

面向 Document AI 的視覺-文字基礎模型,提供多語言視覺編碼器以及專用於文件解析與理解的模型。

apify/mcpc

mcpc 是一個輕量、跨平台的 CLI,提供對 Model Context Protocol (MCP) 的完整存取——AI 代理的工具、提示、任務與付款的標準 API。它讓代理與腳本能從 Bash shell 呼叫任何 MCP 操作,支援持久會話、儲存在作業系統金鑰鏈中的 OAuth 2.1、適合管道的 JSON 輸出、透過 grep 的動態工具發現,以及實驗性的 x402 付款整合。

nexmoe/VidBee

一款開源桌面應用程式,可從 1000 多個網站下載影片和音訊,在本地進行轉錄,並使用 AI 對內容進行摘要和搜尋。

kgoedecke/doop

Doop 是一個開源的即時設計畫布,人類與 AI 代理(透過 Claude Code 或內建 Doop 代理)可共同編輯 HTML 幀。它提供即時多人功能、AI 驅動的設計任務、私有共享,並可透過單一 Docker 命令或 `bun run dev` 自行托管。AI 後端支援 Anthropic(免費層)或使用者提供的 OpenAI/ChatGPT 金鑰。

869413421/ai-moive-studio

一個全棧式 AI 內容創作工作台,透過無限畫布與代理輔助工作流,將文字轉化為 AI 電影與短影片。

Huanshere/VideoLingo

一個透過統一的 Streamlit 界面實現語音轉錄、翻譯與語音生成自動化的 AI 驅動影片翻譯與配音工具。

nicobailon/pi-mcp-adapter

一個 Pi 代理插件,透過一個輕量工具代理 MCP 伺服器,懶加載伺服器並按需發現工具,以節省上下文視窗

taylorwilsdon/google_workspace_mcp

Google Workspace MCP Server 是一個開源 Python 服務,透過 Model‑Client‑Protocol 暴露 120 多個 Google Workspace 操作(Gmail、Drive、Docs、Calendar 等),讓 Claude 或 ChatGPT 等 LLM 助手能讀取和寫入 Workspace 資料。支援多使用者 OAuth 2.1、三種工具層級、無狀態容器部署與完整 CLI,同時將所有流量限制在 Google 的 API 範圍內,並提供 MIT 授權、可自行主機的程式碼。

localai-org/kimodo.cpp

一個基於 GGML/C++ 的 NVIDIA Kimodo 模型實作,可從文字提示生成角色與機器人動作動畫。

OpenBMB/MiniCPM-V

一系列專為高效設備端部署設計的口袋大小多模態 LLM,可在手機上實現高效率影像、影片與即時全模態互動。

BasedHardware/omi

一個開源的 AI 記憶系統,可從可穿戴裝置與桌面應用程式捕捉螢幕與音訊資料,提供即時轉錄、摘要與可搜尋的 AI 聊天功能。

tracel-ai/burn

Burn 是一個原生 Rust 的深度學習框架,透過單一 API 統一訓練與推論。它提供類似 PyTorch 的易用性、自動微分、JIT 編譯的內核融合,以及彈性的後端系統(CUDA、ROCm、Metal、Vulkan、WebGPU、CPU 和 no-std)。藉由 ONNX 導入、權重載入、終端訓練儀表板,以及對嵌入式與瀏覽器環境的支援,Burn 讓您撰寫一次模型,即可在任何地方執行。

huggingface/diffusers

一個模組化程式庫,可用於使用與訓練最尖端的擴散模型,以生成影像、音訊與 3D 分子結構。

koharu-rs/koharu

以 Rust 編寫的 ML 驅動漫畫翻譯工具,自動化文字檢測、OCR、翻譯與生成式填補,實現本地優先的工作流程。

off-grid-ai/OGAM

為 Android、iOS 與 Mac 設計的全面離線 AI 套件,提供文字、影像與視覺 AI 以及語音轉錄功能,所有功能均在裝置本地原生執行,確保完全隱私。

icebird1998/scientific-illustrator

一個 Codex 外掛程式,可自動將參考影像重繪為 Microsoft PowerPoint、WPS Presentation 或 draw.io 中的可編輯圖表。

modelscope/FunClip

一個開源自動化影片剪輯工具,使用 ASR 和 LLM 根據語音文字、說話人身份或 AI 驅動的內容分析來擷取影片片段。

bytebase/dbhub

DBHub 是一個極簡且 Token 高效的 MCP 伺服器,讓基於 LLM 的工具能安全地查詢 PostgreSQL、MySQL、SQL Server、Oracle、SQLite 和 MariaDB。它僅提供兩個核心工具(SQL 執行與結構搜尋),佔用約 1.4k Token,並包含可選的額外工具、防護機制與內建網頁 UI,是 AI 代理與真實資料庫之間的輕量級橋樑。

datascale-ai/opentalking

一個開源的編排框架,透過 WebRTC 整合 LLM、TTS、STT 與影片渲染,實現即時數位人對話。

diffusionstudio/lottie

一個開源框架,讓程式碼代理能從文字提示與 SVG 資產生成可投入生產的 Lottie 動畫。

Tencent-Hunyuan/Hunyuan3D-WorldClaw

WorldClaw 是一個代理式 3D 生成框架,旨在創建大規模、開放世界的 3D 環境。

pollinations/pollinations

一個開源生成式 AI 平台,提供統一的 OpenAI 相容 API,支援文字、影像、影片、音訊、3D 與嵌入生成。

TencentARC/Pixal3D

Pixal3D 是一個高保真 3D 資產生成器,透過像素對齊的反投影技術,從單張影像或多視角影像生成精細的幾何結構與 PBR 紋理。

ahujasid/ableton-mcp

一個將 Claude AI 與 Ableton Live 連接的 Model Context Protocol (MCP) 伺服器,支援提示驅動的音樂製作、軌道操作與自主歌曲編排。

google-deepmind/alphagenome

用於解碼 DNA 序列調控代碼的統一模型與 API,可預測基因表現、剪接與染色質特徵。

liuzhao1225/YouDub-webui

一個開源影片本地化工具,可自動完成 YouTube、Bilibili 或本機檔案影片的轉錄、翻譯與配音。

neavo/LinguaGacha

LinguaGacha 是一個跨平台桌面應用,利用 OpenAI、DeepSeek、Anthropic、Google 或本地模型(如 Qwen2.5-7B)等大語言模型 API,僅需點擊一次即可將字幕、電子書和遊戲腳本翻譯成數十種語言。它提供「AGENT」工作流程,支援自動術語表提取、批量翻譯與自動審查,同時保留格式與程式碼風格。

oil-oil/oil-motion

Oil Motion 是一個 AI 代理技能,可將設計提示和來源影像轉換為互動式網頁動畫(滾動驅動、滑鼠追蹤、觸控等)。它自動完成關鍵幀建立、AI 影片生成、幀級清理,並打包為 MP4 或 WebP 資產,最終提供可直接嵌入的前端程式碼。

SamurAIGPT/Generative-Media-Skills

一個多模態工具集和 MCP 伺服器,透過模式驅動的架構使 AI 智能體能夠生成和編輯專業級的圖像、影片和音訊。

jnMetaCode/agency-orchestrator

Agency Orchestrator 是一個基於 npm 的工具(CLI + Web UI),可從一句話或極小的 YAML 檔案自動組合並執行多代理 AI 工作流程。它提供 276 個預建中文角色(191 個英文角色),支援 15 個 LLM 提供商(許多無需密鑰),建立 DAG 實現並行執行,驗證輸出,並產生可分享的 HTML 報告。適合希望零程式碼擁有「AI 團隊」的個人創業者、產品分析師與開發者。

jd-opensource/JoyAI-VL-Interaction

一個8B規模的視覺語言互動模型與系統,可在不到一秒內無需等待使用者提示,主動響應即時視訊串流

diivi/aseprite-mcp

一個 MCP 伺服器,透過 104 個全面的工具集,讓 AI 助手能夠完全控制 Aseprite,從而創作出專業級的像素藝術與動畫。

jaredrhod/barehands

一個基於網路攝影機的手部追蹤介面,讓您能以空間方式操作筆記、影像和 3D 模型,其設計旨在作為視覺與互動的「身體」,連接至 AI 代理程式。

777genius/agent-teams-ai

Agent Teams AI 是一款免費的跨平台桌面應用程式,可讓您建立和監控 AI 代理團隊(Claude Code、Codex、OpenCode、Cursor、SuperGrok、GitHub Copilot、Z.AI、MiniMax、Kiro 等)。代理可以建立任務、通訊、執行程式碼和終端機指令,並在您觀看看板時執行程式碼審查。此應用程式會追蹤權杖使用量、預算和每個代理的資源統計資料,並提供內建終端機、具 Git 感知的編輯器、多語言 UI,以及透過 `mcp-server` 元件的外掛支援。

IBM/mcp-context-forge

ContextForge 是一個開源閘道,將 MCP、A2A、REST 和 gRPC 服務聯邦化為單一、集中治理的端點,支援認證、速率限制、OpenTelemetry 追蹤、插件系統與管理 UI,可透過 PyPI、Docker 或 Helm 執行。

google-gemini/gemini-live-api-examples

Gemini Live API 的範例集合,使開發者能利用多模態輸入建構低延遲、即時的語音與影片 AI 代理。

X-PLUG/MobileAgent

一個利用視覺感知與規劃實現行動裝置、桌面端及 Web 介面任務自動化的多平台 GUI 智能體及基礎模型系列。