MoonshotAI/Kimi-K3
Kimi K3 是一個擁有 2.8T 參數的開源權重原生多模態 MoE 模型,專為長週期編碼、深度研究和複雜的智能體知識工作而設計。
modelscope/DiffSynth-Studio
一個開源的擴散模型引擎,可在消費級 GPU 上實現影像、影片與音訊生成模型的高效能推論與訓練。
solidSpoon/DashPlayer
一款專為英語學習者打造的 AI 增強影片播放器,提供本地 AI 字幕生成、句子拆解和詞彙工具,以促進沉浸式語言學習。
flyteorg/flyte
Flyte 2 是一個用於定義、編排和提供 ML 流水線與 AI agent 服務的開源 Python 框架。它讓您能夠將普通的 Python 函數作為任務,將其組合成工作流,並在本地或未來的 Kubernetes-native 後端上執行。該專案包含 CLI、以開發者為中心的 TUI,以及對 FastAPI 模型服務化的原生支持。
Jamailar/Beav
Beav(前身為 RedBox)是一款專為自媒體創作者設計的跨平台桌面 AI 工作站。它讓您能夠收集網頁與社群媒體素材、儲存至本地知識庫、利用 AI 生成文字、圖片與影片、編輯配音剪輯、添加動畫並排程發布,所有功能皆整合於單一介面。該應用程式隨附 Chrome/Edge 網頁擷取工具、每日營運報告、可重複使用的圖片模板、多軌影片編輯器,並可選擇整合外部 Agent。它支援 macOS、Windows 與 Linux,可使用內建 AI 服務或任何相容 OpenAI 的端點,並以 MIT-NC(非商業)授權發布。
smixs/visual-skills
一套AI代理技能工具包,應用專業電影製作和戲劇學原理,為AI影片和圖像模型生成高精度提示。
ErickWendel/localstudio
一款瀏覽器原生、以本地為首的簡報編輯器,利用 Web AI 與 WebGPU 提供無後端的 AI 驅動簡報生成、翻譯與簡報工具。
verl-project/verl-omni
一個適用於多模態生成模型的通用 RL 訓練框架,提供快速滾動與穩定的後訓練,適用於擴散模型與多模態模型。
ModernRelay/omnigraph
Omnigraph 是一個基於 Rust 的湖倉式圖資料庫,將資料以欄式 Lance 格式儲存在任何 S3 相容物件儲存中。專為 AI 代理艦隊設計:每個代理可寫入其隔離分支,然後提交變更以供審查和 Git 風格合併。查詢在單一執行時中融合圖遍歷、向量 ANN 和全文搜尋,Cedar 策略對每次變更強制執行細粒度安全。專案提供 CLI、Axum HTTP 伺服器、TypeScript SDK 和 LLM 主機用的「MCP」橋接器,是代理記憶、企業腦知識圖譜、開發圖自動化和版本化 ML 資料層的全棧解決方案。
NVIDIA/cosmos
一個開放平台,提供全模態世界模型與工具,用於建構物理AI,支援機器人與自主系統對文字、視覺、音訊與動作序列的聯合處理與生成。
TrenTorch/TrenTorch
Tren⚡Torch 是一個教育性質的、僅依賴 NumPy 的深度學習框架,重現 TinyTorch 並新增 20 個進階模組——從張量與自動微分到 CNN、Transformer、量化與基準測試——還包含 CLI 與歷史里程碑腳本,支援實作學習。
Yuliang-Liu/MonkeyOCRv2
面向 Document AI 的視覺-文字基礎模型,提供多語言視覺編碼器以及專用於文件解析與理解的模型。
apify/mcpc
mcpc 是一個輕量、跨平台的 CLI,提供對 Model Context Protocol (MCP) 的完整存取——AI 代理的工具、提示、任務與付款的標準 API。它讓代理與腳本能從 Bash shell 呼叫任何 MCP 操作,支援持久會話、儲存在作業系統金鑰鏈中的 OAuth 2.1、適合管道的 JSON 輸出、透過 grep 的動態工具發現,以及實驗性的 x402 付款整合。
nexmoe/VidBee
一款開源桌面應用程式,可從 1000 多個網站下載影片和音訊,在本地進行轉錄,並使用 AI 對內容進行摘要和搜尋。
kgoedecke/doop
Doop 是一個開源的即時設計畫布,人類與 AI 代理(透過 Claude Code 或內建 Doop 代理)可共同編輯 HTML 幀。它提供即時多人功能、AI 驅動的設計任務、私有共享,並可透過單一 Docker 命令或 `bun run dev` 自行托管。AI 後端支援 Anthropic(免費層)或使用者提供的 OpenAI/ChatGPT 金鑰。
869413421/ai-moive-studio
一個全棧式 AI 內容創作工作台,透過無限畫布與代理輔助工作流,將文字轉化為 AI 電影與短影片。
Huanshere/VideoLingo
一個透過統一的 Streamlit 界面實現語音轉錄、翻譯與語音生成自動化的 AI 驅動影片翻譯與配音工具。
nicobailon/pi-mcp-adapter
一個 Pi 代理插件,透過一個輕量工具代理 MCP 伺服器,懶加載伺服器並按需發現工具,以節省上下文視窗
taylorwilsdon/google_workspace_mcp
Google Workspace MCP Server 是一個開源 Python 服務,透過 Model‑Client‑Protocol 暴露 120 多個 Google Workspace 操作(Gmail、Drive、Docs、Calendar 等),讓 Claude 或 ChatGPT 等 LLM 助手能讀取和寫入 Workspace 資料。支援多使用者 OAuth 2.1、三種工具層級、無狀態容器部署與完整 CLI,同時將所有流量限制在 Google 的 API 範圍內,並提供 MIT 授權、可自行主機的程式碼。
localai-org/kimodo.cpp
一個基於 GGML/C++ 的 NVIDIA Kimodo 模型實作,可從文字提示生成角色與機器人動作動畫。
OpenBMB/MiniCPM-V
一系列專為高效設備端部署設計的口袋大小多模態 LLM,可在手機上實現高效率影像、影片與即時全模態互動。
BasedHardware/omi
一個開源的 AI 記憶系統,可從可穿戴裝置與桌面應用程式捕捉螢幕與音訊資料,提供即時轉錄、摘要與可搜尋的 AI 聊天功能。
tracel-ai/burn
Burn 是一個原生 Rust 的深度學習框架,透過單一 API 統一訓練與推論。它提供類似 PyTorch 的易用性、自動微分、JIT 編譯的內核融合,以及彈性的後端系統(CUDA、ROCm、Metal、Vulkan、WebGPU、CPU 和 no-std)。藉由 ONNX 導入、權重載入、終端訓練儀表板,以及對嵌入式與瀏覽器環境的支援,Burn 讓您撰寫一次模型,即可在任何地方執行。
huggingface/diffusers
一個模組化程式庫,可用於使用與訓練最尖端的擴散模型,以生成影像、音訊與 3D 分子結構。
koharu-rs/koharu
以 Rust 編寫的 ML 驅動漫畫翻譯工具,自動化文字檢測、OCR、翻譯與生成式填補,實現本地優先的工作流程。
off-grid-ai/OGAM
為 Android、iOS 與 Mac 設計的全面離線 AI 套件,提供文字、影像與視覺 AI 以及語音轉錄功能,所有功能均在裝置本地原生執行,確保完全隱私。
icebird1998/scientific-illustrator
一個 Codex 外掛程式,可自動將參考影像重繪為 Microsoft PowerPoint、WPS Presentation 或 draw.io 中的可編輯圖表。
modelscope/FunClip
一個開源自動化影片剪輯工具,使用 ASR 和 LLM 根據語音文字、說話人身份或 AI 驅動的內容分析來擷取影片片段。
bytebase/dbhub
DBHub 是一個極簡且 Token 高效的 MCP 伺服器,讓基於 LLM 的工具能安全地查詢 PostgreSQL、MySQL、SQL Server、Oracle、SQLite 和 MariaDB。它僅提供兩個核心工具(SQL 執行與結構搜尋),佔用約 1.4k Token,並包含可選的額外工具、防護機制與內建網頁 UI,是 AI 代理與真實資料庫之間的輕量級橋樑。
datascale-ai/opentalking
一個開源的編排框架,透過 WebRTC 整合 LLM、TTS、STT 與影片渲染,實現即時數位人對話。
diffusionstudio/lottie
一個開源框架,讓程式碼代理能從文字提示與 SVG 資產生成可投入生產的 Lottie 動畫。
Tencent-Hunyuan/Hunyuan3D-WorldClaw
WorldClaw 是一個代理式 3D 生成框架,旨在創建大規模、開放世界的 3D 環境。
pollinations/pollinations
一個開源生成式 AI 平台,提供統一的 OpenAI 相容 API,支援文字、影像、影片、音訊、3D 與嵌入生成。
TencentARC/Pixal3D
Pixal3D 是一個高保真 3D 資產生成器,透過像素對齊的反投影技術,從單張影像或多視角影像生成精細的幾何結構與 PBR 紋理。
ahujasid/ableton-mcp
一個將 Claude AI 與 Ableton Live 連接的 Model Context Protocol (MCP) 伺服器,支援提示驅動的音樂製作、軌道操作與自主歌曲編排。
google-deepmind/alphagenome
用於解碼 DNA 序列調控代碼的統一模型與 API,可預測基因表現、剪接與染色質特徵。
liuzhao1225/YouDub-webui
一個開源影片本地化工具,可自動完成 YouTube、Bilibili 或本機檔案影片的轉錄、翻譯與配音。
neavo/LinguaGacha
LinguaGacha 是一個跨平台桌面應用,利用 OpenAI、DeepSeek、Anthropic、Google 或本地模型(如 Qwen2.5-7B)等大語言模型 API,僅需點擊一次即可將字幕、電子書和遊戲腳本翻譯成數十種語言。它提供「AGENT」工作流程,支援自動術語表提取、批量翻譯與自動審查,同時保留格式與程式碼風格。
oil-oil/oil-motion
Oil Motion 是一個 AI 代理技能,可將設計提示和來源影像轉換為互動式網頁動畫(滾動驅動、滑鼠追蹤、觸控等)。它自動完成關鍵幀建立、AI 影片生成、幀級清理,並打包為 MP4 或 WebP 資產,最終提供可直接嵌入的前端程式碼。
SamurAIGPT/Generative-Media-Skills
一個多模態工具集和 MCP 伺服器,透過模式驅動的架構使 AI 智能體能夠生成和編輯專業級的圖像、影片和音訊。
jnMetaCode/agency-orchestrator
Agency Orchestrator 是一個基於 npm 的工具(CLI + Web UI),可從一句話或極小的 YAML 檔案自動組合並執行多代理 AI 工作流程。它提供 276 個預建中文角色(191 個英文角色),支援 15 個 LLM 提供商(許多無需密鑰),建立 DAG 實現並行執行,驗證輸出,並產生可分享的 HTML 報告。適合希望零程式碼擁有「AI 團隊」的個人創業者、產品分析師與開發者。
jd-opensource/JoyAI-VL-Interaction
一個8B規模的視覺語言互動模型與系統,可在不到一秒內無需等待使用者提示,主動響應即時視訊串流
diivi/aseprite-mcp
一個 MCP 伺服器,透過 104 個全面的工具集,讓 AI 助手能夠完全控制 Aseprite,從而創作出專業級的像素藝術與動畫。
jaredrhod/barehands
一個基於網路攝影機的手部追蹤介面,讓您能以空間方式操作筆記、影像和 3D 模型,其設計旨在作為視覺與互動的「身體」,連接至 AI 代理程式。
777genius/agent-teams-ai
Agent Teams AI 是一款免費的跨平台桌面應用程式,可讓您建立和監控 AI 代理團隊(Claude Code、Codex、OpenCode、Cursor、SuperGrok、GitHub Copilot、Z.AI、MiniMax、Kiro 等)。代理可以建立任務、通訊、執行程式碼和終端機指令,並在您觀看看板時執行程式碼審查。此應用程式會追蹤權杖使用量、預算和每個代理的資源統計資料,並提供內建終端機、具 Git 感知的編輯器、多語言 UI,以及透過 `mcp-server` 元件的外掛支援。
IBM/mcp-context-forge
ContextForge 是一個開源閘道,將 MCP、A2A、REST 和 gRPC 服務聯邦化為單一、集中治理的端點,支援認證、速率限制、OpenTelemetry 追蹤、插件系統與管理 UI,可透過 PyPI、Docker 或 Helm 執行。
google-gemini/gemini-live-api-examples
Gemini Live API 的範例集合,使開發者能利用多模態輸入建構低延遲、即時的語音與影片 AI 代理。
X-PLUG/MobileAgent
一個利用視覺感知與規劃實現行動裝置、桌面端及 Web 介面任務自動化的多平台 GUI 智能體及基礎模型系列。