latent-spaces/brag

一個 Claude Code 技能,利用 Hyperframes 自動將軟體專案轉換為帶有音樂和動態效果的短版可分享發布影片。

TauricResearch/TradingAgents

TradingAgents 是一個基於 LangGraph 的開源框架,透過協調多個 LLM 驅動的代理(基本面、情緒、新聞、技術、研究員、交易員、風險、投資組合)來模擬完整的交易公司。支援數十種 LLM 提供商,取得時點市場資料(SEC EDGAR、FRED、Yahoo Finance、社交情緒),提供帶檢查點的圖形執行,記錄決策以實現持續學習,並提供回測 CLI 以評估跨股票代碼與日期的表現。專為研究設計,非投資建議。

wide-trace/open-higgsfield

一個開源且可自主主機的創作平台,透過統一的提示介面與使用者提供的 API 金鑰,支援使用 32 種不同的 AI 模型生成圖像與影片。

ApodexAI/FrontierAgent

FrontierAgent 是一個開源、終端為首的執行環境,可執行自主 ReAct 代理或平行代理團隊工作流程。它提供沙盒化檔案系統、即時 TUI 任務看板、非同步使用者干預,以及用於研究級長週期任務的內建基準測試框架。使用 `uv` 安裝,指向任何 OpenAI 相容模型端點(包含免費的 Apodex-1.1 服務),並執行 `--mode react` 以啟動單一代理,或 `--mode agent_team` 以啟動協調的平行代理。專案採用 Apache-2.0 授權。

spinabot/brigade

Brigade 是一個自托管、多代理AI助手框架。它讓您能在本地運行一個由代理組成的團隊,共享持久且可追溯記憶(Tideline),按組織架構圖進行組織,並可透過終端UI、WhatsApp、Slack、Discord、iMessage等渠道存取。所有API金鑰與資料皆留在您的機器上;您可接入任何LLM(Claude、OpenAI、Gemini、本地Ollama等),並透過Composio連接1,000多個第三方應用。功能包括技能、子代理分發、cron排程、文件/媒體處理、可選Convex儲存與MCP記憶伺服器。透過一行指令或npm安裝,完成上手流程,啟動始終在線的閘道,即可開始對話。

nexu-io/open-design

一個開源、以本地為先的設計平台,讓程式碼代理能根據品牌的設計系統生成並渲染網頁原型、簡報與動態圖形。

yi1108/printfilm

一個開源的 AI 建置室,透過模板驅動的流程,自動化完成故事板、影像/影片生成與語音合成,支援短影片與連載漫畫的創作。

Comfy-Org/ComfyUI

一個模組化、節點式的 AI 引擎,專為視覺專業人士設計,可精確控制參數,用於生成圖像、影片、音訊與3D模型的複雜工作流程。

docling-project/docling

Docling 是一個開源 Python 庫,可解析大量文件類型(PDF、Word、簡報、試算表、電子書、音訊、影片、電子郵件、影像及多種 XML 模式),並透過 AI 驅動的版面分析、OCR、視覺-語言模型理解與語音轉文字功能加以增強。它輸出統一的 `DoclingDocument`,可匯出為 Markdown、HTML、JSON、DocLang、DocTags 等格式,並可透過 MCP 或 REST API 直接整合至 LangChain、LlamaIndex、Crew AI、Haystack 或自訂代理。該工具可在本機執行以保護隱私敏感資料,亦支援 CLI 與服務模式,非常適合建構 RAG 管道、企業知識庫、金融或法律文件處理,以及多模態 AI 代理。

higgsfield-ai/higgsfield

higgsfield 是一個開源 GPU 節點管理器與訓練框架,專為超大型 LLM 設計。它處理節點分配、ZeRO-3/FSDP 分片、工作佇列與基於 GitHub Actions 的部署,讓您僅用一個簡單的 Python 裝飾器即可在叢集中訓練 LLaMA-70B 等模型。

milind-soni/OpenMausBot

OpenMausBot 是一款桌面聊天應用,可讓您將多個 AI 代理(Claude、Codex、Grok 或任何相容 CLI)作為聯絡人進行管理。每個代理透過小型適配器伺服器在本地執行,可控制雲端或本地電腦,並可透過 Composio 與第三方應用連接。UI 提供模型切換、高風險操作的審核對話框、透過 ElevenLabs 的語音輸出,以及基於 Markdown 的團隊匯入系統。它在 macOS、Windows 和 Ubuntu 上執行,除非啟用外部服務,否則所有資料均本地儲存。

ruvnet/ruflo

Ruflo 是一個開源框架,在 Claude Code/Codex 周圍新增完整的代理執行層。它提供 100 多個專用代理、蜂群協調、持久向量記憶、自我學習循環、零信任聯邦、插件市場與多模型聊天的 Web UI。可透過 `npx ruflo init`(全棧)或作為 Claude Code 插件(輕量)安裝。

krillinai/OpenCreator

OpenCreator 是一個開源、本地執行的 AI 工作區,結合了基於 Codex 的對話式代理與用於多模態內容創作(影片翻譯、下載、縮圖與影像生成)的視覺化儀表板。提供版本化工作流程、本地資料儲存,以及基於相同 Web UI 的桌面客戶端。支援多種 LLM、Whisper、GPT-Image 及其他語音/翻譯服務。專為希望在不依賴僅限雲端平台的情況下實現 AI 協助媒體製作的創作者與小團隊設計。

ahujasid/mcp-for-blender

基於 MCP 的整合,將 LLM 連接到 Blender,實現提示驅動的 3D 建模、場景操作和資產整合。

Anil-matcha/Open-Generative-AI

一個無限制的開源 AI 工作室,可使用 400 多個模型生成圖像、影片和音訊,沒有內容過濾器或訂閱費用。

gzxx-2025/aid-studio

一個自行架設的 AI 製作平台,整合編劇、分鏡、圖片/影片生成與配音,打造 AI 電影、戲劇與漫畫的單一工作流程。

microsoft/playwright-mcp

Playwright MCP 是一個 Node.js 伺服器,可讓基於 LLM 的代理程式透過 Model Context Protocol 控制 Playwright 瀏覽器。它傳回結構化的無障礙快照(JSON)而非螢幕擷取畫面,實現節省 token、確定性的網頁自動化,並保持瀏覽器狀態。

ZJU-REAL/Easel

Easel 是一款開源的 AI 驅動內容工作台,專為社群媒體創作者設計。它結合了 OpenClaw LLM 代理、帳號專屬設定檔以及超過 113 種可執行「技能」,能協助發現趨勢、規劃主題、生成文字、圖像、音訊與影片,並直接發布至七大中國平台,同時將績效數據回饋至設定檔以持續優化。

lixiaoxiao9888-create/manju-laoli-skill

一套為 AI 代理設計的工業級 AIGC 創作規則庫,透過「資產優先」流程將劇本轉換為一致且符合模型要求的影片提示詞。

basketikun/infinite-canvas

一個將無限畫布、多模態AI生成與代理式畫布操作整合至單一工作區的開源AI影像創作工作台。

nilbuild/page-mascot

一個 React 元件和 AI 驅動的工 cụ 集,用於使用精靈表向網站添加互動式、游標追蹤的吉祥物。

OpenSenseNova/SenseNova-U1

OpenSenseNova 的 SenseNova‑U1 系列是基於 NEO‑unify 架構構建的開源、原生統一多模態模型(文字 + 影像)。支援高品質 4K 影像生成、密集文字資訊圖創建、影像編輯、VQA 及交錯文字-影像教學生成。倉儲提供訓練程式碼、預訓練 8 B 參數檢查點(含社群量化 GGUF 檔案)、範例推理指令碼與部署指南,皆於 Apache 2.0 授權下提供。

Devin-AXIS/deepseek-design

DeepSeek Harness 的原生視覺設計系統,讓 AI 能夠生成並手動精修可編輯的網站、簡報與影片。

chatfire-AI/huobao-drama

一個 AI 驅動的自動化製作平台,可簡化短劇的創作過程,從劇本生成和角色設計到最終影片合成。

HBAI-Ltd/Toonflow-app

一個AI驅動的工作台,可自動化從劇本創作、分鏡製作到最終影片生成的全流程,專為短劇製作而設計。

zenstory-ai/drama-skills

由十一項智能體技能組成的 AI 驅動短劇製作流程,可將構想或小說轉化為劇本、分鏡與影片提示,重點在於視覺一致性

alesha-pro/tools

一套本地 AI 工具集合,包含針對 MiniMax H3 視訊-音訊生成的最佳化多 GPU 工作流程,以及專為 AI 代理設計的動畫技能。

v-modal/vmodal_sdk_flutter

一個用於在影片與影像資料庫之間整合跨模態語意搜尋的 Flutter SDK,讓使用者能透過語意、語音或影像尋找特定時刻。

omnigent-ai/omnigent

Omnigent 是一個開源的元框架,將 Claude Code、Codex、Cursor 等多種 LLM 編碼代理統一在單一 CLI 和 Web UI 下,支援跨裝置和雲端沙箱執行、組合與治理,並具備內建協作和策略功能。

darkzOGx/youtube-automation-agent

一個開源的 AI 代理系統,自動化 YouTube 頻道的整個生命周期,從趨勢研究、腳本撰寫到影片製作、發布與資料驅動的優化。

ningzimu/codex-ppt-skill

一種 AI 代理技能,可將文章、報告和論文轉換為圖像式 PowerPoint 簡報,透過規劃綱要、生成樣式化的投影片圖像並將其組裝為 .pptx 檔案。

EverettFish/holo-card-studio

一個Codex技能,可將文字或影像轉換為帶有視差效果的互動式3D全像卡片,同時提供Three.js網頁檢視器與可編輯的Blender專案。

xuanyustudio/LocalMiniDrama

一個開源、本地優先的AI短劇生成器,透過整合多種AI API,實現從腳本生成到最終影片合成的全流程自動化。

alchaincyf/huashu-design

一個針對 AI 代理的設計自動化技能,可將文字提示轉化為專業級的互動式原型、動態圖形與可編輯的簡報文件。

waooAI/waoowaoo

一個用於圖像和影片的 AI 創意工作區,結合了腦力激盪助手和用於整理及優化 AI 生成資產的視覺畫布。

Merserk/dlss5-visual-enhancer

一款適用於 NVIDIA RTX GPU 的 Windows 應用程式,使用 DLSS 5 和 RTX Video 技術來對影像、影片和直播進行升頻、增強和幀插值。

Open-LLM-VTuber/Open-LLM-VTuber

一個開源、語音互動的 AI 伴侶,具備 Live2D 虛擬形象與視覺感知,能完全離線運行,提供私密的即時對話體驗。

Swayingleaves/novanova-studio

一個將圖像與影片生成整合至無限畫布中的 AI Agent 驅動視覺創作工作台,以維持創作脈絡。

yejy53/Editable-Design

Editable Visual Design 是一個開源工具包,讓 LLM(透過 Codex “Skills”)能將自然語言設計需求轉化為完全可編輯的圖形,包括具有獨立文字、圖像和佈局層的 HTML 頁面或 PowerPoint 檔案。它包含三個技能:用於研究圖表的 `paper-fig`、用於海報/資訊圖表的 `editable-design`,以及用於將 HTML 轉換為 PPTX 的 `html-to-pptx`。該系統記錄 LLM 的設計步驟(Agent Design Replay)並提供視覺化編輯器,實現可於本地編輯的快速 AI 生成草稿。

ningzimu/image-to-editable-ppt-skill

一種多代理 AI 技術,透過重建文字、形狀與資產,將圖片、PDF 與基於圖片的投影片轉化為可編輯的 PowerPoint 簡報。

QwenLM/Qwen-MM-Plugins

Qwen 模型的多模態插件集合,使 AI 代理能原生處理影像、影片、音訊與 3D 檔案,並控制 Blender 與 FreeCAD 等軟體。

techjarves/Portable-Local-Studio

一個零設定、離線的AI工作室,將Stable Diffusion、LLM、Whisper與Kokoro TTS整合至單一硬體加速的桌面介面中。

bytedance/UI-TARS-desktop

一個多模態 AI 智能體技術棧,透過視覺識別與精確的 GUI 互動,實現對桌面應用程式與網路瀏覽器的自然語言控制。

buxuku/SmartSub

SmartSub(妙幕)是一款開源、跨平台的桌面應用程式,可下載影片,執行本地或雲端語音轉文字,透過多種服務翻譯字幕,編輯/校對,合成語音(含零樣本語音克隆),最後將字幕硬燒錄或複用至影片中。它可在離線狀態下運行,支援可選GPU加速,且可完全免費使用。

xpzouying/xiaohongshu-mcp

一個自架設的 MCP 伺服器,讓 AI 助手能登入小紅書、發佈內容(圖片或影片)、搜尋動態、按讚/收藏、留言,並取得使用者或貼文詳情。支援二進位檔、Docker 鏡像或原始碼建構,可與 Claude Code、Cursor、VS Code、Open Code、Cline 等整合。

PurpleDoubleD/locally-uncensored

一個全面的本地 AI 工作室,將聊天、圖像和影片生成以及編碼代理整合到一個易於安裝的桌面應用程式中。

lightningpixel/modly

一個本地開源桌面應用程式,利用在使用者 GPU 上執行的 AI 模型,將照片轉換為 3D 網格。

Tencent/WeMM-Embedding

WeMM‑Embedding 是騰訊開源的多模態嵌入套件(2B/4B/9B 參數),可將文字、影像、影片與視覺文件轉換為單一 L2 歸一化向量。支援透過「馬特里什卡」截斷實現多種輸出維度,提供 🤗 Transformers 與 Sentence‑Transformers 的即用推理腳本,並包含 vLLM 與 SGLang 的服務封裝。基準測試(MMEB‑v2/v3)顯示其在影像、影片、文件、文字與代理任務中均達最尖端水準。模型托管於 Hugging Face,採用 Apache 2.0 授權發布。