ruvnet/ruflo

Ruflo 是一個開源框架,在 Claude Code/Codex 周圍新增完整的代理執行層。它提供 100 多個專用代理、蜂群協調、持久向量記憶、自我學習循環、零信任聯邦、插件市場與多模型聊天的 Web UI。可透過 `npx ruflo init`(全棧)或作為 Claude Code 插件(輕量)安裝。

nexu-io/open-design

一個開源、以本地為首的設計工具,讓程式碼代理能根據共享的設計系統產生並渲染高保真原型、簡報投影片與動畫圖形。

ahujasid/blender-mcp

透過 Model Context Protocol 將 Blender 與 LLM 連接的橋樑,實現提示輔助的 3D 建模、場景建立與資產操作。

Comfy-Org/ComfyUI

一個模組化、基於節點的 AI 引擎,供視覺專業人士使用,可建立複雜的工作流來生成圖像、影片、音訊和 3D 模型,並具備精確的參數控制。

dramaclaw/dramaclaw

一個原始碼可用的 AI 戲劇製作管線,透過節點畫布與結構化製作管線的雙模式工作流程,將劇本轉化為成品電影。

ahujasid/camera-to-blender

一個使用 AI 將現實世界的物體照片轉換為 3D 模型,並自動匯入 Blender 的工具。

Anil-matcha/Open-Generative-AI

一個無限制的開源 AI 工作室,可使用 400 多個模型生成圖像、影片和音訊,沒有內容過濾器或訂閱費用。

yejy53/Editable-Design

一個由編碼代理驅動的框架,利用 HTML 和語義層而非扁平化圖像來將提示詞轉換為可編輯、結構化的視覺設計。

Merserk/dlss5-visual-enhancer

一個 Windows 應用程式,透過本地 Gradio 介面將 NVIDIA DLSS 5 神經渲染與幀生成應用於影像與影片。

SegFault42/HeliosGen

一個免費且開源的視覺化工作流建構器,可在無限節點畫布上串連 AI 圖像與影片生成模型。

Tencent/WeMM-Embedding

一組通用的多模態嵌入模型,可為文字、影像、影片與視覺文件提供統一表示,以實現高效能的跨模態檢索。

OpenSenseNova/SenseNova-U1

SenseNova‑U 是一個開源的 8 B 參數統一多模態模型家族(U1 與 U1.5),原生支援文字至圖像、圖像編輯、VQA 與交錯生成。基於 NEO‑unify 架構,它移除了獨立的視覺編碼器/VAE,提供高品質的 4K 生成、強大的圖表渲染能力,以及高效推論(包含 LoRA 與社群提供的 8 位元 GGUF 量化版本)。儲存庫內包含訓練程式碼、推論腳本、基準測試與部署指南,全部採用 Apache 2.0 授權。

basketikun/infinite-canvas

一個開源的、基於節點的工作台,用於AI影像創作,將生成、編輯與提示詞圖書館整合於無限畫布上。

pipecat-ai/pipecat

一個開源的 Python 框架,用於建構支援多代理編排與低延遲傳輸的即時語音與多模態 AI 代理。

NoizAI/HelixWorld

HelixWorld 1.0 是一個即將推出的即時模型,能夠在使用者移動虛擬攝影機時,同步生成影片與空間音訊。該模型基於第一人稱視角影片/音訊與遊戲引擎擷取的資料進行訓練,以因果關係預測下一幀與音場,隨後將整個流程蒸餾以達到互動速度。程式碼、模型權重與技術報告預計將於近期發布;該專案將採用 Apache-2.0 授權條款。

darkzOGx/youtube-automation-agent

一個開源的 AI 代理系統,自動化 YouTube 頻道的整個生命周期,從趨勢研究、腳本撰寫到影片製作、發布與資料驅動的優化。

wide-trace/open-higgsfield

一個開源、自托管的圖像與影片生成工作室,透過使用者提供的平台金鑰,可使用40種不同的AI模型。

ningzimu/codex-ppt-skill

一種 AI 代理技能,透過自動化大綱規劃與視覺風格生成,將文章、報告與論文等內容轉換為專業的影像型 PowerPoint 簡報投影片。

HBAI-Ltd/Toonflow-app

一個AI驅動的工作台,可自動化從劇本創作、分鏡製作到最終影片生成的全流程,專為短劇製作而設計。

jaredrhod/fullstack-agent

一個可組裝多模態AI助理的框架,具備持久文字記憶、語音互動、視覺化工具與基於攝影機的手勢控制功能。

moeru-ai/airi

一個開源框架,用於創造能聊天、玩遊戲並在多個平台互動的互動式 AI 虛擬角色與 VTuber。

zenstory-ai/drama-skills

一個基於AI的短劇創作工作流,透過一組模組化Agent技能,將構思或小說轉化為劇本、分鏡腳本和製作提示。

OpenDCAI/GameFactory-3A

一個開源框架,利用程式碼代理將遊戲需求轉換為多個遊戲引擎的生產就緒資產與引擎就緒程式碼。

ooolabdev/ooosplat

透過自動化幀提取、相機重構與訓練流程,將本地影片轉換為 3D 高斯點雲模型的桌面應用程式。

halcyon-video/halcyon-video

一個適用於 Jellyfin 和 Plex 的 3D 沉浸式影片商店介面,將您的媒體庫變成一座可步行的 1990 年代出租店。

yihong0618/bilingual_book_maker

bilingual_book_maker 是一個 Python CLI,可使用 OpenAI、Claude、Gemini、DeepL、Google、Qwen‑MT 等多種 AI 翻譯服務,將公共領域書籍(EPUB、PDF、TXT、MD、SRT)翻譯為雙語版本。它解析來源,將段落傳送至選定模型,並輸出新的雙語 EPUB(或成對的 TXT/SRT)。功能包括多模型選擇、自訂提供者設定、選擇性翻譯的計畫模式、標籤控制、上下文感知提示、平行處理與恢復支援。

alchaincyf/huashu-design

一個針對 AI 代理的設計自動化技能,可將文字提示轉化為專業級的互動式原型、動態圖形與可編輯的簡報文件。

ant-research/4DAnyone

4DAnyone 是一個研究級神經模型,可將單攝影機人物影片轉換為數十個同步、視角一致的影片(6-24-48 視角),用於下游 4D 高斯點雲重建。可在消費級 GPU(≤24 GB VRAM)上運行,提供快速蒸餾版 Turbo 模型(5.6 倍加速),並提供即用型推理腳本與 nerfstudio 集成。

chatfire-AI/huobao-drama

一個 AI 驅動的自動化製作平台,可簡化短劇的創作過程,從劇本生成和角色設計到最終影片合成。

Core-Mate/OpenGUI

一個可在真實裝置上運行的 Android 移動 GUI 代理框架,使 AI 代理能夠理解並操作應用介面,實現自動化工作流程。

Devin-AXIS/deepseek-design

DeepSeek Harness 的原生視覺設計系統,讓 AI 能夠生成並手動精修可編輯的網站、簡報與影片。

TencentCloud/Octop

Octop 是一個開源、自托管的 AI 助手平台。它運行一個單一的 FastAPI 基礎程序,提供 React 仪表板、CLI,以及飛書、釘釘、QQ、Discord、企業微信等平台的機器人。使用者可建立多個具有獨特 MBTI 風格個性的代理,每個代理擁有獨立的持久記憶與可設定的 LLM 提供商(OpenAI 相容、DashScope、Ollama 等)。所有資料皆本地儲存在 `~/.octop/` 下,系統包含防護機制、JWT 隔離、瀏覽器/終端自動化,以及用於 IDE 整合的雙向 ACP 協定。安裝方式包括一行指令、PyPI 或 Docker;專案採 MIT 授權,持續維護中。

OpenMOSS/MOSS-VL

MOSS‑VL 是一個開源權重的11 B參數影片語言模型家族,能即時理解並對直播影片串流進行對話。它採用交叉注意力架構,結合時間戳幀與3D旋轉嵌入(XRoPE),實現低延遲、可中斷對話、主動靜默與動態修正。釋出三個變體(Realtime、Instruct、Base),提供單GPU使用的量化檢查點,整合FlashAttention‑3、SGLang、ms‑swift與LoRA微調。專案包含展示最尖端串流性能的基準測試,並提供即時與離線推論的腳本。

bytedance/UI-TARS-desktop

一個多模態 AI 智能體技術棧,透過視覺識別與精確的 GUI 互動,實現對桌面應用程式與網路瀏覽器的自然語言控制。

mengxi-ream/read-frog

Read Frog 是一個開源的瀏覽器擴充功能,為任何網頁加入 AI 驅動的翻譯、解釋、文字轉語音、字幕翻譯、製作抽認卡以及自訂 AI 動作。它支援 Chrome、Edge 與 Firefox,兼容 20+ 家 LLM 供應商,會批次處理請求以降低成本,並內建間隔重複系統供詞彙學習使用。

localai-org/kimodo.cpp

一個基於 GGML/C++ 的 NVIDIA Kimodo 模型實作,可從文字提示生成角色與機器人動作動畫。

AutoArk/EVA-OS

一款針對即時多模態應用與智慧硬體的 AIOS,提供從 AI 原生編碼到設備端推論的整合開發體驗。

lipku/LiveTalking

一個用於數位人類的即時互動式串流引擎,可同步音訊與影像,實現逼真的 AI 驅動對話。

duolahypercho/codex-router

Codex Router 是一個社群工具,讓 Codex 桌面/CLI 應用能使用多個外部 LLM 提供商(Anthropic、Kimi、DeepSeek、xAI/Grok、Gemini、Copilot、Ollama Cloud 等)。它安裝背景服務、可選的 Electron 控制中心(含 macOS Dynamic Island 小工具的系統列/選單列應用),以及 CLI 工具,安全儲存 API 金鑰或 OAuth 權杖。經過引導式設定後,您可在 Codex 中選擇「路由模型」,路由器將請求轉發至所選提供者,可選地附加 Perplexity 搜尋側車。安裝可透過一鍵腳本(macOS/Linux/Windows)或 Homebrew 公式(僅 CLI)完成。

jangles-byte/Pythia

一個本地、群智智能的全球預測系統,融合40多個即時資料流,建構3D智慧地球以預測世界事件

PhiloLabs/fable51-worlds

一個利用AI代理群從文字、影像或影片生成可驗證、可行走3D世界的系統,以基於程式碼的Three.js應用形式渲染。

ningzimu/image-to-editable-ppt-skill

一種多智能體 AI 技術,透過重構文本、圖形和視覺資產,將圖像、PDF 和基於圖像的 PPT 轉換為可編輯的 PowerPoint 簡報。

flatkey-ai/flatkey-cli

用於統一多模態 AI 生成的命令列介面,允許媒體團隊和 AI Agent 透過單一 API 金鑰和點數餘額生成圖像、影片、音訊和文本。

open-pencil/open-pencil

一個原生支援 .fig 檔案的開源設計編輯器,為 AI 代理與開發者提供可程式化工具包,以自動化設計工作流程。

jaredrhod/barehands

一個基於網路攝影機的手部追蹤介面,讓您能以空間方式操作筆記、影像和 3D 模型,其設計旨在作為視覺與互動的「身體」,連接至 AI 代理程式。

livekit/agents

一個用於建立即時、多模態語音代理的框架,這些代理能夠看見、聽見並理解,並具備整合的工作排程與彈性模型整合功能。

HKUDS/RAG-Anything

一個整合多模態RAG功能的全棧框架,可無縫處理包含交錯文字、圖片、表格與數學公式的文件。

op7418/guizang-yingzao-skill

一項 AI 驅動的設計技能,將建築與文化照片轉化為藝術指導的編輯海報,並整合中文字體排版與空間感知。