livekit/agents
一個用於建立即時、多模態語音代理的框架,這些代理能夠看見、聽見並理解,並具備整合的工作排程與彈性模型整合功能。
Pinvou/pinvou-agent
Pinvou Agent 是一款跨平台桌面 AI 助手,利用 LLM 為工作、設計和編碼建立可編輯的交付物。
zcbacxc/movie-narrator
一個開源工具包,僅需一個提示即可自動生成AI驅動的劇本、旁白、字幕與渲染影片。
mengxi-ream/read-frog
Read Frog 是一個開源瀏覽器擴充套件,利用 LLM 和 AI TTS 將網頁內容翻譯、解釋並轉換為閃卡,支援雙語檢視、上下文感知翻譯、字幕翻譯、自訂 AI 操作,以及 20 多個 AI 供應商。
sbroenne/mcp-server-excel
ExcelMcp 是一個僅限 Windows 的伺服器與 CLI,允許 LLM 代理透過其 COM API 控制即時 Microsoft Excel 實例,公開 326 個操作(Power Query、資料透視表、VBA、Python 等),實現即時電子表格自動化。
chengyi-ai/native-subtitle-quote-image
一個AI代理工具,可將影片幀轉換為專業的3:4社交媒體引用圖片,使用原始燒錄字幕或自訂腳本生成的疊加字幕。
mattt/iMCP
iMCP 是一款 macOS 應用程式(內建 `imcp‑server` CLI),實作了 Model Context Protocol,將行事曆、聯絡人、位置、地圖、訊息、提醒事項和天氣公開為 JSON‑LD 工具,供 Claude Desktop、Claude Code、Cursor 和 Amp 等 AI 客戶端使用。使用者透過 macOS 權限對話框啟用服務,連接 AI 客戶端後,即可提出自然語言問題,由 AI 在本地取得真實的個人資料來完成請求。專案包含 Swift SDK 整合、用於讀取 iMessage 資料庫的自訂 Swift 套件,以及除錯工具(MCP Inspector、Companion)。
open-pencil/open-pencil
一個原生讀取 .fig 檔案並提供可程式化 AI 驅動工具集,用於 AI 驅動設計自動化與自訂編輯器開發的開源設計編輯器。
Forget-C/Jellyfish
一個為短劇打造的端到端 AI 製作工作區,管理從劇本拆解、資產一致性到影片生成的完整流程。
tigerowo/infinite-canvas
一個將影像、影片與音訊生成整合至節點式無限畫布中的開源多模態 AI 工作台,支援迭代式視覺創作。
gastownhall/gastown
Gas Town 是一個開源的 Go 編寫的多專案 AI 程式碼助手工作區管理器,支援在多個 Git 專案上執行 Claude、Copilot、Codex、Gemini 等 AI 程式碼代理,同時將每一步操作持久化儲存在 Git 支援的帳本中。中央 AI 協調者(*Mayor*)建立 *convoys*(工作項目集合),分派給工作代理(*Polecats*),並由一組監控服務(Witness、Deacon、Dogs)維持系統健康。完成的工作透過 Bors 風格佇列(*Refinery*)合併,可選的聯邦層(*Wasteland*)讓不同安裝間可共享任務。可透過 Homebrew、`go install` 或 Docker 安裝,提供 CLI 工具(`gt`)用於建立 rigs、crews、convoys 並監控進度。
tandpfun/wardrobe
一款由 AI 驅動的工具,可從照片中提取單一衣物以建立數位衣櫥,並生成服裝的建模編輯預覽。
HRuiCcc/RuiC-card-skill
一個自動化流水線,將文字提示或圖像轉換為具有深度和視角變化閃光效果的互動式 3D 全息卡片,適用於 Web。
mnemosyne-oss/mnemosyne
Mnemosyne 是一個以本地為首、基於 SQLite 的 AI 代理記憶層。它透過三層架構(工作記憶、情節記憶、時間性知識圖譜)讓助手下達跨會話的持續記憶,支援混合語意/關鍵字搜尋、強大的向量壓縮、Python SDK、CLI 及內建 MCP 伺服器。它注重隱私:無追蹤資料、預設本地儲存,並提供客戶端加密的可選同步。
homeassistant-ai/ha-mcp
ha‑mcp 是一個非官方的 Home Assistant 模型上下文協定伺服器,讓 LLM 助手(Claude、ChatGPT、Gemini 等)能完全讀取、控制和設定 Home Assistant 實例。透過 HA‑MCP 自訂元件(HACS)或作為 Home Assistant 插件/Docker/PyPI 伺服器安裝,取得一個秘密 Webhook URL,並指向您的 AI 客戶端。該伺服器提供 87 個工具,涵蓋設備控制、自動化/腳本建立、儀表板編輯、備份、日誌和安全策略,實現對整個智慧家居系統的自然語言管理。
linyqh/NarratoAI
一個自動化的 AI 驅動工具,用於電影與電視節目評論影片製作,可在單一工作流程中處理劇本撰寫、影片剪輯、語音旁白與字幕。
jjyaoao/HelloAgents
HelloAgents 是一個 Python 庫,提供用於建構多智能體 AI 應用的生產級框架。它封裝 OpenAI 相容、Anthropic 和 Gemini LLM,提供內建工具(檔案 I/O、任務委派、待辦事項追蹤),並包含工程功能如上下文管理、會話持久化、電路斷路器、樂觀鎖、可觀測性、SSE 串流傳輸和非同步生命週期。透過 `pip install hello-agents` 安裝,設定包含 API 憑證的 `.env` 檔案,即可使用註冊工具集啟動 `ReActAgent` 等智能體。
OpenMOSS/MOSS-VL
一個用於即時和離線影片理解的開權重11B參數模型系列,採用支援可中斷串流互動的交叉注意力架構。
lipku/LiveTalking
一個即時互動式串流引擎,用於數位人,透過 LLM 與 TTS 驅動,實現音視頻同步,打造逼真的虛擬化身。
jianchang512/pyvideotrans
一個開源影片翻譯工具,可自動化語音辨識、字幕翻譯與AI配音,並支援語音克隆與多角色合成。
xushengfeng/eSearch
一款集截圖、離線 OCR、翻譯和反向圖像搜尋於一體的跨平台螢幕搜尋工具,用於提取並處理螢幕資訊。
thesysdev/appless
一種實驗性的生成式 UI 運作系統,以根據使用者請求即時生成的即時串流原生行動介面取代傳統應用程式。
tisfeng/Easydict
Easydict 是一款用於快速查詞、翻譯和 OCR 的原生 macOS 應用程式。它自動偵測語言,提供多種快捷鍵驅動的輸入模式,並聚合來自 20 多個服務(包括傳統詞典、雲端翻譯器以及 OpenAI、Gemini、Claude 和 Ollama 等 LLM)的結果。可透過 Homebrew(`brew install --cask easydict`)或手動下載安裝。開源(GPL-3.0),歡迎社群貢獻。
wiltodelta/remove-ai-watermarks
一個函式庫和CLI工具,用於從AI生成的影像和影片中移除可見標籤、不可見像素浮水印和AI來源中繼資料。
vibe-motion/skills
vibe-motion/skills 是一個插件庫,讓 AI 代理(例如 Claude Code)能透過克隆並執行專用渲染專案,產生多種動畫視覺資產——如尺子進度條、魚眼影片效果、品牌發布影片、3D 地球路徑、黑膠播放器動畫等。透過 `npx skills add vibe-motion/skills` 安裝,選擇一個技能,提供參數,即可獲得 GIF/MP4/HTML 輸出。
umlx5h/LLPlayer
LLPlayer 是一個僅支援 Windows 的 C# 媒體播放器,支援 AI 驅動的字幕生成(Whisper ASR)、即時翻譯(透過雲端或本地 LLM)、位圖字幕 OCR、雙字幕顯示、單字查詢及線上影片支援。專為語言學習者設計,採用 GPL-3.0 開源協議。
tsunehimatoi/psd2live
一個自動化管道與桌面應用程式,可將分層 PSD 檔案轉換為完全綁定的 Live2D 模型,具備自適應網格生成、自動變形器設定與 AI 代理整合功能。
MiaAI-Lab/Qwen3.8-Flash-Next-Single-DGX-Spark
在單一 DGX Spark 上使用 vLLM 部署 Qwen3.8-Flash-Next 視覺-語言模型的部署方案,支援記憶體映射 PLE 表與預測解碼。
Pan-Chera/Multi-Agent-CAD
一個多智能體框架,可從自然語言生成可編輯的 CAD 零件和多部件組裝,具備自動程式碼修復和模擬就緒匯出功能。
ddcat-ai/open-ai-canvas
Open‑AI‑Canvas(影策)是一個開源、自托管的網頁工作台,讓創作者能透過整合畫布、非同步任務佇列與本地 AI 代理系統,將文字簡報轉化為完整的電影風格資產——包括故事板、角色/風格圖庫,以及 AI 生成的影像、影片與音訊。
nolangz/pixel2motion
一套 AI 輔助的工作流程與工具組,用於將點陣圖商標轉換為乾淨、動畫化的 SVG 商標,著重於精準配合與基於 HTML 的動態呈現。
funstory-ai/BabelDOC
BabelDOC 是一個開源 Python 工具,使用 LLM(OpenAI 相容模型)翻譯 PDF 科學論文,並輸出雙語 PDF。它提供 CLI、Python API、豐富的 PDF 處理選項、術語表支援、離線資源打包,可本地執行或透過托管的 Beta 服務使用。
OSideMedia/higgsfield-ai-prompt-skill
一個專為 Higgsfield AI 所設計的完整提示工程庫,可將自然語言轉換為可投入生產的電影級影片與影像提示。
OpenDCAI/GameFactory-3A
一個開源框架,利用程式碼代理將遊戲需求轉換為 UE5、Unity、Godot、Blender 和 three.js 的生產就緒資產與引擎特定程式碼。
666ghj/BettaFish
BettaFish(微輿)是一個開源、基於 Python 的多智能體平台,可自動從數十個社交媒體來源爬取、分析並報告公共意見。使用者透過類似聊天的介面提問;三個專業智能體(Query、Media、Insight)收集資料,ForumEngine 讓它們在 LLM 主持人引導下辯論,ReportEngine 生成互動式 HTML(或 PDF/Markdown)報告。系統包含 24/7 爬蟲(MindSpider)、多模態影片/圖片處理、微調情感模型,並支援私有資料整合。專案提供 Docker Compose、Flask 前端、Streamlit 示範,且可擴展至其他領域。
ZSeven-W/openpencil
一款開源的 AI 原生向量設計工具,能從自然語言提示詞生成 UI 佈局並將其匯出為正式生產代碼。
xinnan-tech/xiaozhi-esp32-server
為 xiaozhi-esp32 專案提供的後端伺服器,使 ESP32 裝置能夠具備語音、視覺與智慧家庭控制能力的 AI 助手。
OpenBMB/ChatDev
ChatDev 2.0(DevAll)是一個開源、零程式碼平台,讓你透過視覺化 Web 控制台或輕量級 Python SDK,以 YAML 定義智能體及其連接,設計並執行多 LLM 智能體工作流程。支援資料視覺化、3D 生成、遊戲開發、研究等內建範本。後端為 FastAPI,前端為 Vue 3,專案提供 Docker/Makefile 支援、可擴展的 Python 工具,以及研究級編排器(Puppeteer、MacNet)
HKUDS/RAG-Anything
RAG‑Anything 是一個 Python 套件,用於建構多模態檢索增強生成系統。它使用 MinerU 解析 PDF、Office 檔案、影像、表格與公式,建立跨模態知識圖譜,並透過混合向量-圖搜尋檢索相關內容,再傳遞給 LLM 生成答案。透過 `pip install raganything` 安裝,使用 `RAGAnythingConfig` 設定,匯入文件並以自然語言查詢。
modelcontextprotocol/python-sdk
一個 Python SDK,讓您能遵循 Model Context Protocol(LLM 與工具之間通訊的標準化 API)來建立與使用伺服器。它提供用於將函數暴露為 LLM 可用的工具/資源的裝飾器,支援 stdio/HTTP/SSE 傳輸方式,包含一個 CLI,並在 py.sdk.modelcontextprotocol.io 提供文件。
ant-research/4DAnyone
4DAnyone 是一個研究級神經模型,可將單攝影機人物影片轉換為數十個同步、視角一致的影片(6-24-48 視角),用於下游 4D 高斯點雲重建。可在消費級 GPU(≤24 GB VRAM)上運行,提供快速蒸餾版 Turbo 模型(5.6 倍加速),並提供即用型推理腳本與 nerfstudio 集成。
antirez/h3.c
專為 Apple Silicon 上的 MiniMax-H3 開發的原生 Metal 推理引擎,透過先進的記憶體與效能優化,實現本地端文字轉影片與文字轉音訊生成。
snapotter-hq/SnapOtter
一個自托管的檔案處理套件,利用本地 AI 提供超過 200 個工具,用於影像、影片、音訊和 PDF 的轉換、壓縮與處理,以保護隱私。
leejet/stable-diffusion.cpp
一個輕量級的純 C/C++ 實作,用於在本機執行影像和影片擴散模型,支援多種硬體後端和模型架構。
WEIFENG2333/VideoCaptioner
一個利用 LLM 進行語音辨識、字幕優化與翻譯的影片字幕處理一站式工具,可自動化影片字幕流程。
OpenSenseNova/SenseNova-Skills
SenseNova‑Skills 是一個開源的 Agent-Skills 集合,為 SenseNova LLM 增添了辦公自動化功能(圖像生成、資訊圖表製作、Excel 分析、深度研究與 PowerPoint 簡報製作)。只需將技能資料夾放入 OpenClaw 或 hermes‑agent 運行時,配置 SenseNova API,Agent 即可將簡單的自然語言請求轉化為精緻的數據驅動報告與簡報檔。
MoonshotAI/Kimi-K3
Kimi K3 是一個擁有 2.8T 參數的開源權重原生多模態 MoE 模型,專為長週期編碼、深度研究和複雜的智能體知識工作而設計。
modelscope/DiffSynth-Studio
一個開源的擴散模型引擎,可在消費級 GPU 上實現影像、影片與音訊生成模型的高效能推論與訓練。