google-gemini/gemini-live-api-examples

Gemini Live API 的範例集合,使開發者能利用多模態輸入建構低延遲、即時的語音與影片 AI 代理。

X-PLUG/MobileAgent

一個利用視覺感知與規劃實現行動裝置、桌面端及 Web 介面任務自動化的多平台 GUI 智能體及基礎模型系列。

YouMind-OpenLab/awesome-seedance-2-prompts

一個經精選、採用 CC-BY-4.0 授權的社群提交提示集合,共 6,405 個,專為字節跳動的 Seedance 2.0 多模態影片生成模型設計,包含精選範例、可搜尋的網頁畫廊與貢獻指南。

niedev/RTranslator

一款基於 Whisper 和 NLLB 等裝置端 AI 模型的 Android 離線即時翻譯應用,實現無需網路的私密對話。

HUANGCHIHHUNGLeo/claude-real-video

一個本地影片處理流程,可為大型語言模型提取有意義的關鍵幀與字幕,以智慧畫面變更偵測取代固定間隔取樣。

op7418/guizang-yingzao-skill

一項 AI 驅動的設計技能,將建築與文化照片轉化為藝術指導的編輯海報,並整合中文字體排版與空間感知。

fengshao1227/ccg-workflow

CCG-Workflow 是一個 Node.js CLI,使 Claude Code 成為多個程式碼生成模型(Codex、Gemini 等)的中心協調器。它注入 JavaScript 鈎子以保持上下文,建立持久任務資料夾,執行內建策略(如 full-collaborate),應用安全/品質門,甚至可部署至 Baota 面板。透過 `npx ccg-workflow`(完整模式)安裝,或作為 Claude 外掛僅取得可重用技能。

xberg-io/xberg

Xberg 是一個開源、基於 Rust 的文件智慧引擎,可從 107 種格式中提取乾淨、結構化的文字(包含 OCR、表格、程式碼結構,以及可選的 LLM 驅動增強)。它提供 15 種語言的綁定、CLI、Docker 鏡像、REST API 和 AI 編碼助手用的 MCP 伺服器。

GMGNAI/gmgn-skills

GMGN Skills 透過 CLI 命令為 AI Agent 提供即時的多鏈鏈上數據與 Meme 代幣交易能力,無需爬蟲即可實現自動化的研究、分析與執行。

ooboqoo/interview-coder-cn

一款由 AI 驅動的截圖助手,能即時分析螢幕上的問題並提供答案,同時對螢幕共享軟體保持隱形。

taoufik123-collab/claude-watch

一個使 Claude 能夠透過提取關鍵幀與字幕來觀看 URL 或本機檔案影片的技能,實現多模態分析。

zilliztech/memsearch

memsearch 是一個 Python 庫與 CLI,將 AI 編碼助手對話記錄為 Markdown,建立混合(BM25 + 密集)Milvus 索引,並透過插件支援 Claude Code、Codex、DeepSeek Harness、OpenClaw 與 OpenCode 等平台的跨平台召回。支援本地 ONNX 嵌入、可選的 Zilliz Cloud 後端、背景專案/使用者筆記,以及自動技能蒸餾。

argosopentech/argos-translate

Argos Translate 是一個用於離線神經機器翻譯的開源 Python 函式庫。它下載封裝為 ".argosmodel" 檔案的預訓練 OpenNMT 模型,支援透過中間語言進行樞軸翻譯,並透過 CTranslate2 提供 GPU 加速,可以透過 Python API、CLI 或獨立的桌面 GUI 使用。該專案還為 LibreTranslate Web/API 服務提供支援。

nyldn/claude-octopus

Claude Octopus 是一個為 Claude Code 設計的外掛程式,添加了多 LLM 編排層。它在你執行 `/octo:*` 命令前保持休眠狀態,隨後可呼叫最多 12 個外部提供者(如 Codex、Copilot、Ollama 等)執行共識門控審查、對抗性評議或完整的「規格到軟體」流程。它內建數十個角色、斜線命令和方法感知工作流程,與持久化記憶工具整合,支援在 Claude Code、Codex CLI、Cursor IDE(透過 MCP 伺服器)、OpenCode 中使用。

open-multi-agent/open-multi-agent

Open Multi‑Agent (OMA) 是一個 TypeScript 框架,用於在 Node.js 應用中編排動態的 LLM 代理團隊。它在執行時從高階目標建構任務 DAG,執行計畫(支援人工審核),記錄完整追蹤以供檢查或重播,並支援任何 LLM 提供者、工具門控、預算與 OpenTelemetry 集成。

Ch921-cell/Remember-R1

Remember-R1 是一個旨在防止多模態模型在長上下文推理過程中遺忘視覺資訊的強化學習框架。

llm-as-a-verifier/llm-as-a-verifier

llm-as-a-verifier 是一個 Python 框架,將 LLM 轉化為 AI 代理輸出的細粒度、機率性驗證器。它對候選軌跡進行評分,透過高效的機率性樞軸錦標賽(PPT)選擇 best-of-N,逐步追蹤進度,並支援多模態(影像)輸入。該庫在多個代理基準測試中達成最尖端成果,包含可重現的評估腳本、快取優化的 token 使用量追蹤器,以及用於無縫整合的 Claude Code 插件(TurboAgent)。

jingyaogong/minimind-v

一個極簡的視覺語言模型 (VLM) 實作,允許使用者在單張消費級 GPU 上僅需 2 小時即可訓練一個 65M 參數的多模態模型。

50kg/image-to-slice

一款 AI 驅動的 UI 分解工具,透過智慧地切割資產並進行背景 inpainting,將扁平的 UI 圖片轉換為可編輯的 Figma 圖層和 HTML/CSS 程式碼。

halcyon-video/halcyon-video

專為 Jellyfin、Plex 和 Emby 等媒體庫設計的可步行 3D 影片商店介面,將數位目錄轉化為沉浸式物理瀏覽體驗。

Blizaine/Maestro

一個使用 LLM 指導的工作流來自動化製作音樂錄影帶和短片的在地化 AI 創意工作室與影片編輯器。

hero8152/Infinite-Canvas

一個視覺化、無限畫布的工作空間,整合多種 AI API 與本地 ComfyUI 工作流程,用於協作式生成式 AI 內容創作。

JohnKinyanjui/sprite-maker

一個本地優先的 AI 工作台,用於創建、動畫化和匯出 2D 遊戲藝術,具備身分保持的 AI 動畫與基於 Rust 的決定論性綁定引擎。

shootthesound/Fizgig

一個允許使用者在消費級 GPU 上微調與修復 AI 圖像與影片模型的 LoRA 訓練與優化工作室。

Adam-CAD/CADAM

一個開源的文字轉 CAD 網頁應用程式,使用 AI 將自然語言與影像轉換為 OpenSCAD 的參數化 3D 模型。

tover0314-w/opentypeless

一個開源的 AI 語音輸入工具,適用於 macOS、Windows 和 Linux,提供應用程式感知的語音輸入、語音問答與文字重寫功能。

MCPJam/inspector

MCPJam Inspector 是一個開源測試與評估平台,用於實現 Model‑Chat‑Protocol (MCP) 的伺服器,該協定被 ChatGPT、Claude、Cursor、Copilot 等基於聊天的 AI 產品所使用。它提供 Web Playground、OAuth 調試器、伺服器除錯工具、可重複使用的「技能」、共享工作區、評估測試用例執行器、CLI、SDK 以及 CI/CD 整合,可在 16 種客戶端設定和 170+ LLM 模型中捕捉回歸問題。

csyqlz/VOZEB-PRO

一個將多模態代理、視覺畫布與短劇製作流程整合為單一商業就緒 SaaS 應用的全端式 AI 內容創作平台。

AgnesAI-Labs/AgnesAI-Models

一個統一的 OpenAI 兼容 API 網關,提供對高效率多模態基礎模型(適用於文字、影像與影片生成)的存取。

penecho/penecho

PenEcho 是一個透過 Model-Canvas-Protocol (MCP) 與 LLM 代理整合的視覺化畫布應用。它讓您能繪圖、註解、嵌入小工具,並讓 AI 代理讀取與編輯畫布,建立對話與視覺工作之間的緊密反饋迴圈。可作為桌面應用或 npm 套件使用,支援本地與雲端主機模型,並提供版本化專案、分享功能與內建助手。

oomol-lab/pdf-craft

一個使用 OCR 和 LLM 驅動的翻譯功能的 Python 函式庫,可將掃描後的 PDF 檔轉換為可編輯的 Markdown 或 EPUB 檔案。

digitalsamba/claude-code-video-toolkit

一個與 Claude Code 集成的 AI 原生影片製作工作區,可自動化腳本撰寫、資產生成與渲染流程,以低成本製作專業級說明型影片。

NomaDamas/CozyClay

一個基於瀏覽器的預視覺化工作室,用於場景佈局與角色擺姿,以建立AI影片生成所需的高控制參考資產。

modstart-lib/aigcpanel

整合唇形同步、語音克隆與音視頻工具,用於 AI 數位人創作的一站式桌面應用程式。

sokrypton/ColabFold

一款透過 Google Colab 與本地安裝,讓蛋白質折疊預測易於取得的工具,整合了 AlphaFold2 與 AlphaFold3 等多種模型及公開 MSA 伺服器。

Blaizzy/mlx-vlm

MLX‑VLM 是一個 Python 套件,可透過 Apple Silicon 上的 MLX 執行時,實現視覺-語言(及多模態)模型的推論、微調與服務部署。它提供 CLI、FastAPI 伺服器、Gradio 聊天 UI,以及推測解碼(DFlash、Gemma‑4 MTP、EAGLE‑3)等高階加速技術。該套件支援數十種預包裝模型、低比特量化、思考預算控制,以及便於開發的代理技能套件。

NVIDIA-NeMo/Nemotron

專為代理型 AI 設計的開源、高效率多模態模型家族及訓練配方,提供從資料整理到部署的完整生命週期工具支援。

jordanrendric/claude-video-vision

透過本地或雲端後端提取畫面並轉錄音訊,使 Claude Code 具備影片理解能力的插件。

Tencent-Hunyuan/HY-World-2.0

一個從文字、影像或影片生成與重建可編輯 3D 資產(網格與 Gaussian Splattings)的多模態世界模型框架,適用於遊戲引擎。

rome-os/rome

Rome 是一個開源的「代理作業系統」,允許人類與 AI 代理在持久、自托管的環境中協作。它引入了 **Rome Apps**——透過 git 跟蹤的套件,包含動作、代理、技能、UI 和資料,使能力超越單次對話而持續存在。您可透過 Docker/Electron 本地執行或使用預覽版 Rome Cloud,使用提供的 SDK 建構應用,並透過應用商店共享。該平台聚焦於可組合、可重用的軟體,而非僅模型提示,定位在持久代理服務與個人軟體平台之間。

ahujasid/camera-to-blender

一個使用 AI 將現實世界的物體照片轉換為 3D 模型,並自動匯入 Blender 的工具。

WecoAI/aideml

AIDE ML 是一個開源的 Python 套件,實作了一個由大語言模型引導的樹狀搜尋代理,可自動撰寫、除錯與優化機器學習流程。使用者以自然語言描述資料集、目標與評估指標;代理會迭代生成程式碼、評估其表現,並修剪搜尋樹,直到指標達到最佳。該套件包含 CLI、Streamlit UI、HTML 可視化功能,並支援任何 OpenAI 兼容的大語言模型(包括本地的 Ollama 模型)。

mizorewww/course2md

使用語音辨識將 YouTube、Bilibili 和本機影片轉換為帶插圖的 Markdown 或 HTML 記錄的工具。

GenielabsOpenSource/spine-animation-ai

一個為 Spine 2D 設計的 AI 驅動工具集,可自動完成角色綁定、資產定位與從原始影像生成動畫。

alibaba/lumenx

一個 AI 原生的動畫漫畫與影片創作平台,透過整合的腳本分析、資產生成與合成流程,將腳本轉化為完成影片。

anymouschina/TapCanvas

一個原生 Agent 無限畫布,將腳本、資產與故事板整合為可追蹤的工作流程,用於 AI 電影與多模態內容生產。

raojiacui/prompt-lens

一款 AI 影片分析工具,可逆向分析現有影片以提取提示與腳本,幫助創作者重現並迭代成功的 AI 影片風格。

laravel/mcp

Laravel MCP 是一個 Laravel 套件,提供即用型 Model Context Protocol (MCP) 伺服器,使 AI 客戶端能透過標準協定與 Laravel 應用的資料與邏輯互動。