AaronFeng753/Waifu2x-Extension-GUI
支援廣泛硬體與神經網路模型的AI驅動影像與影片放大及畫格插補圖形使用者介面。
JuneYaooo/gpt-image2-ppt-skills
gpt-image2-ppt-skills 是一個 Python 技能,適用於多模態 AI 代理,利用 OpenAI 的 gpt‑image‑2 模型生成高品質 16:9 投影片影像,並打包成 .pptx 檔案。支援視覺優先模式與可選的可編輯模式(將投影片重構為原生 PowerPoint 物件)。使用者可透過自然語言提示建立新投影片集、克隆現有的 .pptx 模板,或編輯特定投影片元素。安裝方式為透過支援的代理安裝技能,或執行提供的腳本;需 OpenAI API 金鑰與本地 PowerPoint/Keynote/LibreOffice 渲染器。專案採用 Apache-2.0 授權。
kleinlee/DH_live
一款輕量級 2D 數位人引擎,可在行動瀏覽器與低功耗裝置上實現無需 GPU 的即時動畫與對話。
SeemSeam/claude_codex_bridge
CCB(Claude‑Codex‑Bridge)是一個跨平台終端UI,讓您可以在可見窗格中一起執行許多基於LLM的CLI代理(Codex、Claude、Gemini等),定義協作圖,共享專案範圍的記憶檔案,甚至可以透過Android應用控制工作空間。透過npm安裝,使用內建UI設定,並從命令列管理提供者、角色和富媒體終端。
JimLiu/baocut
一個讓 AI 編碼代理能透過自然語言控制 BaoCut,實現影片自動轉錄、字幕翻譯與時間軸編輯的代理技能。
PhiloLabs/fable51-worlds
一個利用 AI 代理群體將文字、圖像或影片轉換為可漫遊 3D 世界的系統,並將其渲染為基於瀏覽器的 Three.js 應用程式。
QwenLM/Qwen3.8-Flash-Next
一款作為 Qwen4 架構預覽的多模態 MoE 模型,可在程式碼與辦公任務中實現高效率,顯著降低訓練與推論成本。
amitshekhariitbhu/build-your-own-x-machine-learning
一套純 Python、從頭實作的經典機器學習演算法、深度學習模型與應用專案(推薦系統、電腦視覺應用、自然語言處理等)。設計為實作導向的學習資源,適合想了解機器學習技術內部運作的任何人。
DrEAmSs59/CS2-insight-agent
一款專為 CS2 設計的一站式創作套件,可自動化完成回放分析、OBS 高光錄製及 AI 驅動的影片剪輯。
redai-studio/Relax
Relax 是一個基於 Ray‑Serve 的開源強化學習框架,專為多模態大語言模型設計。它透過 TransferQueue 解耦 rollout 與訓練,支援 GPU 集群上的完全異步或混合執行,提供 PPO、GRPO、M2‑PO、RLOO、REINFORCE++ 等豐富的一次策略演算法及插件式獎勵系統。系統相容 Megatron‑LM 訓練後端與 SGLang 推理,可在單一流程中處理文字、視覺、影片與音訊。官方 Docker 鏡像、雙語文件及生產級運維功能(健康監控、指標採集、彈性 rollout 擴展)使其可直接用於 Qwen‑3‑Omni 等模型的研究與大規模微調。
apple-aiml-research/ml-mobileclip
MobileCLIP (以及 MobileCLIP2) 是專為行動裝置優化的輕量、快速圖文模型,用於零樣本分類與描述。此儲存庫提供預訓練權重、訓練/評估腳本 (基於 OpenCLIP)、iOS 演示程式以及 CoCa 描述模型,皆採用 MIT / Apple research 授權。
xr843/insect-world
一個互動式 3D 昆蟲百科全書,收錄 63 個物種,完全透過參數化 TypeScript 程式碼生成,而非使用外部 3D 素材。
morettt/my-neuro
一個用於建立個人化、類似人類的 AI 伴侶的綜合性工作台,支援自訂語音、性格與 Live2D 視覺效果。
nexu-io/codex-slides
專為 Codex 編碼代理設計的開源 AI 投影片工作室,透過可控的即時編輯工作流,將提示詞、程式碼庫或檔案轉換為專業的簡報。
ArcInstitute/state
一個用於預測細胞對擾動的反應並生成細胞嵌入(embeddings)以建模生物狀態轉換的框架。
HisMax/RedInk
只需輸入一句話,即可生成包含大綱、文案及視覺一致圖像的完整多頁社交媒體貼文。AI 驅動工具。
GetStream/Vision-Agents
一個用於構建低延遲、多模態 AI 代理的框架,將即時視訊串流與大型語言模型(LLM)以及電腦視覺模型結合,提供互動式視覺體驗。
TEN-framework/ten-framework
一個用於建構具備低延遲音訊、文字與視覺能力的即時多模態對話式 AI 代理的開源框架。
SakuraMathcraft/LaTeXSnipper
一個使用 OCR 將螢幕截圖、影像和 PDF 轉換為可編輯 LaTeX 公式與文字的桌面應用程式。
microsoft/mcp-gateway
MCP Gateway 是一個為 Model Context Protocol (MCP) 伺服器打造的開源 Kubernetes-native 反向代理與管理層。它提供了一個 REST 控制平面來建立、更新與監控 MCP adapters 與 tools,並具備 session-aware routing、Azure Entra ID RBAC、內建的 React portal、以及可選的 LLM 驅動 agents。可以透過 Docker/K8s 在本地端部署,或使用一鍵式 Azure 範本進行部署。
KangLiao929/Puffin
一系列用於 3D 世界建模的統一多模態模型,透過原生物理、幾何與外觀狀態,實現以相機為中心的空間智能與 3D 世界生成。
nv-tlabs/lyra
NVIDIA 推出的系列開源生成式 3D 世界模型,能從單張圖像或影片中生成 3D 與 4D 場景。
dmMaze/BallonsTranslator
一款基於深度學習的漫畫翻譯工具,可自動化實現漫畫與漫畫的文本檢測、OCR、修復與翻譯。
google-deepmind/gemma
一個用於部署與微調基於 Gemini 研究的 Gemma 系列開源權重大型語言模型的 JAX 函式庫,支援多模態對話與多種硬體後端。
EvolvingLMMs-Lab/lmms-eval
LMMs‑Eval 是一個開源 Python 工具包,統一了 >100 個多模態基準任務(圖像、影片、音訊),用於評估具備視覺/音訊能力的大語言模型。它提供決定論、統計上可靠的结果,支援 30+ 模型家族(透過 vLLM、SGLang 或 OpenAI 相容 API),並包含 Web UI、HTTP 評估伺服器和可擴展的模型/任務介面。
Lynpoint/CyberVerse
一個用於建立即時數位人類代理的開源框架,該代理結合了語音互動、角色記憶和單張照片的視訊動畫。
duixcom/Duix-Mobile
用於在行動與嵌入式裝置上以低延遲與裝置端執行部署即時互動式 AI Avatars 的開源 SDK。
momori777/Artemis
一個完全本機、未經審查的 AI 伴侶系統,整合了 LLM、TTS、影像生成和 Live2D 動畫,以建立私密、以角色為驅動的虛擬夥伴。
chatfire-AI/huobao-canvas
Huobao Canvas 是一個開源、基於節點的可視化編輯器,可讓您在無限畫布上連結來自 11 個提供者的文字、圖像和影片 AI 模型。它提供輕量級 Node 伺服器用於持久化和非同步執行佇列、Docker 和 Electron 部署選項,以及透過 Huobao 進行一鍵設定。非常適合在不編寫程式碼的情況下構建多模態創意流水線。
MirroS-Lab/Code-as-World
Code-as-World 是一個將物理世界表示為可執行程式碼的框架,透過迭代模擬發現世界表示,使 AI 模型能夠進行定量物理推理。
IBM/AssetOpsBench
AssetOpsBench 是一個開源基準/框架,用於建構、編排和評估基於大語言模型(LLM)的AI代理,這些代理處理工業資產管理資料(感測器、工作單、故障模式等)。它提供領域特定的MCP工具伺服器、多種ReAct風格代理後端、141+個真實場景,以及在KDD/AAAI/NeurIPS競賽中使用的多維評估流水線。
Kiri-Innovation/3dgs-render-blender-addon
一個將高保真3D捕捉資料整合至標準3D製作工作流程的Blender外掛程式,支援3D高斯點陣的匯入、編輯、動畫與渲染。
Runfusion/Fusion
Fusion 是一個開源的 AI 驅動軟體工廠,能將自然語言任務描述轉化為完全審查、可合併的程式碼。它協調由 LLM 驅動的代理群,每個任務在獨立的 Git worktree 中執行,並透過可配置的工作流程與人工監督的視覺化儀表板呈現整個流程。
ArtificialAnalysis/Stirrup
Stirrup 是一個用於構建 LLM 驅動型代理的輕量級 Python 框架。它提供現成的工具(程式碼執行、網路搜尋、檔案 I/O、多模態處理)和靈活的 `Tool`/`ToolProvider` 系統,同時自動管理上下文限制和工作階段生命週期。透過 `pip install stirrup`(可選擴充功能包括 Docker、瀏覽器等)進行安裝,建立用戶端(OpenRouter、LiteLLM 或任何 OpenAI 相容的 API),實例化一個 `Agent`,並執行一個允許模型呼叫工具來解決任務的工作階段。易於新增自定義工具和提供者,使 Stirrup 非常適合快速原型設計、特定領域助手以及對使用工具的代理進行研究。
zyddnys/manga-image-translator
一款 AI 驅動的圖像翻譯工具,可檢測、刪除並替換漫畫和連環畫中的文本,支援多種語言和自動排版。
DavidVentura/offline-translator
一個 Android 翻譯應用程式,使用裝置上的模型完全離線執行文字、PDF/ODT 文件和圖片翻譯。
P1kaj1uu/ChattyPlay-Agent
ChattyPlay‑Agent 是一個全端 Web 應用,結合 AI 聊天助手(ChatGPT/DeepSeek)與多項日常工具——音樂串流、影片解析、黃金價格圖表、學術論文瀏覽、LaTeX/markdown 編輯器、思維導圖、漫畫庫、閒魚市場助手、文字生成圖像。採用 React + TypeScript 前端與 Python/Java 後端建構,透過 Docker 運行,並提供線上示範。此倉儲是 AI 助手領域的一個真實軟體專案。
RunMaestro/Maestro
Maestro 是一個跨平台桌面應用,讓高階使用者並行執行、自動化與監控多個 AI 編碼代理(如 Claude Code、OpenAI Codex 等),支援 Git 工作樹、劇本自動化、鍵盤優先 UI、遠端 Web 控制與分析功能,所有功能皆在 AGPL-3.0 許可證下提供。
Tencent-Hunyuan/UniRL
UniRL 是一個開源 Python 框架,將統一的強化學習循環應用於許多多模態生成模型(LLM、視覺-語言模型、圖像/視頻擴散,以及混合 AR-擴散模型)。它提供四個入口點、基於 Hydra 的配置、可插拔的 rollout 引擎,以及通過 Ray 和 FSDP 進行的分佈式訓練。該倉庫包含標準 RL 算法以及團隊提出的三種新穎方法(Flow-DPPO、DRPO、CPPO)的教程。支持的模型包括 Stable Diffusion 3、FLUX.2-Klein、Qwen-3、HunyuanVideo 等。提供文檔、示例配方和 WeChat 社區。採用 Apache-2.0 許可證。
liyue-aigc/female-outfit-director
一種用於AI代理的提示導向工作流程,可生成結構化的生產計畫與創造角色一致的換裝影片的提示。
mlfoundations/open_clip
OpenCLIP 是一個開源 PyTorch 函式庫,實現了 OpenAI 的 CLIP 以及許多較新的多模態模型(SigLIP、CoCa、MaMMUT、CLAP、支援 NaFlex 的視覺/音訊、現代文字塔)。它提供預訓練檢查點、支援分散式/FSDP2 的靈活訓練棧、混合精度和 torch.compile 加速,以及用於零樣本推理和生成式說明的工具。
YGYOOO/WorldX
WorldX 是一個 AI 驅動的模擬引擎,僅需一個文字提示即可生成包含自主代理、地圖與突現敘事的完整虛擬世界。
huangserva/3DCellForge
一個由AI驅動的3D模型工作室,利用多個AI提供者將影像轉換為互動式3D模型,並提供專業級的檢視與展示工作環境。
nv-tlabs/3dgrut
結合高斯光柵化與光線追蹤的混合式 3D 渲染框架,支援畸變相機與反射、陰影等複雜光照效果。
Scottcjn/bottube
一個 AI 原生影片平台,AI 代理與人類共同創作與分享短影片,透過 Proof of Physical AI 實現硬體驗證的內容來源證明。
microsoft/DebugMCP
DebugMCP 是 Microsoft 的 VS Code 延伸模組,會在本機執行 MCP 伺服器,將除錯動作(啟動/停止、逐步執行、中斷點、變數檢視、表示式評估)作為工具公開,讓任何支援 MCP 的 AI 助手(Copilot、Cursor、Codex 等)都能呼叫。它出廠即支援多種語言,完全在本機埠號 3001 執行,並包含安全檢查(僅迴路介面綁定、主機驗證、機密資訊隱藏)。附屬的 *debug‑live* 技能提供高階除錯工作流程,讓 AI 代理能自主地在 VS Code 內直接除錯程式碼。
ganbo-gab/open-storyboard-canvas
Open Storyboard Canvas 是一個開源、跨平台的桌面應用(Tauri + React + Rust),提供用於 AI 生成圖像、影片和 3D 故事板場景的視覺化節點畫布。包含基於聊天的 Canvas Agent(測試版),可建立、編輯和追蹤生成任務,支援多種提供者(OpenAI 相容、Claude、Dreamina CLI),並提供導演工作室工具、提示詞圖書館、批量匯入和詳細日誌。採用 MIT 許可證,基於 Storyboard-Copilot 上游專案建構。
xszyou/Fay
一個整合了 LLM、ASR 與 TTS 的綜合數位人框架,為應用程式、網站及嵌入式設備提供互動式虛擬化身能力。