microsoft/bioemu

一種從氨基酸序列中採樣蛋白質單體結構平衡分佈的生成模型,具備確保物理合理性的引導系統。

OpenSenseNova/SenseNova-Vision

SenseNova-Vision 是一個統一的多模態模型,它將多樣化的電腦視覺任務視為生成問題,使單一模型能夠透過文字和圖像輸出來執行偵測、分割和幾何預測。

dc-ai-projects/DC-Gen

一個用於擴散模型的加速框架,將預訓練模型轉換為深度壓縮的潛在空間,在不損失品質的情況下實現高達 53.8 倍的推理加速。

LYiHub/pub-local-jarvis

適用於 Windows 的本地多模態桌面助理,能感知螢幕與系統音訊,提供即時遊戲陪伴、課程筆記與情境 AI 互動。

IamCreateAI/NeoVerse

NeoVerse 是一個 4D 世界模型,能從單目影片中重建 3D 場景,從而實現沿著新穎的相機軌跡進行高品質的影片生成。

Wakals/CoVT

CoVT 是一個使視覺語言模型能夠使用連續視覺令牌進行推理的框架,透過將語意思考根植於感知線索,提升其空間推理能力與幾何意識。

Visionary-Laboratory/holi-spatial

將影片串流轉換為帶有註釋的 3D 空間智能數據集(包括 3D Gaussian Splatting 幾何形狀與空間 QA 對)的數據策劃流水線。

Alibaba-NLP/VRAG

一個使用代理強化學習的多回合多模態 RAG 框架,使 VLM 能在文字、圖像與影片之間進行推理與資訊檢索。

PiSugar/whisplay-ai-chatbot

基於Raspberry Pi打造的口袋尺寸AI聊天機器人,支援語音對語音互動、圖像生成與本地AI加速。

bakrianoo/mazinger

一個端到端的影片配音流程,自動化完成轉錄、翻譯、語音克隆與音訊組裝,整合為單一工作流程。

facebookresearch/seamless_communication

一個多模態 AI 模型系列,支援語音與文本模態,可在近 100 種語言中實現高品質、具表現力的即時翻譯。

octimot/StoryToolkitAI

一款 AI 驅動的電影剪輯助手,可對影片素材進行轉錄、索引和搜尋,允許剪輯師使用 LLM 自動建立用於匯出至剪輯軟體的敘事片段。

MMMU-Benchmark/MMMU

一個大規模的多學科基準測試,用於在 30 個不同學科上評估大學程度的專業知識與複雜推理能力的多元模態 AI 模型。

GPTomics/bioSkills

bioSkills 是一個包含即用型程式碼範本(「技能」)的函式庫,可教導LLM編碼代理執行生物資訊學分析——從序列輸入輸出到單細胞、變異檢測、結構生物學、化學資訊學及工作流程管理。可透過 Claude Code、Codex、Gemini/Antigravity、OpenCode 和 OpenClaw 的輕量腳本安裝,提供最佳實踐命令列旗標、範例程式碼與使用指南,提升AI生成的生物資訊學程式碼的準確性。

Jane-xiaoer/paper-collage-ad-codex

一個為 OpenAI Codex 設計的全面工作流技能,可從創意腳本到最終 MP4 渲染,自動化生成紙拼貼風格廣告。

xeronsh/openOii

一個使用 LangGraph 協調從故事構思到最終影片合成的多代理流程的 AI 漫畫影片生成專案

shang-zhu/violin

一個開源的影片翻譯工具,能將影片轉錄、翻譯並以聽起來自然的 AI 語音進行配音,支援 33 種語言。

livekit-examples/python-agents-examples

使用 LiveKit Agents 框架建構語音、視訊與電話AI代理的可執行Python範例與全端應用的集合。

Voine/ChatWaifu_Mobile

一個整合 ChatGPT、本地 VITS 語音合成與 Live2D 動畫的 Android 應用程式,創造出沉浸式的角色型 AI 伴侶。

microsoft/psi

位置智能平台(\psi)是 Microsoft 開源的 .NET 框架,用於建構即時多模態 AI 應用——機器人、混合實境助理、智慧空間系統——透過提供高效率串流基礎設施、視覺化工具(PsiStudio)以及感測器/AI 元件程式庫。它可在 Windows 與 Linux 上執行,以 MIT 授權的 NuGet 套件分發,並包含教學、範例與活躍的社群。

ChaitanyaEswarRajeshJakki/gemini-youtube-automation

使用 Gemini 2.5 Flash 的自主 AI 機器人,可在無人干預下每日編寫、產出並上傳教育類 YouTube 影片與 Shorts。

hassancs91/claude-youtube-editor

一個開源管線,透過 AI 生成的視覺效果、音訊清洗和自動上傳,將原始的「說話者頭像」錄影轉換為精緻的影片,實現 YouTube 影片編輯的自動化。

suki0dayo/AI_film_studio

一個基於節點的視覺化編輯器,透過自動化 LLM 提示詞與 ComfyUI 影像及影片生成之間的工作流程,來簡化 AI 電影製作。

Anionex/dsh-vision-toolkit

一個為 DeepSeek Harness 所設計的視覺工具包,讓純文字模型具備執行 UI 復原、長截圖 OCR 和 GUI 自動化等任務的視覺能力。

mintdotgg/mint-playground

一組開源的Three.js體驗,展示使用Mint資產管道建構的互動式3D展廳、遊戲與資料視覺化。

NVIDIAGameWorks/kaolin

NVIDIA 提供的 PyTorch 庫,為 3D 深度學習提供 GPU 優化模組,包括可微分渲染、物理模擬以及對 3D 高斯點的支援。

ParisNeo/lollms-webui

一個統一的本地Web介面,可存取數百個LLM與多模態AI模型,支援文字、影像、影片與音樂生成。

GoogleCloudPlatform/vertex-ai-creative-studio

一個用於探索 Google Cloud 生成式媒體模型的 Web 應用程式,提供影像、影片、音樂與語音生成以及創意工作流程的統一介面。

Stonesjtu/pytorch_memlab

pytorch_memlab 是一個 Python 套件,可逐行分析 CUDA 記憶體使用情況,列出活躍張量,並能暫時將 GPU 資料移至 CPU。它透過 `%mlrun` 魔術指令與 IPython/Jupyter 集成,協助調試 PyTorch 模型中的記憶體不足錯誤。

pnnx/pnnx

pnnx 是一個開源工具,可優化 PyTorch 模型並導出為輕量、無依賴的格式(PNNX)以及 ncnn/ONNX-zero 檔案,使邊緣裝置上的快速推論成為可能。

ljquan/opentu

Opentu 是一個基於畫布的 AI 應用平台,將多模型生成與工具管理整合至單一工作區,實現持續的 AI 任務執行。

OpenSQZ/MiniCPM-V-CookBook

支援文字、視覺與音訊能力的 MiniCPM 系列多模態模型之部署與微調完整食譜手冊,適用於多種硬體平台。

Cjbuilds/Codex-Orchestration

Codex Orchestration 是一個 Codex 外掛程式,可讓您將其他 LLM(Claude Fable 5、Opus 5、OpenRouter 模型等)附加至任務,並為其分配特定角色——規劃者、顧問、設計師、執行者。Codex 保持頂層協調者身份,迭代計畫、審查計畫、可選地設計 UX 資料,最終執行程式碼。外掛程式透過 Codex 市場安裝,透過 Codex 聊天中的技能提示配置,並支援角色特定的工作量層級。旨在提升計畫品質、實現平行工作、減少高階模型使用。MIT 許可。

dromara/wgai

WGAI 是一個基於 Spring-Boot + Vue 的 Web 平台,將視覺(OpenCV、YOLO、OCR、人臉辨識)、音訊(語音轉文字、ChatGPT 風格對話)、數位人虛擬形象與 AGV 導航整合為一個離線優先、工業級的 AI 管理系統。提供線上資料標註、模型訓練、即時影片/音訊分析與系統監控功能,並配備設定介面與公開示範實例。程式碼採用 AGPL-3.0 授權,支援主要透過付費中文社群提供。

visualbruno/ComfyUI-Hunyuan3d-2-1

這是一個為騰訊 Hunyuan3D-2.1 模型開發的 ComfyUI 封裝器,可在視覺化節點工作流中生成帶有紋理的 3D 模型。

zai-org/GLM-V

一系列增強多模態推理能力的視覺語言模型(VLM),支援原生函數呼叫、視覺定位與複雜文件理解。

PaddlePaddle/ERNIE

一組提供文本與視覺語言理解方面最先進性能的大規模多模態 MoE 模型與開發工具包。

cambrian-mllm/cambrian-s

一套多模態大型語言模型與資料集,旨在提升影片理解中的空間推理與「空間超感知」能力。

qualcomm/aimet

AIMET 是 Qualcomm 的開源工具包,用於量化和壓縮 PyTorch/ONNX 模型,使其能夠在邊緣設備上以極小的精度損失實現快速、低記憶體的推理。

SamurAIGPT/AI-Influencer-Generator

一個開源管線,使用 Stable Diffusion、gTTS 和 SadTalker 來為社群媒體創建並動畫化一致的虛擬 AI 網紅。

volcengine/rtc-aigc-demo

一個展示整合RTC、ASR、LLM與TTS的互動式AIGC流程的示範專案,支援即時語音AI互動。

ShayneP/local-voice-ai

一個在本地硬體上運行的私有、低延遲語音助理,使用語音辨識、LLM 和語音生成模型的堆疊。

sympozium-ai/sympozium

Sympozium 是一個開源、Kubernetes 原生的平台,用於協調多智能體 AI 系統。它提供基於 CRD 的策略、共享 SQLite 記憶體、sidecar 隔離技能和可視化工作流程畫布,讓團隊在保持內建治理和可觀測性的同時大規模編排智能體。

nv-tlabs/Gamma-World

Gamma-World 是一個生成式多智能體世界模型,可模擬多個獨立可控智能體共享的環境,支援 24 FPS 的即時互動式影片生成。

kandinskylab/kandinsky-5

一個用於從文字或圖像生成高品質影片與圖像的擴散模型家族,提供 Pro 與 Lite 版本,具備強大的英語與俄語支援。

OliBomby/Mapperatorinator

一個多模型 AI 框架,能從音訊頻譜圖生成完整功能的 osu! 譜面,並提供 AI 驅動的模組工具以偵測譜面不一致性。

R3gm/SoniTranslate

SoniTranslate 是一個用於將影片翻譯成不同語言並同步音訊的網頁應用,將轉錄、翻譯與語音配音整合於一個介面中。

IBM/terramind

面向地球觀測的任意輸入輸出生成基礎模型,支援多模態空間資料生成與環境監測。