microsoft/bioemu
一种从氨基酸序列中采样蛋白质单体结构平衡分布的生成模型,具备确保物理合理性的引导系统。
OpenSenseNova/SenseNova-Vision
SenseNova-Vision 是一个统一的多模态模型,它将多样化的计算机视觉任务视为生成问题,使单一模型能够通过文本和图像输出来执行检测、分割和几何预测。
dc-ai-projects/DC-Gen
一个用于扩散模型的加速框架,将预训练模型转换为深度压缩的潜在空间,在不损失质量的情况下实现高达 53.8 倍的推理加速。
LYiHub/pub-local-jarvis
适用于 Windows 的本地多模态桌面助手,能够感知屏幕和系统音频,提供实时游戏陪伴、课程笔记和上下文 AI 交互。
IamCreateAI/NeoVerse
NeoVerse 是一个 4D 世界模型,能从单目视频中重建 3D 场景,从而实现沿着新颖的相机轨迹进行高质量的视频生成。
Wakals/CoVT
CoVT 是一个使视觉语言模型能够使用连续视觉令牌进行推理的框架,通过将语义思考扎根于感知线索,提升其空间推理能力和几何意识。
Visionary-Laboratory/holi-spatial
将视频流转换为带有注释的 3D 空间智能数据集(包括 3D Gaussian Splatting 几何形状和空间 QA 对)的数据策划流水线。
Alibaba-NLP/VRAG
一个使用代理强化学习的多轮多模态 RAG 框架,使 VLM 能在文本、图像和视频之间进行推理和信息检索。
PiSugar/whisplay-ai-chatbot
基于Raspberry Pi构建的口袋尺寸AI聊天机器人,支持语音对语音交互、图像生成和本地AI加速。
bakrianoo/mazinger
一个端到端的视频配音流水线,自动化完成转录、翻译、语音克隆和音频合成,整合为单一工作流。
facebookresearch/seamless_communication
一个多模态 AI 模型系列,支持语音和文本模态,可在近 100 种语言中实现高质量、具有表现力的实时翻译。
octimot/StoryToolkitAI
一款 AI 驱动的电影剪辑助手,可对视频素材进行转录、索引和搜索,允许剪辑师使用 LLM 自动创建用于导出到剪辑软件的故事片段。
MMMU-Benchmark/MMMU
一个大规模的多学科基准测试,用于在 30 个不同学科上评估大学水平的专业知识和复杂推理能力的多种模态 AI 模型。
GPTomics/bioSkills
bioSkills 是一个包含即用型代码模板(“技能”)的库,可教会LLM编码代理如何执行生物信息学分析——从序列输入输出到单细胞分析、变异检测、结构生物学、化学信息学及工作流管理。可通过 Claude Code、Codex、Gemini/Antigravity、OpenCode 和 OpenClaw 的轻量脚本安装,提供最佳实践命令行标志、示例脚本和使用指南,提升AI生成的生物信息学代码的准确性。
Jane-xiaoer/paper-collage-ad-codex
一个为 OpenAI Codex 设计的全面工作流技能,可从创意脚本到最终 MP4 渲染,自动化生成纸拼贴风格广告。
xeronsh/openOii
一个使用 LangGraph 协调从故事创意到最终视频合成的多代理流水线的 AI 漫画视频生成项目
shang-zhu/violin
一个开源的开源视频翻译工具,能将视频转录、翻译并以听起来自然的 AI 语音进行配音,支持 33 种语言。
livekit-examples/python-agents-examples
一个使用 LiveKit Agents 框架构建语音、视频和电话AI代理的可运行Python示例和全栈应用的集合。
Voine/ChatWaifu_Mobile
一款集成了 ChatGPT、本地 VITS 语音合成和 Live2D 动画的 Android 应用程序,旨在创建一个沉浸式的、基于角色的 AI 伴侣。
microsoft/psi
位置智能平台(\psi)是 Microsoft 开源的 .NET 框架,用于构建实时多模态 AI 应用——机器人、混合现实助手、智能空间系统——通过提供高性能流式传输基础设施、可视化工具(PsiStudio)以及传感器/AI 组件库。它可在 Windows 和 Linux 上运行,通过 MIT 许可的 NuGet 包分发,并包含教程、示例和活跃的社区。
ChaitanyaEswarRajeshJakki/gemini-youtube-automation
使用 Gemini 2.5 Flash 的自主 AI 机器人,可在无人干预的情况下每日编写、生成并上传教育类 YouTube 视频和 Shorts。
hassancs91/claude-youtube-editor
一个开源流程,通过将原始 talking-head 录制转换为精美的视频,并利用 AI 生成的视觉、音频清理和自动上传,实现 YouTube 视频编辑的自动化。
suki0dayo/AI_film_studio
一个基于节点的可视化编辑器,通过自动化 LLM 提示词与 ComfyUI 图像及视频生成之间的工作流程,来简化 AI 电影制作。
Anionex/dsh-vision-toolkit
一个为 DeepSeek Harness 设计的视觉工具包,使纯文本模型具备执行 UI 恢复、长截图 OCR 和 GUI 自动化等任务的视觉能力。
mintdotgg/mint-playground
一组开源的Three.js体验,展示使用Mint资产管道构建的交互式3D展厅、游戏和数据可视化。
NVIDIAGameWorks/kaolin
NVIDIA 提供的 PyTorch 库,为 3D 深度学习提供 GPU 优化模块,包括可微分渲染、物理模拟以及对 3D 高斯点的支持。
ParisNeo/lollms-webui
一个统一的本地Web界面,用于访问数百个LLM和多模态AI模型,支持文本、图像、视频和音乐生成。
GoogleCloudPlatform/vertex-ai-creative-studio
一个用于探索 Google Cloud 生成式媒体模型的 Web 应用程序,提供图像、视频、音乐和语音生成以及创意工作流的统一界面。
Stonesjtu/pytorch_memlab
pytorch_memlab 是一个 Python 库,可逐行分析 CUDA 内存使用情况,列出活跃张量,并能临时将 GPU 数据移至 CPU。它通过 `%mlrun` 魔法命令与 IPython/Jupyter 集成,帮助调试 PyTorch 模型中的内存不足错误。
pnnx/pnnx
pnnx 是一个开源工具,可优化 PyTorch 模型并将其导出为轻量、无依赖的格式(PNNX)以及 ncnn/ONNX-zero 文件,使边缘设备上的快速推理成为可能。
ljquan/opentu
Opentu 是一个基于画布的 AI 应用平台,将多模型生成和工具管理整合到一个工作区中,实现持续的 AI 任务执行。
OpenSQZ/MiniCPM-V-CookBook
支持文本、视觉和音频能力的 MiniCPM 系列多模态模型的部署与微调完整配方手册,适用于多种硬件平台。
Cjbuilds/Codex-Orchestration
Codex Orchestration 是一个 Codex 插件,允许您将其他 LLM(Claude Fable 5、Opus 5、OpenRouter 模型等)附加到任务中,并为它们分配特定角色——规划者、顾问、设计师、执行者。Codex 保持顶层协调者身份,迭代计划、审查计划、可选地设计 UX 成果物,最终执行代码。插件通过 Codex 市场安装,通过 Codex 聊天中的技能提示配置,支持角色特定的工作量级别。旨在提升计划质量、实现并行工作、减少高级模型使用。MIT 许可证。
dromara/wgai
WGAI 是一个基于 Spring-Boot + Vue 的 Web 平台,将视觉(OpenCV、YOLO、OCR、人脸识别)、音频(语音转文字、ChatGPT 风格对话)、数字人虚拟形象和 AGV 导航整合为一个离线优先、工业级的 AI 管理系统。提供在线数据标注、模型训练、实时视频/音频分析和系统监控功能,配备配置界面和公共演示实例。代码采用 AGPL-3.0 许可证,支持主要通过付费中文社区提供。
visualbruno/ComfyUI-Hunyuan3d-2-1
这是一个为腾讯 Hunyuan3D-2.1 模型开发的 ComfyUI 封装器,可以在可视化节点工作流中生成带有纹理的 3D 模型。
zai-org/GLM-V
一系列增强多模态推理能力的视觉语言模型(VLM),支持原生函数调用、视觉定位和复杂文档理解。
PaddlePaddle/ERNIE
一组提供文本和视觉语言理解方面最先进性能的大规模多模态 MoE 模型和开发工具包。
cambrian-mllm/cambrian-s
一套多模态大型语言模型和数据集,旨在提升视频理解中的空间推理和“空间超感知”。
qualcomm/aimet
AIMET 是 Qualcomm 开发的用于量化和压缩 PyTorch/ONNX 模型的开源工具包,能够在以极小的精度损失实现边缘设备上的快速、低内存推理。
SamurAIGPT/AI-Influencer-Generator
一个开源流水线,使用 Stable Diffusion、gTTS 和 SadTalker 来为社交媒体创建并动画化一致的虚拟 AI 网红。
volcengine/rtc-aigc-demo
一个展示集成RTC、ASR、LLM和TTS的交互式AIGC流水线的演示项目,支持实时语音AI交互。
ShayneP/local-voice-ai
一个在本地硬件上运行的私有、低延迟语音助手,使用语音识别、LLM 和语音生成模型的堆栈。
sympozium-ai/sympozium
Sympozium 是一个开源、Kubernetes 原生的平台,用于协调多智能体 AI 系统。它提供基于 CRD 的策略、共享 SQLite 内存、sidecar 隔离技能和可视化工作流画布,让团队在保持内置治理和可观测性的同时大规模编排智能体。
nv-tlabs/Gamma-World
Gamma-World 是一个生成式多智能体世界模型,可模拟多个独立可控智能体共享的环境,支持 24 FPS 的实时交互式视频生成。
kandinskylab/kandinsky-5
一个用于从文本或图像生成高质量视频和图像的扩散模型家族,提供 Pro 与 Lite 版本,具备强大的英语和俄语支持。
OliBomby/Mapperatorinator
一个多模型 AI 框架,能够从音频频谱图生成完整功能的 osu! 谱面,并提供 AI 驱动的模组工具来检测谱面不一致性。
R3gm/SoniTranslate
SoniTranslate 是一个用于将视频翻译成不同语言并同步音频的网页应用,将转录、翻译和语音配音整合在一个界面中。
IBM/terramind
面向地球观测的任意输入输出生成基础模型,支持多模态空间数据生成与环境监测。