fudan-generative-vision/Hallo-Live
Hallo-Live 是一个实时文本驱动的框架,使用因果双流 Diffusion Transformer 为数字化身生成同步的音频和视频。
Lightning-AI/litData
LitData 是 Lightning AI 的一个库,通过提供快速、云原生的数据管道来加速 PyTorch 训练。它提供两种主要模式:(1) `StreamingRawDataset` 可直接从 S3/GCS/Azure/HF Hub 流式传输原始文件,支持异步、批量下载;(2) `ld.optimize` 可将数据集转换为 LitData 自有的分块二进制格式,实现高达 20 倍的流式传输、洗牌和可恢复 epoch 速度提升。该库还包含用于预处理(如图像缩放、嵌入生成)的并行 `map` 原语,以及对图像、音频、视频、张量、图等多种模态的完整支持。与 PyTorch Lightning、Hugging Face datasets 和 Lightning Cloud 的集成,使其成为 I/O 成为瓶颈的大规模 ML 项目的实用工具。
ZebangCheng/Emotion-LLaMA
Emotion-LLaMA 是一种多模态大语言模型,通过专用编码器和指令微调整合音频、视觉和文本输入,旨在实现情感识别与推理。
RTGS2017/NagaAgent
NagaAgent 是一个跨平台桌面 AI 助手(Windows/macOS/Linux),支持与任何 OpenAI 兼容 LLM 聊天,通过 JSON 块自定义工具调用,使用 Neo4j 存储图-RAG 记忆,集成 Live2D 动画头像,支持语音合成/识别与唇形同步,提供天气、网页搜索、游戏指南等插件的 MCP 框架,以及论坛、技能市场等社区功能。以 Electron/Vue 前端 + Python FastAPI 后端构建,可通过 `uv sync`(或 pip)安装,采用 AGPL-3.0 + 专有商业许可的双重许可。
microsoft/foldingdiff
一种用于生成新颖蛋白质骨架结构的扩散模型,可实现计算蛋白质设计中新蛋白质折叠的创建。
HKU-BAL/Clair3
Clair3 是一个开源的深度学习变异检测工具,适用于长读长测序。它首先使用基于 pileup 的神经网络快速扫描,再通过完整比对模型精炼不确定位点,实现高精度的同时保持合理的运行时间。支持 CPU、GPU 和 Apple Silicon 构建,可通过 Docker、Singularity、Bioconda 或 Conda 环境安装,并提供 ONT、PacBio HiFi 和 Illumina 数据的预训练 PyTorch 模型。
tin2tin/Pallaidium
一个集成到 Blender Video Editor 中的生成式 AI 电影工作室,允许用户使用 AI 生成的视频、音频和文本来原型化完整的电影制作。
Sharrnah/whispering
专为流媒体叠加层和游戏内使用设计的本地开源工具,支持实时音频转录、翻译和 OCR。
jtydhr88/ComfyUI-HY-Motion1
基于 HY-Motion 1.0 的 ComfyUI 插件,支持从文本生成 3D 人类动作,具备提示优化功能,并可导出为 GLB 和 FBX。
InternRobotics/PointLLM
PointLLM 是一个能够使 LLM 理解彩色 3D 点云的多模态大语言模型,适用于物体分类和描述生成等任务。
OpenBMB/VisRAG
一种将文档作为图像嵌入以防止文本解析导致的信息丢失,并使用证据引导推理进行多图像问答的视觉-语言 RAG 管道。
zju3dv/Diffuman4D
Diffuman4D 是一款用于高保真度 4D 一致性人体视图合成的空时扩散模型,能够从稀疏视图的视频中实现自由视角渲染。
apple-aiml-research/ml-neuman
NeuMan 是一种神经辐射场实现,能够从单个视频中重建可动画化的人体及其背景场景,支持在原始环境中合成新视角和新姿态。
uezo/ChatdollKit
一个用于 Unity 的 3D 虚拟助手 SDK,可将 3D VRM 模型转化为具备语音功能的聊天机器人,并实现同步语音、唇同步和自主动画。
apple-aiml-research/ml-lito
LiTo 是一个 3D 潜在表示系统,联合建模对象几何和视点相关外观,实现具有真实光照效果的高质量图像到 3D 生成。
monatis/clip.cpp
一个无依赖的 C/C++ 实现的 CLIP,适用于内存受限设备和无服务器部署,实现高效推理。
android/androidify
一个开源的 Android 示例应用,展示如何使用 Gemini API、Imagen 和 Jetpack Compose 构建 AI 驱动的体验,以重新构建 Android 机器人制作器。
kyegomez/Gemini
一个开源的多模态 Transformer 模型实现,可在单一架构中原生处理文本、图像和音频。
PozzettiAndrea/ComfyUI-UniRig
一个使用 UniRig 和 Make it Animatable (MIA) 在 ComfyUI 中自动完成 3D 角色网格绑定与蒙皮的扩展。
theopenconversationkit/tock
Tock 是一个开源对话式 AI 平台,提供 NLP 堆栈、用于设计对话流程的可视化工作室、基于 Kotlin 的 DSL(支持 Python、Node.js 和 REST 绑定)、现成的聊天/语音渠道连接器,以及基于 Docker 的部署方式。
Angel-ML/angel
Angel 是一个基于 Java/Scala 的分布式机器学习与图计算平台,采用参数服务器架构。支持多种经典 ML 算法(LR、SVM、GBDT、LDA* 等)和图算法(PageRank、GCN、GraphSAGE 等),可在 YARN 或本地运行,并提供 Spark 集成(Spark on Angel)以实现便捷的任务提交。
facebookresearch/multimodal
一个用于大规模训练最先进多模态模型的 PyTorch 库,为 CLIP 和 BLIP-2 等模型提供模块化构建块和预训练权重。
mattmireles/gemma-tuner-multimodal
Gemma‑tuner‑multimodal 是一个仅支持 macOS 的 Python 包,可在 Apple Silicon(MPS)上使用 LoRA 对 Google 的 Gemma 模型(3n 和 4 系列)进行文本、图像或音频数据的微调。支持原生运行、从 GCS/BigQuery 流式加载大数据集、向导式 CLI 和实时 Web 可视化,并可导出用于 Core ML 或 GGUF 推理的合并检查点。
flutter-ml/google_ml_kit_flutter
一组 Flutter 插件,使移动应用能够使用 Google 的独立 ML Kit 实现设备端视觉、自然语言和生成式 AI 功能。
aws-samples/sample-mobile-ai-assistant
一款适用于Android、iOS和macOS的跨平台AI助手应用,支持实时聊天、多模态分析以及通过多种LLM提供商即时创建Web应用。
Osilly/Vision-DeepResearch
一个用于开发能够通过跨图像和视频的迭代视觉与文本搜索执行深度研究的多模态大语言模型的框架和基准。
PozzettiAndrea/ComfyUI-TRELLIS2
实现微软TRELLIS.2模型的自定义ComfyUI节点,可从单张图像生成带有PBR材质的高质量3D网格。
wuxiran/cc-pane
CC‑Panes 是一款开源桌面应用(Windows/macOS/Linux),可让您并行运行、组织和协调多个 AI 编码 CLI 代理。它提供工作区级仪表板、可重用的启动配置文件、基于 MCP 的编排层、集成终端拆分、Git/历史工具、规划表面以及 Web/Android 访问——全部使用 Tauri、xterm.js 和 Rust 构建。
deepmodeling/dpgen
DP‑GEN是一个Python平台,可自动化创建深度学习原子间势(Deep Potential模型)。它运行一个并发学习循环——采样结构、选择信息量最大的结构进行DFT计算、重新训练模型——同时处理HPC集群上的作业调度,并与许多MD和量子化学代码接口。
vinavfx/ComfyUI-for-Nuke
一个将 ComfyUI 节点集成到 Nuke 的 API,使 VFX 艺术家能够直接在其专业合成软件中使用生成式 AI 工作流。
PEPETII/danmuai
一款 Windows 桌面助手,使用视觉模型实时分析屏幕内容并生成滚动 AI 评论(danmu),并可选提供语音合成功能。
kkirchheim/pytorch-ood
pytorch‑ood 是一个基于 PyTorch 构建的真正 Python 库,用于分布外检测。它集成了超过 30 种检测器、损失函数、预训练模型、数据集和实用工具,与 pytorch‑lightning 集成,并提供简单 API 和基准辅助工具。通过 `pip install pytorch-ood` 安装,只需几行代码即可开始使用 `EnergyBased` 等检测器。
Utopai-Research/pai-pro
一个以本地为中心的 AI 影视制作工作区,将编码代理与可视化画布和统一的媒体 API 集成,用于生成图像、视频和语音。
elder-plinius/GL4SS
一个时空影像与视频引擎,能够从 2.52 亿年前到公元 3050 年,生成地球上任何地点在任何时间点的 AI 视觉效果。
microsoft/Tutel
Tutel 是 Microsoft 开源的高性能 MoE 库,适用于大型语言模型。它提供动态并行、低精度推理(NVFP4、MXFP4、FP8、BF16)、支持高达 1M token 的上下文,以及视觉扩展功能,并提供 Docker 镜像来运行 DeepSeek-V3.2、Kimi-K3、GLM-5.x、Qwen-3 和 GPT-OSS 等模型,支持 NVIDIA 和 AMD GPU。可以通过 pip 从 Git 仓库安装,或从源码构建,然后运行提供的 Docker 容器,或使用 Python API 进行自定义 MoE 路由。
IDEA-CCNL/Fengshenbang-LM
一个开源的中文预训练基础模型生态系统,以及用于自然语言理解、生成和多模态任务的支持框架。
open-ribbi/velocut
一个结合多轨视频编辑与3D场景导演的浏览器端工作室,集成AI以实现自动场景构图与编辑。
yan5xu/codexloom
CodexLoom 是一个自托管平台,为 Codex 聊天代理添加持久身份、个人资料和组织工具,支持长期运行的“领域代理”,可从多个设备访问,通过有界消息通信,并可通过接口代理暴露给外部聊天平台(Feishu、Slack、Parall)。面向高级单人用户,提供 UI、CLI 和治理功能,采用 Elastic License 2.0 发布。
SkyworkAI/Skywork-R1V
Skywork-R1V 是一个开源多模态推理模型,通过强化学习和视觉思维链(Visual Chain-of-Thought)在复杂的视觉逻辑、数学和物理任务中实现最先进的性能。
datawhalechina/torch-rechub
Torch-RecHub 是一个支持 30 多种模型、模块化设计、ONNX 导出以及多种硬件后端的 PyTorch 框架。
OpenImagingLab/AnyRecon
AnyRecon 是一个 3D 重建框架,利用视频扩散模型从一组捕获视图生成高质量、任意视角的场景重建。
jd-opensource/JoyAI-Image
一个集图像理解、文本生成图像以及指令引导的图像编辑于一体的统一多模态基础模型,专注于空间智能。
Capsize-Games/airunner
一个私密、本地优先的 AI 伙伴与艺术生成平台,结合可定制的聊天伙伴与分层创意画布。
yuqie6/ProductFlow
一个开源、自托管的工作空间,专为小型商户设计,利用AI驱动的视觉工作流自动化产品营销素材的创建,包括文案和图像生成。
mintdotgg/mint-playground
一组开源的Three.js体验,展示使用Mint资产管道构建的交互式3D展厅、游戏和数据可视化。
openbezal/rhema
一个实时AI驱动的桌面应用,可检测直播音频流中的圣经经文,并通过NDI渲染为可广播的叠加层
lucidrains/transfusion-pytorch
一个 PyTorch 实现的 Transfusion 架构,将文本的下一个标记预测与图像等连续模态的流匹配统一在一个模型中。
landing-ai/ade-python
LandingAI ADE API 的 Python 库,可将 PDF 和图像解析为结构化 Markdown,并使用 Pydantic 模型提取类型化数据。