NEKOparapa/ReaDreamAI
一个自动化小说创作的 AI 平台,包括文本生成、一致的角色插图和视频改编。
OpenEnvision/WorldFoundry
一个开源基础设施,为视频生成、3D/4D 表示和具身 AI 提供统一的推理、资产阶段化和基准评估堆栈。
alexiglad/EBT
一个针对能量基础变换器(EBTs)的框架,能够在文本、图像和视频等多模态上实现可扩展的推理与 System 2 思考。
potamides/DeTikZify
DeTi*k*Zify 是一个开源的多模态 LLM,可将草图或光栅科学图形转换为可编辑的 TikZ 代码。它支持图像转 TikZ、通过 Ti*k*Zero 适配器进行文本转 TikZ,以及使用蒙特卡洛树搜索进行迭代优化。可通过 pip 安装,需要完整的 TeX Live、Ghostscript 和 Poppler 安装,并可在 GPU(8‑b 模型)或 CPU(1‑b)上运行。该仓库提供 CLI/Web UI、Python API 示例、Hugging Face 上的模型权重,以及重建训练数据集的脚本。
apple-aiml-research/ml-hierarchical-confusion-matrix
Neo 是一个开源 JavaScript 库(npm 包 `@apple/hierarchical-confusion-matrix`),提供支持层次化和多输出类别标签的交互式混淆矩阵可视化。通过 npm 安装,传入一个规范和一个 `{actual, observed, count}` 记录数组,即可将矩阵嵌入任意网页。它支持扁平、层次化(`:`)、多输出(`,`)以及组合标签结构,并附带实时演示、单元测试和完整的 TypeScript 源码树。
lxtGH/OMG-Seg
一个将图像、视频、像素级分割整合进单一模型的视觉感知与推理统一框架,减少了对专门化模型的需求。
baxtree/subaligner
Subaligner 是一个开源的 Python/CLI 工具,可将字幕与视频/音频同步,支持通过 Whisper 进行语音转录、使用 HuggingFace 模型进行字幕翻译,甚至训练自定义对齐模型。支持多种字幕和媒体格式,提供快速全局偏移(`single`)和高精度双阶段(`dual`)对齐,并支持 Docker、pip 及 LLM 增强功能的可选扩展。
Softlandia-Ltd/vision-is-all-you-need
一种视觉 RAG(V-RAG)演示,使用 VLM 将 PDF 页面作为图像嵌入,以消除文档检索过程中的文本分块需求。
openaiotlab/CUHK-X
用于人类行为识别与推理的大规模多模态数据集和基准,整合七种同步传感器模态,以实现复杂动作理解。
EleutherAI/gpt-neox
GPT‑NeoX 是一个开源、基于 Megatron 的库,用于在多 GPU 集群上训练数十亿参数的语言模型。它加入了 DeepSpeed 风格的优化,支持多种启动器(Slurm、MPI 等),可在 NVIDIA 和 AMD GPU 上运行,并包含 Flash Attention、Mixture‑of‑Experts 和偏好学习微调等现代功能。非常适合拥有庞大计算预算的研究实验室;若仅用于推理,建议使用 Hugging Face `transformers`。
mbzuai-oryx/Video-ChatGPT
一种结合 LLM 与时空视觉编码器的视频对话模型,可实现对视频内容的详细、自然语言讨论。
mbzuai-oryx/groundingLMM
GLaMM 是一个像素定位的大型多模态模型,它将自然语言响应与对象分割掩码整合在一起,以实现精确的视觉定位。
mbzuai-oryx/LLaVA-pp
LLaVA++ 通过整合 LLaMA-3 和 Phi-3 LLM,增强了 LLaVA 1.5 的视觉指令遵循能力和学术任务表现。
NVlabs/OmniVinci
OmniVinci 是一款开源的全模态大语言模型 (LLM),通过专门的时间与对齐架构,共同理解视觉、音频、文本,以提升跨模态推理能力。
blendi-remade/falcraft
一款使用 fal.ai 从文本提示生成 3D 结构并直接在游戏世界中实时播放 AI 视频流的 Minecraft Fabric 模组。
TetreesEX/TetreesAgent_EX
Tetrees Agent EX 是一个 Node.js SDK/CLI,允许开发者通过公开 MCP 合约在 Tetrees EX 市场上搜索、报价、运行、扩展和发布 AI 套件。它提供购买者、构建者和销售者的示例脚本,并将所有凭证本地保存。
JavisVerse/JavisDiT
一种用于联合音视频生成的扩散 Transformer 框架,可确保从文本提示生成的音视频在语义和时间上保持一致。
caiyuanhao1998/Open-DiffusionGS
一种将高斯点阵集成到扩散去噪器中的单阶段图像到3D生成与重建框架,实现快速、可扩展的3D创作。
open-gigaai/giga-models
GigaModels 是一个开源 Python 工具箱,将数十个预训练的视觉、扩散和多模态模型(例如:Grounding DINO、Depth Anything、GigaBrain‑0、Pi0、Cosmos‑Predict2.5)封装在统一的 `load_pipeline` API 之后。它支持推理和训练,提供即用型脚本,并可通过 conda + pip 安装。
huggingface/huggingface-gemma-recipes
一套用于实现 Gemma 模型家族的多模态推理、微调和 RAG 的最小化配方与笔记本集合。
microsoft/XPretrain
XPretrain 是 Microsoft Research 的一个仓库,它为视频-文本和图像-文本对的大规模多模态预训练提供了代码、预训练权重和 HD-VILA-100M 视频-语言数据集。它包含了 HD-VILA、LF-VILA、CLIP-ViP、Pixel-BERT、SOHO 和 VisualParsing 等模型,每个模型都与近期的会议论文相关联。
OliverDOU776/Few-step-probabilistic-glucose-forecasting-from-continuous-glucose-monitoring-and-meal-images
一种利用条件化修正流将大规模源数据集的知识迁移到小规模目标数据集的快速概率预测工具。
wit-ai/pywit
Wit.ai 的 Python SDK,使开发者能够轻松地将文本和语音自然语言理解功能集成到其应用程序中。
6551Team/opentwitter-mcp
opentwitter‑mcp 是一个 Python MCP 服务器,通过一组现成的工具和 WebSocket 推送 API,让 AI 助手能够获取 Twitter/X 用户资料、推文、搜索及实时关注者事件。
wladradchenko/wunjo.wladradchenko.ru
用于人脸替换、语音克隆和视频生成的全能型 AI 媒体工具,可在本地运行以保护隐私
erdogant/pca
一个 Python 库,通过封装 scikit‑learn 的 PCA/SparsePCA/TruncatedSVD 并添加预设双标图、解释方差图、异常值检测(Hotelling T²、SPE/D‑ModX)、特征重要性提取、模型保存/加载,以及方差归一化和新数据投影等实用功能,简化主成分分析(PCA)的使用。
MemeMeow-Studio/MemeMeow
一个使用嵌入模型和视觉 AI 根据情绪或场景描述检索 meme 的自然语言检索工具。
tensorflow/model-analysis
TensorFlow Model Analysis (TFMA) 是一个用于大规模、切片感知的 TensorFlow 模型评估的库。它运行分布式 Beam 流水线,在 Jupyter 中可视化结果,并与 TFX/Kubeflow 流水线集成。
tensorflow/data-validation
TensorFlow Data Validation (TFDV) 是一个可扩展的 Python 库,用于计算机器学习数据集的统计信息、推断模式并检测异常。它与 TensorFlow/TFX 流水线集成,使用 Apache Beam 进行分布式处理,并提供用于检查数据质量的可视化 UI 工具。
polyaxon/haupt
Haupt 是 Polyaxon 的一个服务,提供实验血缘元数据、工件/指标流式传输、交互式沙箱会话(SSH/tmux)、本地查看器 API 以及托管的笔记本空间等 API,帮助管理、监控和复现机器学习实验。
tonywu71/colpali-cookbooks
用于实现、微调和解释基于视觉的文档检索模型 ColPali 和 ColQwen2 的笔记本集合。
vincentarelbundock/marginaleffects
`marginaleffects` 是一个 R/Python 库,可从 100 多种统计和机器学习模型类型中简化提取预测、对比、边际效应和假设检验结果,附带一本免费配套书籍。
eeeXun/gtt
gtt 是一个基于 Go 的终端 UI,支持使用 Google、DeepL、Bing、Apertium、LibreTranslate、Reverso、ChatGPT 等多种在线服务进行文本翻译。支持 API 密钥配置、自定义快捷键、颜色主题、剪贴板集成和文本转语音功能,可通过二进制文件、包管理器、Docker 或从源码构建进行安装。
deeplearning4j/deeplearning4j-examples
一组基于 Maven 的 Java 示例,展示了如何使用 Eclipse Deeplearning4J 生态系统(DL4J、ND4J、SameDiff、DataVec、RL4J 等)完成从基础神经网络训练到 Spark 分布式和 GPU 加速学习,以及模型导入和 Android 部署等任务。
wandb/examples
一组精选的即用脚本和 Colab 笔记本,展示如何将 Weights & Biases 追踪库集成到主流 ML 框架(PyTorch、TensorFlow/Keras、Hugging Face、XGBoost、scikit‑learn 等)中。演示了记录运行、配置、指标、梯度和制品的功能,帮助用户仅用几行代码即可为模型添加实验追踪和可复现性。
ai-ng/2txt
一个使用 Next.js 和 Vercel AI SDK 构建的快速图像转文本转换工具,采用 GPT-5-nano 模型。
leamsigc/ShortsGenerator
一个自动化流水线,用于创建短格式视频,涵盖 AI 脚本生成、素材获取、TTS 语音旁白和社交媒体发布调度。
win4r/openclaw-a2a-gateway
OpenClaw A2A Gateway – 一个 Node.js 插件,实现 Google 的 Agent-to-Agent v0.3.0 协议。提供零配置安装、自动对等发现(DNS-SD/mDNS)、多传输回退(JSON-RPC、REST、gRPC)、生物启发式路由、电路断路器弹性、Bearer 令牌认证和文件传输工具。
duolahypercho/fusion-fable
Fusion‑Fable 是一个 Claude Code 技能,可在多个 LLM(Opus 4.8、GPT-5.5、Gemini 3.1 Pro)上并行运行提示,让 Opus 4.8 判定独立回答,并合成最终结构化响应。它以斜杠命令形式安装,保存溯源文件,并包含与 OMC 计划系统集成的迭代规划模式(`/fusion-plan`)。零配置面板(两次 Opus 4.8 运行)开箱即用;更丰富的面板需要 `codex` 和 `agy` CLI。权衡是更高的令牌成本和延迟,但结果是更高质量、可审计的回答。
nikkigallery/Whimbox
一个利用 LLM 和图像识别技术,通过屏幕截图和输入模拟来自动化《Infinity Nikki》游戏中的日常任务、导航和活动的 AI 代理。
commaai/commavq
一个用于自动驾驶的世界模型框架和数据集,利用 VQ-VAE 进行视频压缩,并使用基于 GPT 的模型预测未来的驾驶场景。
kyegomez/MultiModalMamba
一个融合 Vision Transformer (ViT) 与 Mamba 的多模态 AI 模型,可高效处理并解析文本、图像、音频和视频数据。
ashnkumar/sketch-code
一个使用图像字幕架构将手绘网页原型转换为 HTML 代码的深度学习模型。
mlcommons/training
一个包含 MLPerf Training 基准测试套件参考(未优化)实现的仓库,涵盖视觉、语言、推荐和图模型。每个基准测试均包含模型代码、Dockerfile、数据集脚本和测量达到目标质量所需时间的训练运行脚本。适用于基准测试提交、硬件评估和学习,但不适用于真实世界性能。
luciddreamer-cvlab/LucidDreamer
LucidDreamer 是一个从单张图像和文本提示中实现领域无关的 3D 高斯点阵场景生成的系统。
HITsz-TMG/Uni-MoE
Uni-MoE 是一个基于混合专家(Mixture-of-Experts)的全模态大模型,能够跨多种模态(包括文本、图像和语音)进行理解和生成。
J3n5en/EnsoAI
EnsoAI 是一款基于 Electron 的桌面工作台,将 Git worktree 管理与持久化的 AI agent 会话(Claude、Gemini、Codex 等)结合在一起。它提供内置的 Monaco editor、可视化 Git UI、三向合并工具,以及一键式 IDE 桥接功能,让开发者能够并行开发多个分支的同时,每个分支都能享有专属的 LLM 上下文。
tensorflow/java
TensorFlow‑Java 提供可发布到 Maven 的 Java/JVM 绑定,包括低级 JNI 包装(`tensorflow‑core`)、高级神经网络 API(`tensorflow‑framework`)以及独立的 ndarray 库。支持 Linux(x86_64、arm64)和 macOS(Apple Silicon)二进制文件,可选 GPU 构建,并与标准 Java 构建工具集成。