lycohana/BiliSum
BiliSum 是一个视频转知识工具,可将 Bilibili、YouTube 和本地视频转换为转录文本、视觉笔记和本地 RAG 驱动的知识库。
death34018-hue/AionsHome
一个整合多模态聊天、智能摄像头监控和基于 RAG 的记忆的本地托管 AI 伴侣系统,打造主动式个人助手。
google-labs-code/stitch-sdk
一个 TypeScript SDK,用于从文本提示生成和编辑 UI 屏幕,提供 HTML 和截图以实现快速原型设计和 AI 代理集成。
omicverse/omicverse
OmicVerse 是一个Python库,统一了批量RNA-seq、单细胞和空间转录组学分析。它捆绑了数十个成熟的生物信息学工具,标准化了 anndata/mudata 数据结构,并添加了AI辅助代理(J.A.R.V.I.S.)和MCP服务器,使您可以通过自然语言命令或LLM集成运行工作流。可选扩展提供合成生物学建模和GPU加速分子动力学工作流。
xandergos/terrain-diffusion
一种学习型的 Perlin 噪声继承者,使用扩散模型生成无限、确定且可随机访问的实时地形和气候数据。
oil-oil/wolfcha
Wolfcha 是一款网页游戏,让一名人类玩家与满桌由 AI 控制的角色进行狼人杀游戏。AI 会记住过去的对话,带着意图行动,并实时生成语音台词(可选语音),无需其他人类玩家即可重现混乱的社交推理体验。
PunithVT/ai-avatar-system
一个支持实时唇形同步、零样本语音克隆和多LLM的生产就绪型AI虚拟形象构建平台。
LC044/TrailSnap
一款 AI 驱动的自托管相册,通过票证 OCR、人脸识别和地理足迹映射,自动整理旅行记忆。
ashuoAI/SHUO-Canvas
SHUO Canvas是一款桌面端、基于节点的画布,允许创作者将文本、图像、视频和音频与AI生成(通过OpenAI兼容、RunningHub、ComfyUI等)结合,构建脚本、故事板、角色替换视频、360°全景图、配音和3D场景——所有内容均在一个可视化工作流中完成。
MashiroSaber03/Saber-Translator
一个 AI 驱动的漫画翻译与管理套件,可自动化文本检测、OCR、翻译和图像修复,配备基于 RAG 的剧情分析引擎。
jipraks/yt-short-clipper
一款使用 LLM 识别 YouTube 视频高光并自动将其转换为带字幕的 9:16 竖屏剪辑的 Windows 桌面应用。
vanloctech/youwee
一个开源 GUI,支持从 1,800 多个网站下载视频,集成 AI 视频摘要、自然语言编辑和 AI 驱动的字幕生成。
openstory-so/openstory
一个AI驱动的视频制作平台,可将剧本转化为具有统一角色和视觉风格的视频序列。
Softeria/ms-365-mcp-server
一个 Node.js 服务器,将 Microsoft 365 Graph API 作为 MCP 工具暴露给 LLM,支持个人和组织账户、多账户使用、权限过滤,以及实验性的节省令牌的 TOON 输出格式。
google-deepmind/alphagenome_research
AlphaGenome 是一个统一的 DNA 序列模型,可预测调控性遗传变异对基因表达、剪接和染色质特征在单碱基对分辨率下的影响。
facebookresearch/eb_jepa
一个用于在图像和视频之间学习预测与规划表示的轻量级库,基于能量基联合嵌入预测架构。
huangjunsen0406/py-xiaozhi
py‑xiaozhi 是一个基于 Python 的异步优先框架,用于构建可以倾听、说话、观察并控制硬件的多模态 AI 助手。
NVlabs/FastGen
基于 PyTorch 的框架,利用多种蒸馏和加速技术加速图像和视频生成的扩散模型。
ogkalu2/comic-translate
一个自动化漫画翻译工具,利用大语言模型、OCR 和图像修复技术,在保留原始视觉布局的同时,将多种语言的漫画和漫画翻译成其他语言。
microsoft/skills-for-copilot-studio
Skills for Copilot Studio 是一个插件(适用于 Claude Code、GitHub Copilot CLI 和 VS Code),可让您使用 YAML 文件创建、编辑、同步、测试 Microsoft Copilot Studio“标准”代理并获取设计建议——全部在终端或编辑器中完成。
NVIDIA/TransformerEngine
NVIDIA Transformer Engine 是一个专注于 GPU 的库,提供 FP8/MXFP8/NVFP4 混合精度支持、融合内核以及适用于 PyTorch 和 JAX 的简单 autocast API,从而实现大语言模型和 MoE 模型更快速、低内存消耗的训练与推理。
Alos21750/UAV-Downloader
UAV Downloader 是一款面向 Windows 的视频下载工具,支持 JableTV、MissAV、SupJav 和 Hanime1,可利用本地语音识别(ReazonSpeech K2 v2 或 Whisper)和翻译模型(FuguMT、OPUS-MT)自动生成日语、英语和繁体中文字幕。提供三种运行模式——交互式 GUI(UAV Browser)、无人值守调度器(UAV Watcher)和无头 Docker/CLI 版本,支持代理、并行下载及可选的 LLM 翻译。项目采用 Apache 2.0 许可证发布,默认离线运行。
tianjiangqiji/nova-image-studio
一个允许用户导入自有模型并通过插件系统扩展功能的自托管 AI 图像和视频生成工作台。
wassermanproductions/motion-previs-studio
一款为电影制作人设计的桌面应用程序,可从参考视频中提取姿态、深度和相机运动数据,以创建 AI 视频生成流水线的控制包。
FlowElement-xinliuyuansu/m_flow
M-flow 是一种记忆系统,专为 AI 代理设计,通过在知识图谱中对证据路径进行评分来检索信息,其运作方式类似于认知记忆系统,而不仅仅依赖相似度搜索。
visualbruno/ComfyUI-Trellis2
ComfyUI‑Trellis2 是一个自定义节点包,将微软的 TRELLIS.2 3D 扩散模型集成到视觉编程界面 ComfyUI 中。它提供数十个节点,用于从单张或多张图像(或视频)生成、精炼、纹理化和渲染网格。安装需 Windows、Python 3.11、PyTorch 2.7/2.8 + CUDA,以及 Facebook DINOv3 检查点。仓库提供原生扩展的预构建轮子,并包含示例工作流。这是一个活跃的、真实的 AI/ML 项目,专注于 3D 生成。
Asad-Ismail/MoneyPrinterTurbo-Extended
一个自动化视频生成工具,可生成脚本、使用本地语音克隆合成语音,并匹配相关视频片段,实现同步的逐字字幕。
opentokenz/mcpx
MCPX 是一个基于 Go 的本地服务器,实现了 MCP 协议,使 LLM 代理(如 ChatGPT、Claude 等)能够安全地读取、编辑、执行、管理注册本地工作区中的文件、命令、计划和工件。它提供持久的远程会话、细粒度的安全策略、存储在 SQLite 中的审计日志,以及通过技能和自定义工具实现的可扩展性。
jangles-byte/Pythia
一个本地、群智智能的全球预测系统,融合40多个实时数据流,构建3D智能地球以预测世界事件
NVIDIA-BioNeMo/Proteina-Complexa
一种用于原子级蛋白质结合物设计的生成模型,通过统一生成建模与幻觉,为蛋白质和小分子配体生成结合物。
aurekaresearch/OpenDDE
一个所有原子的生物分子基础模型,利用共折叠进行药物发现中的结构预测、设计和优化。
OpenBMB/MiniCPM-o-Demo
MiniCPM-o 4.5 的演示系统,支持 AI 实时、全双工地同时看、听、说,实现真正的多模态交互
mynaparrot/plugNmeet-server
基于 LiveKit 构建的可扩展、开源网络会议系统,提供自托管视频会议功能,支持 AI 驱动的语音转录与摘要。
bytedance/SALMONN
一套先进的多模态 LLM,为大语言模型提供通用听觉能力与整合音视频感知能力。
mcp-router/mcp-router
MCP Router 是一款已停止维护的开源桌面应用(Windows/macOS),用于本地管理 Model Context Protocol (MCP) 服务器。它允许用户将服务器分组为项目和工作区,逐个切换工具,查看请求日志和基础分析数据,并与主流 AI 前端集成。所有数据均保留在用户设备上;最后一个发布版本为 v0.6.4(支持终止日:2026年9月)
NVIDIA-NeMo/Megatron-Bridge
NeMo Megatron Bridge 是一个 PyTorch 原生库,用于连接 Hugging Face 模型检查点与 NVIDIA 的 Megatron‑Core 训练引擎。它提供双向检查点转换、验证和高吞吐量训练(张量/管道并行、FP8/BF16/FP4)。该仓库附带数十种 LLM、VLM 和扩散模型的现成配方(例如 Llama 3.2、Nemotron‑3 Ultra、K‑EXAONE‑2),并支持 SFT/LoRA 微调。可通过官方 NeMo Docker 容器或从源代码安装,并使用提供的快速入门脚本进行模型转换、训练或导出。
tl2012tl/TE_MAN
TE MAN 是一个 ComfyUI 插件,增加了无限画布工作流、资产库、音频/视频/图像节点、3‑D 导演、批量提示工具和集成 AI 助手聊天面板,支持本地模型推理与远程 API 使用,适用于图像、视频及多模态生成。
nagadomi/nunif
一组基于 PyTorch 的工具,用于图像超分辨率、VR 用 2D 到 3D 视频转换以及数据集过滤的图像质量评估。
ysr666/dsh-vision-router
DeepSeek Harness 的视觉路由插件,使代理可通过工具调用与图像像素交互,并提供内置的无密钥免费视觉备用方案。
tracel-ai/cubecl
CubeCL 是一种基于 Rust 过程宏的语言,允许您用 Rust 编写单个计算内核,并将其 JIT 编译为 CUDA、HIP、Metal、WebGPU(WGSL/SPIR-V)或 CPU SIMD。它用四个轴(向量、平面、立方体维度、立方体数量)对并行性进行建模,支持编译时特化、自动向量化和运行时自动调优,并构成 Rust 深度学习框架 Burn 和内核库 cubek 的低级基础。
nicolasvonluetzow/GaussianGPT
GaussianGPT 是一种基于 Transformer 的模型,通过下一个标记预测生成 3D 高斯场景,支持可控的 3D 场景生成、补全和外绘。
MiniMax-AI/MiniMax-MCP
一个官方的 Model Context Protocol (MCP) 服务器,使 Claude 和 Cursor 等 AI 客户端能够通过 MiniMax API 生成语音、克隆声音,并创建图像和视频。
InternLM/Intern-S1
一系列针对科学智能和长程智能体优化的多模态基础模型,能够在化学和生物学等复杂科学领域进行推理。
ZeroTang05/cyber-doctor
一个利用 RAG、知识图谱和语音交互进行疾病诊断与医疗记录分析的多模态 AI 健康助手。
ACEsuit/mace
MACE 是一个开源的 PyTorch 库,用于等变图神经网络原子间势能。它提供快速训练/评估、多 GPU 和 Apple-Silicon 支持、可选 CUDA 加速,以及材料和有机化学的预训练基础模型目录。通过 `pip install mace-torch` 安装,使用 `mace_run_train` CLI(或 YAML 配置)训练,使用 `mace_eval_configs` 评估。包含文档、Colab 教程和 Weights & Biases 集成。v0.3 线稳定,而重大 v1.0 重构正在进行中。
danilo-znamerovszkij/draw-your-font
一个开源工具,通过本地处理和可选的AI视觉进行字符标注,将手写照片转换为可安装的TTF/WOFF字体。
tracefinity/tracefinity
一款利用 AI 轮廓描绘与比例校准技术,通过工具照片生成自定义 Gridfinity 3D 打印收纳盒的工具。
Mobile-Artificial-Intelligence/maid
Maid 是一个开源的 Android 应用(React Native),可让你通过 llama.cpp 在本地运行 GGUF LLM,并连接到多个远程 LLM API。它提供一键式模型下载、聊天管理、可调生成设置、可选的云同步功能,以及配套的语音合成应用(Maise)。可通过 GitHub 发布版本或 Google Play 安装,也可自行构建 APK。