esrrhs/majiang_algorithm
一个高性能的麻将算法库,利用预先计算的查表法进行毫秒级胡牌检测与 AI 驱动的舍牌决策。
RobotWebTools/web_video_server
一个将 ROS 图像主题串流到 Web 浏览器并支持多种格式的 HTTP 服务器,实现轻松的远程监控机器人摄像头画面。
L-a-r-t/chatgpt-to-notion
一个浏览器扩展,允许用户将 ChatGPT、Claude 和 Mistral 等多个 LLM 的提示和回复直接保存到 Notion 数据库中。
93won/lightweight_vio
一种用于实时状态估计的轻量级立体视觉惯性里程计系统。
microsoft/Cognitive-Samples-VideoFrameAnalysis
一个用于使用 Microsoft Cognitive Services Vision API 以近实时方式分析网络摄像头视频帧的 C# 库和示例应用程序。
apache/singa
Apache SINGA 是一个分布式深度学习系统,能够在大规模神经网络的训练中跨越多台机器进行。
zhanghang1989/PyTorch-Encoding
一个提供用于图像分类和语义分割的高级编码模块和模型库的 PyTorch 库。
CCNYRoboticsLab/imu_tools
一套基于 ROS 的 IMU 滤波器和可视化工具,将角速度、加速度和磁力读数融合为稳定的姿态估计。
ddemidov/vexcl
一个用于 OpenCL 和 CUDA 的 C++ 向量表达式模板库,可减少 GPGPU 开发的样板代码。
Farama-Foundation/SuperSuit
一组用于 Gymnasium 和 PettingZoo 的强化学习环境预处理的微包装器集合。
ML-KULeuven/problog
一个将逻辑程序与概率事实相结合以处理不确定性并执行复杂推理任务的概率逻辑编程工具箱。
herin7/gitforme
一个 AI 驱动的代码探索平台,通过交互式仪表板和具备代码库感知能力的 AI 聊天助手,帮助开发者理解 GitHub 仓库。
joeylitalien/noise2noise-pytorch
Noise2Noise 论文的非官方 PyTorch 实现,提供脚本以使用高斯、泊松、文本叠加或蒙特卡洛渲染噪声,在仅含噪数据上训练和测试 U‑Net 去噪器。
Datayoo/HuggingFists
一款低代码数据流工具,允许用户无需大量编码即可使用 LLM 和 Hugging Face 模型可视化地构建和调度工作流。
GaoQ1/rasa_nlu_gq
一个为 Rasa NLU 添加高级中文 NLP 能力的扩展,包括基于 BERT 的意图分类和 BiLSTM+CRF 实体抽取。
Jazee6/cloudflare-ai-web
一个基于 Web 的 AI 平台界面,允许用户通过 Cloudflare Workers AI 和 AI Gateway 快速部署多模型聊天 UI。
SaiAkhil066/CORTEX-AI-SUPER-RAG
一个本地、代理型 RAG 引擎,采用 9 层管道,包含 GraphRAG 和神经重排序,无需云依赖即可实现高精度文档问答。
apple-aiml-research/ml-aim
一组为多模态理解与图像识别提供高性能的大型自回归视觉编码器。
Spr-Aachen/Easy-Voice-Toolkit
Easy Voice Toolkit 将开源语音模型(Whisper、GPT-SoVITS)整合到 GUI/Colab 工作流程中,用于清理音频、转录、构建语音转换数据集、训练自定义语音模型,以及生成转换后的语音。它提供即开即用的 Windows 便携式包和 Colab 笔记本,并附有开发者友好的安装指南。该项目仅供学术使用,并计划未来集成 LLM 聊天机器人和 Linux 支持。
yzhao062/combo
combo 是一个用于组合机器学习模型和得分的 Python 工具箱。它提供统一的 API,支持堆叠、动态分类器/集成选择和异常检测器融合等集成技术,适用于 scikit-learn、XGBoost、LightGBM 和 pyod 提供的模型,涵盖分类、聚类和异常检测任务。
djcopley/ShellOracle
一个终端工具,可从自然语言描述生成 shell 命令,并通过各种 LLM 提供商将其直接插入提示符中。
apple-aiml-research/ml-gmpi
一种具备 3D 感知能力的生成模型,可将 2D GANs 转换为多平面图像 (Multiplane Images) 以实现 3D 视角合成与网格提取。
hzxie/GaussianCity
GaussianCity 是一个生成式 3D 城市合成工具,利用高斯泼溅技术创建无边界的大规模城市环境。
DaoyuanLi2816/mini-verl
一种通过分阶段调度模型角色,从而在单块 NVIDIA GPU 上运行 verl RLHF 实验(如 PPO 和 GRPO)的工具。
daodao97/chatmcp
一个与 Model Context Protocol (MCP) 集成的跨平台 AI 聊天客户端,可将 LLM 与外部数据源和工具连接。
JingyunLiang/VRT
VRT 是视频修复Transformer(VRT)的PyTorch实现,一种基于Transformer的模型,可处理视频超分辨率、去模糊、去噪、帧插值和时空超分辨率。它采用时间互相关自注意力和并行变形机制,捕捉长程时间依赖性,在九个基准测试中实现最先进PSNR提升。仓库包含预训练权重、测试脚本、Colab演示以及标准视频数据集的训练说明。
lxtGH/OMG-Seg
一个将图像、视频、像素级分割整合进单一模型的视觉感知与推理统一框架,减少了对专门化模型的需求。
ARM-software/armnn
一个在 Arm Cortex-A CPU 和 Arm Mali GPU 上加速 TensorFlow Lite 和 ONNX 模型的高性能 ML 推论引擎。
stotko/stdgpu
一个轻量级C++17库,提供GPU上的STL风格通用数据结构,以在自定义内核中实现灵活且可靠的内存管理。
HarborYuan/ovsam
Segment Anything Model (SAM) 的一个开放式词汇扩展,能够同时进行交互式分割与数千种物体类别识别
google/jax-cfd
JAX‑CFD 是一个基于 JAX 的研究级可微分 CFD 库。它提供有限体积法和伪谱法求解器、可选的 ML 增强模型以及数据工具,使用户户可以使用基于梯度的实验进行湍流模拟。该套件可通过 pip 安装,附带 Colab 演示,但目前已停止维护,建议使用更新的替代方案。
hzxie/CityDreamer
CityDreamer 是一个研究级 PyTorch 框架,通过结合布局生成器、背景填充生成器和建筑实例生成器,可生成无限且逼真的 3D 城市景观。包含在大型 OSM/GoogleEarth 数据集上训练的代码、预训练检查点、Web 演示和 CLI 视频渲染功能。
cvg/DeepLSD
DeepLSD 是一种高精度线段检测器,结合深度学习与图像梯度,从真实世界图像中提取并精炼线段。
mlwithme/BertWithPretrained
一个 PyTorch 实现的 BERT,允许用户从零构建模型,并将其应用于分类、问答和命名实体识别等多种 NLP 任务。
VCIP-RGBD/DFormer
DFormer 是一个用于 RGB‑D 语义分割的研究代码库,实现了 DFormer、DFormerv2(几何引导注意力)和 DFormer++(高效高精度变体)。包含预训练脚本、数据集助手、训练/评估流水线以及 NYU‑Depth v2 和 SUN‑RGBD 的预训练权重。该仓库是一个真实的 AI/ML 项目。
baxtree/subaligner
Subaligner 是一个开源的 Python/CLI 工具,可将字幕与视频/音频同步,支持通过 Whisper 进行语音转录、使用 HuggingFace 模型进行字幕翻译,甚至训练自定义对齐模型。支持多种字幕和媒体格式,提供快速全局偏移(`single`)和高精度双阶段(`dual`)对齐,并支持 Docker、pip 及 LLM 增强功能的可选扩展。
ria-com/nomeroff-net
一个使用 YOLOv8 和基于 RNN 的 OCR 的开源 Python 框架,可跨多个国家自动检测和读取车牌。
hplt-project/sacremoses
一个文本预处理库,为 NLP 数据集提供分词、反分词、归一化和真大小写处理工具。
NVIDIA/cuQuantum
NVIDIA推出的高性能SDK,旨在加速量子科学模拟,提供用于状态向量和张量网络计算的专用库。
microsoft/TransformerCompression
一种训练后压缩工具,通过使用正交变换切掉不重要的权重矩阵组件,使Transformer网络更小、更快。
chi2liu/ABC-GRPO
一种非对称且自适应的 GRPO 强化学习算法改进,使用四个独立剪裁边界防止 LLM 推理任务中的熵崩溃并提升泛化能力。
femto/minion-agent
一个强大的代理框架,可在多个代理后端中集成浏览器自动化、代码执行和MCP工具支持。
Softlandia-Ltd/vision-is-all-you-need
一种视觉 RAG(V-RAG)演示,使用 VLM 将 PDF 页面作为图像嵌入,以消除文档检索过程中的文本分块需求。
yzhao062/SUOD
異種モデルのアンサンブルに対する学習と予測を最適化する大規模な無監督異常検出の加速フレームワークです。
NVIDIA/logits-processor-zoo
一组用于LLM的logits处理器,允许开发者控制输出行为,如强制特定短语、管理响应长度和减轻幻觉。
aniketkarne/ClaudeNightsWatch
一个面向 Claude CLI 的自主任务执行系统,监控使用窗口并自动从 Markdown 文件运行预定义任务。
marciopuga/cog
一个集中式、纯文本的内存层,用于 AI 代理之间共享上下文和持久知识,通过 Markdown 文件在不同工具和项目间传递信息。
Azure-Samples/ai-rag-chat-evaluator
一个用于评估 RAG 聊天应用程序的工具包,通过使用基于 GPT 和基于代码的指标,将生成的答案与真实数据进行基准测试。