OptimalScale/LMFlow

LMFlow 是一个可扩展的 Python 工具箱,用于微调大型语言模型。支持全参数训练、LoRA、内存高效的 LISA 算法、QLoRA 量化,以及一系列加速技巧(FlashAttention‑2、DeepSpeed、vLLM、SGLang)。训练完成后,提供简单的聊天式推理脚本和可选的 Gradio/Flask 部署。该库专为 Linux/Colab 环境设计,还提供多模态模型、分布式奖励模型推理等可选扩展功能。

NVIDIA/apex

一组由 NVIDIA 维护的 PyTorch 工具,通过优化的 CUDA 扩展简化混合精度和分布式训练。

skorch-dev/skorch

一个包装 PyTorch 的 scikit-learn 兼容神经网络库,使用户能够使用 scikit-learn 的管道和网格搜索功能来操作 PyTorch 模型。

facebookresearch/AugLy

一个提供超过 100 种变换的多模态数据增强库,适用于音频、图像、文本和视频,以提升 AI 模型对真实世界互联网数据的鲁棒性。

facebookincubator/AITemplate

一个将深度神经网络转换为优化的 CUDA/HIP C++ 代码的 Python 框架,用于在 NVIDIA 和 AMD GPU 上实现高性能推理服务。

facebookresearch/nevergrad

一种无需梯度即可最小化函数的优化平台,特别适用于机器学习中的超参数调优。

phodal/auto-dev

基于 Kotlin Multiplatform 构建的 AI 原生多智能体开发平台,可在 IDE 和多个设备中集成编码、审查和研究智能体。

PAIR-code/lit

支持文本、图像和表格数据的视觉化、交互式 ML 模型理解工具,帮助开发者调试和解释模型预测。

facebookresearch/Pearl

Meta 提供的生产就绪强化学习库,用于构建能够处理复杂现实环境、稀疏反馈和动态动作空间的模块化 AI 智能体。

onnx/tensorflow-onnx

一个将 TensorFlow、Keras、TensorFlow.js 和 TFLite 模型转换为 ONNX 格式以实现跨平台兼容性和部署的工具。

AIStream-Peelout/flow-forecast

一个开源的深度学习框架,用于时间序列预测、分类和异常检测,包含大量最先进的模型。

apache/mahout

Apache Mahout 是一个机器学习环境,其特色包含 Qumat,这是一个为量子电路提供统一 API 以及为量子机器学习提供 GPU 加速数据编码的 Python 库。

google-parfait/tensorflow-federated

一个用于在分散数据上进行机器学习和计算的开源框架,可在保持训练数据本地化于客户端的同时,实现全球模型训练。

tensorflow/tfx

TensorFlow Extended (TFX) 是一个生产规模的 ML 平台,提供框架以构建和编排自动化的机器学习流水线。

mil-tokyo/webdnn

一个基于浏览器的神经网络推理引擎,使用 WebGPU、WebGL 和 WebAssembly 在 Web 浏览器中直接运行 ONNX 模型。

Cloud-CV/EvalAI

一个通过标准化排行榜和提交接口,实现大规模机器学习与 AI 算法评估与比较的开源平台。

inducer/pycuda

PyCUDA 是 Nvidia 的 CUDA API 的 Python 封装,支持 GPU 上的高性能并行计算,具备自动内存管理和 C++ 速度。

CannyLab/tsne-cuda

一种 GPU 加速的 FIt-SNE 算法实现,相比 CPU 基础方法,在可视化高维数据方面提供了巨大的速度提升。

rentruewang/aioway

将机器学习模型视为指令,自动构建可解释且资源感知的管道的优化编译器。

csinva/imodels

一个提供一系列与 scikit-learn 兼容的可解释机器学习模型的 Python 软件包,例如规则集和稀疏线性模型,旨在取代黑盒模型。

opendilab/LightZero

结合蒙特卡洛树搜索(MCTS)与深度强化学习(DRL)的轻量级 PyTorch 工具包,旨在标准化并加速基于 MCTS 的决策算法研究。

intelligent-machine-learning/dlrover

一个在 K8s 和 Ray 上提供自动故障容错、自动扩缩容和快速检查点恢复的自动分布式深度学习系统,简化大规模 AI 模型训练。

elixir-nx/axon

基于 Nx 提供数值加速的 Elixir 神经网络框架,提供用于模型创建和训练的高级 API。

zama-ai/concrete-ml

一个使用完全同态加密(FHE)的隐私保护机器学习库,通过类似 scikit-learn 的 API 实现加密数据上的推理和训练。

Lightning-AI/lightning-thunder

一个为 PyTorch 设计的源到源编译器,通过 Python 风格的中间表示和可扩展的变换插件,优化模型在训练和推理中的性能。

awaescher/OllamaSharp

一个为 Ollama API 提供全面绑定的 .NET 库,使 C# 开发者能够轻松地将本地和远程 AI 模型集成到其应用程序中。

tensorflow/text

一组用于 TensorFlow 的文本处理类和操作,可在训练和推理的 TensorFlow 图中实现一致的预处理。

sebp/scikit-survival

一个基于 scikit-learn 构建的 Python 模块,允许研究人员在处理删失数据的同时,将协变量与事件发生时间关联起来。

mapillary/inplace_abn

为 PyTorch 提供内存优化的 Batch Normalization 层,通过将 BN 和激活函数结合为原地操作(in-place operation),在训练期间减少高达 50% 的 GPU 显存使用量。

obot-platform/nanobot

一个开源的独立 MCP 主机,使开发者能够通过连接 LLM 与 MCP 服务器来构建和部署 AI 代理。

mjpost/sacrebleu

一个用于计算可共享、可比较、可复现的 BLEU 及其他翻译指标的工具,自动化测试集管理和分词处理。

meta-pytorch/data

一个可扩展的 PyTorch 数据加载库,引入了 epoch 中断点保存的状态化加载功能,以及用于数据预处理的可组合迭代器。

fatwang2/search2ai

专为 AI 代理设计的自托管搜索网关,将多个搜索提供商整合为一个与 Perplexity 兼容的 API,并通过自动故障转移实现高可靠性。

NVIDIA-Merlin/Transformers4Rec

一个基于 PyTorch 的库,将 Hugging Face Transformer 架构引入顺序和会话推荐系统,支持丰富的表格输入特征和 GPU 加速。

a-r-j/graphein

一个用于将生物分子结构与交互作用网络转换为几何图形表示法的 Python 库,用于深度学习。

Artelnics/opennn

用于商业、医疗和工程领域高级分析的高性能 C++ 神经网络库。

hasktorch/hasktorch

利用 PyTorch 共享的核心 C++ 库的 Haskell 张量与神经网络库

wandb/weave

一个为生成式 AI 应用开发提供追踪、日志和评估工具的工具包,为 LLM 开发流程带来严谨性。

huggingface/optimum-quanto

一个用于 Optimum 的 PyTorch 量化后端,通过将权重和激活转换为 int4 或 float8 等低精度格式,减少模型大小和内存使用。

pepperoni21/ollama-rs

一个封装 Ollama 本地模型 HTTP API 的 Rust crate,提供文本生成、聊天(带历史)、流式响应、模型管理、嵌入向量以及通过宏系统实现的 LLM 工具/函数调用的便捷函数。

NVIDIA-Merlin/HugeCTR

专为高效训练和推理具有巨大嵌入表的大规模深度学习模型而设计的 GPU 加速推荐框架。

agi-brain/xuance

一个全面且统一的深度强化学习库,提供与 PyTorch、TensorFlow 和 MindSpore 兼容的模块化 DRL 和 MARL 算法集合。

yongliang-wu/DFT

通过基于预测概率动态重新缩放 Token 损失,在监督微调(SFT)期间提高 LLM 的泛化能力,对推理任务特别有效。

libxsmm/libxsmm

一个使用 JIT 代码生成来优化跨多种 CPU 架构的深度学习和 HPC 工作负载的高性能库,专为小型密集和稀疏线性代数运算设计。

yandex/YaFSDP

由 Yandex 开发的 Sharded Data Parallelism 框架,通过减少通信和内存开销来优化 LLM 预训练,比 PyTorch FSDP 快高达 20%。

tensorflow/neural-structured-learning

一个用于在标签数据有限的情况下,通过图和对抗扰动等结构化信号来提升准确性和鲁棒性的 TensorFlow 框架。

octos-org/octos

用 Rust 编写的可嵌入式 AI 代理调度内核,提供代理驱动应用所需的执行循环、内存和协调基础设施。

triton-inference-server/tensorrtllm_backend

一个高性能 Triton Inference Server 后端,支持使用 TensorRT-LLM 优化的模型,具备飞行中批处理和多 GPU 扩展能力。