flexflow/flexflow-train
通过自动搜索最高效的并行化策略,加速分布式 DNN 训练的深度学习框架。
aeonfun/opendia
一个开源的 MCP 服务器和浏览器扩展,让 AI 模型可以使用您现有的登录账户和会话数据来控制您的浏览器。
JuliaAI/MLJ.jl
MLJ 是 Julia 的机器学习工具箱,为超过 200 个机器学习模型的选取、调优和比较提供统一接口和元算法。
Vchitect/Latte
一种用于高质量视频生成的潜在扩散 Transformer,支持文本到视频和文本到图像任务。
Lightning-AI/lightning-thunder
一个为 PyTorch 设计的源到源编译器,通过 Python 风格的中间表示和可扩展的变换插件,优化模型在训练和推理中的性能。
pnnl/neuromancer
一个将机器学习与科学计算相结合,用于求解参数化约束优化和物理信息驱动系统识别的可微分编程库。
tensorflow/text
一组用于 TensorFlow 的文本处理类和操作,可在训练和推理的 TensorFlow 图中实现一致的预处理。
yym68686/uni-api
uni‑api 是一个仅通过配置运行的服务器,提供单一 OpenAI 兼容 API,同时将请求路由到多个 LLM 提供商(OpenAI、Anthropic、Gemini、Vertex、Azure、AWS 等)。支持加权和轮询负载均衡、自动重试、每模型超时、速率限制、工具调用透传、内容审核以及细粒度请求覆盖——所有配置均通过 `api.yaml` 文件或 `CONFIG_URL` 定义。可作为 Docker 容器部署(提供一键 Fugue 按钮)
flutter-ml/google_ml_kit_flutter
一组 Flutter 插件,使移动应用能够使用 Google 的独立 ML Kit 实现设备端视觉、自然语言和生成式 AI 功能。
yongliang-wu/DFT
通过基于预测概率动态重新缩放 Token 损失,在监督微调(SFT)期间提高 LLM 的泛化能力,对推理任务特别有效。
ikawaha/kagome
一个纯 Go 实现的日本语形态分析器,可将文本分词并分析词性,词典内嵌,便于部署。
BabitMF/bmf
由 ByteDance 开发的跨平台多媒体处理框架,支持高性能视频转码、编辑和 AI 推理,并具备强大的 GPU 加速能力。
AndersonBY/vector-vein
VectorVein 是一个跨平台、无代码的桌面应用,用于构建 AI 驱动的自动化工作流。它允许用户通过可视化方式连接 LLM 调用、嵌入、语音转文本等节点,支持任何 OpenAI 兼容端点(OpenAI、Ollama、LM‑Studio 等),提供本地 FastAPI REST API 用于程序化执行,并以 pywebview 构建的单个可执行文件形式发布。
fal-ai/fal
一个无需管理基础设施即可在云中部署和扩展机器学习模型及流水线的无服务器 Python 运行时和客户端库。
SegmentationBLWX/sssegmentation
一个基于 PyTorch 的监督式语义分割工具箱,提供统一的框架和丰富的模型库,用于训练和测试分割算法。
thekevinscott/UpscalerJS
一个可在浏览器或 Node.js 中使用 AI 实现图像分辨率提升、去噪和去模糊的 JavaScript 库。
huggingface/dataset-viewer
Hugging Face 数据集查看器的后端 API,允许用户通过预计算的数据在 Hub 上浏览、过滤和检查数据集。
kendryte/nncase
一个用于 AI 加速器的神经网络编译器,可将 TFLite、Caffe 和 ONNX 格式的模型优化并部署到 K210、K510 和 K230 等专用硬件上。
scribeocr/scribeocr
一个浏览器端的网络应用,用于从图像中识别文本,以高精度校对OCR数据,并创建完全数字化的ebook风格文档。
omnimind-ai/OmniInfer
一个高性能、跨平台的推理引擎,用于在桌面、移动设备和边缘设备上本地运行 LLM 和 VLM。
Restream/reindexer
一种用 C++ 和 Go 编写的可嵌入式内存文档数据库,提供高性能的 Elasticsearch 替代方案,支持向量搜索和全文搜索。
RichmondAlake/memorizz
一个用于构建记忆优先的 AI 代理的 Python 框架,这些代理使用持久的情景记忆、语义记忆和程序记忆来回忆经验并随时间学习新技能。
mandiant/stringsifter
一种自动对二进制文件中提取的字符串进行排序的机器学习工具,帮助恶意软件分析师快速识别最相关的信息。
mistralai/client-python
Mistral AI 的云 API(聊天、嵌入、音频、文件、代理等)官方 Python SDK。通过 pip/uv/poetry 安装,设置 `MISTRAL_API_KEY`,即可同步或使用 `asyncio` 调用 `client.chat.complete(...)`。包含 Azure 和 GCP 封装,支持流式传输、分页、重试等。
RPG-fan/Cline-Recursive-Chain-of-Thought-System-CRCT-
Cline VS Code 扩展的框架,通过递归文件追踪系统和本地 LLM 辅助分析,管理大规模项目上下文与依赖关系。
iot-salzburg/gpu-jupyter
GPU‑Jupyter 提供基于 Docker 的 GPU 支持 JupyterLab 环境,预装 Python、PyTorch、TensorFlow、Julia 和 R。支持版本镜像、易于自定义和 Docker‑Compose,可在任何配备 NVIDIA GPU 的机器上实现可复现的深度学习实验。
microsoft/TypeAgent
TypeAgent 是微软开源的一个示例项目,展示了如何使用大语言模型、结构化提示和一种新颖的“结构化 RAG”记忆系统,构建一个单一的个人 AI 助手。它包含一个 Electron 外壳、一个将自然语言请求路由到类型化代理的调度器、一个将对话事实存储为逻辑实体的记忆层,以及一个减少 LLM 调用的缓存。该仓库提供了许多示例代理(日历、邮件、浏览器等)和一个用于添加自定义代理的 SDK。这是一个早期阶段的示例代码,仅在 Azure OpenAI 上以英文测试过,未经进一步验证前不适用于生产环境。
texttron/tevatron
一个使用 LLM 在不同语言和模态下训练和部署十亿级神经检索器的统一工具包。
MarioSieg/magnetron
一个基于 C 语言的紧凑型机器学习运行时,配备 Python API,可对张量执行和内存进行完全控制,适用于研究和低层级优化。
kubeflow/kale
通过对单元格进行标记,将 Jupyter Notebook 转换为生产就绪的 Kubeflow Pipelines,从而无需使用 KFP SDK 重写代码的工具。
pnnx/pnnx
pnnx 是一个开源工具,可优化 PyTorch 模型并将其导出为轻量、无依赖的格式(PNNX)以及 ncnn/ONNX-zero 文件,使边缘设备上的快速推理成为可能。
aryn-ai/sycamore
一个用于 ETL 和 RAG 的 AI 驱动文档处理引擎,可将非结构化文档转换为向量数据库使用的高质量数据分块。
Lightning-AI/litData
LitData 是 Lightning AI 的一个库,通过提供快速、云原生的数据管道来加速 PyTorch 训练。它提供两种主要模式:(1) `StreamingRawDataset` 可直接从 S3/GCS/Azure/HF Hub 流式传输原始文件,支持异步、批量下载;(2) `ld.optimize` 可将数据集转换为 LitData 自有的分块二进制格式,实现高达 20 倍的流式传输、洗牌和可恢复 epoch 速度提升。该库还包含用于预处理(如图像缩放、嵌入生成)的并行 `map` 原语,以及对图像、音频、视频、张量、图等多种模态的完整支持。与 PyTorch Lightning、Hugging Face datasets 和 Lightning Cloud 的集成,使其成为 I/O 成为瓶颈的大规模 ML 项目的实用工具。
QJHWC/PaperForge
PaperForge Research OS v3 是一款基于 Python 的工具,整合了 AI 辅助论文写作、实验编排、产出物追踪及可验证的出版流程。它将每个主张与证据的链接存储在 SQLite“科学记忆库”中,强制执行三种执行配置文件(仅写作、研究、完整),并支持本地、Docker、SSH、Slurm、Kubernetes 及云端计算后端。通过 CLI (`paperforge …`) 与本地网页 UI,用户可执行工作流程、批准提案、使用内置模板(generic、CVPR、IEEE、Elsevier)编译 LaTeX,并在进行密钥扫描后发布确定性的源代码包。专为可重现的学术研究设计,以非商业授权开源。
facebookresearch/mvdust3r
一种单阶段 3D 场景重建工具,只需约 2 秒即可从稀疏 RGB 视图中创建 3D 点云和相机姿态,无需预先知道相机姿态。
scikit-tda/scikit-tda
一组专为非拓扑学家设计的拓扑数据分析(TDA)Python 库,旨在让拓扑数据工具更易于使用。
EnzymeAD/Enzyme.jl
Enzyme 的 Julia 绑定,这是一个在 LLVM 上运行的、可为优化后的代码提供高效梯度计算的高性能自动微分工具。
PrimeIntellect-ai/OpenDiloco
通过分布式权重平均化减少通信开销的大型模型全球分布式训练开源框架。
PacificAI/langtest
用于测试 NLP 和 LLM 模型鲁棒性、偏差、公平性和安全性的综合性评估库。
SII-Holos/synergy
一个开源的AI代理工作区,提供持久、可恢复的会话以及软件和知识工作的统一运行时。
e-sensing/sits
SITS 是一个开源 R 包(附带 Python 包装器),用于构建、正则化和分类卫星影像时序数据立方体。它可连接多个公共地球观测数据集,提供一系列 ML/DL 模型(包括 GPU 加速的 CNN 和注意力编码器),并提供从训练、分类、平滑、不确定性估计到主动学习的端到端工具。
irockel/tda
一个提供 GUI 和 MCP 服务器的 Java 线程转储与堆分析工具,用于诊断死锁、性能问题和虚拟线程钉住。
zsylvester/segmenteverygrain
一个用于通过混合 U-Net 和 SAM 2.1 方法检测和分割图像中颗粒的 Python 包,专为地貌学和沉积地质学研究设计。
rodmarkun/SmolML
一个完全从零开始构建的纯 Python 机器学习库,用于教育目的,提供核心 ML 算法的透明实现和自动微分引擎。
nschaetti/EchoTorch
一个面向研究的 PyTorch 模块,用于实现和测试回声状态网络与水库计算,旨在集成到深度架构中。
visionworkbench/visionworkbench
由 NASA 开发的 C++ 库,用于通用型图像处理和计算机视觉,提供相机模型、地图投影和马赛克拼接的工具。
camel-ai/loong
通过合成数据生成和自动验证的自我改进循环来扩展具备推理能力模型的框架。
RosettaCommons/rosetta
用于蛋白质结构、酶和生物大分子的计算分析与设计的生物分子建模库。