FutureMLS-Lab/OSCAR

OSCAR 是一种 2 位 KV 缓存量化方法,通过离线谱协方差感知旋转,将内存使用量减少 8 倍,同时保持接近 BF16 的精度。

actions/ai-inference

一个 GitHub Action,可在自动化工作流中通过 GitHub Copilot CLI 运行 AI 推理。

WenjieDu/SAITS

一种基于自注意力机制的多变量时间序列插补框架,解决了 RNN 基础模型的速度和内存问题

nschaetti/EchoTorch

一个面向研究的 PyTorch 模块,用于实现和测试回声状态网络与水库计算,旨在集成到深度架构中。

uncomplicate/deep-diamond

一个利用优化的原生库实现 CPU 和 GPU 加速的高性能张量和神经网络计算 Clojure 库。

h2oai/h2o4gpu

一组 GPU 加速的机器学习求解器,可作为 scikit-learn 的即插即用替代品,提供 Python 和 R API,实现更快的模型训练。

microsoft/onnxruntime-extensions

一个 C/C++ 库,通过自定义算子扩展 ONNX Runtime,以便在 ONNX 图中处理视觉、文本和 NLP 模型的预处理和后处理。

Seeed-Studio/ModelAssistant

一个用于在低成本嵌入式设备和微控制器上部署优化AI算法的工具链,支持计算机视觉、异常检测和特定场景任务。

milvus-io/milvus-lite

专为开发、测试和小规模 AI 应用设计的轻量级、纯 Python 本地版 Milvus 向量数据库。

runekaagaard/mcp-alchemy

一个将 Claude Desktop 连接到 SQL 数据库的 MCP 服务器,支持自然语言探索、模式分析和查询执行。

atomicstrata/atomicmemory

AtomicMemory 是一个开源、可检查的 LLM 代理记忆服务。它提供支持修正的更新、与模型无关的嵌入,以及托管云和自托管 Docker 部署。该项目包含 Rust Core 服务器、TypeScript SDK、CLI(`am`)、LangChain、LangGraph、Vercel AI 等适配器,以及各种代理主机的插件。快速入门是一行安装程序,可创建云配置文件;`--local` 标志可在您的机器上运行 Core 容器。记忆可通过 CLI 或 SDK 以编程方式摄取和查询,代理可通过 MCP 服务器连接。采用 Apache 2.0 许可。

blueqat/blueqatSDK

基于 PyTorch 的量子计算 SDK,支持在模拟器或真实硬件上对量子电路进行模拟、优化和运行,具备可微分执行和专用自旋量子比特支持。

DragonKingpin/Hydra

一个分布式基础设施框架,使个人能够以大型组织的运营能力管理 PB 级数据仓库、大规模抓取和任务编排。

ROCm/k8s-device-plugin

一个 Kubernetes 设备插件,可将 AMD GPU 注册并调度为容器集群中的计算资源。

JamesShi96/project-butler

一种为 AI 编程助手设计的持久记忆系统,使用基于结构化 Markdown 的记忆栈,在会话间保持项目上下文、规则和进度。

SciML/DiffEqGPU.jl

一个用于微分方程求解器的 GPU 加速库,能够跨多个参数和初始条件进行并行求解。

OpenTabular/DeepTab

一个用于表格数据深度学习的 Python 库,提供与 scikit-learn 兼容的 API 和 15+ 种神经网络架构的动物园。

scottvr/wtffmpeg

一个命令行工具,使用 LLM 将视频和音频任务的自然语言描述转换为可执行的 ffmpeg 命令。

runpod/runpod-python

RunPod 官方 Python 库,提供用于创建 Serverless AI Worker 的 SDK 以及用于管理 GPU 云 Pod 和端点的 REST API 封装器。

HeyWillow/willow

Willow 是一个可自托管的推理服务器,用于快速执行包括语音转文本、文本转语音和 LLM 处理在内的语言任务。

EvolvingAgentsLabs/evolving-agents

一个允许开发者提交、对比和合并代理配置与轨迹的版本控制系统和 Claude Agent SDK 插件,以防止性能退化

mratsim/Arraymancer

一个高性能的 n 维张量库,适用于 Nim,提供在 CPU、CUDA 和 OpenCL 后端上进行科学计算、机器学习和深度学习的工具。

langchain-ai/mcpdoc

一个 MCP 服务器,通过 llms.txt 文件为 AI agent 提供透明且可审计的文档获取方式。

paperboytm/spool

Spool 是一个用于共享和恢复 AI 编程代理会话的工具,可将其转换为持久的网页,允许他人阅读并在本地继续工作。

opea-project/GenAIExamples

一个基于微服务架构的生成式 AI 示例和部署指南集合,旨在简化在不同硬件平台上的 GenAI 应用的扩展与测试。

flytohub/flyto-core

一个为 AI 代理设计的 Python 执行引擎,记录工作流的每一步,使用户能够从失败的步骤重新播放和恢复,而无需重新启动整个流程。

PaddlePaddle/PaddleScience

基于 PaddlePaddle 的科学计算套件,利用深度学习和自动微分解决物理学、化学和气象学中的问题。

spitfireuptown/datalinkx

一个使用 Flink 和 SeaTunnel 管理并执行不同数据源之间数据迁移的异构数据同步服务。

Picovoice/picollm

一个跨平台推理引擎,可在从手机到网页浏览器的各类设备上本地运行高精度、压缩的 LLM。

quantumaikr/quant.cpp

一个用于 LLM 推理的高性能 C 语言库,利用 KV cache 压缩技术,让消费级硬件也能实现长文本上下文理解,减少对分块 RAG 的需求。

thomwebb/gac

一个由 LLM 驱动的 CLI 工具,通过分析代码变更与开发者意图,生成具有上下文且格式良好的 Git 提交信息。

awslabs/generative-ai-cdk-constructs

一个开源的 AWS CDK 扩展,提供良好架构的基础设施模式,帮助快速在 AWS 上部署生成式 AI 解决方案。

IntelLabs/RAG-FiT

一个通过创建增强数据集并使用 PEFT 微调模型,提升检索增强生成(RAG)中大型语言模型(LLM)性能的库。

invergent-ai/surogate

Surogate 是一个原生 C++/CUDA 工具包,用于快速训练 LLM(完整模型、LoRA/QLoRA、强化学习、MoE、多模态)并以 OpenAI 兼容 HTTP API 实现高吞吐服务。支持 BF16、FP8、NVFP4、GGUF 量化,多 GPU/CPU 卸载,推测解码,以及运行时 LoRA。基准测试显示,在 RTX 50 和 H100 硬件上,每秒 token 数比 vLLM/llama.cpp 高出 2–7 倍。

SandAI-org/MagiCompiler

一种针对 Transformer 类架构的高级编译器和运行时增强框架,可优化训练和多模态推理的内存与计算效率。

sepandhaghighi/pycm

一个用于 Python 的多类别混淆矩阵库,为评估分类模型提供广泛的统计指标和可视化工具。

im4codes/imcodes

为编码代理提供消息与记忆层,支持远程机器控制、跨 AI 提供商共享上下文,以及监督式交付流水线。

oxylabs/ai-crawler-py

一个使用自然语言提示的 AI 驱动网页爬虫,可发现相关页面并从网站中提取结构化的 JSON 或 Markdown 数据。

microsoft/genaiops-promptflow-template

一个 LLMOps 模板,使用 Prompt flow 简化 LLM 应用的端到端生命周期,从本地实验与评估到生产部署。

traceloop/openllmetry-js

一个开源的可观测性库,适用于 JavaScript/TypeScript LLM 应用,使用 OpenTelemetry 跟踪对 LLM 提供商和向量数据库的调用。

morphik-org/morphik-core

一种多模态检索引擎,使 AI 应用能够在不丢失空间或视觉上下文的情况下,搜索并理解 PDF 和图表等视觉丰富的文档。

aavetis/PRarena

一个跟踪系统和仪表板,通过分析 AI 编码代理在 GitHub 上的拉取请求合并率来比较其成功率。

Dong90/oh-my-taiyiforge

一个状态机引擎,将 AI 编码转化为结构化的九阶段工程流水线,并在多个 AI 工具之间提供统一指令。

jMetal/jMetalPy

一个用于多目标优化的 Python 框架,提供广泛的进化算法、基准问题和统计分析工具。

sknetwork-team/scikit-network

一个使用稀疏矩阵实现内存高效网络分析的图机器学习Python库。

KristofferC/NearestNeighbors.jl

一个 Julia 包,使用 KD 树、球树执行高效的最近邻搜索,并支持周期边界条件。

shankarpandala/lazypredict

一个机器学习库,可快速对数十种分类、回归和时间序列预测模型进行基准测试,无需手动调优即可识别表现最佳的算法。

microsoft/TransformerCompression

一种训练后压缩工具,通过使用正交变换切掉不重要的权重矩阵组件,使Transformer网络更小、更快。