FutureMLS-Lab/OSCAR
OSCAR 是一种 2 位 KV 缓存量化方法,通过离线谱协方差感知旋转,将内存使用量减少 8 倍,同时保持接近 BF16 的精度。
actions/ai-inference
一个 GitHub Action,可在自动化工作流中通过 GitHub Copilot CLI 运行 AI 推理。
WenjieDu/SAITS
一种基于自注意力机制的多变量时间序列插补框架,解决了 RNN 基础模型的速度和内存问题
nschaetti/EchoTorch
一个面向研究的 PyTorch 模块,用于实现和测试回声状态网络与水库计算,旨在集成到深度架构中。
uncomplicate/deep-diamond
一个利用优化的原生库实现 CPU 和 GPU 加速的高性能张量和神经网络计算 Clojure 库。
h2oai/h2o4gpu
一组 GPU 加速的机器学习求解器,可作为 scikit-learn 的即插即用替代品,提供 Python 和 R API,实现更快的模型训练。
microsoft/onnxruntime-extensions
一个 C/C++ 库,通过自定义算子扩展 ONNX Runtime,以便在 ONNX 图中处理视觉、文本和 NLP 模型的预处理和后处理。
Seeed-Studio/ModelAssistant
一个用于在低成本嵌入式设备和微控制器上部署优化AI算法的工具链,支持计算机视觉、异常检测和特定场景任务。
milvus-io/milvus-lite
专为开发、测试和小规模 AI 应用设计的轻量级、纯 Python 本地版 Milvus 向量数据库。
runekaagaard/mcp-alchemy
一个将 Claude Desktop 连接到 SQL 数据库的 MCP 服务器,支持自然语言探索、模式分析和查询执行。
atomicstrata/atomicmemory
AtomicMemory 是一个开源、可检查的 LLM 代理记忆服务。它提供支持修正的更新、与模型无关的嵌入,以及托管云和自托管 Docker 部署。该项目包含 Rust Core 服务器、TypeScript SDK、CLI(`am`)、LangChain、LangGraph、Vercel AI 等适配器,以及各种代理主机的插件。快速入门是一行安装程序,可创建云配置文件;`--local` 标志可在您的机器上运行 Core 容器。记忆可通过 CLI 或 SDK 以编程方式摄取和查询,代理可通过 MCP 服务器连接。采用 Apache 2.0 许可。
blueqat/blueqatSDK
基于 PyTorch 的量子计算 SDK,支持在模拟器或真实硬件上对量子电路进行模拟、优化和运行,具备可微分执行和专用自旋量子比特支持。
DragonKingpin/Hydra
一个分布式基础设施框架,使个人能够以大型组织的运营能力管理 PB 级数据仓库、大规模抓取和任务编排。
ROCm/k8s-device-plugin
一个 Kubernetes 设备插件,可将 AMD GPU 注册并调度为容器集群中的计算资源。
JamesShi96/project-butler
一种为 AI 编程助手设计的持久记忆系统,使用基于结构化 Markdown 的记忆栈,在会话间保持项目上下文、规则和进度。
SciML/DiffEqGPU.jl
一个用于微分方程求解器的 GPU 加速库,能够跨多个参数和初始条件进行并行求解。
OpenTabular/DeepTab
一个用于表格数据深度学习的 Python 库,提供与 scikit-learn 兼容的 API 和 15+ 种神经网络架构的动物园。
scottvr/wtffmpeg
一个命令行工具,使用 LLM 将视频和音频任务的自然语言描述转换为可执行的 ffmpeg 命令。
runpod/runpod-python
RunPod 官方 Python 库,提供用于创建 Serverless AI Worker 的 SDK 以及用于管理 GPU 云 Pod 和端点的 REST API 封装器。
HeyWillow/willow
Willow 是一个可自托管的推理服务器,用于快速执行包括语音转文本、文本转语音和 LLM 处理在内的语言任务。
EvolvingAgentsLabs/evolving-agents
一个允许开发者提交、对比和合并代理配置与轨迹的版本控制系统和 Claude Agent SDK 插件,以防止性能退化
mratsim/Arraymancer
一个高性能的 n 维张量库,适用于 Nim,提供在 CPU、CUDA 和 OpenCL 后端上进行科学计算、机器学习和深度学习的工具。
langchain-ai/mcpdoc
一个 MCP 服务器,通过 llms.txt 文件为 AI agent 提供透明且可审计的文档获取方式。
paperboytm/spool
Spool 是一个用于共享和恢复 AI 编程代理会话的工具,可将其转换为持久的网页,允许他人阅读并在本地继续工作。
opea-project/GenAIExamples
一个基于微服务架构的生成式 AI 示例和部署指南集合,旨在简化在不同硬件平台上的 GenAI 应用的扩展与测试。
flytohub/flyto-core
一个为 AI 代理设计的 Python 执行引擎,记录工作流的每一步,使用户能够从失败的步骤重新播放和恢复,而无需重新启动整个流程。
PaddlePaddle/PaddleScience
基于 PaddlePaddle 的科学计算套件,利用深度学习和自动微分解决物理学、化学和气象学中的问题。
spitfireuptown/datalinkx
一个使用 Flink 和 SeaTunnel 管理并执行不同数据源之间数据迁移的异构数据同步服务。
Picovoice/picollm
一个跨平台推理引擎,可在从手机到网页浏览器的各类设备上本地运行高精度、压缩的 LLM。
quantumaikr/quant.cpp
一个用于 LLM 推理的高性能 C 语言库,利用 KV cache 压缩技术,让消费级硬件也能实现长文本上下文理解,减少对分块 RAG 的需求。
thomwebb/gac
一个由 LLM 驱动的 CLI 工具,通过分析代码变更与开发者意图,生成具有上下文且格式良好的 Git 提交信息。
awslabs/generative-ai-cdk-constructs
一个开源的 AWS CDK 扩展,提供良好架构的基础设施模式,帮助快速在 AWS 上部署生成式 AI 解决方案。
IntelLabs/RAG-FiT
一个通过创建增强数据集并使用 PEFT 微调模型,提升检索增强生成(RAG)中大型语言模型(LLM)性能的库。
invergent-ai/surogate
Surogate 是一个原生 C++/CUDA 工具包,用于快速训练 LLM(完整模型、LoRA/QLoRA、强化学习、MoE、多模态)并以 OpenAI 兼容 HTTP API 实现高吞吐服务。支持 BF16、FP8、NVFP4、GGUF 量化,多 GPU/CPU 卸载,推测解码,以及运行时 LoRA。基准测试显示,在 RTX 50 和 H100 硬件上,每秒 token 数比 vLLM/llama.cpp 高出 2–7 倍。
SandAI-org/MagiCompiler
一种针对 Transformer 类架构的高级编译器和运行时增强框架,可优化训练和多模态推理的内存与计算效率。
sepandhaghighi/pycm
一个用于 Python 的多类别混淆矩阵库,为评估分类模型提供广泛的统计指标和可视化工具。
im4codes/imcodes
为编码代理提供消息与记忆层,支持远程机器控制、跨 AI 提供商共享上下文,以及监督式交付流水线。
oxylabs/ai-crawler-py
一个使用自然语言提示的 AI 驱动网页爬虫,可发现相关页面并从网站中提取结构化的 JSON 或 Markdown 数据。
microsoft/genaiops-promptflow-template
一个 LLMOps 模板,使用 Prompt flow 简化 LLM 应用的端到端生命周期,从本地实验与评估到生产部署。
traceloop/openllmetry-js
一个开源的可观测性库,适用于 JavaScript/TypeScript LLM 应用,使用 OpenTelemetry 跟踪对 LLM 提供商和向量数据库的调用。
morphik-org/morphik-core
一种多模态检索引擎,使 AI 应用能够在不丢失空间或视觉上下文的情况下,搜索并理解 PDF 和图表等视觉丰富的文档。
aavetis/PRarena
一个跟踪系统和仪表板,通过分析 AI 编码代理在 GitHub 上的拉取请求合并率来比较其成功率。
Dong90/oh-my-taiyiforge
一个状态机引擎,将 AI 编码转化为结构化的九阶段工程流水线,并在多个 AI 工具之间提供统一指令。
jMetal/jMetalPy
一个用于多目标优化的 Python 框架,提供广泛的进化算法、基准问题和统计分析工具。
sknetwork-team/scikit-network
一个使用稀疏矩阵实现内存高效网络分析的图机器学习Python库。
KristofferC/NearestNeighbors.jl
一个 Julia 包,使用 KD 树、球树执行高效的最近邻搜索,并支持周期边界条件。
shankarpandala/lazypredict
一个机器学习库,可快速对数十种分类、回归和时间序列预测模型进行基准测试,无需手动调优即可识别表现最佳的算法。
microsoft/TransformerCompression
一种训练后压缩工具,通过使用正交变换切掉不重要的权重矩阵组件,使Transformer网络更小、更快。