awslabs/fullstack-solution-template-for-agentcore

AgentCore 的全栈启动模板,提供安全的 React 前端和 AWS 基础设施,加速 AI 代理应用的部署。

openvinotoolkit/openvino.genai

用于在 PC 和笔记本电脑上本地运行生成式 AI 模型的高性能库,为 Intel 硬件提供针对文本、图像和语音模型的优化流水线。

docker/mcp-registry

一个经过筛选的 Model Context Protocol (MCP) 服务器注册表,允许开发者发现并部署安全的容器化工具,以实现 AI 助手与外部数据源和工具的连接。

databrickslabs/dbldatagen

一个用于在 Databricks 中使用 Spark 生成可扩展合成数据的 Python 库,专为测试、基准测试和演示而设计。

k8sgpt-ai/k8sgpt-operator

一个支持 AI 驱动的集群分析和故障排除的 Kubernetes Operator,具备针对特定工作负载失败的自动修复功能。

AIProxyTeam/AIProxySwift

一个 Swift 库,用于在应用中集成多种 AI API,支持可选的安全代理后端以保护 API 密钥并管理速率限制。

domdomegg/airtable-mcp-server

一个为 LLM 提供读写访问权限的 MCP 服务器,使其能够管理 Airtable 数据库中的记录、模式和评论。

ServiceNow/PipelineRL

一种可扩展的异步强化学习框架,用于 LLM 代理,通过飞行中权重更新最大化 GPU 利用率,同时保持在线策略数据的新鲜度。

google/gemma.cpp

一个为 Google 的 Gemma 模型设计的轻量级、独立的 C++ 推理引擎,采用极简且 CPU 优化的实现,专为研究和实验而设计。

Entrpi/ds4-on-spark

面向NVIDIA DGX Spark的高性能服务栈,支持DeepSeek-V4-Flash,具备连续批处理、推测解码和大上下文窗口内存管理功能。

ModelEngine-Group/unified-cache-management

一种用于 LLM 的缓存管理框架,通过持久化 KV 缓存并实现稀疏注意力检索与存储-计算分离,显著降低推理延迟和 GPU 内存使用量。

vuejs-ai/vue-tui

一个使用组件、Flexbox 布局和响应式状态构建交互式终端用户界面(TUI)的 Vue 原生框架。

ekimetrics/adaptive-chunking

一个用于 RAG 流水线的框架,通过对五种内在质量指标进行评估,自动为每个文档选择最佳的分块策略。

langchain-ai/langchain-google

Google 生成式 AI、Gemini API 和 Vertex AI 服务的 LangChain 集成的中央集合。

MatthewZMD/aidermacs

Aider 的 Emacs 集成,为 Emacs 编辑器带来 AI 伙伴编程和自动代码编辑功能。

PaddlePaddle/FastDeploy

基于 PaddlePaddle 的面向生产的 LLM 与 VLM 部署工具包,提供高性能推理和广泛的硬件兼容性。

TorchIO-project/torchio

一个用于 PyTorch 的 Python 库,提供高效加载、预处理和增强 3D 医疗图像的工具。

google-deepmind/dm-haiku

一个为 JAX 设计的神经网络库,在保留 JAX 纯函数转换的同时,实现了面向对象的模型定义。

FluxML/Flux.jl

一个纯 Julia 的机器学习框架,提供轻量级抽象,让用户能够使用原生 GPU 与自动微分支持来构建和训练模型。

tencentmusic/cube-studio

Cube Studio 是一个为数据科学与 AI 提供的一体化开发环境,专注于在整个开发生命周期中提供一致的环境。

xberg-io/html-to-markdown

基于Rust核心并提供16种语言绑定的高性能、无损HTML转Markdown转换器,专为处理现实世界中不规范的HTML而设计。

run-llama/llama_deploy

LlamaDeploy 是一个用于部署和提供 AI 工作流的工具,但目前已弃用,并改由 llama-agents 取代。

google-deepmind/acme

Acme 是一个用于强化学习研究的框架,为开发和测试 RL 算法提供可扩展的构建模块和基准代理程序。

Dao-AILab/sonic-moe

一个针对 NVIDIA Hopper 和 Blackwell GPU 优化的、高性能的混合专家模型 (MoE) 实现,旨在降低内存使用量并提高训练吞吐量。

Emericen/tiny-qwen

Qwen 3.8 的最小 PyTorch 重实现,提供可读性强的代码库和 int4 量化支持,便于模型部署。

galilai-group/stable-pretraining

stable-pretraining 是一个基于 PyTorch Lightning 的基础模型研究框架,通过字典驱动设计、实时评估回调、GPU侧增强和 SLURM 级编排,简化了 SimCLR、DINO、MAE、CLIP 等自监督、监督和多模态预训练流程,附带实验性 JAX 后端。

xtensor-stack/xsimd

一个 C++ 库,提供 SIMD 内建函数的统一包装器,以加速不同 CPU 架构上的数值计算。

intel/linux-npu-driver

用于 Intel® Core™ Ultra CPU 上节能 AI 推理加速的 Intel® NPU Linux 内核驱动程序。

baidu/vLLM-Kunlun

一种硬件插件,使vLLM能够在Kunlun XPU上运行,提供优化内核并支持广泛的LLM和多模态模型。

UbiquitousLearning/mllm

专为移动和边缘设备优化的轻量级多模态LLM推理引擎,支持多种NPU和GPU,并具备高级量化功能。

fabsig/GPBoost

一个结合树提升、高斯过程与混合效应模型的软件库,用于处理非线性关系及空间或分组效应等数据依赖性。

arcjet/arcjet-js

一个用于 AI 应用程序的运行时安全平台,可检测提示注入、管理令牌预算,并阻止机器人和敏感数据泄露。

AgentTorch/AgentTorch

一个用于构建大规模人口模型(LPM)的 GPU 优化平台,可模拟数百万个相互作用的代理,以建模复杂的社 会动态。

webmachinelearning/webnn

Web Neural Network API 的 W3C 规范,为 Web 应用程序访问机器学习模型的硬件加速提供标准化方式。

CyberAgentAILab/cmaes

一个实用的 Python 库,实现了 CMA-ES 及其变体,用于连续、整数和分类变量的黑箱优化。

rodmarkun/SmolML

一个完全从零开始构建的纯 Python 机器学习库,用于教育目的,提供核心 ML 算法的透明实现和自动微分引擎。

Context-Engine-AI/Context-Engine

一个通过 MCP 为 AI 编程助手提供深层代码库上下文、记忆和导航工具的语义代码搜索与符号智能系统。

kkokosa/dotLLM

使用 C#/.NET 原生编写的高性能 LLM 推理引擎,为 Transformer 模型提供原生的 CPU/GPU 支持,无需依赖 Python 或 llama.cpp。

clearml/clearml-agent

一种 MLOps/LLMOps 调度器和编排工具,通过零配置实现本地和云端资源上的 ML 实验自动执行。

sb-ai-lab/LightAutoML

一个自动化机器学习框架,允许用户通过现成的预设或构建自定义管道来创建表格、文本、图像和时间序列数据的 ML 模型。

aiyiyi121/sxdevops

一个开源智能运维(AIOps)代理平台,将可观测性、事件跟踪和任务执行整合到受控的 AI 驱动 IT 运维工作流中。

gpustack/gguf-parser-go

一个基于 Go 的工具,用于解析 GGUF 模型元数据,并在无需下载完整文件的情况下估算内存使用量和性能。

ServerlessLLM/ServerlessLLM

一个在共享 GPU 上高效部署多个 AI 模型的高性能系统,通过超快检查点加载和 GPU 多路复用,实现高效的无服务器推理。

tairov/llama2.mojo

一个使用纯 Mojo 编写的高性能 Llama 2 推理实现,利用 SIMD 和向量化技术来优化 CPU 性能。

clay-good/OpenLore

基于静态分析的确定性、本地优先的内存与治理系统,为 AI 编码代理提供代码库方向感和安全变更保障。

saurabhkumar8112/cyclomatic-complexity-skill

一个测量并降低代码循环复杂度的 Claude 技能,使 AI 生成的逻辑更易于维护和人类可读。

cursor/community-plugins

一个社区驱动的 Cursor AI 编辑器插件目录,可自动检测组件并使用 AI 代理对提交的插件进行安全扫描

ROCm/MIOpen

AMD 为高性能机器学习原语提供的库,为 ROCm 支持的平台上的深度学习提供优化内核。