cvg/GeoCalib
GeoCalib 是一个研究级 Python 库,通过深度网络结合几何优化,从单张图像预测相机内参和场景重力方向。支持多种镜头模型、部分先验、批量处理和多相机阵列标定,并附带易安装的推理代码、Gradio 网页演示、Colab 笔记本和实时网络摄像头演示。预训练模型在 OpenPano 数据集(约 37k 个来自 HDR 全景图的透视裁剪图像)上训练,已在 LaMAR、MegaDepth、TartanAir 和 Stanford2D3D 等基准上达到最先进水平。
prathoshap/vagdhenu
一种生产级的大型梵文吟诵文本转语音系统,能够生成传统的旋律吟诵,而非平淡的朗读语音。
qodo-ai/qodo-cover
一款通过 AI 驱动的工具,可自动生成单元测试以提高代码覆盖率,支持多种编程语言及多种 LLM 提供商。
GetStream/Vision-Agents
一个用于构建低延迟、多模态 AI 代理的框架,将实时视频流与大型语言模型(LLM)以及计算机视觉模型结合,提供交互式视觉体验。
NativeSensors/EyeGestures
一个开源眼动追踪库,可使用标准网络摄像头和手机摄像头而非昂贵的专用硬件,实现眼控界面。
steineggerlab/foldseek
一款支持 GPU 加速的快速且灵敏的工具,用于比较和聚类大规模蛋白质结构集,支持单体和多聚体搜索。
GPTomics/bioSkills
bioSkills 是一个包含即用型代码模板(“技能”)的库,可教会LLM编码代理如何执行生物信息学分析——从序列输入输出到单细胞分析、变异检测、结构生物学、化学信息学及工作流管理。可通过 Claude Code、Codex、Gemini/Antigravity、OpenCode 和 OpenClaw 的轻量脚本安装,提供最佳实践命令行标志、示例脚本和使用指南,提升AI生成的生物信息学代码的准确性。
meta-pytorch/botorch
BoTorch 是一个基于 PyTorch 的库,提供模块化框架,用于组合概率模型和获取函数。
google-ai-edge/litert-torch
一个将 PyTorch 模型转换为 .tflite 格式的 Python 库,可在 Android、iOS 和 IoT 设备上实现高性能的本地执行。
NVIDIA-NeMo/Skills
一套用于 LLM 开发的流水线集合,可简化本地工作站和大规模 GPU 集群上的合成数据生成、训练和评估流程。
samvallad33/vestige
Vestige 是一个开源、本地运行的 LLM 编码代理记忆层。它记录决策为“记忆”,合并重复项,标记矛盾,并能从错误回溯到导致问题的早期决策(回填)。所有数据均保留在开发者机器上(SQLite),可选通过付费 Pro 版本实现加密同步。安装仅需一条 npm 命令;工具以 25MB 的 Rust 二进制文件形式提供,仅需一次性下载嵌入器和重排序器,之后即可离线运行。基准测试显示,Vestige 使代理比普通向量搜索 RAG 更可靠地收敛到正确修复。采用 AGPL-3.0 许可证。
bybren-llc/safe-agentic-workflow
一个经过生产环境测试的 AI Agent 框架,通过实现 SAFe 方法论来协调跨 Claude 和 Gemini 等多种 AI 提供商的多智能体团队。
maxritter/pilot-shell
一个围绕 Claude Code 和 Codex 构建的专业上下文与工程封装系统,为生产级软件提供持久上下文、质量门禁和运行时验证。
om-ai-lab/VLM-R1
VLM-R1 是一个使用 GRPO 训练 R1 风格大型视觉语言模型的框架,旨在提升在视觉定位、数学与目标检测等任务中的推理与泛化能力。
johannesjo/parallel-code
一个用于并行分派多个 AI 编码代理的 GUI,使用 git worktree 将每个任务隔离到独立的分支和目录中,实现并发开发。
lmstudio-ai/lmstudio-js
The official JavaScript/TypeScript SDK for LM Studio, enabling developers to integrate local LLMs into applications with advanced memory and hardware controls.
kha-white/manga-ocr
一款专为日式漫画优化的 OCR 工具,能够识别多行文字、振假名,以及垂直和水平布局。
OpenVGLab/OmniLottie
OmniLottie 是一个多模态 AI 生成器,使用预训练的视觉‑语言模型,从文字、图像或视频输入生成复杂的向量 Lottie 动画。
pyro-ppl/pyro
一个构建在 PyTorch 上的深度概率编程库,允许用户为大型数据集创建并扩展通用概率模型。
DannyMac180/skills
一组公开的 AI 智能体技能,通过动态工作流、Claude Code 插件开发和个性化学习的工具来扩展智能体能力。
vercel-labs/workflow-builder-template
一个用于构建 AI 驱动的工作流自动化平台模板,具有可生成可执行 TypeScript 代码的可视化拖拽式构建器。
pycaret/pycaret
一个开源的自托管机器学习平台,结合了 AutoML 引擎、用于实验管理的控制平面以及用于完整训练到部署工作流的 Web UI。
landing-ai/ade-cli
一种用于代理文档提取的命令行工具,可将复杂文档转换为带有可验证证据(页面和框坐标)的结构化 Markdown 和数据。
pocketpaw/pocketpaw
一款在您本地机器上本地运行的自托管 AI 代理,提供原生桌面应用,并与 Discord 和 Slack 等多个消息平台集成。
m1ckc3s/claude-status-bar
一个 macOS 菜单栏应用,实时显示 Claude Code 的 AI 状态,包括是否正在工作、思考或等待用户授权。
openxla/stablehlo
为 ML 模型提供的可移植层和操作集,实现不同 ML 框架与 ML 编译器之间的互操作性。
drawthingsai/draw-things-community
一个社区仓库,提供 Draw Things 应用的核心图像生成、采样和训练代码,包含可自托管的 gRPC 服务器以实现远程推理。
MoonInTheRiver/DiffSinger
一个基于扩散模型的框架,用于从歌词、MIDI 和音高数据生成高质量的歌声合成与文本转语音生成。
FalkorDB/GraphRAG-SDK
GraphRAG‑SDK 是一个 Python SDK,从您的文档构建 FalkorDB 中的知识图谱,然后通过遍历该图谱回答问题。它添加了出处边、多跳检索和可选拒答功能,显著减少 LLM 幻觉,并附带基准测试显示其优于标准向量 RAG。通过 pip 安装,运行 FalkorDB 容器,摄入文本(或 PDF/markdown),调用 `finalize()`,再使用 `completion()` 查询。该库支持模式、增量更新、自定义提供者,采用 Apache‑2.0 许可。
Phyzicalorg/Phyzical_org
一个基于浏览器的机器人远程操作平台,用于众包人类示范数据,以训练视觉-语言-动作(VLA)模型和模仿学习策略。
jdevalk/specification.website
一个将碎片化 Web 标准整合为单一参考的平台无关网站规范,包含使网站对 AI 代理更易读的工具。
alan345/AI-Fullstack-SaaS-Boilerplate
使用 Fastify、React 和 tRPC 的全栈 SaaS 代码模板,提供预配置基础,用于构建集成 OpenAI 的 AI 驱动 Web 应用程序。
KINGSTON-115/llm-pid-tuner
一种基于 LLM 的 PID 调参辅助工具,通过分析硬件或仿真中的系统响应,自动建议并应用最优控制参数。
RUC-NLPIR/FlashRAG
FlashRAG 是一个 Python 库,提供模块化框架、基准数据集以及 23 种 SOTA 检索增强生成(RAG)方法的实现(包括基于推理和多模态的方法)。支持密集、稀疏和神经稀疏检索,通过 vLLM 实现快速 LLM 推理,并提供 Web UI 以实现轻松配置和评估。
woheller69/whisperIME
基于 Whisper 引擎的 Android 离线语音识别输入法,提供注重隐私的语音转文字和翻译功能。
PaddlePaddle/PaddleX
基于PaddlePaddle的低代码AI开发工具,提供预训练模型流水线,支持在多种硬件上快速完成训练、推理和部署。
huggingface/optimum
Hugging Face 生态系统的扩展,提供优化工具,使 AI 模型在目标硬件加速器上以最高效率进行训练和运行。
microsoft/magentic-ui
MagenticLite 是 Microsoft AI Frontiers 的一款代理式应用程序,使用高效且小规模的 AI 模型自动化浏览器和本地文件系统任务。
FrigadeHQ/yap
一款轻量级、在设备上运行的 macOS 语音输入工具,利用 Apple 原生语音 API 将转录文本私密地粘贴到任何活跃应用中。
ML-GSAI/LLaDA
LLaDA 是一种大规模掩码扩散语言模型,它挑战了自回归架构的主导地位,实现了与 LLaMA3 8B 相当的性能。
drhelius/Gearboy
使用 C++ 编写的高精度 Game Boy 模拟器,内置 MCP 服务器以支持 AI 辅助调试和 ROM 破解。
dongsheng123132/u-claw
一个将 OpenClaw 框架打包到 USB 驱动器上的便携式 AI 工作区,让用户可以将 AI 配置和记忆带到任何计算机上。
google-ai-edge/model-explorer
Model Explorer 是 Google‑AI‑Edge 的开源可视化工具,可将 TensorFlow、TFLite、TF‑JS、MLIR 和 PyTorch ExportedProgram 模型渲染为交互式分层图。它提供 GPU 加速渲染、可搜索节点、I/O 高亮、元数据叠加以及可扩展的适配器系统以支持更多格式。
robusta-dev/robusta
一个与 Prometheus 集成,为警报提供诊断数据和自动修复功能的 Kubernetes 警报增强引擎。
Zaneham/Booth
一款开源编译器,可将 CUDA、HIP 和 Triton 内核转换为 AMD、NVIDIA 和 Tenstorrent GPU 以及 x86-64 CPU 的二进制文件。
MIT-SPARK/Hydra
一个实时空间感知系统,可逐步构建并优化用于机器人环境理解的3D场景图。
yarin-zhang/AI-Gist
一款以隐私为先、跨平台的提示词管理工具,允许用户通过本地存储来组织、优化并使用动态 AI 提示词。
NVIDIA-AI-Blueprints/aiq
一个可部署的研究后端,通过协调浅层和深层研究代理,提供带引用的答案和深入报告。