Chaoses-Ib/ComfyScript
用于 ComfyUI 的 Python 前端和库,允许用户使用 Python 脚本而不是可视化节点图来定义和运行图像生成工作流。
VibiumDev/vibium
一个为 AI 编码代理提供验证能力的层,可通过 CLI、MCP 或客户端库实现网页任务的浏览器自动化与验证。
Mengqi-Lei/count-anything
Count Anything 是一种基于自然语言查询在图像中计数对象的研究模型。它通过结合稀疏区域计数器和密集像素计数器,并使用无参数融合步骤,在六个领域(场景、卫星、医学等)中实现跨域工作。该仓库提供预训练检查点、训练/评估脚本,以及大型 CLOC 数据集的准备说明。
Intellindust-AI-Lab/EdgeCrafter
EdgeCrafter 提供专为边缘设备优化的紧凑视觉变换器(ViTs),实现低延迟下的高性能目标检测、实例分割和姿态估计。
microsoft/TimeCraft
TimeCraft 是 Microsoft Research 基于扩散模型的合成时间序列数据生成框架。它通过原型字典支持跨领域少样本适应、自然语言控制和目标感知生成,优化合成样本以提升下游任务性能。扩展功能包括因果约束、基础模型预训练的在线增强,以及从不规则观测中生成连续时间序列。
open-ribbi/velocut
一个结合多轨视频编辑与3D场景导演的浏览器端工作室,集成AI以实现自动场景构图与编辑。
yan5xu/codexloom
CodexLoom 是一个自托管平台,为 Codex 聊天代理添加持久身份、个人资料和组织工具,支持长期运行的“领域代理”,可从多个设备访问,通过有界消息通信,并可通过接口代理暴露给外部聊天平台(Feishu、Slack、Parall)。面向高级单人用户,提供 UI、CLI 和治理功能,采用 Elastic License 2.0 发布。
kris-hansen/comanda
在仓库中运行持久且自我改进的代理工作流的终端原生运行时,通过质量门禁和代码库索引确保工作确实已完成。
Cocolalilal/LastChat
一款面向 Android 的隐私优先 AI 助手应用,具备基于 RAG 的记忆、多模态输入以及内置的 Python 和 JavaScript 引擎。
lhotse-speech/lhotse
一个用于灵活多模态数据准备的 Python 库,可优化机器学习训练中语音、音频、视频和图像数据的加载与操作。
SkyworkAI/Skywork-R1V
Skywork-R1V 是一个开源多模态推理模型,通过强化学习和视觉思维链(Visual Chain-of-Thought)在复杂的视觉逻辑、数学和物理任务中实现最先进的性能。
do-md/domd
专为大文件、实时协作和 AI 输出流式传输设计的高性能 WYSIWYG Markdown 编辑器与内核
NVlabs/physical_ai_av
用于访问和处理 NVIDIA Physical AI Autonomous Vehicles Dataset 以构建端到端驾驶系统的 Python 开发工具包。
fajarhide/omni
通过精炼噪声命令输出并用可检索句柄替换重复数据,减少 AI 代理令牌使用量的工具。
gobii-ai/gobii-platform
一个 AI 员工平台,用于运行持久、永远在线的自主代理,这些代理可通过电子邮件或短信联系,并执行生产环境的浏览器自动化。
AmberSahdev/Open-Interface
一款使用 LLM 通过视觉反馈模拟键盘和鼠标输入,自主驱动 PC 的 AI 驱动计算机自动化工具。
SponsioLabs/Sponsio
Sponsio 是一个开源库,为基于 LLM 的代理程序提供确定性、微秒级的防护机制。它让您能编写基于形式化方法的合约(YAML 规则集),并在每次工具调用时强制执行,无需调用任何模型即可阻止、警告或允许操作。该库与 Python 或 TypeScript 中的 LangChain、Claude、OpenAI、CrewAI 及其他代理框架集成,随附 22 个现成的合约套件,并提供用于审计与查看的托管控制台。基准测试显示,错误行为减少超过 95%,每次调用延迟低于 0.2 毫秒,使其成为生产环境 AI 代理快速且可靠的安全层。
av/harbor
Harbor 是一个 CLI 驱动的 Docker-Compose 编排器,让你通过一个 `harbor up` 命令即可启动一个完整的本地 LLM 技术栈——包括模型后端 (Ollama, llama.cpp, vLLM, MLX, etc.), 聊天前端 (Open WebUI, LibreChat, AnythingLLM, ...), 网页搜索, 语音, 图像生成, 和基于 Boost 的智能体工作流。
artivis/manif
一个用于机器人状态估计的 Lie 理论库,提供 C++ 和 Python 工具来处理各种 Lie 群的旋转、平移和速度。
marcusquinn/aidevops
aidevops 是一个 MIT 许可的 AI-DevOps 框架,提供 CLI 和 OpenCode 插件,用于在代码、基础设施、产品、营销等领域协调 AI 代理。它将工作分解为 14 个主要代理和数千个子代理,使用脉冲监督者路由任务、管理 token 预算、保护密钥安全并维护 Git 清洁。通过 npm 或 Homebrew 安装后,运行 `aidevops init`、`aidevops pulse` 或特定领域的斜杠命令,即可自动化构建、部署、报告和业务流程,同时保持可审计性。
pinecone-io/python-sdk
一个用于 AI 应用的 Python 客户端,支持创建、管理和查询向量索引。
ZhixiangLuo/10xProductivity
一个本地优先的堆栈,通过利用现有用户权限和工具访问,将编码代理人转变为工作中的个人 AI 助手,绕过企业 IT 限制。
SonySemiconductorSolutions/mct-model-optimization
A model compression toolkit for PyTorch and Keras that optimizes AI models for edge deployment using quantization, pruning, and hardware-aware optimization.
ultralytics/xview-yolov3
一种专为在 xView 卫星影像数据集上进行遥感应用的对象检测训练和运行而设计的 YOLOv3 特化实现。
study8677/repobrain
一个跨 IDE 的代码库知识引擎,为代码库创建有依据的问答系统,使 AI 代理能够提供包含文件路径和行号的准确答案。
norse/norse
Norse 是一个基于 PyTorch 的库,添加了脉冲神经网络原语(LIF、LSNN 等),用于构建、训练与评估事件驱动模型。它提供 pip/conda/Docker 安装方式、即用的示例任务(MNIST、CIFAR‑10、cart‑pole),并可与 PyTorch‑Lightning 集成以支持可扩展的训练。
mlmed/torchxrayvision
一个用于胸部 X 光数据集和模型的库,提供预训练模型以及统一接口,以便在多个公开胸部 X 光数据集上工作。
netket/netket
NetKet 是一个基于 JAX 的 Python 库,利用神经网络和机器学习来研究多体量子系统。
DougTrajano/pydantic-ai-skills
Pydantic AI 的配套库,使代理能够从本地或远程注册表加载模块化技能,执行捆绑脚本,并通过渐进披露机制管理资源。
jahala/tilth
一种语法感知的代码导航工具,为人类和 AI 代理提供结构化洞察,减少探索代码库所需的工具调用次数。
tschnz/Live-Video-Magnification
一种使用 Eulerian video magnification 技术实时放大微小运动和颜色变化的视频放大工具。
LvcidPsyche/auto-browser
一个 MCP 原生浏览器控制平面,为 AI 智能体提供具有人机回环(human-in-the-loop)接管功能、可重用身份验证配置文件以及内置安全护栏的真实浏览器。
MigoXLab/dingo
Dingo 是一个开源的 Python 库(以及 SaaS 产品),用于评估 AI 数据、模型输出和 RAG 系统。支持基于规则、基于 LLM 和基于代理的检查,可从文件、数据库、S3 或 Hugging Face 流式读取数据,并提供 JSON 报告及可选的可视化仪表板。通过 `pip install dingo-python`(含可选扩展)安装,通过 CLI(`dingo eval …`)或 Python SDK 运行,并可通过自定义规则、LLM 提示或代理进行扩展。
papercopilot/paperlists
一个全面的结构化 AI 会议论文记录库,以及用于分析主要会议(如 NeurIPS 和 ICLR)学术文献的本地搜索工具。
ome-projects/ome
一款面向企业级大语言模型(LLM)服务的Kubernetes Operator,可自动化模型管理、运行时选择和GPU资源优化。
OtterMind/Nubase
一个 AI 原生的后端和部署层,允许代码代理直接部署数据库、边缘函数和前端,将 AI 生成的代码转化为实时应用。
xorq-labs/xorq
一个可执行、Git 原生的表格式数据工作目录,可将临时的代理生成脚本转化为可复现、内容地址化的管道。
datawhalechina/torch-rechub
Torch-RecHub 是一个支持 30 多种模型、模块化设计、ONNX 导出以及多种硬件后端的 PyTorch 框架。
nikdanilov/whisper-obsidian-plugin
一个使用 Whisper 将音频录音或上传的文件转换为文本的 Obsidian 插件,并可选择使用 LLM 进行语法和格式的后处理。
art-from-the-machine/Mantella
一个为 Skyrim 和 Fallout 4 设计的模组,通过语音转文字、LLM 和文字转语音技术,实现与 NPC 的自然、AI 驱动对话。
OpenImagingLab/AnyRecon
AnyRecon 是一个 3D 重建框架,利用视频扩散模型从一组捕获视图生成高质量、任意视角的场景重建。
jd-opensource/JoyAI-Image
一个集图像理解、文本生成图像以及指令引导的图像编辑于一体的统一多模态基础模型,专注于空间智能。
syxanash/maxheadbox
一个可在 Raspberry Pi 上运行的 100% 本地化语音激活 LLM 代理,可通过自定义工具扩展以自动化硬件操作。
lightly-ai/lightly-studio
一个使用嵌入来帮助用户高效管理与标注图像和视频数据的本地优先数据整理与标注工具。
dog-qiuqiu/FastestDet
一种超轻量、无锚点的实时目标检测算法,针对 ARM CPU 与嵌入式设备的高速推理进行优化。
aws-solutions/generative-ai-application-builder-on-aws
一个用于在 AWS 上部署与实验可自定义的生成式 AI 使用案例的网页式管理仪表板,支持 RAG 增强型聊天机器人和 AI Agent。
Anil-matcha/Seedance-2-API
ByteDance 的 Seedance AI 视频生成器的 Python 封装,支持高保真度的文本到视频和图像到视频生成,重点实现真实人类面部与角色一致性。
zakirkun/guardian-cli
一个 AI 驱动的渗透测试自动化框架,协调安全工具和多代理 AI,执行自适应安全评估并提供有证据支持的报告。