vitoplantamura/OnnxStream

一个内存优化的推理库,通过流式加载权重和使用注意力切片,使 Stable Diffusion 和 LLM 等大型 AI 模型能够在超低内存设备上运行。

UWMILab/UniWM

UniWM 是一种统一的、内存增强的世界模型,用于视觉导航,它在单一多模态自回归骨干网络中集成了自我中心视觉预测与规划。

microsoft/LatentSpatialMemory

一个用于视频世界模型的框架,将 3D 场景内容存储为潜在表示,通过避免重复的 RGB 渲染来提高生成速度并减少内存开销。

Ma-Zhuang/OmniNWM

OmniNWM是一个研究代码库,构建用于自动驾驶仿真的全景多模态世界模型。它从车辆轨迹联合生成RGB、语义、深度和3D占用图,使用归一化Plücker射线图实现精确控制,并提供基于占用的密集奖励以支持闭环策略评估。该仓库包含安装步骤(含对`transformers`的手动补丁)、nuScenes数据准备说明、预训练检查点下载链接,以及用于推理、分布外测试和分阶段训练的脚本。

TencentARC/VerseCrafter

VerseCrafter 是一个可控视频世界模型,通过 4D 几何控制和 GeoAdapter,为真实视频中的相机和多对象运动提供精确且可解释的控制。

nvidia-cosmos/cosmos-predict1

一套面向未来状态预测的世界基础模型,能够从文本或视频提示生成视觉模拟,以支持 Physical AI 的开发。

Tencent-Hunyuan/HY-WorldPlay

HY-World 1.5 是一个实时交互式世界建模框架,利用流式视频扩散技术,根据用户输入生成几何一致的3D环境。

jamubc/gemini-mcp-tool

一个将 AI 助手连接到 Gemini/Antigravity CLI 的 MCP 服务器,支持大规模代码库分析和沙箱化代码执行。

justrach/kuri

一个为 AI agent 设计的轻量级浏览器自动化工具,以单个 Zig 二进制文件实现,无需 Node.js 依赖。

0xranx/golembot

GolemBot 是一个 Node.js 运行时,为现有的编码代理(Cursor, Claude Code, OpenCode, Codex)提供聊天机器人“身体”。通过单个 `golembot gateway` 命令,您可以在 Slack、Telegram、Discord、Feishu、DingTalk、WeCom、WeChat 或自定义 HTTP API 上公开该代理,并通过微小的 YAML 配置切换 LLM 提供者(OpenRouter、MiniMax、DeepSeek 等)。它集成了 ClawHub 市场(13k+ 社区技能),使代理能够即时获得新能力。功能包括内置仪表板、cron 调度器、舰队管理以及最小化的 JavaScript SDK(`createAssistant`)。通过 `npm i -g golembot` 安装,运行 `golembot onboard` 进行配置,然后运行 `golembot gateway` 上线。采用 MIT 许可证。

OpenEnvision/WorldFoundry

一个开源基础设施,为视频生成、3D/4D 表示和具身 AI 提供统一的推理、资产阶段化和基准评估堆栈。

nndeploy/nndeploy

一个使用可视化工作流在桌面、移动和边缘设备上部署 AI 模型的高性能 AI 部署框架。

evilmartians/agent-prism

用于可视化 AI Agent 追踪轨迹的 React 组件库,将复杂的 JSON 日志转换为层级可视化图表,使调试更加容易。

Cranot/roam-code

roam‑code 是一个本地静态分析 CLI(及可选 MCP 服务器),可构建仓库的符号图,使 AI 编码代理无需任何远程 API 调用即可查询定义、调用者、测试影响和风险(爆炸半径)。它提供预飞行检查、健康摘要、验证门禁和 Claude 特定钩子,全部开源且保护隐私。

mit-ll-responsible-ai/hydra-zen

一个 Python 库,通过消除 Hydra 项目中手写的 YAML 配置,简化可配置且可扩展工作流的创建。

expectedparrot/edsl

一种面向计算社会科学和市场研究的领域专用语言,能够使用 AI 代理和大型语言模型(LLM)设计并运行调查和实验。

iflytek/astron-rpa

一款企业级开源 RPA 桌面应用,支持低代码自动化桌面软件和网页,具备与 AI 代理的深度集成。

aristoteleo/PantheonOS

一个可进化的多代理框架,能够自动化并扩展数据科学,专注于端到端的单细胞生物学分析。

microsoft/MInference

MInference 通过利用动态稀疏注意力模式,在单个 A100 GPU 上实现高达 10 倍的加速,从而加速长文本 LLM 的预填充(pre-filling)阶段。

imagej/imagej2

ImageJ2 是一个科学成像框架,它扩展了原始的 ImageJ,以支持多维图像数据以及跨多种编程语言的无头处理。

unrealcv/unrealcv

一个为 Unreal Engine 设计的插件,使计算机视觉研究人员能够使用 PyTorch 和 TensorFlow 等外部 AI 框架构建和交互虚拟世界。

Tencent-Hunyuan/HunyuanVideo-1.5

一个轻量级的 8.3 亿参数视频生成模型,能够在消费级 GPU 上实现高质量的文本到视频和图像到视频合成。

buildingjoshbetter/TrueMemory

一个本地优先的长期记忆系统,为 AI 代理自动捕获并更新用户偏好和事实,跨会话消除 AI 健忘症。

Mohamedelrefaie/DrivAerNet

一个包含 8,150 个高保真 CFD 汽车设计的高质量多模态数据集和基准测试,用于训练用于空气动力学优化和性能预测的 AI 模型。

RobotecAI/rai

一个灵活的 AI agent 框架,用于开发和部署具身智能 (Embodied AI) 功能,使机器人可以利用生成式 AI 进行推理、多模态交互和复杂任务执行。

giselles-ai/giselle

一个用于通过可视化构建器与 GitHub 整合来构建和运行代理型工作流的开源 AI agent studio。

alexiglad/EBT

一个针对能量基础变换器(EBTs)的框架,能够在文本、图像和视频等多模态上实现可扩展的推理与 System 2 思考。

NVIDIA/DALI

一个用于数据加载和预处理的 GPU 加速库,旨在消除深度学习流水线中图像、视频、音频数据中的 CPU 瓶颈。

memodb-io/Acontext

一个开源的 AI 代理技能记忆层,能够自动从代理运行中捕获学习内容,并以人类可读的 Markdown 文件存储。

vakra-dev/reader

一个生产级别的网页爬取引擎,为 AI 代理和大型语言模型(LLM)提供干净的 Markdown 输出以及反机器人绕过功能。

HyperGAN/HyperGAN

一个基于 PyTorch 的可组合 GAN 框架,使开发者和艺术家能够轻松训练、共享和部署生成对抗网络。

ra1nty/DXcam

一个高性能的 Windows 屏幕捕获库,为 Python 提供低延迟、高帧率的画面,适用于 AI 代理和计算机视觉工作负载。

winfunc/opcode

一个用于 Claude Code 的 GUI 应用程序与工具包,提供可视化会话管理、自定义代理创建以及使用分析。

potamides/DeTikZify

DeTi*k*Zify 是一个开源的多模态 LLM,可将草图或光栅科学图形转换为可编辑的 TikZ 代码。它支持图像转 TikZ、通过 Ti*k*Zero 适配器进行文本转 TikZ,以及使用蒙特卡洛树搜索进行迭代优化。可通过 pip 安装,需要完整的 TeX Live、Ghostscript 和 Poppler 安装,并可在 GPU(8‑b 模型)或 CPU(1‑b)上运行。该仓库提供 CLI/Web UI、Python API 示例、Hugging Face 上的模型权重,以及重建训练数据集的脚本。

mrpulor-gh/nuphus-mcp

该仓库是一个关于 AI 桌面和浏览器自动化的真正软件项目,提供一个基于 Rust 的 MCP 服务器,通过标准输入输出的 JSON-RPC 与 AI 代理通信,使 AI 代理能够控制本地计算机,支持本地 OCR 和可选的视觉模型集成。

NaomiProject/Naomi

Naomi 是一个开源、始终在线的语音助手平台(Python,Linux/Raspberry Pi),可让你控制家庭设备、查询信息,并通过简单的 Python 模块添加自定义“技能”。

tidyverts/fable

一个提供时间序列预测模型集合的 R 包,包含 ARIMA 和指数平滑法,并与 tidyverse 工作流整合。

noCaptchaAi/NoCaptcha-Ai-Browser-Extension

一个使用 API 密钥在后台自动检测并解决各种类型 CAPTCHA 的浏览器扩展。

polm/cutlet

支持多种罗马化系统和 URL 别名生成的日本语文本转罗马字工具。

NeuralEnsemble/PyNN

一种与模拟器无关的 Python 语言,用于构建可在多个模拟器和神经形态硬件上无需修改即可运行的神经元网络模型。

apple-aiml-research/ml-hierarchical-confusion-matrix

Neo 是一个开源 JavaScript 库(npm 包 `@apple/hierarchical-confusion-matrix`),提供支持层次化和多输出类别标签的交互式混淆矩阵可视化。通过 npm 安装,传入一个规范和一个 `{actual, observed, count}` 记录数组,即可将矩阵嵌入任意网页。它支持扁平、层次化(`:`)、多输出(`,`)以及组合标签结构,并附带实时演示、单元测试和完整的 TypeScript 源码树。

arrayfire/arrayfire

一个通用张量库,为 CPU、GPU 和其他硬件加速器上的并行计算提供高级抽象。

YeeZTech/YeeZ-Privacy-Computing

Fidelius 是一款基于 Intel SGX 的隐私计算中间件,通过确保原始数据在可供计算的同时对参与方不可见,实现安全的数据协作。

xianyu110/clawbot

Clawdbot 是一个开源、本地运行的 AI 助手,可通过可配置的 API 代理端点连接 Claude、GPT、Gemini 等 LLM。它提供 Web 和终端 UI、Telegram/Discord/WhatsApp 机器人,并将所有数据存储在主机上。README 包含安装说明(Node 22+、npm 或脚本)、模型和渠道设置的引导向导、多模型代理的详细 JSON 配置、常见陷阱(Node 版本、环境变量误用、缺失字段)、以及用于管理网关、日志和诊断的完整 CLI 命令集。

hildensia/bayesian_changepoint_detection

基于 PyTorch 的时序数据贝叶斯变化点检测库,支持在线与离线方法,并具备 GPU 加速能力。

esrrhs/majiang_algorithm

一个高性能的麻将算法库,利用预先计算的查表法进行毫秒级胡牌检测与 AI 驱动的舍牌决策。

RobotWebTools/web_video_server

一个将 ROS 图像主题串流到 Web 浏览器并支持多种格式的 HTTP 服务器,实现轻松的远程监控机器人摄像头画面。

L-a-r-t/chatgpt-to-notion

一个浏览器扩展,允许用户将 ChatGPT、Claude 和 Mistral 等多个 LLM 的提示和回复直接保存到 Notion 数据库中。