zhimaAi/chatwiki

ChatWiki 是一个基于 Docker 的开源平台,可将微信公众号转变为 AI 助手。它提供可视化工作流构建、自动回复(文本、语音、图片、小程序卡片)、从抓取文章或上传文档创建知识库、混合向量-图谱搜索以及人工交接功能。后端使用 Go 和 Python,前端使用 Vue.js,数据库为 PostgreSQL 16 与 pgvector 实现嵌入。支持超过 20 个 LLM 提供商(如 OpenAI、Claude、DeepSeek),可部署为 Web 应用、桌面客户端或嵌入其他服务。个人用户可免费使用;商业用户需购买付费许可证。

autonomous-ai/autonomous-os

一个可定制的机器人操作系统,集成了代理推理引擎和模块化技能系统,以实现真正的物理自主性。

google-deepmind/concordia

用于构建生成式基于智能体的模型,模拟实体在物理、社会或数字环境中的落地交互的库。

google/sam

一个去中心化、零信任的P2P网络层,使自主AI代理能够在分布式环境中安全地发现和通信,同时保持数据和身份的完全主权。

RefoundAI/lenny-skills

一个由 76 个产品管理和工程技能组成的 Markdown 文件库,基于 Lenny 的播客和新闻通讯,为 AI 代理提供专业化知识和工作流程。

sktime/sktime

一个为时间序列分析提供统一接口的 Python 库,包括预测、分类和异常检测,并与 scikit-learn 生态系统兼容。

jd-opensource/JoyAI-Video-Edit

一种利用自回归扩散技术,在帧到达时实时编辑直播视频流或上传视频的系统。

zhongkaifu/TensorSharp

TensorSharp 是一个原生 .NET 引擎,可在 CUDA、Vulkan、Metal、Apple-MLX 或纯 C# CPU 上运行 GGUF 格式的 LLM、基于扩散的图像/视频生成及多模态模型。其性能可与或超越 llama.cpp,支持连续批处理、分页 KV 缓存、张量并行、推测解码、工具调用/代理技能,并提供 Ollama/OpenAI 兼容 API 和 Web UI。

nexu-io/codex-slides

专为 Codex 编码代理设计的开源 AI 幻灯片工作室,通过可控的实时编辑工作流,将提示词、代码库或文件转换为专业的演示文稿。

PhiloLabs/fable51-worlds

一个利用AI代理群从文本、图像或视频生成可验证、可步行3D世界的系统,以基于代码的Three.js应用形式渲染。

mkturkcan/DART

一个无需训练的框架,通过 TensorRT 优化和蒸馏主干网络,将 SAM3 转换为实时多类别开放词汇检测器。

product-on-purpose/pm-skills

一个精选的包含 68 项专业产品管理技能、模板和工作流的库,供 AI 代理使用,旨在消除提示词摸索并标准化高质量的 PM 产出物。

ros2/ros2

机器人操作系统(ROS)是一套开源的软件库和工具,旨在帮助开发者构建机器人应用。

compozy/compozy

一个为 ACP 兼容代理 CLI 提供的守护进程式运行时,用于管理持久会话、自动化和记忆的 AI 代理操作系统。

vibe-motion/skills

一套专为AI代理设计的动画与动态图形技能集合,可生成从3D渲染到品牌宣传视频的各类专业视觉资产。

PacktPublishing/LLM-Engineers-Handbook

一个可直接投入生产的框架和代码库,用于构建端到端的 LLM 系统,覆盖训练、RAG 与在 AWS 上的部署。

OSU-NLP-Group/HippoRAG

一个为 LLM 设计的记忆框架,通过模拟人类长期记忆功能,提升了多跳检索(multi-hop retrieval)与复杂上下文整合的能力。

tuya/TuyaOpen

一个跨平台的 C/C++ SDK 和框架,用于构建集成了嵌入式设备、多模态 AI 以及通过 Tuya Cloud 连接领先 LLM 的 AI-agent 硬件。

colliery-io/graphqlite

一个为 SQLite 添加图数据库功能和 Cypher 查询语言支持的扩展,使嵌入式图数据存储和查询成为可能。

FujiwaraChoki/supoclip

一款开源、AI 驱动的视频剪辑工具,可将长视频自动转换为适合传播的竖屏剪辑,支持自动人脸裁剪、字幕和病毒传播评分。

PetoiCamp/OpenCatEsp32-Quadruped-Robot

OpenCatESP32 是运行在 ESP32 基础 BiBoard 上的固件,用于 Petoi 的开源四足机器人(Bittle X、Nybble Q 和即将推出的 Quaddle)。它提供实时步态控制、动作录制“木偶模式”,以及足够的处理能力用于视觉或强化学习实验,所有功能均可通过 Arduino IDE 编程实现。

hanlinwenyuan/hlwy-ai-checker

一种通过将其统计输出指纹与官方 API 基线进行比较,来验证第三方 AI API 提供商是否使用真实模型的工具。

owl234/ARL-Next

一个 AI 原生的资产侦察与漏洞监控平台,使用 AI 代理自动化资产发现与威胁情报收集。

thinking-machines-lab/tinker-cookbook

一个通过Tinker API实现语言模型微调的抽象化与配方库,支持SFT、RL和多模态训练。

chen0416ccc-cpu/codex-windows-fast-patch-skill

一组用于修复 Windows Codex Desktop 在软件更新后出现的损坏功能(如 Fast Mode、Computer Use、插件市场)的修复脚本和代理技能集合。

su-kaka/gcli2api

一个将 GeminiCLI 和 Antigravity 转换为 OpenAI、Gemini 和 Claude 兼容接口的 API 网关,具备高级 OAuth 凭据轮换和管理功能。

JuneYaooo/gpt-image2-ppt-skills

gpt-image2-ppt-skills 是一个 Python 技能,用于多模态 AI 代理,利用 OpenAI 的 gpt‑image‑2 模型生成高质量 16:9 幻灯片图像,并将其打包为 .pptx 文件。支持视觉优先模式和可选的可编辑模式(将幻灯片重构为原生 PowerPoint 对象)。用户可通过自然语言提示创建新幻灯片集、克隆现有 .pptx 模板,或编辑特定幻灯片元素。安装方式为通过支持的代理安装技能或运行提供的脚本;需要 OpenAI API 密钥和本地 PowerPoint/Keynote/LibreOffice 渲染器。项目采用 Apache-2.0 许可证。

fxy2311-youyou/expression-trainer

一款本地桌面应用,利用离线语音识别和 AI 技术,帮助用户通过识别填充词和模糊语言来提升口语表达能力。

SWivid/F5-TTS

F5-TTS 是一个使用扩散 Transformer 和流匹配的高性能文本转语音系统,可快速生成流畅且忠实的语音,训练和推理速度均显著提升。

bytedance/flowgram.ai

一个用于构建自定义 AI 工作流平台的可组合工作流开发框架和工具包,支持可视化画布和变量管理。

Zafer-Liu/Data-Analysis-Agent

一个对话式 AI 代理,用于业务数据分析,可将自然语言问题转换为 SQL 查询、可视化图表和业务洞察。

Gsync/jobsync

JobSync 是一个基于 Docker 的自托管 Web 应用,用于追踪求职申请、简历、任务和面试问题,并通过支持工具调用的 LLM(本地 Ollama 或云服务)提供 AI 功能——简历审查、职位匹配评分、求职信生成和自动职位发现。它还提供 MCP 服务器,允许外部 AI 代理直接添加职位或面试条目。

kennss/SiliconScope

一个无需 sudo 的 Apple Silicon 系统监控工具,为 AI 和媒体工作负载提供对神经网络引擎、媒体引擎和内存带宽的深度可见性。

microsoft/agent-framework-go

基于图的编排,用于构建生产级 AI 代理和多代理工作流的 Go 实现的 Microsoft Agent Framework。

Anionex/agent-vision-toolkit

一个通过任务感知视觉工具和无缝代理集成,为仅支持文本的 LLM 代理赋予图像问答和 GUI 自动化能力的工具包。

fufankeji/deepseek-harness-studio

一个无需代码的桌面应用程序,用于 DeepSeek Harness,提供可视化界面以管理 AI 代理、插件和本地模型推理。

TNTwise/REAL-Video-Enhancer

一款支持多种 GPU 后端和多种专用模型的跨平台 GUI 应用程序,用于 AI 驱动的视频帧插值和超分辨率。

OpenPetsHQ/openpets

一个将动画宠物置于屏幕上的桌面伴侣平台,具备插件 SDK 和 MCP 集成,让 AI 编码代理驱动宠物的反应和状态。

only-cli/oc

一个 CLI 工具,可将网站转换为紧凑、编号格式,供 AI 代理浏览网页时节省 token。

facebookresearch/map-anything

一个开源研究框架,通过单个 Transformer 模型处理来自各种输入组合的多种 3D 任务,实现通用的度量 3D 重建。

ghbalf/freecad-ai

一个 AI 驱动的工作台,可从自然语言描述生成并执行 Python 代码,以创建 3D 模型。

pytorch/executorch

ExecuTorch 是一个开源的 PyTorch 基础运行时,用于将 AI 模型部署到边缘设备——从手机到微控制器。它可直接从 PyTorch 导出模型,提前编译为极小的 `.pte` 文件,并通过轻量级 C++/Python/Swift/Kotlin API 在多种硬件后端上运行。支持视觉、语音和 LLM(如 Llama),已在 Meta 的生产应用中使用。

EricLBuehler/mistral.rs

用 Rust 编写的快速、灵活的 LLM 推理引擎,支持多模态模型、代理工具执行和 OpenAI/Anthropic 兼容 API。

goohai/Goohaitools-comfyui

一个包含 70 多个自定义节点的完整工具包,专为 ComfyUI 设计,用于专业图像制作,专注于批量处理、自动证件照生成和高级蒙版操作。

BryceWG/BiBi-Keyboard

一款 AI 驱动的 Android 语音输入法,支持多种云端和本地 ASR 引擎,并使用 LLM 进行文本后处理。

Vrun-design/openflowkit

一个开源、本地优先的绘图工作室,结合可视化画布与双向图示即代码及AI生成,用于创建技术架构流程。

newbietan/CloudSSH

基于 Cloudflare Workers 的无服务器 Web SSH 终端,允许用户通过浏览器直接管理远程服务器,内置 SFTP 和 AI 协助功能。

Bhanunamikaze/Agentic-SEO-Skill

一个基于 89 个脚本和 10 个专业代理的 LLM 优先 SEO 分析工具包,可自动完成 AI IDE 中的技术 SEO 审计与战略规划。