livekit/agents
一个用于构建实时、多模态语音代理的框架,这些代理能够看见、听见并理解,具备集成的任务调度和灵活的模型集成能力。
Pinvou/pinvou-agent
Pinvou Agent 是一款跨平台桌面 AI 助手,利用 LLM 为工作、设计和编码创建可编辑的交付物。
zcbacxc/movie-narrator
一个开源工具包,仅需一个提示即可自动生成AI驱动的脚本、旁白、字幕和渲染视频。
mengxi-ream/read-frog
Read Frog 是一个开源浏览器扩展,利用 LLM 和 AI TTS 实现网页内容的翻译、解释和闪卡生成,支持双语视图、上下文感知翻译、字幕翻译、自定义 AI 操作以及 20 多个 AI 提供商。
sbroenne/mcp-server-excel
ExcelMcp 是一个仅限 Windows 的服务器和 CLI,允许 LLM 代理通过其 COM API 控制实时 Microsoft Excel 实例,暴露 326 个操作(Power Query、数据透视表、VBA、Python 等),实现实时电子表格自动化。
chengyi-ai/native-subtitle-quote-image
一个AI代理工具,可将视频帧转换为专业的3:4社交媒体引用图片,使用原始烧录字幕或自定义脚本生成的叠加字幕。
mattt/iMCP
iMCP 是一款 macOS 应用程序(内置 `imcp‑server` CLI),实现了 Model Context Protocol,将日历、联系人、位置、地图、信息、提醒事项和天气作为 JSON‑LD 工具公开,供 Claude Desktop、Claude Code、Cursor 和 Amp 等 AI 客户端使用。用户通过 macOS 权限对话框启用服务,连接 AI 客户端后,即可提出自然语言问题,由 AI 在本地获取真实的个人数据来完成请求。项目包含 Swift SDK 集成、用于读取 iMessage 数据库的自定义 Swift 包,以及调试工具(MCP Inspector、Companion)。
open-pencil/open-pencil
一个原生读取 .fig 文件并提供可编程 AI 驱动工具集用于 AI 驱动设计自动化和自定义编辑器开发的开源设计编辑器。
Forget-C/Jellyfish
一个为短剧打造的端到端 AI 制作工作区,管理从剧本拆解、资产一致性到视频生成的完整流程。
tigerowo/infinite-canvas
一个将图像、视频和音频生成整合到节点式无限画布中的开源多模态 AI 工作台,支持迭代视觉创作。
gastownhall/gastown
Gas Town 是一个开源的 Go 编写的多项目 AI 编码助手工作区管理器,支持在多个 Git 项目上运行 Claude、Copilot、Codex、Gemini 等 AI 编码代理,同时将每一步操作持久化存储在 Git 支持的账本中。中央 AI 协调者(*Mayor*)创建 *convoys*(工作项集合),分发给工作代理(*Polecats*),并由一组监控服务(Witness、Deacon、Dogs)保障系统健康。完成的工作通过 Bors 风格队列(*Refinery*)合并,可选的联邦层(*Wasteland*)支持不同安装间共享任务。可通过 Homebrew、`go install` 或 Docker 安装,提供 CLI 工具(`gt`)用于创建 rigs、crews、convoys 并监控进度。
tandpfun/wardrobe
一款由 AI 驱动的工具,可从照片中提取单个衣物以创建数字衣橱,并生成服装的建模编辑预览。
HRuiCcc/RuiC-card-skill
一个自动化流水线,将文本提示或图像转换为具有深度和视角变化闪光效果的交互式 3D 全息卡片,适用于 Web。
mnemosyne-oss/mnemosyne
Mnemosyne 是一个面向 AI agent 的、基于 SQLite 的本地优先记忆层。它通过三层架构(工作记忆、情境记忆、时序知识图谱)为助手提供跨会话的持久记忆,并结合了混合语义/关键词搜索、重度向量压缩、Python SDK、CLI 和内置 MCP server。它专注于隐私:无遥测,默认本地存储,并提供可选的客户端加密同步。
homeassistant-ai/ha-mcp
ha‑mcp 是一个非官方的 Home Assistant 模型上下文协议服务器,允许 LLM 助手(Claude、ChatGPT、Gemini 等)完全读取、控制和配置 Home Assistant 实例。通过 HA‑MCP 自定义组件(HACS)或作为 Home Assistant 插件/Docker/PyPI 服务器安装,获取一个秘密 Webhook URL,并将其指向您的 AI 客户端。该服务器提供 87 个工具,涵盖设备控制、自动化/脚本创建、仪表板编辑、备份、日志和安全策略,实现对整个智能家居系统的自然语言管理。
linyqh/NarratoAI
一个全自动的 AI 驱动工具,用于电影和电视剧评论视频制作,可在单一工作流中完成脚本编写、视频剪辑、配音生成和字幕添加。
jjyaoao/HelloAgents
HelloAgents 是一个 Python 库,提供用于构建多智能体 AI 应用的生产级框架。它封装了 OpenAI 兼容、Anthropic 和 Gemini LLM,提供内置工具(文件 I/O、任务委派、待办事项追踪),并包含工程功能如上下文管理、会话持久化、熔断器、乐观锁、可观测性、SSE 流式传输和异步生命周期。通过 `pip install hello-agents` 安装,配置包含 API 凭据的 `.env` 文件,即可使用注册工具集启动 `ReActAgent` 等智能体。
OpenMOSS/MOSS-VL
一个用于实时和离线视频理解的开权重11B参数模型系列,采用支持可中断流式交互的交叉注意力架构。
lipku/LiveTalking
一个实时交互式流媒体引擎,用于数字人,通过 LLM 和 TTS 驱动,实现音视频同步,打造逼真的虚拟化身。
jianchang512/pyvideotrans
一个开源视频翻译工具,可自动化语音识别、字幕翻译和AI配音,支持语音克隆和多角色合成。
xushengfeng/eSearch
一款集截图、离线 OCR、翻译和反向图像搜索于一体的跨平台屏幕搜索工具,用于提取并处理屏幕信息。
thesysdev/appless
一种实验性的生成式 UI 操作系统,用根据用户请求即时生成的实时流式原生移动界面取代传统应用。
tisfeng/Easydict
Easydict 是一款用于快速查词、翻译和 OCR 的原生 macOS 应用。它自动检测语言,提供多种快捷键驱动的输入模式,并聚合来自 20 多个服务(包括传统词典、云翻译器以及 OpenAI、Gemini、Claude 和 Ollama 等 LLM)的结果。可通过 Homebrew(`brew install --cask easydict`)或手动下载安装。开源(GPL-3.0),欢迎社区贡献。
wiltodelta/remove-ai-watermarks
一个库和CLI工具,用于从AI生成的图像和视频中移除可见标签、不可见像素水印和AI来源元数据。
vibe-motion/skills
vibe-motion/skills 是一个插件库,让 AI 代理(如 Claude Code)能够通过克隆并运行专用渲染项目,生成多种动画视觉资产——如尺子进度条、鱼眼视频效果、品牌发布视频、3D 地球路径、黑胶播放器动画等。通过 `npx skills add vibe-motion/skills` 安装,选择一个技能,提供参数,即可获得 GIF/MP4/HTML 输出。
umlx5h/LLPlayer
LLPlayer 是一个仅支持 Windows 的 C# 媒体播放器,支持 AI 驱动的字幕生成(Whisper ASR)、实时翻译(通过云或本地 LLM)、位图字幕 OCR、双字幕显示、单词查询及在线视频支持。专为语言学习者设计,采用 GPL-3.0 开源协议。
tsunehimatoi/psd2live
一个自动化管道和桌面应用程序,可将分层 PSD 文件转换为完全绑定的 Live2D 模型,具备自适应网格生成、自动变形器设置和 AI 代理集成功能。
MiaAI-Lab/Qwen3.8-Flash-Next-Single-DGX-Spark
在单台 DGX Spark 上使用 vLLM 部署 Qwen3.8-Flash-Next 视觉语言模型的部署方案,支持内存映射 PLE 表和推测解码。
Pan-Chera/Multi-Agent-CAD
一个多智能体框架,可从自然语言生成可编辑的 CAD 零件和多部件组件,具备自动代码修复和仿真就绪导出功能。
ddcat-ai/open-ai-canvas
Open‑AI‑Canvas(影策)是一个开源、自托管的网页工作台,允许创作者通过集成画布、异步任务队列和本地 AI 代理系统,将文本简报转化为完整的电影风格资产——包括故事板、角色/风格库,以及 AI 生成的图像、视频和音频。
nolangz/pixel2motion
一套 AI 辅助的工作流和工具集,用于将栅格徽标转换为干净、动画化的 SVG 徽标,侧重于精准匹配和基于 HTML 的运动交付。
funstory-ai/BabelDOC
BabelDOC 是一个开源 Python 工具,使用 LLM(OpenAI 兼容模型)翻译 PDF 科学论文,并输出双语 PDF。它提供 CLI、Python API、丰富的 PDF 处理选项、术语表支持、离线资源打包,可本地运行或通过托管的 Beta 服务使用。
OSideMedia/higgsfield-ai-prompt-skill
一个专为 Higgsfield AI 设计的全面提示工程库,可将自然语言转化为可投入生产的电影级视频和图像提示。
OpenDCAI/GameFactory-3A
一个开源框架,利用代码代理将游戏需求转换为 UE5、Unity、Godot、Blender 和 three.js 的生产就绪资产和引擎特定代码。
666ghj/BettaFish
BettaFish(微舆)是一个开源、基于 Python 的多智能体平台,可自动从数十个社交媒体来源爬取、分析并报告公共舆论。用户通过类似聊天的界面提问;三个专业智能体(Query、Media、Insight)收集数据,ForumEngine 让它们在 LLM 主持人引导下辩论,ReportEngine 生成交互式 HTML(或 PDF/Markdown)报告。系统包含 24/7 爬虫(MindSpider)、多模态视频/图像处理、微调情感模型,并支持私有数据集成。项目提供 Docker Compose、Flask 前端、Streamlit 演示,且可扩展至其他领域。
ZSeven-W/openpencil
一款开源的 AI 原生向量设计工具,能从自然语言提示词生成 UI 布局并将其导出为正式生产代码。
xinnan-tech/xiaozhi-esp32-server
为 xiaozhi-esp32 项目提供的后端服务器,使 ESP32 设备能够具备语音、视觉和智能家居控制能力的 AI 助手。
OpenBMB/ChatDev
ChatDev 2.0(DevAll)是一个开源、零代码平台,允许你通过可视化 Web 控制台或轻量级 Python SDK,使用 YAML 定义智能体及其连接,设计并运行多 LLM 智能体工作流。支持数据可视化、3D 生成、游戏开发、研究等内置模板。后端为 FastAPI,前端为 Vue 3,项目提供 Docker/Makefile 支持、可扩展的 Python 工具,以及研究级编排器(Puppeteer、MacNet)
HKUDS/RAG-Anything
RAG‑Anything 是一个 Python 库,用于构建多模态检索增强生成系统。它使用 MinerU 解析 PDF、Office 文件、图像、表格和公式,创建跨模态知识图谱,并通过混合向量-图搜索检索相关内容,再传递给 LLM 生成答案。通过 `pip install raganything` 安装,使用 `RAGAnythingConfig` 配置,导入文档并以自然语言查询。
modelcontextprotocol/python-sdk
一个 Python SDK,让您能够遵循 Model Context Protocol(LLM 与工具之间的通信标准 API)来构建和使用服务器。它提供用于将函数暴露为 LLM 可用的工具/资源 Dev 的装饰器,支持 stdio/HTTP/SSE 传输方式,包含一个 CLI,并在 py.sdk.modelcontextprotocol.io 提供文档。
ant-research/4DAnyone
4DAnyone 是一个研究级神经模型,可将单摄像头人物视频转换为数十个同步、视角一致的视频(6-24-48 视角),用于下游 4D 高斯点云重建。可在消费级 GPU(≤24 GB VRAM)上运行,提供快速蒸馏版 Turbo 模型(5.6 倍加速),并提供即用型推理脚本和 nerfstudio 集成。
antirez/h3.c
专为 Apple Silicon 上的 MiniMax-H3 开发的原生 Metal 推理引擎,通过先进的内存与性能优化,实现本地端文本转视频与文本转音频生成。
snapotter-hq/SnapOtter
一个自托管的文件处理套件,利用本地 AI 提供超过 200 个工具,用于图像、视频、音频和 PDF 的转换、压缩和处理,以保护隐私。
leejet/stable-diffusion.cpp
一个轻量级的纯 C/C++ 实现,用于在本地运行图像和视频扩散模型,支持多种硬件后端和模型架构。
WEIFENG2333/VideoCaptioner
一个利用 LLM 进行语音识别、字幕优化和翻译的视频字幕处理一站式工具,可自动化视频字幕流程。
OpenSenseNova/SenseNova-Skills
SenseNova‑Skills 是一个开源的 Agent Skills 集合,为 SenseNova 大语言模型添加办公自动化功能(图像生成、信息图制作、Excel 分析、深度研究和 PowerPoint 生成)。将技能文件夹放入 OpenClaw 或 hermes‑agent 运行时,配置 SenseNova API 后,代理即可将简单的自然语言请求转化为专业的数据驱动报告与演示文稿。
MoonshotAI/Kimi-K3
Kimi K3 是一个拥有 2.8T 参数的开源权重原生多模态 MoE 模型,专为长周期编码、深度研究和复杂的智能体知识工作而设计。
modelscope/DiffSynth-Studio
一个开源的扩散模型引擎,可在消费级 GPU 上实现图像、视频和音频生成模型的高性能推理与训练。