LYL1015/JarvisHub
一个基于可编辑画布作为共享项目状态的画布原生开源框架,用于管理长期创意工作。
NVIDIA-AI-IOT/live-vlm-webui
一个通用的 Web 界面,用于使用实时网络摄像头或 IP 摄像头流对视觉语言模型进行实时交互和基准测试。
dnhkng/GLaDOS
一个具备视觉、长期记忆和低延迟响应管道的主动式多模态AI人格框架。
Everless321/dYm
一款结合无水印视频下载与 AI 驱动内容分析的桌面应用程序,可自动为抖音视频打标签并生成摘要。
pipecat-ai/pipecat-examples
使用 Pipecat 框架构建语音与多模态 AI 代理的中高级示例应用集合。
meangrinch/MangaTranslator
基于Gradio的Web应用,通过检测对话气泡、清理原始文本并渲染AI翻译文本,实现漫画和漫画的自动化翻译。
OpenTSLM/OpenTSLM
OpenTSLM 是一个开源库,为 Llama 3.2 和 Gemma LLM 添加原生时序处理功能,支持对医疗信号(ECG、EEG、加速度计等)进行自然语言提示和推理。它提供预训练检查点、简单的 `OpenTSLM` Python API、多个基准任务的推理演示脚本,以及覆盖 MCQ、描述生成和链式思维推理阶段的课程学习训练管道。通过 `pip install opentslm` 安装,从 Hugging-Face 加载模型,并使用提供的脚本进行微调或评估。采用 MIT 许可证。
livekit/agents-js
一个基于插件架构的 Node.js 框架,用于构建能够听、看、理解的实时多模态语音 AI 代理,支持 STT、LLM 和 TTS 的灵活集成。
uezo/aiavatarkit
一个模块化框架,用于构建低延迟的对话式 AI 化身,集成了跨多个渠道的 VAD、STT、LLM 和 TTS 管道。
Nanako0129/pilotfish
pilotfish 是 Claude Code 的一个策略驱动编排层,它会自动将低投入的编程任务委派给更便宜的 Claude 模型(Haiku, Sonnet),同时将高层规划和最终判断保留在主 Opus 会话中。它通过 macOS/Linux 插件或 legacy global 配置进行安装,在 markdown 中定义角色智能体,并根据交互形状和风险路由工作。该项目包含文档、基准测试和 MIT 许可。
IvanWng97/pixtuoid
pixtuoid 是一个基于 Rust 的终端 UI,将多个 AI 编码助手以动画像素艺术同事的形式可视化为多楼层办公室。支持多种助手 CLI(Claude Code、Codex 等),显示令牌使用量、工具活动,并提供主题、天气、宠物和 LoFi 背景音乐——全部本地运行,无遥测。
Djdefrag/QualityScaler
一款使用 DirectX12 兼容 GPU 在本地对图像和视频进行增强、放大和去噪的 Windows AI 上采样器。
Tencent-Hunyuan/HY-Motion-1.0
一系列十亿参数级 Text-to-3D 人体动作生成模型,利用 Diffusion Transformers 和 Flow Matching 技术,通过文本提示词生成基于骨架的动画。
huohua325/Memslides
MemSlides 是一个开源、具备分层记忆的 LLM agent 框架,可创建个性化幻灯片,并支持多轮、局部化的修改。它维护用户配置、工作记忆与工具记忆,以保持偏好一致性并避免重复劳动,并提供 CLI 与 Docker 镜像,方便进行实验。
AHEKOT/ComfyUI_VNCCS_Utils
用于 3D Gaussian Splatting、无限画布图像编辑以及专业 3D 角色姿态控制和光照的高级 ComfyUI 实用节点集。
AnubhavChaturvedi-GitHub/jarvis-ai-assistant
一款模块化、语音激活的 AI 桌面助手,结合了语音识别、LLM 推理、图像生成和系统自动化,实现免手操作控制计算机。
yangjian102621/geekai
一个一站式 AI 多模态内容创作平台,将文本、图像、音频和视频生成工具整合到一个商业就绪的工作空间中。
timmyy123/LLM-Hub
一款适用于 Android 和 iOS 的开源移动应用,利用硬件加速实现私密的设备端 LLM 对话、图像生成和视频生成。
resend/resend-mcp
Resend MCP Server 是一个开源的 Node.js 包,实现了 MCP 接口,使 AI 代理(Claude、Cursor、Copilot 等)能够通过托管的远程服务器或本地运行的 stdio/HTTP 服务器,完全管理 Resend 邮件平台——包括发送邮件、处理联系人、模板、广播、域名、Webhook 等功能。
NickPittas/DirectorsConsole
一个统一的AI视觉特效制作管线,通过将提示词锚定于真实世界的摄影机、镜头和灯光限制,确保图像和视频生成中的电影摄影精确度。
tensorforger/FluxRT
一个为 FLUX.2 设计的实时流媒体编辑管线,能在消费级 GPU 上以低延迟和交互式提示词更新来转换摄像头或视频流。
OpenGVLab/Ask-Anything
专为以聊天为中心的视频和图像理解而设计的多种模态大语言模型系列,能够就视觉内容进行自然语言对话。
web-infra-dev/midscene-skills
一个视觉驱动的自动化库,能够使用截图在网页、桌面和移动平台上实现 UI 的自然语言控制。
ZJUI-AI4H/Hulu-Med
Hulu‑Med 是一个开源的多模态医疗视觉语言模型,能够处理文本、2D 图像、3D 扫描和视频。 它提供多种模型尺寸(4 B-235 B)、完整的训练代码,并在数十个医疗基准测试中取得了最先进的结果。 该仓库提供易于安装、HuggingFace 兼容的加载以及用于高吞吐量推理的可选 vLLM 服务。
pytorch/benchmark
PyTorch Benchmarks 是一组标准化、轻量级的流行深度学习模型(如 BERT、ResNet、Stable Diffusion 等)的集合,可用于衡量不同 PyTorch 构建、CUDA 版本和后端的性能。它提供统一 API、安装脚本、多种运行器(简单测试、pytest-benchmark、自定义用户基准)以及用于在 AWS g4dn.metal 实例上进行低噪声调优的实用工具。
agentuniverse-ai/agentUniverse
agentUniverse 是一个 Apache-2.0 许可的 Python 框架,用于构建和编排 LLM 驱动的多智能体应用。它提供即用型协作模式(PEER、DOE),支持数十个 LLM 提供商,包含领域知识注入工具、基于 OpenTelemetry 的可观测性,以及可视化工作流 UI。该库已在蚂蚁集团的真实金融产品中使用,并提供丰富的文档、示例应用和 GitHub/Discord 社区。
landing-ai/ade-cli
一种用于代理文档提取的命令行工具,可将复杂文档转换为带有可验证证据(页面和框坐标)的结构化 Markdown 和数据。
meme-search/meme-search
一个使用 AI 视觉模型根据内容和文本对图像进行索引,支持语义和关键词检索的自托管迷因搜索引擎。
tonyd2wild/DeepSeek-v4-Flash-Vision-Exp-DSpark-1M-NVFP4-KV-2x-DGX-Spark
在 DGX Spark 集群上部署 DeepSeek-V4-Flash-Vision-Exp 的高性能部署方案,支持原生视觉、100万 token 上下文和通过 vLLM 实现的高吞吐推测解码。
hawk86104/three-vue-tres
基于 Three.js 和 Vue 3 构建的 AI 协作型 Web 3D 工程生态系统,用于创建可投入生产的数字孪生和工业可视化。
pengchujin/jzsub
一个自动化工具,可从多个平台下载高质量视频,并使用 GPT 生成并内嵌双语字幕。
thanhkeke97/RSTGameTranslation
一个适用于 Windows 游戏的实时屏幕翻译工具,利用 OCR 和大语言模型将屏幕上的文本和音频翻译成用户语言。
OpenGVLab/InternVideo
一系列旨在用于多模态视频理解、长上下文建模和上下文推理的视频基础模型及大规模数据集。
horang-labs/tessera
Tessera 是一款本地桌面/网页应用,可让您并行运行多个 Claude Code、Codex 或 OpenCode AI 编码代理,每个代理各自位于独立的 Git worktree 中。它提供看板、分栏界面、终端聊天视图、完整的 Git 集成,以及移动端远程访问,同时使用您机器上已安装的提供商 CLI。
apple-aiml-research/ml-4m
一个利用分词和掩码建模来实现跨数十种模态和任务的任意模态间多模态基础模型扩展的框架。
inclusionAI/UI-Venus
一个通用基础 GUI 智能体,通过闭环的感知-推理-行动系统统一了移动、Web 和桌面交互。
Anionex/dsh-vision-toolkit
一个为 DeepSeek Harness 设计的视觉工具包,使纯文本模型具备执行 UI 恢复、长截图 OCR 和 GUI 自动化等任务的视觉能力。
google/spatial-media
一套用于360度视频和空间音频的规范和工具,确保沉浸式媒体能被正确识别并播放。
yincongcyincong/MuseBot
MuseBot 是一个开源的 Go 机器人,可将 Telegram、Discord、Slack、Lark、钉钉、企业微信、QQ 和微信连接到多种 LLM API(OpenAI、DeepSeek、Gemini、OpenRouter 等)。它支持 AI 回复流式输出、图像/语音输入、函数调用、RAG、管理界面、指标和定时任务,可本地运行或通过 Docker 部署。
strnad/CrewAI-Studio
CrewAI Studio 是一个基于 Streamlit 的 GUI,支持通过 Conda、虚拟环境、Docker 或一键部署轻松安装。它允许您设计、运行和导出基于 CrewAI 框架的多代理 AI 团队,支持多种 LLM 提供方和自定义工具。
facebookresearch/brain2qwerty
一种从非侵入性脑记录中解码自然句子的系统,可实现打字过程中脑活动到文本的重建。
redis/mcp-redis
Redis MCP Server 是一个基于Python、支持Docker的服务器,允许AI代理通过自然语言命令与Redis交互。它实现了Model Content Protocol,为每种Redis数据类型(字符串、哈希、列表、集合、流、JSON、向量索引、发布/订阅等)提供工具,并支持Azure Entra ID认证。可通过PyPI或Docker安装,通过CLI标志或环境变量配置,并可接入Claude Desktop、OpenAI Agents SDK或任何MCP客户端。
wjq-learning/CBraMod
一种通过预训练和微调流程设计用于临床和脑机接口(BCI)应用的 EEG 解码基础模型。
awwaiid/ghostwriter
一个为 reMarkable 平板设计的 AI 助手,通过截图捕捉手写输入,并直接在屏幕上绘制或打字回复。
nvidia-cosmos/cosmos-transfer2.5
一个用于物理AI的多控制网平台,可将深度和分割等视频模态转换为机器人和自动驾驶汽车的高保真训练数据。
bytedance/Lance
Lance 是一个 30 亿参数的统一多模态模型,将图像和视频的理解、生成和编辑整合到一个框架中。
bytedance/Sa2VA
Sa2VA 是字节跳动发布的一个研究级代码库,将 SAM‑2 分割模型与多模态 LLM(如 InternVL、Qwen‑VL)融合,为图像和视频提供像素级的接地理解能力。它包含核心 Sa2VA 模型、VRT 推理基准、SAMTok 掩码令牌接口,以及 SaSaSa2VA 等扩展。该仓库使用 `uv` 包管理器实现可复现的环境配置,提供一键式设置脚本,并链接至论文、模型库和数据集。
fikrikarim/parlor
一个完全在设备端运行的实时多模态 AI 助手,利用 Gemma 4 和 Kokoro TTS 实现低延迟的语音和视觉交互。