AaronFeng753/Waifu2x-Extension-GUI

支持广泛硬件和神经网络模型的AI驱动图像和视频放大及帧插值图形用户界面。

JuneYaooo/gpt-image2-ppt-skills

gpt-image2-ppt-skills 是一个 Python 技能,用于多模态 AI 代理,利用 OpenAI 的 gpt‑image‑2 模型生成高质量 16:9 幻灯片图像,并将其打包为 .pptx 文件。支持视觉优先模式和可选的可编辑模式(将幻灯片重构为原生 PowerPoint 对象)。用户可通过自然语言提示创建新幻灯片集、克隆现有 .pptx 模板,或编辑特定幻灯片元素。安装方式为通过支持的代理安装技能或运行提供的脚本;需要 OpenAI API 密钥和本地 PowerPoint/Keynote/LibreOffice 渲染器。项目采用 Apache-2.0 许可证。

kleinlee/DH_live

一款轻量级 2D 数字人引擎,可在移动浏览器和低功耗设备上实现无需 GPU 的实时动画与对话。

SeemSeam/claude_codex_bridge

CCB(Claude‑Codex‑Bridge)是一个跨平台终端UI,让您可以在可见窗格中一起运行许多基于LLM的CLI代理(Codex、Claude、Gemini等),定义协作图,共享项目范围的记忆文件,甚至可以通过Android应用控制工作空间。通过npm安装,使用内置UI配置,并从命令行管理提供商、角色和富媒体终端。

JimLiu/baocut

一个使 AI 编码代理能够通过自然语言控制 BaoCut 实现视频自动转录、字幕翻译和时间线编辑的代理技能。

PhiloLabs/fable51-worlds

一个利用 AI 代理群体将文字、图像或视频转换为可漫游 3D 世界的系统,并将其渲染为基于浏览器的 Three.js 应用程序。

QwenLM/Qwen3.8-Flash-Next

一款作为 Qwen4 架构预览的多模态 MoE 模型,可在编码和办公任务中实现高效率,显著降低训练与推理成本。

amitshekhariitbhu/build-your-own-x-machine-learning

一个纯 Python、从零实现的经典机器学习算法、深度学习模型以及应用项目(推荐系统、计算机视觉应用、自然语言处理等)集合。旨在作为动手学习资源,帮助任何想了解机器学习技术内部工作原理的人。

DrEAmSs59/CS2-insight-agent

一款专为 CS2 设计的一站式创作套件,可自动化完成回放分析、OBS 高光录制及 AI 驱动的视频剪辑。

redai-studio/Relax

Relax 是一个基于 Ray‑Serve 的开源强化学习框架,专为多模态大语言模型设计。它通过 TransferQueue 解耦 rollout 与训练,支持 GPU 集群上的完全异步或混合执行,提供 PPO、GRPO、M2‑PO、RLOO、REINFORCE++ 等丰富在线策略算法及插件式奖励系统。系统兼容 Megatron‑LM 训练后端与 SGLang 推理,可在单一管道中处理文本、视觉、视频和音频。官方 Docker 镜像、双语文档及生产级运维功能(健康监控、指标采集、弹性 rollout 扩展)使其可直接用于 Qwen‑3‑Omni 等模型的研究与大规模微调。

apple-aiml-research/ml-mobileclip

MobileCLIP (以及 MobileCLIP2) 是专为移动端优化的轻量、快速图文模型,用于零样本分类与描述。此仓库提供预训练权重、训练/评估脚本 (基于 OpenCLIP)、iOS 演示程序以及 CoCa 描述模型,均采用 MIT / Apple research 授权。

xr843/insect-world

一个交互式 3D 昆虫百科全书,收录 63 个物种,完全通过参数化 TypeScript 代码生成,而非使用外部 3D 素材。

morettt/my-neuro

一个用于创建个性化、类人 AI 伙伴的综合性工作台,支持自定义语音、性格和 Live2D 视觉效果。

nexu-io/codex-slides

专为 Codex 编码代理设计的开源 AI 幻灯片工作室,通过可控的实时编辑工作流,将提示词、代码库或文件转换为专业的演示文稿。

ArcInstitute/state

一个用于预测细胞对扰动的反应并生成细胞嵌入(embeddings)以建模生物状态转换的框架。

HisMax/RedInk

只需输入一句话,即可生成包含大纲、文案及视觉一致图像的完整多页社交媒体帖子。AI 驱动工具。

GetStream/Vision-Agents

一个用于构建低延迟、多模态 AI 代理的框架,将实时视频流与大型语言模型(LLM)以及计算机视觉模型结合,提供交互式视觉体验。

TEN-framework/ten-framework

一个用于构建具有低延迟音频、文本和视觉能力的实时多模态对话式 AI 代理的开源框架。

SakuraMathcraft/LaTeXSnipper

一个使用 OCR 将截图、图像和 PDF 转换为可编辑 LaTeX 公式和文本的桌面应用程序。

microsoft/mcp-gateway

MCP Gateway 是一个开源的、原生 Kubernetes 的反向代理和管理层,用于 Model Context Protocol (MCP) 服务器。它提供 REST 控制平面,用于创建、更新和监控 MCP 适配器和工具,支持会话感知路由、Azure Entra ID RBAC、内置 React 管理门户,以及可选的 LLM 驱动代理。可通过 Docker/K8s 本地部署,或使用一键式 Azure 模板部署。

KangLiao929/Puffin

一系列统一的多模态模型,用于 3D 世界建模,能够利用原生物理、几何和外观状态实现以相机为中心的空间智能和 3D 世界生成。

nv-tlabs/lyra

NVIDIA 推出的系列开源生成式 3D 世界模型,能从单张图像或视频生成 3D 与 4D 场景。

dmMaze/BallonsTranslator

一款基于深度学习的漫画翻译工具,可自动化实现漫画和漫画的文本检测、OCR、修复和翻译。

google-deepmind/gemma

一个用于部署和微调基于 Gemini 研究的 Gemma 系列开源权重大语言模型的 JAX 库,支持多模态对话和多种硬件后端。

EvolvingLMMs-Lab/lmms-eval

LMMs‑Eval 是一个开源 Python 工具包,统一了 >100 个多模态基准任务(图像、视频、音频),用于评估具备视觉/音频能力的大语言模型。它提供确定性、统计上可靠的结果,支持 30+ 模型家族(通过 vLLM、SGLang 或 OpenAI 兼容 API),并包含 Web UI、HTTP 评估服务器和可扩展的模型/任务接口。

Lynpoint/CyberVerse

一个用于构建实时数字人代理的开源框架,该代理结合了语音交互、角色记忆和单张照片的视频动画。

duixcom/Duix-Mobile

用于在移动和嵌入式设备上以低延迟和端侧执行部署实时交互式 AI Avatars 的开源 SDK。

momori777/Artemis

一个完全本地、未经审查的 AI 伴侣系统,集成了 LLM、TTS、图像生成和 Live2D 动画,以创建私密、以角色为驱动的虚拟伙伴。

chatfire-AI/huobao-canvas

Huobao Canvas 是一个开源、基于节点的可视化编辑器,可让您在无限画布上链接来自 11 个提供商的文本、图像和视频 AI 模型。它提供轻量级 Node 服务器用于持久化和异步运行队列、Docker 和 Electron 部署选项,以及通过 Huobao 进行一键设置。非常适合在不编写代码的情况下构建多模态创意流水线。

MirroS-Lab/Code-as-World

Code-as-World 是一个将物理世界表示为可执行代码的框架,通过迭代模拟发现世界表示,使 AI 模型能够进行定量物理推理。

IBM/AssetOpsBench

AssetOpsBench 是一个开源基准/框架,用于构建、编排和评估基于大语言模型(LLM)的AI代理,这些代理处理工业资产管理系统数据(传感器、工单、故障模式等)。它提供领域特定的MCP工具服务器、多种ReAct风格代理后端、141+个真实场景,以及在KDD/AAAI/NeurIPS竞赛中使用的多维评估流水线。

Kiri-Innovation/3dgs-render-blender-addon

一个将高保真3D捕获数据集成到标准3D制作工作流中的Blender插件,支持导入、编辑、动画和渲染3D高斯溅射。

Runfusion/Fusion

Fusion 是一个开源的 AI 驱动的软件工厂,可将自然语言任务描述转化为完全审查、可合并的代码。它协调由 LLM 驱动的代理群,每个任务在独立的 Git worktree 中运行,并通过可配置工作流和人工监督的可视化仪表板呈现整个流程。

ArtificialAnalysis/Stirrup

Stirrup 是一个用于构建 LLM 驱动型智能体的轻量级 Python 框架。它提供现成的工具(代码执行、网络搜索、文件 I/O、多模态处理)和灵活的 `Tool`/`ToolProvider` 系统,同时自动管理上下文限制和会话生命周期。通过 `pip install stirrup`(可选扩展包括 Docker、浏览器等)进行安装,创建客户端(OpenRouter、LiteLLM 或任何 OpenAI 兼容的 API),实例化一个 `Agent`,并运行一个允许模型调用工具来解决任务的会话。易于添加自定义工具和提供者,使 Stirrup 非常适合快速原型设计、特定领域助手以及对使用工具的智能体的研究。

zyddnys/manga-image-translator

一款 AI 驱动的图像翻译工具,可检测、删除并替换漫画和连环画中的文本,支持多种语言和自动排版。

DavidVentura/offline-translator

一个 Android 翻译应用,使用设备上的模型完全离线地翻译文本、PDF/ODT 文档和图像。

P1kaj1uu/ChattyPlay-Agent

ChattyPlay‑Agent 是一个全栈 Web 应用,将 AI 聊天助手(ChatGPT/DeepSeek)与多种日常工具——音乐流媒体、视频解析、金价图表、学术论文浏览、LaTeX/markdown 编辑器、思维导图、漫画库、闲鱼市场助手、文本生成图像——融合在一起。采用 React + TypeScript 前端和 Python/Java 后端构建,通过 Docker 运行,提供在线演示。该仓库是 AI 助手领域的一个真实软件项目。

RunMaestro/Maestro

Maestro 是一个跨平台桌面应用,允许高级用户并行运行、自动化和监控多个 AI 编码代理(如 Claude Code、OpenAI Codex 等),支持 Git 工作树、剧本自动化、键盘优先 UI、远程 Web 控制和分析功能,所有功能均在 AGPL-3.0 许可证下提供。

Tencent-Hunyuan/UniRL

UniRL 是一个开源 Python 框架,将统一的强化学习循环应用于许多多模态生成模型(LLM、视觉-语言模型、图像/视频扩散,以及混合 AR-扩散模型)。它提供四个入口点、基于 Hydra 的配置、可插拔的 rollout 引擎,以及通过 Ray 和 FSDP 进行的分布式训练。该仓库包含标准 RL 算法以及团队提出的三种新颖方法(Flow-DPPO、DRPO、CPPO)的教程。支持的模型包括 Stable Diffusion 3、FLUX.2-Klein、Qwen-3、HunyuanVideo 等。提供文档、示例配方和 WeChat 社区。采用 Apache-2.0 许可证。

liyue-aigc/female-outfit-director

一种用于AI代理的提示导向工作流,可生成结构化的生产计划和用于创建角色一致的换装视频的提示。

mlfoundations/open_clip

OpenCLIP 是一个开源 PyTorch 库,实现了 OpenAI 的 CLIP 以及许多较新的多模态模型(SigLIP、CoCa、MaMMUT、CLAP、支持 NaFlex 的视觉/音频、现代文本塔)。它提供预训练检查点、支持分布式/FSDP2 的灵活训练栈、混合精度和 torch.compile 加速,以及用于零样本推理和生成式说明的工具。

YGYOOO/WorldX

WorldX 是一个 AI 驱动的模拟引擎,仅需一个文本提示即可生成包含自主代理、地图和涌现叙事的完整虚拟世界。

huangserva/3DCellForge

一个AI驱动的3D模型工作室,利用多个AI提供商将图像转换为交互式3D模型,并提供专业级的检查与展示工作环境。

nv-tlabs/3dgrut

一种结合高斯光栅化与光线追踪的混合 3D 渲染框架,支持畸变相机和反射、阴影等复杂光照效果。

Scottcjn/bottube

一个 AI 原生视频平台,AI 代理与人类共同创作和分享短视频,通过 Proof of Physical AI 实现硬件验证的内容来源证明。

microsoft/DebugMCP

DebugMCP 是一个由微软维护的 VS Code 扩展,运行一个本地 MCP 服务器,将调试操作(启动/停止、单步执行、断点、变量检查、表达式评估)作为工具暴露,供任何兼容 MCP 的 AI 助手(Copilot、Cursor、Codex 等)调用。它开箱即用支持多种语言,仅在端口 3001 本地运行,并包含安全检查(仅回环绑定、主机验证、密钥隐藏)。附带的 *debug‑live* 技能提供高级调试工作流,使 AI 代理能够自主地在 VS Code 内直接调试代码。

ganbo-gab/open-storyboard-canvas

Open Storyboard Canvas 是一个开源、跨平台的桌面应用(Tauri + React + Rust),提供用于AI生成图像、视频和3D故事板场景的可视化节点画布。包含基于聊天的Canvas Agent(测试版),可创建、编辑和跟踪生成任务,支持多种提供者(OpenAI兼容、Claude、Dreamina CLI),并提供导演工作室工具、提示词库、批量导入和详细日志。采用MIT许可证,基于Storyboard-Copilot上游项目构建。

xszyou/Fay

一个集成了 LLM、ASR 和 TTS 的综合数字人框架,为应用程序、网站和嵌入式设备提供交互式虚拟化身能力。