Mobile-Artificial-Intelligence/maid
Maid 是一个开源的 Android 应用(React Native),可让你通过 llama.cpp 在本地运行 GGUF LLM,并连接到多个远程 LLM API。它提供一键式模型下载、聊天管理、可调生成设置、可选的云同步功能,以及配套的语音合成应用(Maise)。可通过 GitHub 发布版本或 Google Play 安装,也可自行构建 APK。
raysonmeng/agent-bridge
AgentBridge 是一个本地工具,将 Claude Code 和 OpenAI Codex 连接起来,使它们能自动交换消息、拆分任务并审查彼此的代码。它运行一个基于 Bun 的守护进程和一个简短的 CLI(`abg`/`agentbridge`),用于启动两个代理,处理回合协调、配额交接和过滤冗余输出。专为希望两个 LLM 编程助手协作而无需手动复制粘贴的开发者设计。
ZiYang-xie/WorldGen
WorldGen 是一款工具,能够在几秒钟内从文字提示或图像生成沉浸式 3D 场景,支持 Gaussian Splatting 与 mesh 输出,适用于 VR、游戏和模拟。
bcurts/agentchattr
agentchattr 是一个跨平台的本地聊天服务器,允许你和多个 AI 编码代理实时对话。通过在 Web UI 中 @ 提及代理,服务器会通过 MCP 将提示注入代理的终端,代理自动读取聊天并回复,实现免手操作的协调、多代理工作流、任务、规则、会话、频道、置顶、决策卡片、调度、语音输入等丰富功能。
sorker/ai-shotlive
AI ShotLive Director 是一个开源的 React + Express (或 Electron) 平台,可将小说或故事大纲转化为短视频或动态漫画。它采用关键帧驱动的工作流程(起始/结束帧 → 插值),并允许你接入任何文本、图像、视频或音频模型(OpenAI, Anthropic, Google, AntSK, etc.)。功能包括小说转剧本转换、素材生成(角色形象手册、场景概念图)、网格分镜编辑器、带有 AI 字幕/TTS 的多轨视频编辑,以及完整的备份/恢复功能。可通过 Docker, 本地 SQLite, 或作为桌面应用使用,并受 CC BY-NC-SA 4.0 许可。
ChrisChen667788/wind-comic
一个将单句转化为完整短片戏剧的多智能体 AI 工作室,自动化从剧本、角色设计、配音到最终 MP4 导出的全部流程。
NVIDIA-AI-Blueprints/video-search-and-summarization
一个用于构建使用自然语言搜索、总结和推理实时或录制视频流的GPU加速视觉代理的参考架构。
saddam213/AmuseAI
一个本地多模态 AI 应用程序,使用各种开源管道和 GPU 后端生成和编辑图像、视频、音频和文本。
aaronyi97/image-story-video-wizard
为Codex和WorkBuddy设计的AI视频制作工作流,从主题选择到基于故事的视频最终渲染,提供逐步引导。
Evianis/travel-photo-abstraction
一种 Codex 技能,通过将形状和空间节奏等视觉证据映射为极简的抽象标记,分析照片以创建稀疏的编辑风格抽象画。
lidge-jun/ima2-gen
一个本地优先的视觉生成工作室,提供跨多个 AI 提供商的统一图像和视频生成界面,并配备高级迭代工具。
scraed/LanPaint
一种无需训练的通用扩散模型图像修复采样器,通过「思考模式」提升图像、视频和音频的修复质量。
facebookresearch/fairchem
fairchem 是Meta的开源库,提供用于化学和材料科学的机器学习原子间势(UMA模型)。它提供可pip安装的 `fairchem-core` 包、ASE兼容的计算器、多GPU推理能力,以及分子、聚合物、无机晶体、催化剂、MOFs等的预训练模型,实现快速且量子精度的模拟。
songlab-cal/gpn
一套专为预测全基因组变异功能效应而设计的基因组语言模型,可处理对齐和未对齐的基因组序列。
corvo007/MioSub
一个基于 Gemini 和 Whisper 的 AI 驱动字幕编辑器,可自动化实现转录、翻译和毫秒级精准时间轴对齐。
anliyuan/Ultralight-Digital-Human
一个轻量级数字人模型,专为移动设备上的实时说话头生成而设计,可通过短视频进行个性化训练。
NVIDIA/cudnn-frontend
NVIDIA 的 cuDNN Frontend 是一个开源的纯头文件 C++ API 加上 Python 绑定,简化了在 Hopper 和 Blackwell GPU 上构建高性能深度学习内核(注意力机制、GEMM、融合操作)的过程。它提供了现成的 JIT 编译内核,包括 Flash-Attention、混合专家 GEMM 融合、稀疏/线性注意力等,均可通过统一的 Graph API 和 PyTorch 兼容操作访问。
omnichar/OmniChar
一个开源工作室,使用可移植的 .char 格式创建一致的 AI 角色,该格式可在多个图像和视频生成模型中工作。
kunchenguid/autopreso
一个使用 AI 代理根据演讲者的语音实时绘制和重新排列 Excalidraw 白板的免手演示工具。
safetensors/safetensors
safetensors 是一个基于 Rust 的 Python 库,定义了一种小型、带 JSON 头部的二进制格式,用于安全存储张量(无 pickle 代码执行),同时支持零拷贝、懒加载和现代 dtype。它被用于 Hugging Face 分发大型模型权重,可通过 `pip install safetensors` 安装。
zhizinan1997/jimeng-free-api-all
一个为 Jimeng AI 提供 OpenAI 兼容 API 服务的项目,支持多账户轮换和管理仪表板,实现程序化图像与视频生成。
kyleskom/NBA-Machine-Learning-Sports-Betting
一个Python项目,抓取NBA统计数据和体育博彩赔率,构建对位特征,训练XGBoost和TensorFlow模型以预测比赛胜者和大/小分总和,并输出期望值和凯利准则建议投注金额。包含数据收集、模型训练、命令行预测脚本和简单Flask网页UI。
NVIDIA/cosmos-framework
一个用于训练和部署多模态世界模型(包括 Cosmos 3 系列)的端到端框架,旨在统一语言、视觉、音频和动作,服务于物理人工智能。
xmarre/ComfyUI-Spectrum-MiniMax-H3
Spectrum 的 ComfyUI 实现通过预测隐藏状态来跳过昂贵的 Transformer 评估,加速 MiniMax H3 音视频生成。
openxla/xprof
XProf 是一个开源、可扩展的分析器(带有 TensorBoard 插件),适用于现代机器学习工作负载。它可可视化步骤时间分解、操作时间线、内存使用情况和 HLO 图,支持分布式处理,并可通过 `pip install xprof` 安装。
EvolvingLMMs-Lab/LLaVA-OneVision-2
一个完全开源的 8B 多模态模型,使用编解码器对齐的视觉编码器统一图像、长视频和空间理解,以实现高效的长视频推理。
facebookresearch/meshflow
MeshFlow 是一个高效的 3D 网格生成系统,它使用 MeshVAE 和 flow-matching Diffusion Transformer 在约一秒内创建艺术网格。
AlayaLab/WildWorld
一个来自 AAA ARPG 的大规模、具备明确状态标注的世界模型数据集,旨在用于训练生成式游戏环境。
dineshsoudagar/local-llms-on-android
一款使用 ONNX 和 LiteRT 后端,支持语音、图像和摄像头输入的完全离线、私密的 Android 应用。
jedzqer/manga-translator-android
一款使用本地气泡检测和 OCR 结合 LLM 翻译,在原始图像上叠加翻译文本的 Android 漫画翻译应用。
OneMoreGres/ScreenTranslator
一个利用在线翻译服务,通过屏幕捕获和OCR技术翻译屏幕上出现的文本的工具。
GalTransl/GalTransl
GalTransl 是一个桌面 GUI,可自动提取、翻译(通过 GPT-4/Claude/DeepSeek 等)并重新注入日文 galgame 脚本为中文,支持 GPT 驱动词典、缓存和字幕功能。
Wing900/ManimCat
一个利用 Manim 和 matplotlib 驱动的 AI 工作空间,可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过可通过 {
mll-lab-nu/VAGEN
VAGEN 是一个强化学习框架,用于训练多轮对话 VLM 代理,通过显式的视觉状态推理来强化其内部世界模型,从而提升性能。
tmustier/pi-for-excel
Pi for Excel 是一个开源的 Office 插件,将对话式 AI 代理嵌入 Microsoft Excel。该代理可使用您配置的任意 LLM 读取、写入、格式化和分析电子表格,提供 16 个内置电子表格工具、会话管理、一键回滚的自动检查点,以及可扩展的沙箱扩展。
google-deepmind/tips
TIPS 是一系列为通用计算机视觉和多模态 AI 设计的基础图文编码器,具有增强的空间感知能力和 patch-text 对齐能力。
xikhar/persona
一款跨平台桌面应用程序,提供实时、富有表现力的 3D 角色头像,可响应 AI 助手的语音输出。
vinhhien112/img2obj
通过结构化分析和评审工作流生成必要的构建代码,将参考图像转换为可用于动画制作的程序化 Three.js 对象,这是一个 Codex 插件。
RareSense/Nova3D
Nova3D 是一个代码原生的 3D 生成系统,将资产作为可执行的 Blender Python 脚本生成,从而实现带有命名部件的结构化、可编辑且可动画化的 3D 模型生产。
OrRon/EpicInfographics
一项专为 AI 代理设计的技能,通过以场景为基础的设计与数学精确度取代通用模板,使其能够创建专业、工作室级别的信息图表与动画。
gradio-app/trackio
Trackio 是一个免费、轻量级的实验跟踪库(与 wandb 兼容),将日志存储在本地 SQLite 中,提供快速的非阻塞 API、Gradio 风格的仪表板、CLI/SQL 查询工具、警报,以及可选的 Hugging Face Spaces 免费托管或自托管。
nodetool-ai/nodetool
一个以节点图系统和集成 AI 代理为基础,支持图像、视频、音频和文本生成的代理优先创意工作区。
ATH-MaaS/Ovis
Ovis 是一个多模态大语言模型 (MLLM) 架构,通过结构化对齐视觉与文本嵌入,实现高分辨率图像处理与反思性推理。
morsoli/aimangastudio
一个提供从脚本生成、分镜设计到角色风格控制的全流程AI漫画创作工具。
jeremychone/rust-genai
genai 是一个 Rust crate,为 26+ 提供商(OpenAI、Anthropic、Gemini、Ollama、Bedrock 等)提供的 200+ LLM 模型提供单一、易用的异步 API。它会自动选择正确的原生协议,支持自定义 OpenAI 兼容端点、流式传输、工具调用、图像分析,并通过 ChatOptions 提供丰富的配置选项。该库积极维护中(v0.6 已发布,v0.7 beta 即将推出),并包含大量示例和文档。
X-GenGroup/Flow-Factory
一个用于跨图像、视频和音视频模态的扩散模型和流匹配模型的在线强化学习与离线微调的统一框架。
tiiuae/Falcon-Perception
Falcon‑Perception 是一个开源的 PyTorch/MLX 推理库,专为 Falcon 多模态变换器设计,可基于自然语言查询执行对象检测、实例分割或 OCR。它提供高度优化的分页和批处理引擎、FastAPI 服务器、Streamlit UI、Docker/vLLM 部署用于 OCR,以及 Colab 笔记本。270 M 参数的 Falcon‑OCR 1.5 模型在保持三倍更小体积的同时,实现了与更大 VLM 相当的端到端 OCR 质量。
notepower2k1/CapCap
一款用于视频在地化处理的 Windows 应用程序,利用 Faster-Whisper 等 AI 模型与各种 TTS 引擎来实现自动化的逐字稿制作、翻译与配音。