tensorflow/java
TensorFlow‑Java 提供可发布到 Maven 的 Java/JVM 绑定,包括低级 JNI 包装(`tensorflow‑core`)、高级神经网络 API(`tensorflow‑framework`)以及独立的 ndarray 库。支持 Linux(x86_64、arm64)和 macOS(Apple Silicon)二进制文件,可选 GPU 构建,并与标准 Java 构建工具集成。
mistralai/client-python
Mistral AI 的云 API(聊天、嵌入、音频、文件、代理等)官方 Python SDK。通过 pip/uv/poetry 安装,设置 `MISTRAL_API_KEY`,即可同步或使用 `asyncio` 调用 `client.chat.complete(...)`。包含 Azure 和 GCP 封装,支持流式传输、分页、重试等。
nextcloud/recognize
一个使用本地 AI 模型自动对照片、视频和音乐进行分类的 Nextcloud 智能媒体标签应用
inclusionAI/Ming
Ming-flash-omni 2.0 是一个开源的全模态MLLM,通过单一MoE架构统一了文本、图像、音频和视频的多模态感知与生成。
cgnomads/GSOPs
一个 SideFX Houdini 插件,为 VFX 生产提供全面的高斯点云场景导入、编辑和动画工具集。
sambanova/bloomchat
BLOOMChat 是一个从开源 BLOOM 模型微调而来的 1760 亿参数多语言聊天 LLM。该仓库提供了数据准备、分词和训练脚本(后者用于 SambaNova 的 RDU 硬件),以及使用 Hugging Face 的 Bloom 推理代码的详细 GPU 推理说明。这是一个真正的大规模 LLM 项目,旨在帮助研究人员和开发者复现或运行该模型。
remyxai/VQASynth
一个将图像数据集转换为空间 VQA 数据集的流水线,以提升视觉-语言模型的 3D 空间推理和距离估计能力。
smartscanapp/smartscan-android
一款使用设备端处理和自动媒体分组,将图片和视频转换为可搜索个人知识库的 Android 应用。
AIGeeksGroup/3D-R1
3D-R1 是一种通用 3D 视觉-语言模型,通过合成 CoT 数据和强化学习提升空间推理与场景理解能力。
kozistr/pytorch_optimizer
一个与 PyTorch 兼容的库,通过单一且一致的 API,整合了 100 多种研究型优化器、多种学习率调度器(LR schedulers)和损失函数,并提供低精度训练的选用整合功能。
OmniCustom-project/OmniCustom
OmniCustom 是一个联合音视频生成框架,基于参考输入和文本提示生成保持特定视觉身份和声音音色的同步视频。
kyegomez/ScreenAI
一个专为理解用户界面和信息图而设计的 ScreenAI 视觉-语言模型的实现。
Cerlancism/chatgpt-subtitle-translator
一个使用 OpenAI ChatGPT API(或兼容服务)的 Node.js CLI/Web UI,可逐行翻译 SRT 字幕文件,保留时间戳。支持批量处理、结构化 JSON 输出、提示缓存、可选审核,以及用于更丰富翻译的高级多轮“代理”模式。
HUANGLIZI/LViT
LViT 是一个结合语言和视觉变换器的多模态框架,旨在提升 CT 扫描及其他医学影像中医学图像分割的准确性。
MME-Benchmarks/Video-MME-v2
一个用于评估 MLLM 视频理解能力的稳健基准,采用三级渐进难度量表和分组非线性评分机制,以衡量真实的时间推理能力。
software-mansion-labs/private-mind
一款完全离线的移动 AI 应用,可在设备上实现私密、本地化的聊天、文档分析和多模态交互,无需依赖云服务。
VrchStudio/comfyui-web-viewer
一个为 ComfyUI 设计的自定义节点集合,通过集成流媒体和 MIDI、OSC、游戏手柄等外部控制,实现 AI 艺术的实时互动。
ixaxaar/pytorch-dnc
一个 PyTorch 库,实现可微神经计算机(DNC)、稀疏 DNC(SDNC)和稀疏访问记忆(SAM),包含安装说明、API 使用方法、调试支持和示例训练任务(复制、加法、argmax)。
tianclll/Ace-Translate
一款专注于隐私的离线文档翻译工具,使用本地 LLM 和 OCR 翻译多种文件格式,同时保留原始版面布局。
PipeNetwork/kimi-k3-mlx
一个 Moonshot 的 Kimi-K3 多模态 MoE 模型的 MLX 版本,支持流式转换器和 REAP 剪枝,可在 Apple Silicon 上运行。
pipecat-ai/pipecat-client-web
用于连接和与使用 Pipecat 框架构建的语音和多模态 AI 应用程序交互的 Web 客户端 SDK 和 React 库。
facebookresearch/mmf
MMF 是一个基于 PyTorch 的模块化视觉与语言多模态研究框架,提供最先进模型的参考实现以及分布式训练工具。
om-ai-lab/VLM-FO1
VLM-FO1 是一个用于视觉语言模型(Vision-Language Models)的即插即用模块,能够在不损害通用推理能力的情况下,增强细粒度感知和空间意识。
OpenEnvision/Awesome-Multimodal-Modeling
Awesome‑Multimodal‑Modeling 是一个社区维护的“awesome-list”,全面调查多模态 AI 模型。它定义了四个清晰的类别——Traditional、MLLMs、Unified 和 Native——解释其架构差异,并链接到 Hugging Face 上的开源模型集合。该仓库为需要结构化视角来理解快速演进的多模态领域的研究人员和工程师提供支持。
Sharrnah/whispering-ui
Whispering Tiger 应用程序的原生 Windows UI,可实现音频流和游戏内图像的实时转录与翻译。
ardha27/AI-Waifu-Vtuber
一款集成了语音识别、LLM 和文本转语音技术的 AI 驱动 VTuber 助手,用于创建用于直播和个人使用的交互式虚拟角色。
tongjingqi/Thinking-with-Video
一种全新的多模态推理范式和基准测试 (VideoThinkBench),用于评估视频生成模型解决复杂视觉和文本推理任务的能力。
AceDataCloud/Nexior
Nexior 是一个 MIT 许可的 Vue 基础应用,将 40 多个聊天、图像、音频和视频 AI 模型整合到一个可自托管的统一界面中。支持一键 Vercel 或 Docker 部署,BYOK 或单个 AceData 密钥,内置用户账户、支付和推荐机制,是 AI 产品即用型 SaaS 的理想起点。
awekrx/ChatGPT-MidJourney-prompt
一个利用 LLM 根据简单的文本提示为 MidJourney 图像自动生成详细且具创意提示词的 Python 库。
HorizonWind2004/reconstruction-alignment
一种用于统一多模态模型的自我监督式后训练方法,通过训练模型从其自身的视觉特征中重建图像,从而提升图像生成与图像编辑能力。
Licoy/GoAmzAI
一个为个人与企业设计的私有化、多模态 AIGC 平台,将文本、图像、视频、音乐和 PPT 生成功能整合进一个统一的管理系统。
a616567126/GPT-WEB-JAVA
一个基于Java的Web平台,将GPT、Midjourney和Stable Diffusion整合为具备用户管理和支付系统的商业AI服务。
lone-cloud/gerbil
SUMMARY: 一个跨平台桌面应用程序,用于在您自己的硬件上运行本地文本和图像生成,具有集成模型搜索和对各种 GPU 加速器的支持。
SkyworkAI/UniPic
一个用于图像生成、编辑和理解的统一多模态模型系列,具有高速多图编辑和自回归建模能力。
noahgsolomon/brainrot.js
一个使用 Groq、OpenAI 与 Speechify,自动生成包含名人声音克隆和生成内容的 AI 视频的工具。
Fabric-Project/Fabric
一个基于视觉节点的创意编码环境,用于在 macOS 上快速原型设计交互式 3D 图形、图像/视频处理和 AI 增强视觉。
askui/python-sdk
一个 Python SDK,让 AI agent 可以通过基于视觉的自动化,而非脆弱的 UI selector,来控制桌面和移动端设备。
IliasHad/edit-mind
一个本地视频知识库,通过转录和视觉分析为视频建立索引,以实现对视频内容的自然语言语义搜索。
nv-tlabs/XCube
XCube 是一款用于高分辨率稀疏 3D 体素网格的生成模型,它利用分层潜在扩散和 VDB 数据结构来创建精细的 3D 物件和大规模场景。
FoundationVision/Liquid
Liquid 是一个统一的自回归多模态生成器,将视觉理解和图像生成整合到单一 LLM 中,无需外部视觉嵌入。
WHU-USI3DV/VistaDream
VistaDream 是一个无需训练的框架,通过确保生成的新视角之间的一致性,从单张视图图像重建高质量 3D 场景。
OpenDCAI/OpenWorldLib
一个用于先进世界模型的统一代码库和框架,整合了用于视频生成、3D 场景生成和视觉-动作推理的各种开源研究。
livekit/python-sdks
LiveKit Python SDK 提供异步客户端工具,用于加入 LiveKit 房间、发布/接收音视频轨道、执行 RPC 调用以及控制硬件编码器。配套的 `livekit-api` 包封装了 LiveKit 的服务器 REST 端点,用于房间创建、令牌生成、SIP、导出等功能。它还与 LiveKit Agents 集成,支持结合 STT、LLM 和 TTS 模型的语音 AI 机器人。
ChilloutCharles/BrainFlowsIntoVRChat
一个将生物传感器的 EEG 和生物指标数据转换为 OSC 参数的工具,使 VRChat 实现脑控头像动画和效果。
Nutlope/make-comics
一个利用 Google Flash Image 2.5 和 Qwen3 80B 生成故事、角色和画面的 AI 驱动漫画创作工具。
vual/lobe-chat-pro
Lobe Chat Pro 是一个开源、自托管的 AI 聊天平台(lobe‑chat 的分叉),增加了完整的管理控制台、用户/分组管理、多供应商模型定价、支付集成(WeChat、Stripe 等)以及用于图像、音乐和视频生成的多模态“无限画布”面板。可通过 Docker 以三种形式部署:完整后端、仅网关登录、仅网关无登录。
GitHpriyanshu23/Smart-Plant-Doctor
一个结合 ESP32 实时环境传感、基于图像的疾病检测以及 Gemma 4 驱动的护理助手的 AI 与物联网植物健康平台。
worm128/AI-YinMei
集成了 LLM、流式 TTS 和虚拟形象的一站式 AI 直播平台,可为多个直播平台创建交互式 AI 机器人。