new-sankaku/manga-editor-desu
一个结合专业布局与文字排版工具,并支持可选AI图像生成和LLM提示辅助的网页漫画创作工具。
EvolvingLMMs-Lab/NEO
NEO 是一系列原生视觉语言模型,采用无编码器密集架构,统一了像素与文字处理,以实现高效的多模态理解。
TIGER-AI-Lab/VLM2Vec
一个用于训练和评估全模态嵌入模型的统一框架,该模型可为文本、图像、视频、音频和视觉文档生成固定维度的向量。
roboflow/maestro
一个用于加速 Florence-2、PaliGemma 2 和 Qwen2.5-VL 等多模态视觉语言模型微调的精简工具。
R3gm/SoniTranslate
SoniTranslate 是一个用于将视频翻译成不同语言并同步音频的网页应用,将转录、翻译和语音配音整合在一个界面中。
ailia-ai/ailia-models
包含419个跨视觉、音频和文本等不同领域的预训练AI模型,全部可通过统一CLI运行,并自动下载权重。
ohdearquant/lionagi
lionagi 是一个用于构建、运行和治理多智能体 LLM 工作流的 Python 库和 CLI。它提供类型化、持久化的对话状态,支持并行扇出和基于 DAG 的流程,集成模型专用 CLI 与 API 提供者,并包含用于可视化运行管理的 Web UI(Lion Studio)
nikvdp/cco
cco 是一个用于 AI 编码代理(如 Claude Code、Codex 等)的沙箱包装器,可在隔离环境中运行它们,以保护您的系统免受提示注入和意外损坏的影响,同时保持无缝的终端体验。
Sportinger/MasterSelects
一个浏览器端媒体编辑器,支持视频、音频和 3D 编辑,允许 AI 编码代理在创作过程中直接将新工具和效果构建到工作区中。
OfficeDev/microsoft-365-agents-toolkit
由 Microsoft 提供的工具包(VS Code/Visual Studio 扩展和 CLI),用于为 Microsoft 365 Copilot、Teams 和 Office 构建 AI 驱动的代理、聊天机器人及其他扩展。集成了认证助手、Azure Functions 支持、热重载调试和 CI/CD 管道,面向 JavaScript/TypeScript 和 .NET 开发者。
shrimbly/node-banana
用于跨多个提供方构建图像、视频、音频和 3D 内容复杂 AI 媒体生成流水线的可视化节点工作流编辑器。
modelstudioai/cli
Aliyun Model Studio CLI (bailian‑cli) 是 Alibaba Cloud AI 平台的终端工具,提供用于多模态生成(文本、图像、视频、语音)、资产理解、托管代理编排、数据集验证、微调、部署和账户管理的命令。可通过 npm 或单行脚本安装,使用 API 密钥或 OAuth 认证后,执行 `bl …` 命令,或让 AI 代理将自然语言提示翻译为 CLI 调用。
NetManAIOps/ChatTS
ChatTS 是一种专为多变量时间序列设计的多模态 LLM,能够原生理解并推理时间序列数据,使用户可以对数值数据进行对话式问答。
jimmysu0309/shinkansen
Shinkansen 是一款真正的 AI 驱动浏览器扩展程序,使用 Google Gemini、Google Translate 或自定义 OpenAI 兼容模型来翻译网页、YouTube 字幕和文档(PDF、Word、EPUB 等)。它保留原始布局和时间戳,提供双语输出,并在本地处理文件以保护隐私。
Graylab/IgFold
IgFold是一种从氨基酸序列预测抗体3D结构的深度学习工具,能够为药物发现提供快速准确的结构建模。
apple-aiml-research/ml-fastvlm
FastVLM 是一种高效的视觉编码框架,采用名为 FastViTHD 的混合编码器,可大幅降低高分辨率图像在视觉语言模型中的延迟和 token 数量。
apple-aiml-research/ml-flextok
FlexTok 是一种将图像重采样为灵活长度的 1D 令牌序列的系统,允许图像以可截断的序列形式表示,同时仍能实现图像重建。
merveenoyan/smol-vision
一系列用于缩小、优化和定制前沿视觉与多模态 AI 模型的配方,以提升效率和性能。
sign/translate
一个实时双向翻译系统,可将手语视频转换为口语文本和音频,也可将口语转换为通过角色或GAN生成的手语。
Pangu-Immortal/MagicWX
一款使用 ONNX、MediaPipe 和 MNN 等本地运行时实现完全离线文本聊天和 Stable Diffusion 图像生成的 Android 应用。
AIFrontierLab/TorchUMM
一个用于多模态模型推理、评估和后训练的统一框架,通过单一接口支持图像理解、生成和编辑。
aiqm/torchani
TorchANI 2.0 是一个 PyTorch 库,用于训练和使用 ANI 风格的神经网络原子间势能,提供 GPU 加速的能量/力预测以及分子动力学和 ML/MM 模拟工具。
escalante-bio/mosaic
mosaic 是一个基于 JAX 的 Python 库,为数十种蛋白质属性和结构预测模型提供统一、可梯度优化的接口。通过允许用户组合可微分的损失项(结合亲和力、稳定性、溶解性、逆折叠似然等)并使用自定义优化器运行连续松弛设计,它在单一、JIT 加速的框架中实现了多目标蛋白质工程。该仓库包含众多前沿模型(Boltz、AlphaFold、OpenFold‑3、Protenix、ProteinMPNN、ESM 等)、示例笔记本和详细文档,但要求用户调整超参数并安装 GPU/TPU 兼容的 JAX。
PozzettiAndrea/ComfyUI-Sharp
Apple 的 SHARP 模型的 ComfyUI 封装器,可在不到一秒内从单张图像实现 3D 高斯点云。
2U1/Qwen-VL-Series-Finetune
用于微调Qwen-VL系列模型(Qwen2-VL、Qwen2.5-VL、Qwen3-VL、Qwen3.5)的训练工具包,支持SFT、DPO、GRPO和多模态数据。
tong-io/tongflow
TongFlow 是一个开源的可视化工作室,允许您通过连接简单的“添加”、“转换”和“合并”节点来构建多模态生成式 AI 流水线。它支持文本、图像、视频、音频、3D 和文档,拥有丰富的插件生态系统(官方 API 插件、路由器和 GPU/CPU 计算插件),可通过轻量级桌面客户端或自托管后端使用。采用 AGPL-3.0 许可证。
Simbastack-hq/framedex
一个为视频和照片档案生成纯文本 AI 描述、转录和元数据侧车文件的可查询知识库。
geekyutao/Inpaint-Anything
一个结合SAM和生成式修复模型的统一框架,可实现图像、视频和3D场景中的对象移除、填充或替换。
dai-hongtao/InkTime
一款 AI 驱动的 e-ink 相框,利用视觉模型对回忆进行评分和标注,每天展示“历史上的今天”中最精彩的照片。
AlexGladkov/claude-in-mobile
`mcp-devices`(又名 `claude‑in‑mobile`)是一个模块化的 Node/Rust 服务器,允许 Claude 风格的 AI 代理控制 Android、iOS、网页、桌面、Aurora 和 HarmonyOS 设备。安装基础包(`npm i -g mcp-devices`),添加平台插件(如 `@mcp-devices/plugin-android`),启用它们,并将 MCP 兼容客户端指向服务器。该工具提供截图、点击、UI 检查、实时调试和测试等功能,支持 AI 驱动的设备自动化和具身智能体研究。
OTeam-AI4S/ODesign
一个全原子生成式世界模型,用于设计能与特定靶标结合的蛋白质、配体和核酸。
qntx/ovo
Ovo 是一个 Rust 库,提供可嵌入的多代理运行时内核。它允许宿主应用程序启动轻量级代理(称为“回合”),这些代理运行 Rhai 脚本,并可选择性地使用操作系统级别的沙箱(macOS Seatbelt 或 Linux Landlock)。该库提供了可配置的审批策略、沙箱后端 trait,以及可选的工具包功能以实现受限制的文件系统访问。目前版本为预稳定版(0.9.x),采用 MIT/Apache-2.0 双重许可。
facebookresearch/MetaCLIP
一种全球扩展的CLIP配方,可在不降低英语性能的前提下实现高性能多语言图像-文本对齐
skrub-data/skrub
skrub 是一个 Python 库,提供以数据框架为中心的清理、编码和相似性分组工具,全部包装为 scikit-learn 兼容的转换器,以简化表格机器学习管道的预处理阶段。
liangnjupt/VisTouch
用于材料识别和跨模态学习的机器人滑动接触的大型同步视频、音频和触觉力数据集。
livekit/rust-sdks
LiveKit 的 Rust 客户端 SDK,支持跨桌面与移动端的实时视频/音频/数据流串流、房间管理以及硬件加速编码。
pinellolab/DNA-Diffusion
一种基于扩散模型的生成式模型,用于创建 200bp 的细胞类型特异性合成调控 DNA 序列。
OpenMOSS/AnyGPT
AnyGPT 是一个开源的多模态大语言模型(文本、语音、图像、音乐),通过离散标记化统一所有模态。它提供基础模型和聊天模型检查点、推理脚本,以及用于训练和零样本多模态任务的 AnyInstruct 数据集。
MoonshotAI/Kimi-K2.5
Kimi K2.5 是一个开源、原生多模态代理模型,采用 1T 参数 MoE 架构,整合视觉与语言理解,实现复杂任务执行。
muthuishere/mcp-server-bash-sdk
MCP 2026-07-28 的纯 Bash 实现,为 AI 代理工具调用提供零开销的 stdio 和本地 HTTP 绑定。自动发现 `tool_*` 函数,使用官方模式验证 JSON,包含完整测试套件,并提供构建自定义 Bash 基 MCP 服务器的逐步文档。
receptron/mulmocast-cli
一个使用 JSON 基础中间语言 MulmoScript 生成视频、播客和幻灯片等多模态内容的 AI 原生演示平台。
lupantech/MathVista
MathVista 是一个用于评估基础模型在视觉上下文中数学推理能力的基准测试,整合了来自 31 个多模态数据集的 6,141 个示例。
jiaxiaogang/HE
he4o 是一个基于 Helix 熵减理论的 AGI 系统,结合预设规则与动态学习,实现具身智能与终身学习。
Yu-Yang-Li/StarWhisper
一个用于自动化天文观测、光变曲线与脉冲星分类,并提供天文学研究专用技能包的AI框架。
gokayfem/ComfyUI_VLM_nodes
面向视觉语言模型的生产级 ComfyUI 节点套件,提供结构化检测、分割和自适应视频推理,并优化 VRAM 使用。
AlekPet/ComfyUI_Custom_Nodes_AlekPet
一组用于 ComfyUI 的自定义节点,添加了提示词翻译、AI 驱动内容生成和图像操作工具。
MatteoFasulo/Whisper-TikTok
一款利用 OpenAI-Whisper 和 Edge TTS 自动生成带有自然语音旁白的字幕 TikTok 视频的 AI 工具。
fudan-generative-vision/Hallo-Live
Hallo-Live 是一个实时文本驱动的框架,使用因果双流 Diffusion Transformer 为数字化身生成同步的音频和视频。