yxlllc/DDSP-SVC
一个高效的歌唱音色转换项目,相比传统 SVC 模型,显著降低了硬件需求并大幅缩短训练时间,实现高质量 AI 语音变换。
AIStream-Peelout/flow-forecast
一个开源的深度学习框架,用于时间序列预测、分类和异常检测,包含大量最先进的模型。
googleapis/js-genai
适用于TypeScript和JavaScript的官方Google Gen AI SDK。提供对Gemini 2.0+模型和功能的统一接口,同时支持Developer和Enterprise平台。
intelligent-machine-learning/dlrover
一个在 K8s 和 Ray 上提供自动故障容错、自动扩缩容和快速检查点恢复的自动分布式深度学习系统,简化大规模 AI 模型训练。
fan-ziqi/rl_sar
用于四足、轮式和人形机器人强化学习策略的仿真验证与物理部署的框架。
suyiiyii/AutoGLM-GUI
AutoGLM‑GUI 是一个桌面/Docker 应用,允许 LLM 通过 ADB 控制 Android 手机。它提供基于聊天的任务执行、分层规划/执行代理、实时屏幕预览、多设备管理、cron 调度、工作流保存、对话历史记录,以及用于与其他 AI 工具集成的 MCP API。
itsmostafa/aws-agent-skills
一个为 Claude Code 和 Codex CLI 设计的插件,为 18 个核心 AWS 服务提供经过筛选、LLM 优化的知识库,实现自动化云工程。
zilliztech/VectorDBBench
VectorDBBench 是一个 Python CLI 工具,可在众多开源和云向量数据库上对插入、向量搜索、过滤搜索和全文 BM25 检索进行基准测试。它内置标准 ANN 数据集(SIFT、GIST、Cohere、OpenAI 嵌入)和较新的多模态 Hugging Face 数据集,报告延迟/召回率/QPS 和云成本,并提供可视化 UI 以比较结果。
huohua325/Memslides
MemSlides 是一个开源、具备分层记忆的 LLM agent 框架,可创建个性化幻灯片,并支持多轮、局部化的修改。它维护用户配置、工作记忆与工具记忆,以保持偏好一致性并避免重复劳动,并提供 CLI 与 Docker 镜像,方便进行实验。
superxslam/SuperOdom
为使用 ROS 2 的机器人提供鲁棒的位姿估计和退化检测的轻量级 LiDAR-惯性里程计与建图系统
aws-samples/sample-mobile-ai-assistant
一款适用于Android、iOS和macOS的跨平台AI助手应用,支持实时聊天、多模态分析以及通过多种LLM提供商即时创建Web应用。
cuga-project/cuga-agent
一种企业级智能体框架,提供通用智能体框架,用于快速部署领域特定智能体,内置编排、安全策略以及混合 API/浏览器执行功能。
dimastatz/whisper-flow
一个基于 OpenAI Whisper 的实时转写服务,通过流式处理而非批量处理,提供低延迟的语音转文字功能。
WeChatCV/Stand-In
通过仅训练 1% 的额外参数,保持高主体一致性的轻量级、即插即用身份保留型视频生成框架。
AIFrontierLab/TorchUMM
一个用于多模态模型推理、评估和后训练的统一框架,通过单一接口支持图像理解、生成和编辑。
zh-plus/openlrc
一个使用 faster-whisper 进行音频转录,并利用 LLM 将文本翻译并润色为同步 .lrc 字幕的 Python 库。
OpenRouterTeam/ai-sdk-provider
一个用于 Vercel AI SDK 的 OpenRouter 提供者,通过统一接口访问超过 300 种 LLM 和嵌入模型。
gmickel/flow-next
Flow‑Next是编码代理(Claude Code、OpenAI Codex、Cursor等)的插件,将变更请求转换为持久规格说明,然后自动驱动规划、实现、对抗性审查、实时QA和PR创建,并在仓库中记录所有证据。
machinewrapped/llm-subtrans
LLM‑Subtrans 是一个基于 Python 的桌面和 CLI 工具,使用 LLM API(Gemini、OpenAI、Anthropic 等)翻译字幕文件(SRT/ASS/VTT)。支持可插拔字幕格式、可选音频转录、项目文件续传及多种高级 CLI 选项。可通过预构建的 Windows/macOS 安装包或虚拟环境安装程序从源码安装;通过简单 GUI 或命令行运行,只需提供 API 密钥即可使用。
a-bonus/google-docs-mcp
一个连接 AI 助手与 Google Docs、Sheets、Drive、Gmail 和 Calendar 的 MCP 服务器,使 LLM 能够读取和管理 Workspace 数据。
saidsurucu/borsa-mcp
一个为 LLM 提供 Borsa Istanbul、美国股票、TEFAS 基金和加密货币的实时与历史金融数据的 MCP 服务器,支持 AI 驱动的金融分析。
NadirRouter/NadirClaw
一个本地 LLM 路由代理,通过将提示词路由到最便宜的可行模型,并仅在必要时升级到高级模型,将 API 成本降低 40-70%。
google-deepmind/simply
一个基于 JAX 的极简且可扩展的研究代码库,旨在为人类和 AI 智能体实现快速的 LLM 迭代和自动化的 AI 研究。
aiqm/torchani
TorchANI 2.0 是一个 PyTorch 库,用于训练和使用 ANI 风格的神经网络原子间势能,提供 GPU 加速的能量/力预测以及分子动力学和 ML/MM 模拟工具。
flagos-ai/FlagScale
FlagScale 是 FlagOS 生态系统的一体化工具包,为在多种 AI 硬件芯片上训练、强化学习和推理大模型提供统一接口。
Graylab/IgFold
IgFold是一种从氨基酸序列预测抗体3D结构的深度学习工具,能够为药物发现提供快速准确的结构建模。
kitoweeknd/RFUAV
RFUAV提供一个公开可用的RF信号数据集,用于无人机检测/识别,并附带Python/MATLAB工具,可将原始IQ记录转换为谱图,训练视觉风格分类器(ResNet、ViT等)或YOLOv5检测器,并在广泛SNR范围内评估性能。
milanglacier/minuet-ai.el
一个由 LLM 驱动的 Emacs 代码补全包,支持多个提供商以及基于聊天和 Fill-in-the-middle (FIM) 补全模式。
sonichi/sutando
一款适用于 macOS 的个人 AI 代理,集成了语音、视觉和系统访问,用于管理会议、通话和数字任务,同时自主改进自己的代码。
escalante-bio/mosaic
mosaic 是一个基于 JAX 的 Python 库,为数十种蛋白质属性和结构预测模型提供统一、可梯度优化的接口。通过允许用户组合可微分的损失项(结合亲和力、稳定性、溶解性、逆折叠似然等)并使用自定义优化器运行连续松弛设计,它在单一、JIT 加速的框架中实现了多目标蛋白质工程。该仓库包含众多前沿模型(Boltz、AlphaFold、OpenFold‑3、Protenix、ProteinMPNN、ESM 等)、示例笔记本和详细文档,但要求用户调整超参数并安装 GPU/TPU 兼容的 JAX。
visualbruno/ComfyUI-Hunyuan3d-2-1
这是一个为腾讯 Hunyuan3D-2.1 模型开发的 ComfyUI 封装器,可以在可视化节点工作流中生成带有纹理的 3D 模型。
NevermindNilas/TheAnimeScripter
专为动画设计的AI驱动视频增强工具包,可在单次处理中实现放大、运动插值和修复。
meta-prompting/meta-prompting
一种提示框架,使用结构化模板而非具体示例来改善 LLM 推理,为自动化提示工程提供形式化的数学基础。
vllm-project/compressed-tensors
一个扩展 safetensors 格式的库,旨在为各种 LLM 压缩和量化方案提供统一的存储和管理系统。
voska/hass-mcp
一个将 Home Assistant 与 LLM 集成的 MCP 服务器,使 AI 助手能够通过自然语言控制设备、管理仪表盘并排查自动化问题。
Xerophayze/TTS-Story
支持多种本地和云端语音引擎的基于网页的多语音 TTS 应用,适用于制作有声故事和有声书。
remorses/usecomputer
usecomputer 是一个跨平台CLI(以及TypeScript库),可在macOS、Linux和Windows上让AI代理执行截图、坐标映射、鼠标/键盘操作(点击、拖拽、输入、滚动)。它使用原生Zig后端,提供精确的屏幕-图像映射的coord-map系统,通过SSE流式传输全局输入事件,并支持Kitty Graphics Protocol以代理友好的方式交付图像。
Lixsp11/sekai-codebase
Sekai 是一个高质量的自我中心(egocentric)视频数据集,包含超过 5,000 小时的已标注第一人称和无人机视角视频,用于世界探索与生成。
google-deepmind/physics-IQ-benchmark
一个高质量的基准测试数据集和工作流程,用于使用真实世界镜头评估生成式视频模型的物理理解能力和真实感。
Eyeline-Labs/Vista4D
Vista4D 是一个视频重拍框架,使用 4D 点云从源视频中通过新相机轨迹和视角合成动态场景。
Intellindust-AI-Lab/EdgeCrafter
EdgeCrafter 提供专为边缘设备优化的紧凑视觉变换器(ViTs),实现低延迟下的高性能目标检测、实例分割和姿态估计。
yan5xu/codexloom
CodexLoom 是一个自托管平台,为 Codex 聊天代理添加持久身份、个人资料和组织工具,支持长期运行的“领域代理”,可从多个设备访问,通过有界消息通信,并可通过接口代理暴露给外部聊天平台(Feishu、Slack、Parall)。面向高级单人用户,提供 UI、CLI 和治理功能,采用 Elastic License 2.0 发布。
microsoft/LMOps
一项聚焦于基础技术的研究计划,旨在提升 LLM 提示、推理速度与上下文处理,以打造 AI 产品。
lightly-ai/lightly-studio
一个使用嵌入来帮助用户高效管理与标注图像和视频数据的本地优先数据整理与标注工具。
cvg/glue-factory
A library for training and evaluating deep neural networks that extract and match local visual features, supporting state-of-the-art models like LightGlue and GlueStick.
goodrain/rainbond
一个开源容器平台,允许用户通过图形界面在 Kubernetes 上部署和管理应用程序与 AI 服务,无需具备 Kubernetes 专业知识。
Alluxio/alluxio
一个分布式缓存平台,通过桥接计算框架与各种存储系统之间的鸿沟,来加速数据密集型分析工作负载。
foxglove/foxglove-sdk
通过流式传输或 MCAP 文件记录和可视化多模态机器人数据的库集合,支持 Python、C++、Rust 和 ROS。