enricoros/big-AGI
为专家设计的多模型 AI 工作空间,允许用户自带 API 密钥访问数百个模型,同时提供多模型验证工具以减少幻觉。
undertheseanlp/underthesea
一个开源的代理型 AI 工具包和越南语 NLP 库,提供多提供方 LLM 支持和针对越南语的专用文本处理工具。
AnswerDotAI/llms-txt
一项提案,旨在通过标准化使用 /llms.txt 文件,为 AI 代理提供简洁、格式化的 Markdown 摘要和网站上干净内容的链接。
Mochocyang/QMAI
面向长篇小说的内存中心AI写作桌面系统,通过结构化记忆摄入与混合检索防止情节漏洞与角色漂移。
naqashafzal/AI-Content-Studio
一个自动化 AI 视频和播客生成器,可将长篇 YouTube 视频转换为病毒式短视频,并从文本提示生成 AI 驱动的播客。
facebook/ThreatExchange
一组用于内容审核和安全威胁情报的工具和 API,包含用于相似性匹配的图像和视频哈希算法。
OctoMap/octomap
一种基于八叉树的高效概率 3D 地图框架,使机器人能够高效地表示和追踪 3D 环境中的占据、空闲和未知空间。
strnad/CrewAI-Studio
CrewAI Studio 是一个基于 Streamlit 的 GUI,支持通过 Conda、虚拟环境、Docker 或一键部署轻松安装。它允许您设计、运行和导出基于 CrewAI 框架的多代理 AI 团队,支持多种 LLM 提供方和自定义工具。
huggingface/AnyLanguageModel
AnyLanguageModel 是一个 Swift 包,用统一 API 替代 Apple 的 FoundationModels 导入,支持 Apple、Core ML、MLX、llama.cpp、Ollama、OpenAI、Anthropic、Gemini 等众多 LLM 提供方。它提供 `LanguageModelSession` 用于提示,通过 `@Generable/@Guide` 实现 Swift 结构体的引导生成,支持工具调用并附带代理钩子,可选图像输入,并通过基于特性的依赖选择机制保持二进制文件体积小。安装通过 SwiftPM 完成;通过特性(`CoreML`、`MLX`、`Llama`)启用后端。安全建议警告不要硬编码 API 密钥,推荐将用户密钥存入 Keychain 或使用代理服务器。目标为 Swift 6.1+、iOS 17/macOS 14+,支持设备端和云 API。
elara-labs/code-context-engine
通过使用针对性的语义搜索和检索取代全文件读取,降低 AI 编程助手成本的本地代码库索引引擎。
NoKV-Lab/NoKV
为临时 AI 代理沙箱提供持久化、版本化工作区的提供者,通过原子元数据控制确保资产谱系和状态的持续存在。
Topdu/OpenOCR
一个开源工具包,提供轻量级模型,实现统一的文本、公式和表格识别以及文档解析。
unslothai/unsloth-zoo
Unsloth 的一个实用库,可显著降低显存需求,实现更快、更高效的 LLM、视觉模型和 TTS 模型微调。
open-edge-platform/geti
一个端到端的视觉 AI 应用和库,可快速构建、标注、训练和部署针对边缘硬件优化的计算机视觉模型。
edouard-claude/snip
一个使用声明式 YAML 管道在 AI 编码助手接收前过滤冗余 shell 输出的 CLI 代理,可将 token 使用量减少 60-90%。
allweonedev/presentation-ai
一个开源、AI 驱动的演示文稿生成器,通过先创建大纲的工作流,从主题自动生成可自定义的幻灯片。
rsxdalv/TTS-WebUI
一个用于多种开源文本转语音、音频生成和音频转换 AI 模型的统一 Web 界面和管理器。
opengeos/segment-geospatial
一个 Python 包,将 Segment Anything Model (SAM) 适配为地理空间数据使用,使得通过文本、点或框即可轻松分割卫星影像。
bashtage/arch
一个专注于波动率建模(ARCH/GARCH)、单位根检验和协整分析的 Python 金融计量经济学库。
toki-plus/video-mover
一个从文件监控、AI生成字幕到多平台浏览器自动化上传的全自动视频分发流水线。
zjunlp/SkillNet
SkillNet 是一个开源基础设施,将AI代理能力视为可复用、可搜索的软件资产。它提供公共技能库、Python SDK/CLI 和公共 REST API,用于发现、下载、创建、评估、分析和编排这些技能。该平台使代理能够复用现有功能(如PDF解析、网页抓取),而无需重新发明轮子,提供质量评分,构建技能关系图谱,并可为下游LLM代理生成场景特定提示。安装仅需 `pip install skillnet-ai`;搜索或公共下载无需API密钥,而创建/评估/编排则需要LLM API密钥。项目包含Web探索器、MCP服务器、与Claude、OpenAI、OpenClaw、JiuwenClaw的集成,以及ALFWorld、WebShop、ScienceWorld的基准测试脚本。
rpng/MINS
一种灵活融合 IMU、轮式编码器、摄像头、GNSS 和 LiDAR 的多传感器辅助惯性导航系统,可实现鲁棒的机器人定位与在线传感器校准。
clidey/whodb
一个轻量级的、自托管的数据库工作区,用于探索、编辑和查询数据,并提供可选的 AI 驱动的自然语言界面。
atong01/conditional-flow-matching
一个 PyTorch 库,用于条件流匹配,提供无需模拟的训练方法,使图像、表格数据和生物动力学的快速生成建模成为可能。
anliyuan/Ultralight-Digital-Human
一个轻量级数字人模型,专为移动设备上的实时说话头生成而设计,可通过短视频进行个性化训练。
agentuniverse-ai/agentUniverse
agentUniverse 是一个 Apache-2.0 许可的 Python 框架,用于构建和编排 LLM 驱动的多智能体应用。它提供即用型协作模式(PEER、DOE),支持数十个 LLM 提供商,包含领域知识注入工具、基于 OpenTelemetry 的可观测性,以及可视化工作流 UI。该库已在蚂蚁集团的真实金融产品中使用,并提供丰富的文档、示例应用和 GitHub/Discord 社区。
ouguangjun/Leg-KILO
专为高动态运动设计的实时LiDAR SLAM系统,为四足机器人及其他移动平台提供稳健的位姿估计与地图构建能力。
huangjunsen0406/py-xiaozhi
py‑xiaozhi 是一个基于 Python 的异步优先框架,用于构建可以倾听、说话、观察并控制硬件的多模态 AI 助手。
embeddings-benchmark/mteb
一个用于评估嵌入(embeddings)与检索系统的多模态工具箱,提供标准化的基准测试与排行榜,用于比较模型性能。
rapidaai/voice-ai
一个为代理机构和企业打造的开源语音 AI 编排平台,可帮助其在不被供应商锁定的情况下构建和部署可扩展、实时的语音代理。
KdaiP/EchoBot
一款配备 Live2D 动画头像的 AI 助手,将角色扮演与后台代理任务分离,既提供情感陪伴,又具备技术生产力。
google-github-actions/run-gemini-cli
一个将 Gemini AI 集成到开发工作流中的 GitHub Action,可自动完成 PR 审查、问题分类,并在 GitHub 内提供对话式 AI 协助
lucasjinreal/Crane
Crane 是一个基于 candle 的 Rust 推理框架,可在 CPU、CUDA、Metal 和实验性 ROCm 上快速运行 LLM、视觉语言模型、OCR、ASR、TTS 和音乐转录。它可直接加载 GGUF 检查点,提供干净的 Rust API 和 OpenAI 兼容 HTTP 服务器,并附带可立即使用的聊天、图像聊天、OCR、语音等演示二进制文件。
opencv/opencv_contrib
这是一个用于 OpenCV 实验性及社区贡献额外模块的仓库,作为这些功能移至官方核心发行版之前的测试场。
kaixxx/noScribe
一款免费、开源的用于本地音频转录和说话人识别的应用程序,专为研究人员和记者设计,以确保数据隐私。
specstoryai/getspecstory
一个本地优先的知识管理系统,可捕获、索引并使所有与 AI 编码助手在各种 IDE 和 CLI 工具中的互动可被搜索。
modelscope/ms-agent
一个轻量级框架,用于构建能够通过知识驱动技能系统执行深度研究、代码生成和多模态任务的自主代理。
sjtuyinjie/Ultra-Fusion
一个在轮式、腿式和空中机器人中,即使在传感器退化或校准错误情况下也能保持精确定位的稳健、紧密耦合的多传感器SLAM框架。
InternRobotics/NavDP
NavDP 是一个使用扩散策略的端到端无地图导航模型,能够实现从仿真到现实的迁移,使机器人在不同机器人实体之间实现实时路径规划与障碍物避让。
EmergenceAI/Emergence-World
一个持久的、模拟的世界,其中具有独特个性和记忆的自主 AI 代理构建社会、自我治理并随时间演化,以研究涌现行为。
aardio/ImTip
一个提供光标旁输入法状态指示器和可编程 AI 驱动热键的 Windows 桌面助手,用于翻译和生产力提升。
bytedance/agentkit-samples
AgentKit(火山引擎提供的企业级 AI Agent 平台)的教程和参考实现集合,涵盖从基础对话到复杂多代理系统和 RAG 的全部内容。
zs1083339604/FaceWinUnlock-Tauri
一款利用 OpenCV 和自定义凭据提供程序,使无原生 Windows Hello 硬件的设备也能实现人脸识别解锁的 Windows 工具。
ibm-granite/granite-tsfm
一套用于处理 IBM 的 Granite 时间序列基础模型进行预测的实用工具、笔记本和部署组件集合。
isaac-sim/IsaacLab-Arena
Isaac Lab‑Arena 是 NVIDIA Isaac Lab 的一个阿尔法阶段开源扩展,允许通过混合可重用的 *场景*、*实体* 和 *任务* 原语来构建机器人仿真环境。它在运行时组装这些组件,支持顺序任务链、自然语言物体放置和大规模并行评估,使基准测试或训练通用机器人策略变得更加容易。安装可通过 `uv` Python 管理器或提供的 Docker 镜像完成;该库仅支持 Linux,需要 NVIDIA GPU 和 Isaac Sim。项目采用 Apache 2.0 许可证(包含专有的 Isaac Sim 组件),旨在用于研究而非生产。
microsoft/SwiftStreamingMarkdown
专为 LLM 流式传输优化的 iOS 和 macOS Markdown 渲染器,提供流畅过渡、LaTeX 支持和内联引用 UI。
mavlink/mavlink
轻量级、仅头文件的消息序列化库,用于无人机与地面控制站之间的高效通信。
cvg/GeoCalib
GeoCalib 是一个研究级 Python 库,通过深度网络结合几何优化,从单张图像预测相机内参和场景重力方向。支持多种镜头模型、部分先验、批量处理和多相机阵列标定,并附带易安装的推理代码、Gradio 网页演示、Colab 笔记本和实时网络摄像头演示。预训练模型在 OpenPano 数据集(约 37k 个来自 HDR 全景图的透视裁剪图像)上训练,已在 LaMAR、MegaDepth、TartanAir 和 Stanford2D3D 等基准上达到最先进水平。