azure-search-openai-demo: 一个用于通过引用和多模态支持查询私有文档的参考 RAG 聊天应用程序
一个参考 RAG 聊天应用程序,允许用户使用 Azure OpenAI 和 Azure AI Search 与自己的文档进行交互。
美国最高法院 Trump v. Slaughter 判决对欧盟‑美国数据传输的影响
美国最高法院在 *Trump v. Slaughter* 案中的裁决剥夺了 FTC 的独立性,因违反欧盟对独立数据监管的要求,威胁了欧盟‑美国数据隐私框架的法律基础。
verl-agent: 一个用于训练具有可定制记忆和步长无关 rollouts 的长程 LLM 智能体的强化学习框架
veRL 的扩展,用于通过强化学习训练 LLM 智能体,其特点是具有步长无关的 rollout 机制,可高效处理长程、多轮任务。
comfyui_LLM_party: 用于构建复杂 LLM 和智能体工作流的 ComfyUI 节点综合套件
一套用于构建 LLM 工作流的 ComfyUI 节点综合套件,支持将 AI 智能体、RAG 和 VLMs 集成到视觉图像生成流水线中。
OpenManus-RL:用于提升 LLM 推理与决策的基于 RL 的智能体调优框架
一个开源框架,利用强化学习优化 LLM 智能体,提升其推理、工具使用和决策能力。
AI 时代技术熟稔度的侵蚀
对从高摩擦计算向 AI 驱动的无缝化转变如何将“与机器搏斗”的亲密熟稔感,替换为对不透明抽象化的依赖进行的反思。
llm-beginner: 通过从零开始的实现来掌握 LLM 和 AI agent 的循序渐进式动手实践课程
一套全面的、动手实践的教程系列,供初学者通过六个循序渐进的实现任务来学习 LLMs 和 AI agents,从构建 mini-GPT 到创建 coding agent。
SkillOpt: 一种使用深度学习风格优化循环实现智能体技能自我进化的执行策略
SkillOpt 是一个将智能体技能文档视为可训练状态的框架,它使用深度学习风格的优化循环来进化并提高智能体性能,而无需修改模型权重。
Knoppix: Live Linux 发行版的先驱
Knoppix 是一个可引导的 Live Linux 系统,允许用户从 CD、DVD 或 USB 驱动器运行完整的操作系统而无需安装,为系统恢复和教育用途开创了 "live" 发行版模式。
韩国宣布 1 万亿美元投资用于存储芯片、数据中心和类人机器人
韩国承诺投入 1 万亿美元,扩大存储芯片产能、建设 AI 数据中心,并在 2028 年前实现类人机器人商业化,以确保在物理 AI 领域的全球领先地位。
Webernetes:将 Kubernetes 移植到浏览器并使用 LLMs
Webernetes 是 Kubernetes 的部分移植到 TypeScript,使其能够在浏览器中完整运行模拟集群,以用于交互式教育内容。
2026年美国中期选举中的加密行业支出
加密货币公司已花费1.89亿美元影响2026年美国中期选举,使其成为本周期最大的企业政治支出者。
CERN LHC 第三次长期停机与向高亮度 LHC 的过渡
CERN 已启动第三次长期停机 (LS3),以将大型强子对撞机 (LHC) 升级为高亮度 LHC (HiLumi LHC),预计运行将会在 2030 年恢复。
Qwen 3.6 27B: 本地 LLM 开发的新黄金平衡点
Qwen 3.6 27B 正在成为一种兼具智能与性能的本地模型,尽管其硬件需求引发了关于本地与云端推理成本效益的争论。
mrpt: 一个功能全面的移动机器人 C++ 框架,具备 SLAM、导航和 3D 可视化功能
一个稳健、模块化的移动机器人 C++ 框架,为 SLAM、导航和传感器集成提供必要的工具。
unrealcv: 连接 Unreal Engine 与 AI 框架以创建合成计算机视觉环境的桥梁
UnrealCV 是 Unreal Engine 的一个插件,允许计算机视觉研究人员通过编程方式与虚拟世界交互以生成合成数据,并集成了 PyTorch/Tensorflow。
paperlib: 一个具有 AI 驱动摘要和语义库搜索功能的开源学术论文管理器
一款开源学术论文管理工具,简化了元数据抓取和组织,具有 LLM 驱动的摘要和语义搜索功能。
bgslibrary: 一个用于视频流中前景-背景分离的全面 C++ 框架
一个用于计算机视觉中背景减除的全面 C++ 框架,提供超过 40 种算法来检测视频流中的移动对象。
emgucv:跨平台 .NET 包装器,用于 OpenCV 图像处理库
跨平台 .NET 包装器,用于 OpenCV 图像处理库,使 .NET 兼容语言能够在多个操作系统上使用 OpenCV 功能。
MaaNTE: 一个基于图像识别和音频识别的自动化工具,用于简化游戏 *異環* 中的重复性任务
一款针对游戏 *異環* (The Ring) 的自动化工具,通过图像和音频识别来模拟用户交互,从而简化重复性的游戏玩法。
stitching: 一个用于快速且鲁棒的图像拼接与全景图创建的 Python 包
一个用于快速且鲁棒的图像拼接的 Python 包,它使用 OpenCV 将多张重叠的图像组合成单一的全景图。
Moondream Photon: 通过流水线解码消除 GPU Bubble
Moondream 的 Photon 推理引擎通过使用流水线解码将 CPU 管理工作与 GPU 计算重叠,从而在 NVIDIA B200 GPU 上将解码吞吐量提升了高达 35%。
LongCat-2.0 MoE Model Analysis
LongCat-2.0 是一个大规模混合专家 (MoE) 模型,具有 1.6 万亿总参数和 480 亿激活参数,是使用 AI ASIC superpods 开发的。
.self 顶级域名:HCCF 对以人为本域名的愿景
人本计算基金会(HCCF)正在争取 .self 顶级域名,以支持伦理的、以人为本的技术和自托管。
CV-CUDA:用于 AI 预处理流水线的高吞吐量 GPU 加速计算机视觉库
NVIDIA 提供的 GPU 加速计算机视觉库,为 AI 流水线提供高吞吐量、低延迟的图像和视频处理。
comic-translate:一款利用 LLM 和图像修复技术在漫画面板内翻译文字的 AI 漫画翻译器
一款利用 LLM、OCR 与图像修复技术,将多语言漫画翻译并保留原始画面的 AI 漫画翻译器。
habitat-lab:用于在室内环境中训练和评估具身 AI 代理的模块化框架
一个用于具身 AI 端到端开发的模块化高级库,可用于训练和评估在室内环境中执行任务的代理。
WebPlotDigitizer: 一款用于从数据可视化图像中提取数值数据的计算机视觉辅助工具
WebPlotDigitizer 是一款为研究人员和科学家提供的、通过计算机视觉辅助从数据可视化图像中提取数值数据的工具。
ComputeLibrary: 为 Arm 硬件优化的低层机器学习函数集合
针对 Arm Cortex-A、Neoverse 和 Mali GPU 架构优化的低层机器学习函数集合,旨在提供高性能的 ML 推理。
LichtFeld-Studio: 用于训练、编辑和自动化 3D Gaussian Splatting 场景的模块化工作站
一个用于 3D Gaussian Splatting 的模块化工作站,在单个原生应用程序中集成了训练、实时可视化、编辑和导出功能。
anylabeling: 一个通过 YOLOv8 和 Segment Anything 实现自动标注的 AI 辅助图像标注工具
一款 AI 驱动的图像标注工具,集成了 YOLOv8 和 Segment Anything Model (SAM) 系列,旨在为计算机视觉实现数据标注的自动化和加速。
AliceVision: 用于 3D 重建和相机追踪的光影测量计算机视觉框架
一个光影测量计算机视觉框架,通过照片或视频提供 3D 重建和相机追踪算法。
habitat-sim: 用于具身智能研究的高性能、支持物理特性的 3D 模拟器
一个用于具身智能研究的高性能、支持物理特性的 3D 模拟器,为在真实 3D 环境中训练智能体提供快速渲染和刚体动力学。
scenic: 一个基于 JAX 的研究库,用于原型设计大规模基于注意力机制的计算机视觉模型
一个基于 JAX 和 Flax 的计算机视觉研究库,为开发跨图像、视频和音频的基于注意力机制的模型提供可扩展的库和项目模板。
torchgeo:用于多光谱地理空间和遥感数据深度学习的 PyTorch 领域库
一个 PyTorch 领域库,提供专为地理空间和遥感数据设计的数据集、采样器和预训练模型。
VLMEvalKit: 一个支持 70+ 基准测试的大型视觉语言模型统一评估工具包
一个用于大型视觉语言模型的开源评估工具包,支持在 70+ 个基准测试和 200+ 个模型上进行一键式评估。
ARC-AGI-3:在没有指令的情况下解决基准
Tufa Labs 讨论了 ARC-AGI-3 的挑战,强调要解决它需要超越暴力搜索,通过高级抽象实现行动效率和目标获取。
obs-backgroundremoval: 一个用于 OBS Studio 的虚拟绿幕和低光增强插件
一个使用神经网络为人物视频和图像提供虚拟绿幕背景移除和低光增强功能的 OBS Studio 插件。
webots: 一个用于机械系统建模和编程的开源机器人模拟器
一个开源机器人模拟器,提供完整的开发环境,用于对机器人、车辆和机械系统进行建模、编程和模拟。
ceres-solver: 一个用于解决大规模非线性最小二乘法和通用优化问题的成熟 C++ 库
Ceres Solver 是一个用于建模和解决大型、复杂非线性最小二乘法和通用无约束优化问题的 C++ 库。
sparrow: 一个面向 API 的文档智能平台,用于结构化数据提取和智能体工作流
一个面向 API 的企业级文档智能平台,利用 Vision LLMs 和智能体工作流将发票、收据和对账单转换为结构化 JSON。
Chinese-CLIP:面向跨模态检索和零样本图像分类的大规模中文视觉语言模型
一个在 2 亿图文对上训练的中文 CLIP 模型,用于跨模态检索和零样本图像分类。
scikit-image: 一个用于科学图像处理与分析的全面 Python 库
scikit-image 是一个用于图像处理的 Python 库,它提供了一套用于分析和操作图像的算法集合。
Final2x: 一个支持自定义模型和 Nvidia 50 系列 GPU 的跨平台图像超分辨率工具
一个使用 AI 模型来放大图像并提高其分辨率的跨平台图像超分辨率工具。
gocv: Go 语言绑定 OpenCV 4 计算机视觉库
GoCV 为 OpenCV 4 提供 Go 语言绑定,使 Go 开发者能够在其应用中集成先进的计算机视觉和硬件加速的图像处理。
librealsense:用于从 RealSense 相机流式传输深度和颜色数据的跨平台库
一个跨平台的 RealSense 深度相机 SDK,能够实现深度和颜色流式传输,并提供用于计算机视觉和机器人领域的校准数据。
rerun: 物理 AI 和机器人技术的多模态数据层与可视化调试器
一个用于物理 AI 的多模态数据层和可视化调试器,使开发者能够实时记录、查询和可视化多速率传感器数据。
pcl:用于 2D 和 3D 图像及点云处理的大规模开源库
用于 2D/3D 图像及点云处理的大规模开源库,广泛应用于机器人和 3D 感知领域。
segmentation_models.pytorch:一个高层次的 PyTorch 库,用于图像语义分割,拥有超过 800 个预训练编码器
一个 PyTorch 库,提供高层 API,能够轻松创建和训练使用多种预训练编码器和架构的图像语义分割模型。
LinuxMD 将 Linux 带到 Sega MegaDrive(Genesis)
LinuxMD 演示了完整的 Linux 内核可以通过 EverDrive 卡在 Sega MegaDrive 上启动,展示了在基于 68000 的主机上实现 Unix 的可行性。