2051

Meshroom: 一个用于 3D 重建和计算机视觉流水线的基于节点的视觉编程框架

一个用于 3D 重建和计算机视觉的基于节点的视觉编程框架,使用户能够利用 AI 和摄影测量技术构建复杂的数据处理流水线。

2052

open_clip: 一个用于训练和部署大规模对比语言-图像及音频-文本模型的开源框架"} <|file_separator|> <|thought|> <|thought|> {

OpenAI CLIP 的开源实现,支持训练和使用大规模对比语言-图像模型,用于零样本分类和检索。

2053

carla: 一个用于训练和验证自动驾驶系统的开源城市驾驶模拟器

一个用于自动驾驶研究的开源模拟器,用于在模拟的城市环境中开发、训练和验证自动驾驶系统。

2054

labelme:一个带 AI 辅助掩码和多格式数据集导出的图形图像标注工具

一个图形图像标注工具,允许用户使用各种形状和 AI 辅助工具对图像进行标注,以创建计算机视觉模型的数据集。

2055

cvat: 一个用于构建高质量计算机视觉数据集的专业数据标注平台

一个用于为计算机视觉构建高质量视觉数据集的开源数据标注平台,支持图像、视频和 3D 标注。

2056

AirSim: 用于自动驾驶车辆和 AI 研究的高保真视觉与物理模拟器

一个基于 Unreal Engine 构建的无人机和汽车开源模拟器,旨在作为深度学习、计算机视觉和强化学习领域 AI 研究的平台。

2057

MaaAssistantArknights: 一个基于图像识别的《明日方舟》自动化助手,可自动完成日常任务和基建管理

一个基于图像识别和深度学习的《明日方舟》自动化助手,用于自动化日常任务、基建管理和资源采集。

2058

vit-pytorch: 一个使用 PyTorch 实现的 Vision Transformer (ViT) 及其变体的全面集合

一个全面的 PyTorch 库,实现了原始的 Vision Transformer (ViT) 及其数十种用于图像分类的高级变体。

2059

label-studio: 一个具有 ML 辅助预标注和主动学习功能的多模态开源数据标注工具

一款开源数据标注工具,允许用户标注音频、文本、图像和视频,以准备或改进机器学习模型的训练数据。

2060

espnet:面向 ASR、TTS 与口语语言理解的全方位端到端语音处理工具包

一个基于 PyTorch 的端到端语音处理工具包,提供统一框架,支持 ASR、TTS、语音翻译和增强等任务。

2061

leon: 一个具有代理执行能力和本地优先隐私保护的开源个人 AI 助手

一个开源的个人 AI 助手,通过使用工具、记忆和代理执行来执行任务,同时支持本地 AI 模型以保护隐私。

2062

Cursor iOS 应用在未征得同意的情况下将用户切换至新隐私模式

安装 Cursor iOS 应用会自动将账户从旧版 "不存储我的代码" 隐私模式切换到更宽松的新模式,且在应用中无法恢复旧版选项。

2063

PlayStation Store Studio Canal 电影下架

索尼在未提供退款的情况下,从 PlayStation Store 用户账户中移除数百部 Studio Canal 电影,引发了关于数字所有权本质的争论。

2064

美国最高法院裁定地理围栏令必须遵守宪法保护

美国最高法院裁定,地理围栏令必须遵守第四修正案的保护,驳回了选择使用位置服务即放弃用户隐私权的论点。

2065

Tidal AI 政策:对 AI 生成音乐的去货币化

Tidal 推出了一项新 AI 政策,允许平台上出现 AI 生成的音乐,但禁止其获利,以确保版税保留给人类艺术家。

2066

HunyuanVideo-1.5: 一个适用于消费级 GPU 进行高质量合成的 8.3B 参数轻量级视频生成模型

一个 8.3B 参数的轻量级视频生成模型,能够在消费级 GPU 上实现高质量的文本到视频和图像到视频合成。

2067

OpenMontage: 一个将研究、剧本编写和编辑编排进完整制作流水线的智能体视频制作系统

一个开源的、智能体驱动的视频制作系统,通过编排研究、剧本编写、素材生成和编辑,根据自然语言提示词创建专业的视频。

2068

Ornith-1.0: 用于智能体编程的自我改进开源模型

Ornith-1.0 是一套采用 MIT 许可的、自我改进的开源模型系列(9B、35B 和 397B),专为智能体编程设计,是在 Gemma 4 和 Qwen 3.5 的基础上进行后训练得到的。

2069

Outer Shell:用于 SSH 的原生图形外壳

Outer Shell 通过 SSH 提供基于浏览器的远程服务器图形界面,利用 Unix 域套接字来提供原生和基于 HTML 的应用,无需公开 HTTP 端口。

2070

Rocket Lab 收购 Iridium

Rocket Lab 收购 Iridium,整合了盈利的卫星通信网络和宝贵的频谱,打造垂直一体化的太空公司。

2071

三星、SK Hynix 与 Micron 因内存价格操纵在美国被起诉

三星、SK Hynix 与 Micron 面临美国诉讼,指控他们协同削减 DRAM 供应并停产旧内存标准以抬高价格。

2072

ZLUDA 6 发布:在非 NVIDIA GPU 上运行未经修改的 CUDA 应用程序

ZLUDA 6 引入了对 32 位 PhysX 的支持、Blender 的基础纹理支持,以及显著提升了在非 NVIDIA 硬件上运行 CUDA 应用程序的 Windows 易用性。

2073

Mullvad VPN 争议:联合创始人 Daniel Berntsson 的政治捐款

Mullvad VPN 联合创始人 Daniel Berntsson 为瑞典 Örebro 党提供资金,引发了关于企业中立性以及私人政治捐款与公司价值观交叉的辩论。

2074

与 AI 协作:术士学徒问题的具体案例

Carson Gross 通过 hyperscript 解析器中一个真实的 bug 修复案例,探讨了 AI 在软件开发中的优势和劣势,并强调了盲目接受 AI 提出的解决方案的危险性。

2075

BAIR 2026 毕业生展示

伯克利人工智能研究(BAIR)实验室宣布了其2026届博士毕业生,突出了机器人、大型语言模型、AI安全和医疗保健方面的研究。

2076

genai-processors: 一个用于构建异步且可组合的多模态 AI 流水线的模块化框架

一个轻量级的 Python 库,用于构建模块化、异步且可组合的 AI 流水线,统一了多模态内容处理和流式传输。

2077

instill-core: 一个用于数据处理、流水线编排和模型托管的端到端 AI 基础设施平台

一个端到端的 AI 平台,简化了非结构化数据、AI 流水线和模型部署的编排,用于构建 RAG 和 AI 优先的应用。

2078

YTPro: 一个带有 AI 视频摘要和高级播放控制功能的修改版 YouTube 客户端

一个修改版的 YouTube 客户端,集成了 Google Gemini 用于 AI 视频摘要,并具备广告拦截和内容下载工具。

2079

alan-sdk-web:一个智能应用平台 SDK,能够实时生成业务逻辑和 UI

一个用于将智能层嵌入 Web 应用的 SDK,能够实时生成业务逻辑和 UI 组件。

2080

presentation-ai: 一个支持本地 LLMs 和自定义主题的开源 AI 演示文稿生成器

一款开源的、由 AI 驱动的演示文稿生成器,通过“大纲优先”的工作流,根据一个话题即可创建可定制的幻灯片。

2081

TTS-WebUI: 一个用于运行和管理数十种开源文本转语音和音频生成模型的统一 Web 界面

一个用于管理和运行各种开源文本转语音、音频生成和音频转换 AI 模型的统一 Web 界面。

2082

Gemini-API: 一个针对 Google Gemini Web 应用的逆向工程异步 Python 封装库

一个针对 Google Gemini Web 应用的逆向工程异步 Python 封装库,支持通过编程方式访问图像生成、深度研究和自定义 Gems 等功能。

2083

hallucination-leaderboard: 一个追踪 LLM 在摘要任务中幻觉率的公开排行榜

一个使用 Vectara 的 Hallucination Evaluation Model (HHEM) 来衡量和比较不同 LLM 在对文档进行摘要时产生幻觉频率的公开排行榜。

2084

semantic-router: 一个为 LLMs 和 agents 使用语义向量空间进行路由的超快速决策层

一个为 LLMs 和 agents 提供的高速决策层,它使用语义向量空间根据含义而非缓慢的 LLM 生成来路由请求。

2085

transformer-explainer: 一个用于学习 GPT-2 内部操作的交互式浏览器可视化工具

一个在浏览器中运行实时 GPT-2 模型的交互式可视化工具,旨在帮助用户学习基于 Transformer 的模型如何预测文本。

2086

ChatGPT-Shortcut: 一个用于在多个平台提升 AI 输出质量的精选提示词库和管理工具

一款 AI 提示词管理工具,提供包含 5,000 多个提示词的精选库,并提供各种工具来在不同 AI 平台中组织、创建和分享自定义提示词。

2087

morphic: 一个具有生成式 UI 的 AI 搜索引擎,可从流式 JSON 渲染丰富的内联组件

一款由 AI 驱动的搜索引擎,使用生成式 UI 渲染丰富的、带有引用的回答,并包含交互式组件,而非纯文本。

2088

krita-ai-diffusion: 一个为 Krita 开发的生成式 AI 插件,集成了扩散模型以实现精确的图像编辑和绘画

一个为 Krita 开发的插件,将生成式 AI 扩散模型集成到绘画工作流中,提供局部重绘、实时绘画和精确结构控制的工具。

2089

outlines: 一个通过类型约束生成来保证 LLM 结构化输出的库

一个通过将生成过程约束为匹配特定 Python 类型或 Pydantic 模型,从而保证 LLM 结构化输出的库。

2090

Open-Generative-AI: 一个具有本地推理和多模型支持的、不受限制的 AI 视频平台开源替代方案

一个开源、不受限制的 AI 工作室,可使用 200 多种模型生成图像和视频,具有本地推理选项和可视化工作流构建器。

2091

openui:一个开源的 AI 驱动 UI 生成器,可将实时描述渲染为框架就绪代码

一款开源工具,允许你使用自然语言描述 UI 组件并实时渲染,同时支持将其转换为 React、Svelte 或 Web Components。

2092

TurboDiffusion:一种将视频生成扩散延迟降低 100‑200 倍的加速框架

TurboDiffusion 是一种视频生成加速框架,通过注意力优化和时间步蒸馏,在单 GPU 上实现 100‑200 倍的扩散生成加速。

2093

MAGI-1: 一种用于可扩展高保真视频生成且具有强物理准确性的自回归世界模型

MAGI-1 是一种自回归视频生成模型,通过逐块生成高保真视频来确保时间一致性和物理准确性。

2094

ComfyUI-LTXVideo: 用于高级 LTX-2 视频生成和音频合成的自定义 ComfyUI 节点

一套自定义 ComfyUI 节点和工作流集合,通过 HDR 输出、对口型和生成式放大等功能扩展了 LTX-2 视频生成模型。

2095

transformerlab-app:一个统一 AI 研究工具和集群编排的开源机器学习平台

一个统一训练、微调、推理和评估为单一界面的开源机器学习平台,适用于个人和研究实验室。

2096

当运行 CUDA 核心时会发生什么:从源码到 SASS

深入探讨 CUDA 核心的生命周期,追踪其从 `nvcc` 编译、PTX/SASS 生成到在 RTX 4090 上硬件层面的执行全过程。

2097

HackerRank 招聘代理:AI 简历筛选中的非确定性分析

对 HackerRank 开源 `hiring-agent` 工具的分析揭示了显著的评分不一致性和设计缺陷,同一份简历在多次运行中可能得到截然不同的分数。

2098

maestro: 一个加速多模态视觉语言模型微调的精简工具

一个用于加速 Florence-2、PaliGemma 2 和 Qwen2.5-VL 等多模态视觉语言模型微调的精简工具。

2099

SimpleTuner: 一个用于微调多模态生成式模型并具备企业级编排功能的统一训练框架

一个用于微调图像、视频和音频生成式模型的全面训练框架,支持广泛的架构,并专注于简单性和内存效率。

2100

OneTrainer: 训练和微调多种扩散模型的全方位解决方案

一套全面的扩散模型训练套件,通过 GUI 或 CLI 提供数据集准备、微调和模型转换工具。