microsoft/mlvc

MLVC: Multi-platform Learned Video Codec for Real-World Deployment

解决的问题

MLVC 是一种专为消费设备实际部署而设计的神经视频编码器。它解决了在 Apple、Intel 和 Qualcomm 的通用 NPU(神经处理单元)上,构建一个在保持高视觉质量的同时实现实时性能(平均 100 FPS)的可学习视频压缩系统这一挑战。

工作原理

MLVC 采用学习型方法进行视频压缩,提供完整的训练与部署管道。其包含:

  • 训练管道: 支持图像(I 帧)和视频(P 帧)模型的训练,提供基于 PSNR 或感知优化的选项。
  • 硬件优化: 内置转换工具,可将模型导出为 CoreML(Apple)、OpenVINO 用 ONNX(Intel)和 QNN(Qualcomm),以利用硬件加速。
  • 熵编码: 专为实时部署优化的生产级 C++ 熵编码器,用于处理实际比特流生成。
  • 评估套件: 提供计算 BD-rate、RD 曲线以及各种质量指标(PSNR、MS-SSIM、LPIPS 等)的工具,可用于与 H.265/HEVC 等传统编码器进行性能对比。

适用人群

从事学习型视频压缩、神经编码器以及边缘设备上高性能 AI 驱动媒体处理的研究人员和开发者。

主要亮点

  • 实时性能: 在通用 NPU 上实现约 100 FPS 的编码与解码性能。
  • 硬件鲁棒性: 通过专用导出工具,原生支持 Apple、Intel 和 Qualcomm 的 NPU。
  • 显著的效率提升: 相比硬件 HEVC,MOS 基础 BD-rate 改进超过 70%。
  • 全面的工具链: 提供预训练检查点、训练代码和基准测试工具。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目