microsoft/mlvc
MLVC: Multi-platform Learned Video Codec for Real-World Deployment
解决的问题
MLVC 是一种专为消费设备实际部署而设计的神经视频编码器。它解决了在 Apple、Intel 和 Qualcomm 的通用 NPU(神经处理单元)上,构建一个在保持高视觉质量的同时实现实时性能(平均 100 FPS)的可学习视频压缩系统这一挑战。
工作原理
MLVC 采用学习型方法进行视频压缩,提供完整的训练与部署管道。其包含:
- 训练管道: 支持图像(I 帧)和视频(P 帧)模型的训练,提供基于 PSNR 或感知优化的选项。
- 硬件优化: 内置转换工具,可将模型导出为 CoreML(Apple)、OpenVINO 用 ONNX(Intel)和 QNN(Qualcomm),以利用硬件加速。
- 熵编码: 专为实时部署优化的生产级 C++ 熵编码器,用于处理实际比特流生成。
- 评估套件: 提供计算 BD-rate、RD 曲线以及各种质量指标(PSNR、MS-SSIM、LPIPS 等)的工具,可用于与 H.265/HEVC 等传统编码器进行性能对比。
适用人群
从事学习型视频压缩、神经编码器以及边缘设备上高性能 AI 驱动媒体处理的研究人员和开发者。
主要亮点
- 实时性能: 在通用 NPU 上实现约 100 FPS 的编码与解码性能。
- 硬件鲁棒性: 通过专用导出工具,原生支持 Apple、Intel 和 Qualcomm 的 NPU。
- 显著的效率提升: 相比硬件 HEVC,MOS 基础 BD-rate 改进超过 70%。
- 全面的工具链: 提供预训练检查点、训练代码和基准测试工具。
相关
- 项目
- 项目
- 项目
- 项目
- 项目