microsoft/mlvc
MLVC: Multi-platform Learned Video Codec for Real-World Deployment
解決的問題
MLVC 是一種專為消費性裝置實際部署而設計的神經影片編碼器。它解決了在 Apple、Intel 和 Qualcomm 的通用 NPU(神經處理單元)上,建構一個在維持高視覺品質的同時,仍能達成即時性能(平均 100 FPS)的學習型影片壓縮系統的挑戰。
工作原理
MLVC 採用學習型方法進行影片壓縮,提供完整的訓練與部署流程。其包含:
- 訓練流程: 支援圖像(I 幀)與影片(P 幀)模型的訓練,並提供基於 PSNR 或感知優化之選項。
- 硬體最佳化: 內建轉換工具,可將模型匯出為 CoreML(Apple)、OpenVINO 用 ONNX(Intel)與 QNN(Qualcomm),以利用硬體加速。
- 熵編碼: 專為即時部署優化之生產級 C++ 熵編碼器,用於處理實際位元流產生。
- 評估套件: 提供計算 BD-rate、RD 曲線以及各種品質指標(PSNR、MS-SSIM、LPIPS 等)的工具,可用於與 H.265/HEVC 等傳統編碼器進行性能比較。
適用對象
從事學習型影片壓縮、神經編碼器以及邊緣裝置上高效率 AI 驅動媒體處理的研究人員與開發者。
主要亮點
- 即時性能: 在通用 NPU 上實現約 100 FPS 的編碼與解碼性能。
- 硬體穩健性: 透過專用匯出工具,原生支援 Apple、Intel 與 Qualcomm 的 NPU。
- 顯著的效率提升: 相較於硬體 HEVC,MOS 基礎 BD-rate 改進超過 70%。
- 完整的工具鏈: 提供預訓練檢查點、訓練程式碼與基準測試工具。
相關
- 專案
- 專案
- 專案
- 專案
- 專案