SearchSavior/OpenArc

Inference engine for Intel devices. Serve LLMs, VLMs, Whisper, Kokoro-TTS, Embedding and Rerank models over OpenAI endpoints.

解決的問題

OpenArc 提供了一種在 Intel 硬體上部署與加速 AI 模型的簡化方法。它作為一個推理引擎,允許使用者在本地且私密的環境下執行各種類型的模型,消除了為不同 AI 任務手動配置 OpenVINO 加速的複雜性。

工作原理

它利用 OpenVINO 在 CPU、GPU 與 NPU 裝置上提供模型服務。該引擎提供 OpenAI 相容的端點,使其能夠整合到現有的 AI 工作流中。它支援廣泛的模型類型,包括 LLM、VLM、Whisper 以及各種基於 Qwen 的 TTS、ASR 與 embedding 模型。

適用對象

希望專門在基於 Intel 的裝置上執行高效能本地 AI 模型的開發者與 AI 愛好者。

亮點

  • 廣泛的模型支援:提供 LLM、VLM、音訊模型(Whisper、Kokoro-TTS)以及 embedding/reranker 模型服務。
  • Intel 硬體加速:透過 OpenVINO 針對 CPU、GPU 與 NPU 裝置進行優化。
  • OpenAI 相容性:為對話補全、音訊轉錄與語音生成提供標準端點。
  • 推理優化:包括用於 LLM 的投機解碼(speculative decoding)與多 GPU 流水線並行。
  • 效能追蹤:內建 llama-bench 風格的基準測試以及詳細的請求指標,如 TTFT 與吞吐量。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • Dispatch