SearchSavior/OpenArc
Inference engine for Intel devices. Serve LLMs, VLMs, Whisper, Kokoro-TTS, Embedding and Rerank models over OpenAI endpoints.
解決的問題
OpenArc 提供了一種在 Intel 硬體上部署與加速 AI 模型的簡化方法。它作為一個推理引擎,允許使用者在本地且私密的環境下執行各種類型的模型,消除了為不同 AI 任務手動配置 OpenVINO 加速的複雜性。
工作原理
它利用 OpenVINO 在 CPU、GPU 與 NPU 裝置上提供模型服務。該引擎提供 OpenAI 相容的端點,使其能夠整合到現有的 AI 工作流中。它支援廣泛的模型類型,包括 LLM、VLM、Whisper 以及各種基於 Qwen 的 TTS、ASR 與 embedding 模型。
適用對象
希望專門在基於 Intel 的裝置上執行高效能本地 AI 模型的開發者與 AI 愛好者。
亮點
- 廣泛的模型支援:提供 LLM、VLM、音訊模型(Whisper、Kokoro-TTS)以及 embedding/reranker 模型服務。
- Intel 硬體加速:透過 OpenVINO 針對 CPU、GPU 與 NPU 裝置進行優化。
- OpenAI 相容性:為對話補全、音訊轉錄與語音生成提供標準端點。
- 推理優化:包括用於 LLM 的投機解碼(speculative decoding)與多 GPU 流水線並行。
- 效能追蹤:內建
llama-bench風格的基準測試以及詳細的請求指標,如 TTFT 與吞吐量。
相關
- 專案
- 專案
- 專案
- 專案
- Dispatch