SearchSavior/OpenArc
Inference engine for Intel devices. Serve LLMs, VLMs, Whisper, Kokoro-TTS, Embedding and Rerank models over OpenAI endpoints.
解决的问题
OpenArc 提供了一种在 Intel 硬件上部署和加速 AI 模型的简化方法。它作为一个推理引擎,允许用户在本地和私密环境下运行各种类型的模型,消除了为不同 AI 任务手动配置 OpenVINO 加速的复杂性。
工作原理
它利用 OpenVINO 在 CPU、GPU 和 NPU 设备上提供模型服务。该引擎提供 OpenAI 兼容的端点,使其能够集成到现有的 AI 工作流中。它支持广泛的模型类型,包括 LLM、VLM、Whisper 以及各种基于 Qwen 的 TTS、ASR 和 embedding 模型。
适用对象
希望专门在基于 Intel 的设备上运行高性能本地 AI 模型的开发者和 AI 爱好者。
亮点
- 广泛的模型支持:提供 LLM、VLM、音频模型(Whisper、Kokoro-TTS)以及 embedding/reranker 模型服务。
- Intel 硬件加速:通过 OpenVINO 针对 CPU、GPU 和 NPU 设备进行了优化。
- OpenAI 兼容性:为聊天补全、音频转录和语音生成提供标准端点。
- 推理优化:包括用于 LLM 的投机解码(speculative decoding)和多 GPU 流水线并行。
- 性能追踪:内置
llama-bench风格的基准测试以及详细的请求指标,如 TTFT 和吞吐量。
相关
- 项目
- 项目
- 项目
- 项目
- Dispatch