SearchSavior/OpenArc
Inference engine for Intel devices. Serve LLMs, VLMs, Whisper, Kokoro-TTS, Embedding and Rerank models over OpenAI endpoints.
解決する課題
OpenArcは、Intelハードウェア上でAIモデルをデプロイおよび加速するための簡素化された方法を提供します。これは推論エンジンとして機能し、ユーザーがさまざまなモデルタイプをローカルかつプライベートに実行できるようにし、異なるAIタスクに対してOpenVINO加速を手動で設定する複雑さを排除します。
仕組み
OpenVINOを活用して、CPU、GPU、NPUデバイス間でモデルを配信します。このエンジンはOpenAI互換のエンドポイントを提供するため、既存のAIワークフローに統合することが可能です。LLM、VLM、Whisper、およびさまざまなQwenベースのTTS、ASR、embeddingモデルを含む幅広いモデルタイプをサポートしています。
対象者
Intelベースのデバイスで、高性能なローカルAIモデルを特別に実行したい開発者やAI愛好家。
ハイライト
- 幅広いモデルサポート: LLM、VLM、オーディオモデル(Whisper、Kokoro-TTS)、およびembedding/rerankerモデルを配信。
- Intelハードウェア加速: OpenVINOを介してCPU、GPU、NPUデバイス向けに最適化。
- OpenAI互換性: チャット補完、オーディオ文字起こし、音声生成のための標準的なエンドポイントを提供。
- 推論の最適化: LLM向けの投機的デコーディング(speculative decoding)やマルチGPUパイプライン並列処理を含む。
- パフォーマンス追跡: 内蔵の
llama-benchスタイルのベンチマーク、およびTTFTやスループットなどの詳細なリクエストメトリクス。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- Dispatch