RoboVerseOrg/RoboVerse
一個用於可擴展機器人學習的統一平台與基準,將多個模擬框架和資料集整合到單一介面中。
TIGER-AI-Lab/Pixel-Reasoner
Pixel Reasoner 是一個研究框架,為視覺-語言模型添加視覺操作(如縮放、選幀等),透過指令微調與好奇心驅動的強化學習進行訓練。該倉庫提供安裝指南、SFT 與 RL 階段的腳本、預訓練的 7B 檢查點、資料集,以及圖像與影片基準的評估流程。
jabberjabberjabber/ImageIndexer
一款本地 AI 工具,可自動生成圖像的說明文字和關鍵字,並將其直接寫入圖像元數據中,以便於索引和搜尋。
yuanze-lin/Olympus
一個電腦視覺的通用任務路由器,可將單一自然語言指令轉換為一系列專業模型呼叫,以產生影像、影片和3D模型。
facebookresearch/mmf
MMF 是一個基於 PyTorch 的模組化視覺與語言多模態研究框架,提供最先進模型的參考實作以及分散式訓練工具。
om-ai-lab/VLM-FO1
VLM-FO1 是一個用於視覺語言模型 (Vision-Language Models) 的即插即用模組,能在不損害通用推理能力的情況下,增強細粒度感知與空間意識。
OpenEnvision/Awesome-Multimodal-Modeling
Awesome‑Multimodal‑Modeling 是一個社群維護的「awesome-list」,全面調查多模態 AI 模型。它定義了四個清晰的類別——Traditional、MLLMs、Unified 和 Native——解釋其架構差異,並連結至 Hugging Face 上的開源模型集合。該倉儲為需要結構化視角來理解快速演進的多模態領域的研究人員與工程師提供支援。
OpenBMB/UltraEval-Audio
一個用於評估大型音訊基礎模型(large audio foundation models)的統一開源框架,支援跨 34 個基準測試(benchmarks)的語音理解與生成。
Sharrnah/whispering-ui
Whispering Tiger 應用程式的原生 Windows UI,可實現音訊串流與遊戲內圖像的即時轉錄與翻譯。
daanzu/kaldi-active-grammar
Kaldi‑Active‑Grammar 是 Kaldi 語音辨識引擎的 Python 包裝器,可編譯多個小型語法,並在每個語音輸入中僅啟用所需部分。支援所有主要作業系統的二進位 wheel,內建預訓練英文模型,並為 Dragonfly 與 Caster 語音控制框架提供後端。透過 pip 安裝,下載模型,定義規則,即可動態啟用情境感知的指令控制。
cubist38/mlx-openai-server
一個用於在 Apple Silicon 上本地執行 MLX 模型的 OpenAI 相容 API 伺服器,支援文字、多模態、影像與音訊模型。
filippogiruzzi/voice_activity_detection
一種基於深度學習的語音活動檢測(VAD)系統,使用 1D-ResNet 和 MFCC 特徵將音訊訊號分類為語音或雜訊。
dictation-toolbox/dragonfly
一個允許使用者建立自訂語音指令以自動化電腦操作與透過語音程式設計的 Python 語音辨識框架。
algolia/voice-overlay-ios
一個提供精緻語音轉文字覆蓋層 UI 的 iOS 函式庫,使用 Apple 的原生 `SFSpeechRecognizer` 處理權限與語音辨識。
judahpaul16/gpt-home
一個基於 Raspberry Pi 的自托管 AI 家庭助理,使用 LiteLLM 和 LangGraph 將 LLM 與家庭自動化及個人生產力工具整合。
sveinbjornt/hear
macOS 的命令列介面,可使用系統內建語音辨識功能對即時麥克風輸入與音訊檔案進行轉錄。
Picovoice/rhino
Rhino 是 Picovoice 的裝置端語音轉意圖引擎,能即時將口語指令轉換為結構化的意圖與槽位。它可在從微控制器到手機、瀏覽器和桌面的各種裝置上本地運行,支援多種語言,並提供 Python、.NET、Java、Flutter、React Native、Android、iOS、Web、Node.js 和 C 的 SDK。
openspeech-team/openspeech
一個用於建構端對端自動語音辨識系統的框架,提供 20 多種 ASR 模型的參考實作與多種語言的配方。
yeyupiaoling/MASR
一個基於 PyTorch 的自動語音辨識框架,支援多種模型架構與語言的串流與非串流推論。
mybigday/whisper.rn
裝置端 Whisper(及 NVIDIA Parakeet)語音轉文字的 React Native 綁定,支援 GPU/Core ML 加速、語音活動檢測(VAD)與即時串流。
TheStageAI/TheWhisper
基於微調的 Whisper 模型,針對 NVIDIA GPU 與 Apple Silicon 上的低延遲串流與設備內推論優化之高效能語音轉文字解決方案。
TensorSpeech/TensorFlowASR
一個基於 TensorFlow 的自動語音辨識 (ASR) 框架,實作了多種 ASR 架構,並支援 TFLite 轉換以進行高效能部署。
ardha27/AI-Waifu-Vtuber
一款集成了語音識別、LLM 和文本轉語音技術的 AI 驅動 VTuber 助手,用於創建用於直播和個人使用的互動式虛擬角色。
sooftware/conformer
Conformer 架構的 PyTorch 實作,透過結合 CNN 與 Transformer 來捕捉局部與全域音訊依賴關係,從而提升語音辨識效能。
modal-labs/quillman
一個由 Moshi 語音對語音模型驅動的語音聊天應用程式,提供低延遲、雙向音訊串流,實現類人互動。
tensorflow/lingvo
一個專為建構和擴展序列對序列模型及巨型語言模型而設計的模組化 TensorFlow 框架。
HeyWillow/willow
Willow 是一個可自託管的推理伺服器,用於快速執行包括語音轉文字、文字轉語音及 LLM 處理在內的語言任務。
flashlight/wav2letter
wav2letter++ 是一個端到端自動語音識別框架,提供實現最先進語音轉文本架構的方案 (recipes) 與預訓練模型。
Uberi/speech_recognition
一個為語音辨識提供統一介面的 Python 函式庫,支援 OpenAI Whisper、Google Speech 和 Vosk 等多種線上與離線引擎。
elevenlabs/elevenlabs-js
ElevenLabs 官方 Node.js SDK,讓開發者能將逼真的 AI 語音合成、即時音訊串流與語音驅動的 AI 代理整合至其應用中。
wildminder/ComfyUI-VoxCPM
VoxCPM 的 ComfyUI 自定義節點集成。VoxCPM 是一個無需分詞器(tokenizer-free)的 TTS 系統,能夠實現富有表現力的語音生成、自然語言語音設計以及高級語音克隆。
codeforequity-at/botium-speech-processing
一個用於開源與雲端語音轉文字 (STT) 及文字轉語音 (TTS) 服務的統一 API,簡化聊天機器人與語音應用程式的音訊處理流程。
tongjingqi/Thinking-with-Video
一種全新的多模態推理範式與基準測試 (VideoThinkBench),用於評估影片生成模型解決複雜視覺與文本推理任務的能力。
AceDataCloud/Nexior
Nexior 是一個 MIT 許可的 Vue 基礎應用,將 40 多個聊天、影像、音訊與影片 AI 模型整合到一個可自托管的統一介面中。支援一鍵 Vercel 或 Docker 部署,BYOK 或單一 AceData 金鑰,內建使用者帳戶、付款與推薦機制,是 AI 產品即用型 SaaS 的理想起點。
EvolvingLMMs-Lab/lmms-engine
一個統一、高效率的多模態模型訓練引擎,整合分散式訓練、內核融合與高階優化器,支援可擴展的預訓練與微調。
awekrx/ChatGPT-MidJourney-prompt
一個利用 LLM 根據簡單的文本提示為 MidJourney 圖像自動生成詳細且具創意提示詞的 Python 函式庫。
HorizonWind2004/reconstruction-alignment
一種用於統一多模態模型的自我監督式後訓練方法,透過訓練模型從其自身的視覺特徵中重建影像,從而提升影像生成與影像編輯能力。
shiimizu/ComfyUI_smZNodes
自訂 ComfyUI 節點(CLIP Text Encode++ 和 Settings),複製 AUTOMATIC1111 的提示詞解析與嵌入邏輯,使 stable-diffusion-webui 與 ComfyUI 之間的影像生成完全一致。
biagiomaf/smart-comfyui-gallery
專為 ComfyUI 與 AI 生產庫設計的開源數位資產管理與畫廊工具,用於組織、搜尋與重混生成內容。
Windsander/ADI-Stable-Diffusion
一個使用 ONNXRuntime 在多個平台實現高效率、無 Python 依賴的 Stable Diffusion 模型推論的 C++ 庫與 CLI 工具。
Licoy/GoAmzAI
一個為個人與企業設計的私有化、多模態 AIGC 平台,將文字、圖像、影片、音樂與 PPT 生成功能整合進一個統一的管理系統中。
mrhan1993/Fooocus-API
為 Fooocus 打造的 FastAPI 驅動 REST API,讓開發者無需手動調整參數,即可透過程式化方式生成高品質圖像。
Acly/comfyui-tooling-nodes
一套 ComfyUI 自定義節點和 API 擴充,可將 ComfyUI 作為外部工具的後端使用,具有優化的圖像傳輸、區域提示詞(regional prompting)和模型檢查功能。
melMass/comfy_mtb
ComfyUI 的自定義節點集合,透過額外的實用工具擴展圖像生成工作流。
a616567126/GPT-WEB-JAVA
一個基於Java的Web平台,將GPT、Midjourney與Stable Diffusion整合為具備使用者管理與支付系統的商業AI服務。
vual/ChatGPT-Next-Web-Pro
ChatGPT‑Next‑Web‑Pro 是一個開源的、自託管的 OpenAI 風格 LLM Web UI,它增加了多模態(圖像、音訊、影片)生成、檔案解析、S3 儲存,以及可選的包含用戶帳號、訂閱計劃和管理面板的後端。可以透過單一 Docker run(無後端)或 Docker-Compose 堆疊(有後端)進行部署。
basetenlabs/truss
用於將 AI/ML 模型打包並部署至生產環境的 CLI 工具,自動化容器化、GPU 設定與相依性管理。
xxxily/hello-ai
一個由 AI 驅動的導航中心,利用自主代理從 GitHub 發現、評估並組織高品質的開源 AI 專案,形成一個自動更新的目錄。