JeremyCCHsu/Python-Wrapper-for-World-Vocoder
一個用於 WORLD Vocoder 的 Python 包裝器,透過將音訊分解為音高、頻譜包絡和非週期性,實現高品質的語音分析與重新合成。
usnistgov/dioptra
Dioptra 是 NIST 的開源 Docker 基礎平台,用於測試 AI 模型是否符合可信性標準(公平性、安全性、可解釋性等)。它提供 REST API、Web UI 和 Python 客戶端,支援使用 YAML 定義實驗,相容 PyTorch/TensorFlow 插件,並為開發者、審計者、研究人員和紅隊提供可重現、可追蹤的執行記錄。
Zyphra/ZONOS2
ZONOS2 是一個基於 Mixture-of-Experts 骨幹網絡的高保真多語言文本到語音模型,可實現自然的語音克隆與富有表現力的情感控制。
understandable-machine-intelligence-lab/Quantus
Quantus 是一個開源 Python 庫(支援 PyTorch/TensorFlow),提供 35 個以上的定量指標,用於評估神經網路解釋方法,涵蓋忠實性、穩健性、定位性、複雜性、隨機化、公理性六大類別。它支援影像、時間序列與表格資料,實現可重現、批次高效能的 XAI 技術評估,並提供教學、文件與社群支援。
SeaDve/Mousai
一款使用 AudD API 從桌面音訊或麥克風辨識音樂的歌曲辨識應用程式。
OlympiaAI/raix
Raix 是一個 Ruby 庫,為任何 Ruby 類別添加 LLM 聊天、工具(函數)分發與提示鏈功能。它透過 RubyLLM/OpenRouter 包裝多個提供者,管理對話記錄,提供全域/類別/實例鉤子,支援 JSON 模式、快取與提示快取,並提供用於宣告函數與多階段提示的 DSL。
flyteorg/flytekit
Flytekit Python 是 Flyte 的官方 SDK,讓您使用 `@task` 和 `@workflow` 裝飾器在純 Python 中撰寫、測試與部署 AI/ML 工作流程。透過 `pip install flytekit` 安裝,遵循快速入門指南,並透過外掛擴充或根據提供的文件貢獻。
amsehili/auditok
一個輕量級的 Python 程式庫,透過能量閾值或 WebRTC VAD 將音訊串流分割為事件。
vb000/LookOnceToHear
一種智慧可穿戴系統,使用者只需凝視目標說話者數秒,即可在嘈雜環境中分離並聽到該說話者的語音。
composio-community/open-chatgpt-atlas
Open ChatGPT Atlas 是一個開源的 Chrome/Edge 擴充套件(以及可選的 Electron 應用),可讓 AI 透過 Gemini 2.5 Computer‑Use 控制瀏覽器,並透過 Composio 呼叫 500 多個第三方服務。使用 Node 建立 `dist` 資料夾,加入您的 Google 和可選的 Composio API 金鑰,然後透過側邊欄聊天輸入自然語言命令,如「點擊此按鈕」或「建立 GitHub 問題」。它提供視覺反饋、安全確認,且完全在客戶端執行。
InternLM/InternBootcamp
InternAgentHarness(InternBootcamp)是一個開源框架,用於建立、執行與評估多輪、工具增強型 LLM 代理。它讓研究人員能定義合成任務,公開經驗證的外部工具,管理多輪互動,計算獎勵,並記錄完整軌跡,以供資料產生或強化學習訓練使用。
pmarreck/yt-transcriber
一個使用 Whisper 將 YouTube 影片或本地媒體檔案轉錄為文字的 CLI 工具,支援可選的 AI 摘要與翻譯功能。
audeering/opensmile-python
一個用於 openSMILE 的 Python 接口,可實現機器學習研究中標準化音訊特徵的提取。
runesleo/claude-code-workflow
QuietHarness 是一個微型、開源的 AI 程式碼代理(Claude Code、Codex、Cursor)安全層。它提供共享設定範本、預覽安裝指令碼、自動備份和風險門控操作,確保代理在未確認前不會覆寫檔案、跳過測試或執行不可逆操作。可按專案或全域安裝,完全離線運行,採用 MIT 授權。
CaptainYifei/fake-news-detector
一個基於 Streamlit 的網頁應用,使用 LLM(例如 Qwen2.5)和 BGE‑M3 嵌入從新聞中提取主張,透過 DuckDuckGo/SearXNG 檢索網路證據,並透過三節點流程進行驗證。支援中文、英文、日文、韓文,多種模型提供者,使用者帳戶、歷史記錄,以及 PDF 報告。
Jittor/jittor
Jittor 是一個高性能深度學習框架,透過 JIT 編譯整個計算圖,並使用元操作符生成針對特定模型優化的 CUDA/C++ 內核。它提供類似 PyTorch 的 Python API,支援 CPU 與 GPU 後端(CUDA、ROCm、Hygon),並包含視覺、渲染、幾何學習與強化學習的模型庫。
yxlllc/DDSP-SVC
一個高效的歌唱音色轉換專案,相比傳統 SVC 模型,顯著降低硬體需求並大幅縮短訓練時間,實現高品質 AI 語音變換。
strob/gentle
基於 Kaldi 構建的強大強制對齊器,可將語音音訊與文本轉錄進行對齊,提供精確的詞級時間戳。
appleboy/CodeGPT
CodeGPT 是一個基於 Go 的 CLI,使用 LLM API(OpenAI、Azure、Gemini、Anthropic、Ollama、Groq、OpenRouter)自動產生 Conventional-Commit 訊息與簡短的程式碼審查摘要。支援安裝 Git `prepare-commit-msg` 鈎子、自訂提示、語言翻譯、串流輸出與彈性設定(API 金鑰、提供者、代理、差異上下文等)。可透過 Homebrew、Chocolatey、腳本、二進位檔或 `go install` 安裝。
VOICEVOX/voicevox_core
為 VOICEVOX 提供核心語音合成引擎,以 C 與 Python 函式庫形式,方便於各種應用中輕鬆整合。
DataBassGit/AgentForge
AgentForge 是一個低程式碼 Python 框架,用於建構、測試與迭代 AI 驅動的自主代理。它使用宣告式 YAML 檔案(Cogs)來組合代理、附加可選記憶,並協調多代理工作流程,同時支援 OpenAI、Gemini、Claude 以及透過 Ollama/LMStudio 的本地模型。
fishaudio/fish-diffusion
支援多說話人訓練與高效硬體利用的基於擴散模型的語音合成(TTS)、歌唱語音合成(SVS)與歌唱語音轉換(SVC)訓練框架。
wavlab-speech/versa
一個綜合性工具包,提供90多種指標的統一介面,用於評估語音和音訊的品質、可懂度和技術屬性。
BakeLens/crust
Crust 是一個開源、本地執行的代理,位於 AI 程式碼助手與 LLM 提供商之間。它檢查每一次工具呼叫(檔案讀取、shell 命令、網路請求等),並阻止可能暴露機密或損害主機的動作。該閘道可作為 HTTP 代理、MCP/ACP stdio 包裝器或 Docker 容器運行,內建 42 個安全規則、51 個 DLP 模式,並支援自訂策略外掛。它完全在使用者機器上執行,日誌加密儲存在作業系統密鑰環中,並透過 Swift 套件支援 iOS 集成。
Stability-AI/stable-codec
一種高品質、低比特率的語音編碼器,可將音訊壓縮為離散標記,專為語音合成等下游任務優化。
Deep-unlearning/smol-audio
一系列實用的筆記本,用於在Hugging Face生態系中對ASR與音訊字幕等任務的音訊AI模型進行微調與優化。
Kocoro-lab/Kocoro
Kocoro 是一個開源的 macOS AI 代理守護程序(`shan`),讓語言模型代理能讀取/寫入檔案、控制應用程式、執行 shell 命令、自動化瀏覽器,並整合 Slack/Telegram。提供 CLI/TUI、HTTP API、MCP 流式傳輸,以及即時語音前腦。可透過 npm、腳本或 Go 建置安裝;設定 Shannon Cloud 或自架設網關以取得 LLM 完成。守護程序處理權限、代理記憶體、排程與可擴充工具,而獨立的閉源 GUI(Kocoro Desktop)提供精緻介面。採用 MIT 授權。
milady-ai/milady
Milady 是一個以隱私為先的個人AI助手,可在本地運行(或透過自托管或雲端後端)。它提供帶3D頭像的桌面應用、多平台聊天連接器、漸進式動作串流傳輸,以及內建的BNB智能鏈交易功能。可透過macOS/Windows/Linux的簽署安裝程式安裝,或使用CLI(`milody setup`)。系統具備能源感知、插件可擴展性,並可透過API金鑰安全地暴露為遠端後端。
absadiki/pywhispercpp
支援多種硬體加速後端的 Python 繫結,提供高效率語音轉文字轉錄功能。
microsoft/cognitive-services-speech-sdk-js
一個用於整合 Microsoft Cognitive Services 語音功能的 JavaScript SDK,可在瀏覽器和 Node.js 中實現語音轉文字和文字轉語音功能。
ASLP-lab/MeanVC
MeanVC 是一個輕量級的零次學習語音轉換系統,利用平均流與擴散變壓器,實現即時、單步的音色轉移。
Prorise-cool/Claude-Code-Multi-Agent
Claude Code Multi‑Agent 是一個開源框架,為 Anthropic 的 Claude Code 專案賦予專案感知能力與專家代理功能。它使用 Python Hook 系統與本地執行的 Ollama 模型,自動偵測程式碼庫類型,分析使用者意圖,載入 300 多個領域專用的「技能」(後端、前端、測試、安全等),並強制執行自動文件(DEVELOPMENT.md、KNOWLEDGE.md、CHANGELOG.md)。克隆倉儲,安裝 Ollama、模型與 uv 後,將專案放入倉儲,Claude Code 即可立即了解其上下文,建議合適工具,並可透過 `/backend‑specialist` 或 `/kiro/spec` 等斜線命令驅動。 關鍵點: - 零設定啟動;所有設定皆位於 `.claude/settings.json` 與 `prompts.json`。 - Hooks 在會話啟動、使用者提示、工具使用等時執行,處理專案偵測、意圖分析與文件更新。 - Skills 由 `SKILL.md` 檔案定義,可自動發現。 - 完全本地運行(無外部 API),與 Git 整合,MIT 許可。 適合希望獲得可重現、本地部署 AI 編碼助手的開發者或小團隊。
vercel/next-evals-oss
Next.js Evals 是一個由 Vercel 維護的框架,用於在真實世界的 Next.js 任務上自動測試 AI 代碼代理。它從 `vercel/next.js` 倉儲同步評估固定裝置,在 Vercel 沙箱中執行代理,檢查隱藏斷言,記錄通過/失敗、令牌使用量與成本,並匯出 JSON 排行榜,為公開的 Next.js 評估網站提供支援。
PierrunoYT/Kokoro-TTS-Local
一個本地實作的 Kokoro-82M 文字轉語音模型,具備網頁介面、54 個多語系語音與完整的離線支援。
MisoLabsAI/MisoTTS
用於對話式英語語音生成與聲音克隆的高品質文本轉對話 RVQ Transformer 模型。
OpenBMB/UltraEval-Audio
一個用於評估大型音訊基礎模型(large audio foundation models)的統一開源框架,支援跨 34 個基準測試(benchmarks)的語音理解與生成。
daanzu/kaldi-active-grammar
Kaldi‑Active‑Grammar 是 Kaldi 語音辨識引擎的 Python 包裝器,可編譯多個小型語法,並在每個語音輸入中僅啟用所需部分。支援所有主要作業系統的二進位 wheel,內建預訓練英文模型,並為 Dragonfly 與 Caster 語音控制框架提供後端。透過 pip 安裝,下載模型,定義規則,即可動態啟用情境感知的指令控制。
filippogiruzzi/voice_activity_detection
一種基於深度學習的語音活動檢測(VAD)系統,使用 1D-ResNet 和 MFCC 特徵將音訊訊號分類為語音或雜訊。
dictation-toolbox/dragonfly
一個允許使用者建立自訂語音指令以自動化電腦操作與透過語音程式設計的 Python 語音辨識框架。
algolia/voice-overlay-ios
一個提供精緻語音轉文字覆蓋層 UI 的 iOS 函式庫,使用 Apple 的原生 `SFSpeechRecognizer` 處理權限與語音辨識。
sveinbjornt/hear
macOS 的命令列介面,可使用系統內建語音辨識功能對即時麥克風輸入與音訊檔案進行轉錄。
Picovoice/rhino
Rhino 是 Picovoice 的裝置端語音轉意圖引擎,能即時將口語指令轉換為結構化的意圖與槽位。它可在從微控制器到手機、瀏覽器和桌面的各種裝置上本地運行,支援多種語言,並提供 Python、.NET、Java、Flutter、React Native、Android、iOS、Web、Node.js 和 C 的 SDK。
openspeech-team/openspeech
一個用於建構端對端自動語音辨識系統的框架,提供 20 多種 ASR 模型的參考實作與多種語言的配方。
yeyupiaoling/MASR
一個基於 PyTorch 的自動語音辨識框架,支援多種模型架構與語言的串流與非串流推論。
mybigday/whisper.rn
裝置端 Whisper(及 NVIDIA Parakeet)語音轉文字的 React Native 綁定,支援 GPU/Core ML 加速、語音活動檢測(VAD)與即時串流。
TheStageAI/TheWhisper
基於微調的 Whisper 模型,針對 NVIDIA GPU 與 Apple Silicon 上的低延遲串流與設備內推論優化之高效能語音轉文字解決方案。
TensorSpeech/TensorFlowASR
一個基於 TensorFlow 的自動語音辨識 (ASR) 框架,實作了多種 ASR 架構,並支援 TFLite 轉換以進行高效能部署。
sooftware/conformer
Conformer 架構的 PyTorch 實作,透過結合 CNN 與 Transformer 來捕捉局部與全域音訊依賴關係,從而提升語音辨識效能。