netease-youdao/Confucius4-TTS
Confucius4-TTS 是一個基於 LLM 的文字轉語音引擎,可在 14 種語言中實現無需參考文字的零樣本跨語言語音克隆。
asklokesh/loki-mode
Loki Mode 是一個開源 CLI/SDK,可將產品規格轉化為完全建構、測試和驗證的程式碼庫。它執行一個自主的 LLM 驅動工作流程(Reason-Act-Reflect-Verify),包含八個品質門檻檢查,並產生可由任何人重新驗證的加密綁定「證據收據」。可透過 bun/npm/Homebrew/Docker 安裝,使用 `loki quickstart` 建立新應用,或使用 `loki modernize heal` 評估和改善現有倉儲。該工具需要 Anthropic API 金鑰(或相容模型),專注於可審計、生產級程式碼生成。
kaixxx/noScribe
一個免費、開源的本地音訊轉錄與說話人辨識應用程式,專為研究人員和記者設計,以確保資料隱私。
knowsuchagency/mcp2cli
mcp2cli 是一個執行時 CLI 生成器,可將 MCP 伺服器、OpenAPI 規範或 GraphQL 端點轉換為即時可用的命令列工具。它支持 OAuth, OAuth-safe flags, baked configurations, usage-aware ranking, 與 machine-readable JSON 輸出,使 LLM agents 與開發者能夠以最小的 token overhead 進行 API 調用。
ken107/read-aloud
一款適用於 Chrome 和 Firefox 的瀏覽器擴充功能,利用文字轉語音技術將網頁文字轉換為音訊,以提升無障礙體驗並方便多工處理。
plasma-umass/scalene
Scalene 是一款快速的行級 Python 分析器,可測量 CPU、GPU (NVIDIA) 和記憶體使用情況,實現 Python 與原生代碼的分離,可視化縫合後的堆疊,並能直接從 UI 向 LLM(OpenAI、Azure、Bedrock、Ollama 等)請求優化建議。
ZaxbyHub/opencode-swarm
OpenCode Swarm 是一個 OpenCode 外掛程式,可將單一 AI 編碼提示轉化為帶門禁、可生產部署的工作流程。它強制執行審查、測試、安全掃描與文件化,支援 13 種語言,提供可恢復會話、PR 監控與多種安全/速度模式。透過 `bunx opencode‑swarm install` 安裝;透過 `~/.config/opencode/opencode‑swarm.json` 設定;使用 `/swarm agents`、`/swarm status`、`/swarm auto‑proceed` 等斜線命令控制流程。
librosa/librosa
用於音訊與音樂訊號處理的 Python 函式庫,為建構音樂資訊檢索系統提供基礎工具。
SamadhiFire/xinqingnian-maoxuan-skill
一個適用於 Claude/Codex 的技能,透過四步「毛式」分析法指導 LLM 分析卡住的專案、團隊衝突或人生決策,輸出簡潔文字摘要和可選的單檔案 HTML 報告。
TaoLiveAIGC/TaoMate
TaoMate 是一個研究級、實時音訊・影像數位人生成系統。該程式碼庫提供推論程式碼、多GPU啟動器,以及四GPU互動式瀏覽器示範。它整合了 22B LTX-2.3 轉換器、Gemma-3 文字編碼器和可選的 Gemma-4 對話模型,需要高記憶體 NVIDIA GPU 和來自 Hugging Face 的獨立模型檢查點。
diodiogod/TTS-Audio-Suite
TTS Audio Suite 是一個 ComfyUI 擴充,整合了 19 個文字轉語音、語音轉換與音訊編輯引擎(例如 F5‑TTS、DramaBox、Higgs Audio、Qwen3‑TTS、RVC)。它提供字幕感知生成、分段標籤、視覺化波形分析、靜音語音時間對齊,以及內建的 RVC 模型訓練功能,所有功能皆透過執行時隔離,確保不同引擎的相依性不會衝突。
pytorch/audio
一個基於 PyTorch 的音訊函式庫,提供用於機器學習的音訊資料處理工具,具備 GPU 加速與專用音訊轉換功能。
estebanstifli/LocalText2Voice
一款用於建立長篇有聲讀物和播客的桌面應用,使用本地或雲端 AI 文字轉語音引擎,具備內建的品質驗證和音訊混音功能。
sdatkinson/NeuralAmpModelerPlugin
一個將 Neural Amp Modeler 引擎整合至 DAW 的 VST3/AudioUnit 插件,實現 AI 驅動的吉他放大器模擬。
genomoncology/biomcp
BioMCP 是一個統一的 CLI/MCP 伺服器,讓使用者和 AI 代理能透過簡單的指令語法查詢約 30 個生物醫學資料庫(如 PubMed、ClinVar、ClinicalTrials.gov、OncoKB 等),並可在實體間轉換、執行本地研究分析及進行基因集富集分析。可透過腳本、uv/pip、Homebrew、Docker 或原始碼安裝,提供豐富來源資訊的 JSON 或終端輸出,並可直接與 Claude Code、Codex 和 Claude Desktop 整合。
vllm-project/vime
Vime 是一個用於大型語言模型(LLM)的開源 RL 後訓練框架。它結合了 slime/Megatron 分佈式訓練棧與 vLLM 推論,透過 vllm-router 提供高吞吐量的 rollout 過程,並提供靈活的數據生成管道。支援的模型包括 Qwen、DeepSeek V3 和 LLaMA 3。使用者可以透過配置 Megatron、vLLM 和 router 參數來執行 agentic RL、coding-agent RL 或自定義 RL 演算法。該儲存庫提供快速入門文件、多個現成的範例,以及為開發者提供的清晰的程式碼閱讀路徑。
tile-ai/tilelang-ascend
TileLang‑Ascend 是一個建立在 TVM 之上的 Python 風格 DSL,用於在華為 Ascend NPU 上編寫高效能 AI 核心函數。它提供了一個能發出 Ascend 專屬程式碼的編譯器,支援自動向量化、記憶體規劃與同步,並以可透過 pip 安裝的 wheel 形式發布,內含許多現成的範例(GEMM、Flash‑Attention 等)。
matrixorigin/memoria
Memoria 是基於 MatrixOne 資料庫建構的 AI 代理記憶的 Git 風格版本控制層。它為每一次記憶變更提供快照、分支、合併與回滾功能,支援混合向量/全文搜尋、自動矛盾偵測,並採用隱私優先的部署模式(雲端或自托管)。代理透過 MCP 命令或 REST API 與之互動,使記憶可安全修改、可審計且可在會話間重複使用。
SUC-DriverOld/MSST-WebUI
一個基於網頁的 Music-Source-Separation-Training 界面,允許使用者使用各種 AI 模型從音樂軌道中分離人聲與樂器。
bolna-ai/bolna
Bol na 是一個開源框架,可協調語音轉文字、LLM 和文字轉語音服務,建構可發起與接收電話通話的語音優先助理。它提供核心伺服器、通話 Webhook(Twilio/Plivo)、Redis 和 ngrok 的 Docker-Compose 容器,並提供 Python SDK(`Assistant`)用於建構串流管道。該平台與提供者無關(支援 Deepgram、Azure、OpenAI、ElevenLabs、AWS Polly 等),並可擴充至新的通話或音訊服務。
royshil/obs-localvocal
一個使用 OpenAI 的 Whisper 提供即時、本地語音轉文字轉錄與翻譯的 OBS 插件,確保隱私且無雲端成本。
DeadWaveWave/opencove
OpenCove 是一款跨平台的 Electron 應用程式,提供一個無限的 2D 畫布,讓您可以在上面放置執行 AI 編碼代理(如 Claude Code、Codex)的終端機、筆記、任務和圖片。佈局、終端機輸出和代理狀態會在重啟後保留,您還可以為畫布建立快照以便日後重複使用。它的目標是讓 AI 助理的工作流程空間化,而不是隱藏在分頁或冗長的聊天記錄中。
elevenlabs/elevenlabs-python
ElevenLabs 的官方 Python SDK,可讓開發者將逼真的 AI 文字轉語音、語音克隆與即時對話式 AI 代理整合至其應用程式中。
prathoshap/vagdhenu
一種生產級的梵文吟誦文本轉語音系統,能夠生成傳統的旋律吟誦,而非平淡的朗讀語音。
spotify/pedalboard
一個高效能的 Python 函式庫,用於讀取、寫入與套用專業級音訊效果及第三方 VST3/Audio Unit 外掛程式至音訊檔案與即時串流。
LearnPrompt/humanize-ppt
Humanize PPT 是一個開源 Python 編排工具,可將 Markdown 轉換為觀眾狀態轉移(AST)投影片計畫,決定每頁媒體內容,將渲染任務交給下游 HTML 或 PPTX 技能,執行自動簡報檢查以標記「好看但無法講解」的投影片,並產生輕量級講者外殼。它可透過簡單技能安裝與 AI 代理(Claude‑Code、Codex、Hermes)整合,支援下游渲染器如 `guizang-ppt-skill`、`frontend-slides`、`ppt‑master` 和媒體生成器(`baoyu-image-gen`、Remotion)。MIT 許可證。
flybirdxx/ComfyUI-Qwen-TTS
基於 Qwen3-TTS 模型的 ComfyUI 自訂節點,支援高品質語音合成、零樣本語音克隆與自然語言驅動的語音設計。
mbailey/voicemode
一個為 Claude Code 和其他 MCP 相容代理設計的語音介面,支援使用雲端或本機語音服務,實現自然、免提的對話。
Dicklesworthstone/coding_agent_session_search
一個基於 Rust 的終端 UI 與 CLI,將數十個 AI 編碼助手的對話日誌聚合、歸一化並索引至本地 SQLite 歸檔中。提供 60 毫秒以下的詞法搜尋與可選的設備內 MiniLM 語意搜尋,並提供穩定的 JSON 機器人模式 API,用於自動化與診斷。
KoljaB/RealtimeSTT
一個提供快速、即時轉錄功能,並內建語音活動檢測與喚醒詞支援的 Python 語音轉文字程式庫。
di-sukharev/opencommit
OpenCommit 是一個 Node.js CLI,利用 LLM(OpenAI、Anthropic、Ollama 等)從暫存變更中自動產生符合規範、帶表情符號的 Git 提交訊息。支援全域與專案級設定、多提供者、本地模型伺服器、Git 鈎子與 GitHub Action,實現提交訊息的自動優化。
richardr1126/openreader
一個開源、自托管的語音朗讀文件閱讀器,支援 EPUB、PDF、TXT、MD 與 DOCX 檔案的同步朗讀播放。
OpenMOSS/MOSS-Audio
MOSS-Audio 是一個開源音訊理解模型,統一了語音、環境音與音樂分析,並具備強大的時間感知與推理能力。
kigner/audio.cpp-webui
基於 ggml 的高性能 C++ 音訊推理框架,可在多種硬體後端上實現 TTS、ASR 與語音複製模型的快速、便攜本地執行。
riba2534/happyclaw
HappyClaw 是一個自托管平台,可將 Anthropic Claude Code 代理作為長期運行的多使用者服務執行。它封裝了 Claude Agent SDK(TypeScript)與 Claude Code CLI,提供基於 Web 和 8 個即時通訊管道的介面,支援隔離工作區(主機或 Docker)、完整的 Claude Code 功能(檔案存取、Shell、瀏覽器、插件)、排程、使用量追蹤,以及企業級 RBAC 與備份。
hkjarral/AVA-AI-Voice-Agent-for-Asterisk
一個為 Asterisk 與 FreePBX 所設計的開源 AI 語音代理,提供 STT、LLM 與 TTS 提供商的模組化流程,可建立生產就緒的語音機器人。
magenta/magenta-realtime
專為 Apple Silicon 上的音訊串流優化的即時音樂生成開源權重模型及推論引擎。
Eddycrack864/UVR5-UI
一個基於 `python-audio-separator`(UVR5 的 Python 版本)的使用者友善圖形介面,支援使用多種 AI 模型從音訊與影片檔案中分離人聲與樂器。
f-is-h/Usage4Claude
Usage4Claude 是一款原生的 macOS 選單列應用程式,能即時監控 Anthropic Claude (以及可選的 OpenAI Codex) 的訂閱配額。它支援所有 Claude 產品、多帳號、自適應刷新、彩色環狀用量圖、通知功能,並將憑證安全地儲存在 macOS Keychain 中。您可以透過預建的 DMG 安裝,或使用 Swift/SwiftUI 從原始碼構建。
andimarafioti/faster-qwen3-tts
使用 CUDA 圖捕獲技術的高效率推論引擎,實現 Qwen3-TTS 的即時、低延遲語音克隆與語音生成。
FireRedTeam/FireRedASR2S
一個工業級的全功能 ASR 系統,整合語音辨識、語音活動偵測、語言辨識與標點預測,並針對中文方言提供專屬支援。
ttlequals0/MinusPod
一個使用 Whisper 和 LLM 自動偵測並移除播客節目廣告的自架設伺服器,透過乾淨無廣告的 RSS 訂閱源提供服務。
JordyZomer/lemmalog
Lemmalog 是一個基於 Rust 的 Datalog 引擎,可將 LLM 提取的三元組轉化為可驗證、可增量更新的記憶儲存。支援置信度加權事實、時間有效性、實體標準化、證明樹生成以及混合 BM25 加實體檢索層。透過 CLI、REPL 或 JSON-RPC MCP 伺服器整合,驅動 Claude Code/Kimi 代理,在 MemEval 風格基準測試中表現優異,同時使用的令牌遠少於全上下文基線。
sdatkinson/NeuralAmpModelerCore
一個核心 C++ DSP 套件,提供在音訊插件中執行神經放大器模型所需的神經網路邏輯。
langchain-ai/social-media-agent
一個由 LLM 驅動的智能體,可抓取 URL、起草 Twitter/LinkedIn 貼文,經人工審核後透過 Arcade 或原生 OAuth 發布。基於 LangGraph 構建,支援 Slack、Supabase、GitHub 與 YouTube 整合,並可透過提示詞檔案配置。
speechbrain/speechbrain
用於對話式 AI 的開源 PyTorch 工具包,提供語音和文本處理(包括語音識別和合成)的方案和工具。
Kieirra/murmure
Murmure 是一個開源桌面應用,使用 NVIDIA 的 Parakeet TDT 0.6B v3 模型實現離線、以隱私為先的語音轉文字。它在 Windows、macOS 和 Linux 上本地執行,支援 25 種歐洲語言,並提供無遙測的簡單語音輸入介面。
stemrollerapp/stemroller
StemRoller 是一個免費應用程式,使用 Demucs 演算法從透過整合的 YouTube 搜尋找到的歌曲中分離人聲與伴奏 stem。