echogarden-project/echogarden
一個完整的 Node.js 語音處理工具集,提供離線與雲端的文字轉語音、語音轉文字以及音訊對齊工具,無需 Python 或 Docker。
baskduf/FableCodex
FableCodex 是一個 Codex 插件,為程式碼產生任務強制執行基於證據的多階段工作流程(目標清單、發現門禁、驗證),幫助使用者在大型或安全關鍵變更中避免遺漏步驟,且不修改底層模型。
finnvoor/yap
使用 Apple 的 Speech.framework 在 macOS 上對檔案、即時系統音訊與麥克風輸入進行裝置端語音轉錄的 CLI 工具。
tgies/klattsch
一個原始的並行共振峰語音合成器,可在瀏覽器、Node.js 與 CLI 中重現 1970 年代與 80 年代電腦語音的復古音色。
NSHipster/sosumi.ai
sosumi.ai 是一個基於 Node 的服務,可將 Apple 開發者文件(包括 Swift 文件、HIG 和 WWDC 轉錄)轉換為乾淨的 Markdown 格式,使 AI 模型和自動化工具能輕鬆使用。提供簡單的 URL 重寫、HTTP/MCP API、CLI、Chrome 擴充功能,並可在 Cloudflare Workers 或任何 Hono 兼容執行環境中自托管。
McCloudS/subgen
一個自架設的 AI 字幕生成工具,可與 Bazarr、Plex、Jellyfin 和 Emby 整合,為個人媒體資料庫生成字幕。
nethical6/conversation-steganography
Conversation Stenography 是一個開源的 Go CLI 工具,使用 AES-SIV 加密秘密訊息,將密文編碼為本地運行的 LLM(例如 Llama 3.2 或 GPT-2)的 token 選擇,並輸出外觀自然的覆蓋文字。使用者將該文字複製到任何聊天應用中;接收方執行相同工具以解碼並解密隱藏訊息。系統完全離線運作,使用共享密語(PBKDF2 派生金鑰),並透過訊息鏈結確保完整性。包含設定精靈、模擬模式與多個 CLI 命令,但屬於概念驗證,易受現有隱寫偵測方法攻擊。
mikeoliphant/neural-amp-modeler-lv2
一個使用 NeuralAudio 引擎播放神經網路機器學習放大器模型的 LV2 插件。
kadirnar/whisper-plus
一個全面的音訊與影像處理工具包,擴展 OpenAI 的 Whisper,支援轉錄、說話人分離、摘要以及基於 RAG 的影片聊天。
vercel-labs/coding-agent-template
一個由 Vercel 托管的範本,允許經過驗證的使用者建立 AI 驅動的編碼任務(Claude、Codex、Copilot、Cursor、Gemini、opencode)。它會啟動一個 Vercel Sandbox,執行所選代理,將變更提交至 AI 生成的分支,並顯示即時日誌。使用 Next.js 15、Tailwind、Neon Postgres 和 Vercel AI Gateway 建構;支援多使用者 OAuth、使用者級 API 金鑰,以及可選的沙箱保持運行功能,用於迭代式工作。
yym68686/uni-api
uni‑api 是一個僅透過設定運作的伺服器,提供單一 OpenAI 相容 API,同時將請求路由至多個 LLM 提供商(OpenAI、Anthropic、Gemini、Vertex、Azure、AWS 等)。支援加權與輪詢負載平衡、自動重試、每模型超時、速率限制、工具呼叫透傳、內容審核以及細粒度請求覆蓋——所有設定皆透過 `api.yaml` 檔案或 `CONFIG_URL` 定義。可作為 Docker 容器部署(提供一鍵 Fugue 按鈕)
stenolabs/stenoai
一款以隱私為首要考量的人工智慧筆記本,在本地裝置上錄製、轉錄並摘要機密會議,以確保資料絕不離開現場。
braindecode/braindecode
Braindecode 是一個 Python 工具箱,將深度學習模型應用於原始大腦訊號資料(EEG/ECoG/MEG)。它提供了資料集載入器、前處理、數種現成的神經網路架構以及視覺化工具,全部建構於 PyTorch 和 MNE-Python 之上。可透過 `pip install braindecode` 安裝,主要目標使用者為處理神經生理資料的神經科學家與機器學習研究人員。
SciML/NeuralPDE.jl
NeuralPDE.jl 是一個 Julia 庫,使用物理資訊神經網路求解 ODE、SDE、RODE 和 PDE。它能從符號方程自動產生損失函數,支援使用 Flux/Lux 進行 GPU 訓練,並可與 NeuralOperators 集成以建構高階神經運算子模型。
dimastatz/whisper-flow
一個基於 OpenAI Whisper 的即時轉寫服務,透過串流處理而非批次處理,提供低延遲的語音轉文字功能。
BUTSpeechFIT/DiariZen
一個利用自監督學習與結構化剪枝技術,在音訊錄製中準確識別「誰在何時說話」的說話人日誌工具包。
bigsk1/voice-chat-ai
一個語音驅動的 AI 界面,支援多種 LLM 與 TTS 服務提供者,支援即時對話與本地語音克隆。
LambdaTest/agent-skills
一個 Node.js 函式庫,為 AI 編碼助手(Claude Code、Copilot 等)提供外掛式「技能」,用於產生 Selenium、Playwright、Cypress 等測試自動化程式碼,並在 TestMu AI 雲平台上執行。
Quantatirsk/qwen3-asr
Qwen3‑ASR 是一個自托管語音轉文字伺服器,封裝了 Qwen3‑ASR 模型(0.6 B 與 1.7 B)。它自動選擇 GPU‑vLLM 後端或 CPU‑Rust 後端,提供 OpenAI 與阿里雲相容的 HTTP/WebSocket API,支援說話人分離、基於 VAD 的分段、批次推理,並可透過 Docker、自訂 GPU 鏡像或離線 tarball 部署。MIT 許可證。
IBM/LNN
LNN 是一個 Python 庫,用於神經符號人工智能,將邏輯公式表示為加權神經網絡,即使在知識不一致或不完整的情況下,也能實現可解釋、可微分的推理與學習。
huisezhiyin/sdd-riper
SDD‑RIPER Light 是一個輕量、原生於倉儲的框架,為基於 LLM 的編碼代理添加控制平面。它定義了一個清晰的循環——重述目標、建立最小規格、等待人類審核、執行、以證據驗證,並將結果同步回專案,使代理能安全、可審計、可恢復地修改程式碼。四個模組化「技能」(light、strict、codemap、new‑chat‑ready)涵蓋日常任務、高風險工作、陌生程式碼庫與交接場景。
leiting-eric/DailyBrief
DailyBrief 是一個自托管的 Node/TypeScript 應用,聚合 26 個免費新聞來源、21 個標的的市場資料與 AI 生成摘要,生成雙語(中文/英文)單頁 HTML 報告。支援六種可交換的 LLM 後端,提供三種部署方式(GitHub Actions + Pages、本地一鍵安裝、AI 代理安裝),僅需承擔 LLM API 呼叫成本(使用 DeepSeek 時約 1 美元/月)。
timoncool/ACE-Step-Studio
一個使用 ACE-Step 1.5 XL 模型在本地生成包含人聲、歌詞與音樂影片的完整歌曲的 AI 音樂製作工作室。
huanchong-99/SoloDawn
SoloDawn 是一款開源 Web 應用程式,可實現全棧軟體開發自動化。它透過一個由 LLM 驅動的主要代理來編排多個 AI 命令列工具(Claude Code、Codex 等),並根據需求生成子代理。任務在並行的 Git 分支中執行,每個分支都會通過三層品質檢查。當生成的程式碼符合 90 分的評分標準時,會自動合併,從簡單的自然語言描述直接交付可投入生產的產品。
strands-labs/ai-functions
Strands AI Functions 是一個 Python 庫,可將外觀普通的函數轉換為基於 LLM 的代理。使用 `@ai_function` 裝飾器,你撰寫一個帶有文件字串提示的普通函數;該庫建構提示、呼叫模型(Bedrock、OpenAI、Claude 等)、解析類型化結果,並可自動重提示,直到使用者定義的後置條件通過。函數可返回真實的 Python 物件(如 pandas DataFrames),支援非同步執行,可在 *AI 線程* 中保持狀態,並可透過協調器在本地或透過 WebSocket 進行團隊編排。功能包括自修正迴圈、經濟意識模型選擇、記憶體支援的最佳化,以及用於管理分散式代理的 CLI/TUI。透過 `pip install strands-ai-functions` 安裝(可選擴充支援 Claude、Kiro、Codex)
FrigadeHQ/yap
一款輕量級、在設備上運作的 macOS 語音輸入工具,利用 Apple 原生語音 API 將轉錄文字私密地貼上至任何活躍應用中。
fluxions-ai/vui
Vui 是一個開源、即時的語音助手技術棧,它將語音轉文字 (ASR)、本地 LLM 以及流式 TTS 模型 (Vui Nano, 300 M 參數) 整合在一起。它提供 WebRTC/WebSocket 管道,具備輪流對話、中斷功能、OpenAI Realtime-API 相容性、單次語音備忘錄 HTTP 端點、可插拔的 ASR (faster-whisper 或 Moonshine) 與 LLM 後端 (Ollama, vLLM, OpenAI 相容), 工具路由、語音複製與可選的 Claude 風格任務委派。可透過一鍵式腳本或 Docker-compose 安裝;支援 Linux + NVIDIA GPU, macOS + MLX, 以及透過 Cloudflare Tunnel 或 Tailscale 進行行動裝置存取。
MoonInTheRiver/DiffSinger
一個基於擴散模型的框架,可從歌詞、MIDI 和音高數據生成高品質的歌聲合成與文字轉語音生成。
GetBindu/Bindu
Bindu 是一個開源框架,可將任何基於 LLM 的代理轉換為安全、身份驗證、支付功能齊全的網際網路服務。它提供內建 mTLS、DID 簽章、透過 Hydra 的 OAuth2、USDC(x402)支付強制、技能廣告、推播通知以及多語言 SDK(Python、TypeScript、Kotlin)。透過一次 `bindufy()` 呼叫,即可獲得 JSON-RPC 端點、可選的公開隧道與部署助手,輕鬆建構代理群組、付費 API 或受監管的 B2B 代理整合。
watzon/pindrop
一款利用設備內轉寫引擎實現私密、離線語音轉文字的 Mac 原生 AI 語音輸入應用。
sp-uhh/sgmse
一個基於 PyTorch 的擴散式生成模型實作,用於語音增強與去混響,從音訊信號中去除噪音與混響。
prophesier/diff-svc
一個使用擴散模型將輸入的歌聲轉換為目標音色,並提供基礎音高修正支援的歌聲轉換工具。
VRCWizard/TTS-Voice-Wizard
一款為 VRChat 及其他環境設計的無障礙工具,能將語音轉文字與文字轉語音,提供即時翻譯與化身整合功能。
aa0101181514/tw-legal-rag
tw-legal-rag 是一個開源 Python CLI,連接到託管的語意搜尋服務,該服務包含 2200 萬+ 份台灣判例、法規與行政裁決。它支援自然語言搜尋、取得精確案件編號、將結果(包括摘要、判例歷程與引用白名單)打包為 JSON 檔案,並對 LLM 生成的答案執行確定性引用核驗。該工具本身不呼叫 LLM,無需 API 金鑰,作為法律 AI 應用的檢索增強生成(RAG)前端使用。
MaKTaiL/gemini-srt-translator
Gemini SRT 翻譯工具是一個使用 Google Gemini 模型翻譯或轉錄字幕檔案(`.srt`/`.ass`)的 Python 套件。它可透過命令列工具(`gst`)或 Python API 使用,能利用 FFmpeg 從影片中提取字幕/音訊,支援續傳安全的批次處理、模型調校、企業版 Vertex AI 認證,並可作為技能安裝至 AI 程式碼代理。
Stability-AI/stable-audio-metrics
音樂與音訊生成模型的評估指標集合,提供對長時立體聲音訊計算弗雷歇距離、KL散度與CLAP分數的工具。
HexmosTech/git-lrc
git-lrc 是一款基於 Go 的工具,可安裝全域 Git hook,在每次提交時執行 AI 驅動的程式碼審查。它將差異檔發送至可配置的 LLM(預設為 Gemini),返回行內註解、風險評分及投影片摘要,並將審查狀態記錄在提交訊息中。每月 30k LOC 以內免費;付費方案起價為每 100k LOC 32 美元。
ankur-anand/unisondb
UnisonDB 是一個開源、原生日誌的即時資料庫,專為邊緣AI設計。它將資料儲存在 B+ 樹(BoltDB 或 LMDB)中,同時透過寫前日誌(WAL)以 gRPC 或物件儲存(S3/MinIO)方式即時複製。系統提供基於 Raft 的高可用寫入、亞毫秒級變更通知與多模型支援(KV、寬欄位、大物件),使數千個邊緣節點無需獨立串流基礎設施即可保持同步。
ratwithacompiler/OBS-captions-plugin
一款利用 Google Cloud Speech Recognition API 為 Twitch 直播與 VOD 提供即時字幕的 OBS 外掛程式。
AaronZ345/GTSinger
一個大規模、多語言的歌唱語料庫,包含專業錄音與真實音樂樂譜,旨在提升 AI 歌唱語音合成與技術控制能力。
decocms/studio
deco Studio 是一個開源的、以 TypeScript 為先的平台,允許組織運行私有 AI 代理。它提供了一個統一的模型上下文協定 (MCP) 控制平面,用於路由模型呼叫、管理與內部工具的安全連接、處理 SSO/RBAC、審計日誌和成本分攤。代理封裝了上下文、工具和策略;連接儲存了用於 GitHub、Slack 或資料庫等的加密憑證;模型層是可互換的(OpenRouter, Anthropic, OpenAI 等)。該系統可以在本地、Docker 或透過 Kubernetes 上的 Helm 執行,並包含透過 OpenTelemetry 實現的完整可觀測性。
statewright/statewright
Statewright 是一個基於 Rust 的開源框架,將 LLM 代理封裝在決定性狀態機中,強制執行各狀態的工具策略、模型路由和審批門,使程式碼生成代理更可靠。它提供 CLI/TUI、主機插件(Claude Code、Codex、Cursor 等)以及可自託管的 Docker 堆疊。
johnmarktaylor91/torchlens
TorchLens 是一個 Python 庫,用於捕獲、可視化和干預任何 PyTorch 模型(並預覽支援其他框架)的完整計算圖。它記錄每個激活和梯度,提供豐富的操作級元資料,允許您查詢或過濾張量,繪製 PDF 圖,計算感受場/投影場,並在前向傳遞中即時干預或重播圖以進行「如果……會怎樣」實驗。該工具已在超過 11,600 個架構上驗證,約 89% 透過演算法驗證,確保捕獲的激活不僅合理,而且可證明正確。
JeffreyCA/spleeter-web
一個網頁應用程式,使用 Spleeter 和 Demucs 等 AI 模型,從歌曲中分離或移除人聲、貝斯和鼓聲。
plmbr/notebook-intelligence
Notebook Intelligence (NBI) 是一個開源 JupyterLab 擴展,增加了 AI 聊天、內聯代碼生成、自動補全和自主筆記本編輯智能體。它可與 Copilot、OpenAI 兼容 API、本地 Ollama 模型或 Anthropic Claude(通過 Claude Code)配合使用。功能包括 Claude 專用工具、基於 MCP 的工具調用、多語言感知以及 AI 編輯檔案的即時重新載入。
dectalk/dectalk
一個為現代平台保留並編譯經典 DECtalk 語音合成引擎原始原始碼的文本轉語音系統。
Aivis-Project/AivisSpeech
一款使用 AivisSpeech Engine 與基於 ONNX 的模型來生成情感豐富的合成語音的日文文本轉語音軟體。
sandrohanea/whisper.net
透過 whisper.cpp 提供 OpenAI Whisper 的 Dotnet 綁定,讓 .NET 應用程式能實現高效率語音轉文字轉錄與翻譯。