PowerBeef/Vocello

一個適用於 macOS 和 iOS 的本地首選語音工作室,使用 MLX 和 Swift 生成高品質語音,支援語音克隆與自訂語音設計,且無需依賴雲端。

nateshmbhat/pyttsx3

一個利用原生系統引擎在離線狀態下產生語音輸出的 Python 套件,無需網路連接即可進行文字轉語音轉換。

readbeyond/aeneas

用於強制對齊的 Python/C 庫與工具集,可自動將音訊朗讀與對應的文字片段同步。

ashbuilds/payload-ai

一個為 Payload CMS 添加 AI 驅動的文本、影像和語音生成功能的插件,支援多個模型提供者,並提供細粒度設定與存取控制。

SponsioLabs/Sponsio

Sponsio 是一個開源函式庫,為基於 LLM 的代理程式提供確定性、微秒級的防護機制。它讓您能編寫基於形式化方法的合約(YAML 規則集),並在每次工具呼叫時強制執行,無需呼叫任何模型即可封鎖、警告或允許操作。該函式庫與 Python 或 TypeScript 中的 LangChain、Claude、OpenAI、CrewAI 及其他代理框架整合,隨附 22 個現成的合約套件,並提供用於審計與檢視的託管控制台。基準測試顯示,錯誤行為減少超過 95%,每次呼叫延遲低於 0.2 毫秒,使其成為生產環境 AI 代理快速且可靠的安全層。

av/harbor

Harbor 是一個以 CLI 驅動的 Docker‑Compose 協調器,讓你僅需一個 `harbor up` 命令,即可啟動完整的本地 LLM 堆疊——包含模型後端(Ollama、llama.cpp、vLLM、MLX 等)、聊天前端(Open WebUI、LibreChat、AnythingLLM、…)、網路搜尋、語音、影像生成,以及基於 Boost 的智能工作流程。

marcusquinn/aidevops

aidevops 是一個 MIT 許可的 AI-DevOps 框架,提供 CLI 和 OpenCode 插件,用於在程式碼、基礎設施、產品、行銷等領域協調 AI 代理。它將工作分解為 14 個主要代理和數千個子代理,使用脈衝監督者路由任務、管理 token 預算、保護密鑰安全並維護 Git 清潔。透過 npm 或 Homebrew 安裝後,執行 `aidevops init`、`aidevops pulse` 或特定領域的斜線命令,即可自動化建置、部署、報告和業務流程,同時保持可審計性。

norse/norse

Norse 是一個基於 PyTorch 的函式庫,加入了脈衝神經網路原語(LIF、LSNN 等),用於建構、訓練與評估事件驅動模型。它提供 pip/conda/Docker 安裝方式、即用的範例任務(MNIST、CIFAR‑10、cart‑pole),並可與 PyTorch‑Lightning 整合以支援可擴展的訓練。

MigoXLab/dingo

Dingo 是一個開源的 Python 庫(以及 SaaS 產品),用於評估 AI 資料、模型輸出和 RAG 系統。支援基於規則、基於 LLM 和基於代理的檢查,可從檔案、資料庫、S3 或 Hugging Face 流式讀取資料,並提供 JSON 報告及可選的視覺化儀表板。透過 `pip install dingo-python`(含可選擴充)安裝,透過 CLI(`dingo eval …`)或 Python SDK 執行,並可透過自訂規則、LLM 提示或代理進行擴展。

nikdanilov/whisper-obsidian-plugin

一個使用 Whisper 將音訊錄音或上傳的文件轉換為文字的 Obsidian 插件,並可選擇使用 LLM 進行語法和格式的後處理。

iver56/audiomentations

一個用於音訊數據增強的 Python 函式庫,提供多種轉換方式,使音訊深度學習模型在實際應用中更加強健。

datachain-ai/datachain

DataChain 是一個 Python 函式庫,能將 S3/GCS/Azure(或本地)中的檔案轉換為儲存在輕量級 SQLite 資料庫中的版本化、型別化資料集。它無需移動原始檔案,即可對數百萬筆記錄進行快速、亞秒級的篩選、連接、聚合和向量相似度搜尋。管線以標準 Python 函式編寫;引擎負責處理平行執行、檢查點和增量更新。選用功能包括為人類/LLM 自動生成的 Markdown 知識庫,以及讓 Claude、Cursor、Codex、Copilot 或 Pi 等工具能讀取資料層的技能。託管的「Studio」服務則增加了共享資料集註冊表、分散式運算和大型媒體的 UI。使用 `pip install datachain` 安裝,並可選擇執行 `datachain skill install --target claude`。

AgentEra/Agently

Agently 是一個用於構建可靠 AI 服務的 Python 框架。它提供結構化的請求/響應合約、部分結果的即時串流、可觀察的操作(工具調用)、版本化技能以及信號驅動的工作流引擎 (TriggerFlow)。該庫抽象了模型提供商,支持模型池,並包含用於 Python、shell、網頁瀏覽、SQLite 等的內置操作。專為需要可調試性、重啟安全工作流和嚴格輸出驗證的生產級助手、內部副駕駛和 AI 支持的 API 而設計。

tolimarchuk/goalbuddy

GoalBuddy 是一個基於 npm 的 CLI,它在你的倉儲內建立一個基於檔案的「看板」,用於協調使用 Codex 和 Claude Code 等 LLM 代理的長期編碼任務。它允許你定義目標,將其分解為安全、可驗證的片段,將這些片段分派給選定的代理,捕獲 YAML 格式的收據,並透過測試、示範等 Oracle 驗證工作。看板在工具間持久存在,支援代理間的無縫交接、審計追蹤和並行子目標,且執行時開銷極小。

psyray/oasis

OASIS 是一個 Python CLI 工具,使用本地託管的 LLM(透過 Ollama 或任何 OpenAI 相容伺服器)掃描原始碼中的安全漏洞。它先執行快速掃描模型,再執行深度分析模型,對發現結果進行決定論性驗證,快取結果,並輸出標準 JSON 以及 HTML/PDF/Markdown 報告。一個密碼保護的 Web 仪表板允許使用者探索發現結果,並請求助理進行重新調查。支援多模型執行、抑制註冊表、與基線的差異比較,以及 CI 退出碼門控。

skyzh/vector-db-from-scratch

一個基於 Rust 的逐步課程,涵蓋 Arrow 表、DataFusion 整合,以及多種 ANN 索引(IVFFlat、NSW、HNSW、IVF-PQ),支援 SQL 並附帶基準測試工具。

gemelo-ai/vocos

一種使用頻譜係數與逆傅立葉變換,從聲學特徵中合成高品質音訊波形的快速神經聲碼器。

linto-ai/whisper-timestamped

openai-whisper 的擴充,為多語言自動語音辨識提供精確的單字級時間戳與置信度分數。

paul-buerkner/brms

brms 是一個 R 套件,提供高階、lme4 風格的介面,用於使用 Stan 擬合貝葉斯廣義(非線性)多層模型。它支援多種回應族群、靈活的先驗,以及一整套擬合後的診斷與視覺化工具,讓使用者無需直接撰寫 Stan 程式碼即可執行複雜的貝葉斯迴歸。

OpenVoiceOS/ovos-installer

Open Voice OS 的精簡安裝程式,讓使用者能夠在 Raspberry Pi、Linux 或 Mac 硬體上部署注重隱私的開源語音助手。

yibie/skills-manager

Skills Manager 是一款原生 macOS 應用(及配套終端 UI),可集中發現、安裝、測試和組織數十種基於 LLM 的開發者工具(如 Claude Code、Cursor、Gemini CLI、OpenHands 等)的編碼代理「技能」(提示擴展)。它將原始技能套件儲存在本地 Library 中,分組為可複用的 Collections,並透過符號連結掛載到代理中,提供衝突檢測、翻譯和離線優先操作。

CUNY-CL/wikipron

一個從 Wiktionary 挖掘多語言發音資料,以建立音素到音標(G2P)資料集的命令列工具與 Python API。

uxlfoundation/oneDNN

oneDNN(oneAPI Deep Neural Network Library)是一個開源、跨平台的效能庫,提供高度優化的 CPU 與 GPU 內核,適用於深度學習運算子。它實作 oneAPI 規範,支援 Intel、AMD、Arm,以及實驗性的 Power/IBM z/RISC‑V 硬體,並被 PyTorch、TensorFlow、ONNX Runtime、llama.cpp 等主要框架使用。

tensorflow/quantum

TensorFlow Quantum 是一個 Python 庫,將 Cirq 量子電路與 TensorFlow/Keras 集成,提供高效率的混合量子-古典機器學習模型、自動微分,以及透過 qsim 實現的可擴展模擬。

lucasjinreal/Kokoros

透過 CLI、Rust crate 與 OpenAI 相容 API 伺服器提供快速文字轉語音合成的 Kokoro TTS 模型高性能 Rust 實作。

fishaudio/audio-preprocess

一組用於人聲分離、音量匹配與轉錄等任務的音訊處理腳本,用於準備AI訓練的資料集。

Ammaar-Alam/minebench

MineBench 是一個基於網頁的基準測試工具,透過讓 LLM 對『中世紀城堡』等提示輸出體素座標,來評估其三維空間推理能力。它可視化生成結果,支援人類進行頭對頭對比,並使用 Bradley-Terry 系統對模型進行排名。平台包含成對投票用的 Arena、自訂建構用的 Sandbox、社群提示的 Gallery,以及 GLB、STL、.vox、.schem 等格式的匯出功能。支援主流 LLM 提供商,可透過 Node.js、pnpm 和 Docker 在本地執行。

justrach/kuri

一個為 AI agent 設計的輕量級瀏覽器自動化工具,以單一 Zig 二進位檔實現,無需 Node.js 依賴。

0xranx/golembot

GolemBot 是一個 Node.js 執行階段,為現有的編碼代理(Cursor, Claude Code, OpenCode, Codex)提供聊天機器人「身體」。透過單一的 `golembot gateway` 指令,您可以在 Slack、Telegram、Discord、Feishu、DingTalk、WeCom、WeChat 或自訂 HTTP API 上公開該代理,並透過微小的 YAML 設定檔切換 LLM 提供者(OpenRouter、MiniMax、DeepSeek 等)。它整合了 ClawHub 市場(13 k+ 社群技能),使代理能即時獲得新能力。功能包括內建儀表板、cron 排程器、艦隊管理,以及最小化的 JavaScript SDK(`createAssistant`)。透過 `npm i -g golembot` 安裝,執行 `golembot onboard` 進行設定,然後執行 `golembot gateway` 上線。採用 MIT 授權。

Cranot/roam-code

roam‑code 是一個本地靜態分析 CLI(及可選 MCP 伺服器),可建立程式碼庫的符號圖,讓 AI 編碼代理無需任何遠端 API 呼叫即可查詢定義、呼叫者、測試影響與風險(爆炸半徑)。它提供預飛行檢查、健康摘要、驗證門禁與 Claude 特定鈎子,全部開源且保護隱私。

mrpulor-gh/nuphus-mcp

該倉儲是一個關於 AI 桌面與瀏覽器自動化的真實軟體專案,提供一個基於 Rust 的 MCP 伺服器,透過標準輸入輸出的 JSON-RPC 與 AI 代理通訊,使 AI 代理能夠控制本機電腦,支援本地 OCR 與可選的視覺模型整合。

NaomiProject/Naomi

Naomi 是一個開源、持續在線的語音助理平台(Python,Linux/Raspberry Pi),可讓你控制家庭裝置、查詢資訊,並透過簡單的 Python 模組新增自訂「技能」。

xianyu110/clawbot

Clawdbot 是一個開源、本地執行的 AI 助手,可透過可設定的 API 代理端點連接 Claude、GPT、Gemini 等 LLM。它提供 Web 與終端機 UI、Telegram/Discord/WhatsApp 機器人,並將所有資料儲存在主機上。README 包含安裝說明(Node 22+、npm 或腳本)、模型與頻道設定的引導向導、多模型代理的詳細 JSON 設定、常見陷阱(Node 版本、環境變數誤用、遺漏欄位),以及用於管理網關、日誌與診斷的完整 CLI 命令集。

Spr-Aachen/Easy-Voice-Toolkit

Easy Voice Toolkit 將開源語音模型(Whisper、GPT-SoVITS)整合到 GUI/Colab 工作流程中,用於清理音訊、轉錄、建立語音轉換資料集、訓練自訂語音模型,以及生成轉換後的語音。它提供即開即用的 Windows 可攜式套件和 Colab 筆記本,並附有開發者友善的安裝指南。此專案僅供學術使用,並計劃未來整合 LLM 聊天機器人和 Linux 支援。

google/jax-cfd

JAX‑CFD 是一個基於 JAX 的研究級可微分 CFD 函式庫。它提供有限體積法和偽譜法求解器、可選的 ML 增強模型以及數據工具,讓使用者能夠在湍流模擬上進行基於梯度的實驗。該套件可透過 pip 安裝,附帶 Colab 演示,但目前已停止維護,建議使用更新的替代方案。

Kabanosk/whisper-website

一個使用 OpenAI 的 Whisper 在本地將音訊轉錄為文字或各種格式字幕的自托管 Web 應用程式。

teticio/audio-diffusion

一個透過將擴散模型應用於 mel spectrograms 以合成音樂與音訊迴圈的框架,支援潛在擴散與條件生成。

Xueyang-Song/paper-pilot

Paper Pilot 是一個桌面(Electron + React)研究助理,可爬取 8+ 個學術資料庫,下載 PDF,使用 SQLite + FTS5 + 向量搜尋進行索引,並允許你向本地或主機的 LLM 提出基於證據的答案。所有資料均保留在你的機器上;該應用提供可審計的引用追蹤與可重現的文獻回顧工作流程。

Deep-ai-inc/ch.at

ch.at 是一個單一二進位檔案的 Go 伺服器,讓您透過 HTTP、SSH、DNS 或 API 與 LLM(預設為 GPT-4o)進行對話,無需 JavaScript,無需帳號,且所有狀態皆保留在 RAM 中。它專注於隱私,易於自行託管,並包含一個用於透過相同輕量級協定發布訊息的公共看板。

EasyJailbreak/EasyJailbreak

EasyJailbreak 是一個開源的 Python 框架,將 LLM jailbreak 攻擊模組化。它提供現成的食譜(如 ReNeLLM、GPTFuzz、AutoDAN 等),並允許使用者插入自訂的選擇器、變異器、約束與評估器,以生成、執行與評分針對目標語言模型的對抗性提示。可透過 `pip install easyjailbreak` 或從原始碼安裝,再使用高階 API(如 `PAIR` 食譜)或自行建構攻擊流程。專案包含文件、論文、資料集與可下載的實驗結果。

ankane/torch.rb

Torch.rb 是一個包裝 PyTorch C++ 庫(LibTorch)的 Ruby gem,讓 Ruby 開發者能使用功能完整的深度學習 API。它支援張量、自動微分、神經網路模組、優化器,以及 GPU(CUDA/MPS)加速,並以 Ruby 風格的方法名稱對應 PyTorch 的 Python API。安裝需搭配對應的 LibTorch 建置版本,之後即可直接在 Ruby 中撰寫與執行模型(例如 CNN、GAN)。

FlashLabs-AI-Corp/FlashLabs-Chroma

一個支援直接音訊理解與個人化語音克隆的即時端對端多模態語音對話模型。

Firepal/stammer

一個 Python 工具,利用另一個音訊或影片來源中最接近頻譜的幀來重現音訊來源。

jacbz/Lofi

一種利用 VAE 模型將音樂軌道表示並生成為特徵向量的機器學習支援的 lo-fi 音樂生成器。

jjazzboss/JJazzLab

JJazzLab 是一個開源應用程式,可根據和弦符號和選定的音樂風格生成包含鼓、貝斯、吉他和鋼琴的真實、動態伴奏軌道。

ronibandini/reggaetonBeGone

一款基於 Raspberry Pi 3 的邊緣AI裝置,可在本地運行 Edge Impulse 音訊分類模型以檢測雷蓋頓。當置信度超過 95% 時,觸發藍牙流程禁用設定好的喇叭。包含 OLED 反饋、啟動按鈕、日誌記錄以及完整的軟硬體說明。

kristianvast/hermes-claude-auth

hermes‑claude‑auth 是一個 Python 執行時補丁,可在 Anthropic 於 2026‑04‑04 引入 OAuth 驗證後,讓 hermes‑agent 繼續使用 Claude Code 訂閱。它安裝一個 .pth 沙盒,對代理的請求建構器進行猴子補丁,添加必要的計費頭,修復提示佈局,並實作對訂閱視窗速率限制的自動等待。安裝程式支援 Linux/macOS 和 Windows,提供卸載腳本,並透過 git 鈎子 + cron 恢復機制,確保在 hermes 更新後仍能存活。

JeremyCCHsu/Python-Wrapper-for-World-Vocoder

一個用於 WORLD Vocoder 的 Python 包裝器,透過將音訊分解為音高、頻譜包絡和非週期性,實現高品質的語音分析與重新合成。