microsoft/TypeAgent

TypeAgent 是微軟開源的一個範例,展示如何使用大型語言模型、結構化提示和一種新穎的「結構化 RAG」記憶系統,建構單一的個人 AI 助理。它包含一個 Electron 外殼、一個將自然語言請求路由至類型化代理的調度器、一個將對話事實儲存為邏輯實體的記憶層,以及一個減少 LLM 呼叫的快取。該倉儲提供許多範例代理(日曆、郵件、瀏覽器等)和一個用於新增自訂代理的 SDK。這是一個早期階段的範例程式碼,僅在 Azure OpenAI 上以英文測試過,未經進一步驗證前不適合用於生產環境。

erdogant/bnlearn

bnlearn 是一個用於學習、參數化與查詢貝葉斯網路的 Python 套件。它支援結構發現(各種評分與搜尋方法)、CPT 評估、因果推論(do-計算)、合成資料產生與可視化,所有功能皆封裝於簡單的 API 中。

bugbakery/transcribee

一款開源的音訊與影片轉錄工具,利用 AI 生成自動草稿,並支援協作式手動編輯。

joaopauloschuler/neural-api

一個原生 Pascal 深度學習函式庫(CAI Neural API),可在 CPU(AVX)或 OpenCL GPU 上執行現代 LLM、音訊生成、影像超解析度與經典視覺模型,編譯為單一二進位檔,無需 Python 或 CUDA。

FonaTech/Clouds-Coder

Clouds Coder 是一個 Python 執行環境,將 CLI 執行與瀏覽器基礎 IDE 分離,加入 AI 代理編排功能,並提供僅限局域網的協作工作區,支援版本化檔案、衝突解決與管理員批准的工具策略。

jim60105/docker-whisperX

一組為 WhisperX 優化的 Docker 映像,提供預打包的 ASR 模型,支援詞彙級時間戳,實現快速且高效的語音轉文字轉錄。

TalAter/annyang

一個輕量級的 JavaScript 函式庫,使用語音辨識技術使用戶能夠透過語音指令控制網站。

lenML/Speech-AI-Forge

一個統一的框架與 API 伺服器,為包括 ChatTTS、CosyVoice 與 Whisper 在內的多種 TTS 與 ASR 模型提供集中式介面。

open-mmlab/FoleyCrafter

FoleyCrafter 是一個影片轉音訊生成框架,能根據無聲影片的視覺內容產生真實且同步的音效。

brailcom/speechd

一種裝置無關的語音合成介面,提供統一 API 以存取多個文字轉語音引擎。

walkingddd/CPA-Helper

CPA‑Helper 是一個自架設的 Web 仪表板(Go 後端 + Vue 前端),用於管理 CLIProxyAPI/CPA 帳戶。它提供多使用者分析、使用者級 API 金鑰處理、餘額限制、模型價格目錄以及 Codex 認證檔的健康檢查,所有資料均本地儲存在 SQLite 中。

CopilotC-Nvim/CopilotChat.nvim

一個將 GitHub Copilot Chat(及其他 LLM)直接嵌入編輯器的 Neovim 插件,提供聊天、工具呼叫、自訂提示和自動化用的 Lua API。

nishuzumi/gemini-teacher

基於 Google Gemini 的 AI 驅動英語口說助手,提供即時發音反饋與文法修正。

dseditor/QwenASRMiniTool

一個本地離線的語音識別字幕生成工具,支援音訊、影片和麥克風錄音轉SRT字幕,基於Qwen3-ASR和Whisper模型,可純CPU或GPU加速,內建多種特化語言模型、說話人分離和卡拉OK逐字模式,並附帶命令列介面和OpenAI相容API。

chenpipi0807/ComfyUI-Index-TTS

一個實現高品質語音克隆與文字轉語音的 ComfyUI 擴充套件,支援多語系、情感控制及多角色小說文字解析。

dbccccccc/ttsfm

一個使用 openai.fm 後端將文本轉換為自然語音的 OpenAI 相容文本轉語音 (TTS) API 服務與 Python SDK。

hgneng/ekho

Ekho 是一個中文文本轉語音引擎,可將書面文本轉換為口語音訊,並支援自定義語音數據整合。

bosun-ai/swiftide

Swiftide 是一個用於構建 LLM 應用程式的 Rust 框架,包含三個核心組件:用於半自主代理的代理人框架 (agent harness)、用於工作流編排的類型化任務圖 (typed task graphs),以及用於索引與檢索的串流 RAG 管線 (streaming RAG pipelines)。

facebookresearch/HolisticTraceAnalysis

Holistic Trace Analysis (HTA) 是一個 Python 庫,可讀取分散式訓練任務產生的 PyTorch Profiler(Kineto)追蹤檔案,並生成資料框與視覺化圖表,展示 GPU 在計算、通訊、記憶體或閒置狀態上耗費的時間。它提供內核級分解、閒置時間原因分析、通訊-計算重疊、頻繁內核模式、啟動時間統計、增強的記憶體頻寬/佇列長度計數器,以及追蹤對比工具。透過 `pip install HolisticTraceAnalysis`(Linux/macOS,Python ≥ 3.10)安裝,並在筆記本中使用 `TraceAnalysis` 類取得各分析結果的 pandas DataFrames。提供文件、範例與實驗性 CUPTI 計數器 API。

tsurumeso/vocal-remover

透過將人聲與背景音樂分離,使用深度學習從歌曲中提取伴奏音軌的工具。

ML-KULeuven/deepproblog

DeepProbLog是一個Python函式庫,透過引入神經述詞(其機率由PyTorch模型輸出的事實)將ProbLog的機率邏輯程式設計與深度學習結合。它支援精確推理和可選的近似推理,包含研究論文中的範例實驗,並可透過`pip install deepproblog`安裝。

rossoctl/rossoctl

Rossoctl 是一個開源、Kubernetes 原生平台,透過 RossoCortex 資料平面攔截 AI 代理,強制執行身分、授權、韌性與可觀測性。它提供可重複使用的服務(技能、工具、記憶、知識庫、沙箱)與管理工具,使跨框架的可信、生產級代理部署成為可能。

nnstreamer/nnstreamer

NNStreamer 提供 GStreamer 外掛程式,讓開發人員能將神經網路推論直接嵌入媒體管線中,支援 Linux、Android、Tizen 和 macOS 上的多種 AI 框架與硬體加速器。

halo-dev/upage

UPage 是一個開源、基於 Docker 的平台,利用大型語言模型將自然語言描述轉化為完全響應式的網頁。它提供視覺化編輯器、多頁面生成與乾淨的 HTML/CSS/JS 匯出功能,並支援任何相容的 LLM API。

backmeupplz/voicy

一個使用工作佇列架構和 GPU 加速轉錄的 Telegram 機器人,可自動將音訊訊息轉換為文字。

tequilahub/tequila

Tequila 是一個用於建構與最佳化變分量子演算法的 Python 框架。它提供電路、哈密頓量與期望值的抽象物件、自動微分,並與多種量子模擬器(Qulacs、Qiskit、Cirq 等)及量子化學套件(Psi4、PySCF、Madness)無縫支援。使用者撰寫高階程式碼,呼叫 `tq.minimize`,即可在模擬器或實際硬體上執行。

aliyun/alibabacloud-bailian-speech-demo

阿里雲百煉開發者範例集。可使用Qwen-Audio及其他模型實現語音辨識、合成和即時語音對話。

jcvasquezc/DisVoice

一個用於從語音中提取聲學與語言特徵,以檢測語音障礙並識別情緒的 Python 框架。

wenet-e2e/wekws

專為低功耗物聯網裝置設計的、可投入生產的端對端小型喚醒詞檢測工具包。

Azure-Samples/cognitive-services-speech-sdk

一組跨平台程式碼範例,展示如何使用 Microsoft Cognitive Services Speech SDK 進行語音辨識、合成與翻譯。

BindsNET/bindsnet

BindsNET 是一個基於 PyTorch 的函式庫,用於在 CPU 或 GPU 上建構和模擬脈衝神經網路。它提供神經元模型、生物啟發的學習規則(例如 STDP),以及將 SNN 轉換為 ML 或 RL 代理的工具。可透過 pip、Poetry 或 Docker 安裝,並執行從 MNIST 非監督學習到 Atari 遊戲的各種範例。

lean-dojo/LeanCopilot

Lean Copilot 是一個將大型語言模型整合為 Lean 4 證明自動化戰術的函式庫。提供 `suggest_tactics`、`search_proof` 和 `select_premises` 等命令,內建預建構的 BYT5 模型,並可透過簡單的 HTTP API 接入任何外部模型。透過標準 Lake 套件管理器安裝,可在任何 Lean 專案中立即使用。

inworld-ai/tts

一個支援單機或多機 GPU 集群上進行預訓練、SFT 與 RLHF 對齊的 SpeechLM 基於語音合成系統之訓練與模型框架。

openyak/openyak

OpenYak 是一個開源桌面 GUI (Electron + React),讓您能與 Codex 或 Claude Code 代理進行對話,同時將所有對話記錄、檔案和專案資料保留在本地 (Rust + SQLite)。它透過 stdio 整合官方執行環境,顯示參考檔案 (Markdown, HTML, PDF, DOCX, 程式碼),並提供一個由 Playwright 驅動的共享瀏覽器,讓使用者與代理皆可控制同一個頁面。請使用 Node 26、Rust 1.90 以及您自己的 Codex/Claude CLI 二進位檔案執行;應用程式目前為 v2 alpha 版本,採用 Apache-2.0 授權。

machinewrapped/llm-subtrans

LLM‑Subtrans 是一個基於 Python 的桌面與 CLI 工具,使用 LLM API(Gemini、OpenAI、Anthropic 等)翻譯字幕檔案(SRT/ASS/VTT)。支援可插入的字幕格式、可選音訊轉錄、專案檔案續傳及多種高階 CLI 選項。可透過預先建構的 Windows/macOS 套件或虛擬環境安裝程式從原始碼安裝;透過簡單 GUI 或命令列執行,只需提供提供者的 API 金鑰即可使用。

neiltron/apple-health-mcp

一個本地 Node.js 伺服器,讓 AI 助理客戶端(透過 MCP)能夠使用記憶體中的 DuckDB 資料庫,對個人的 Apple Health CSV 匯出檔案執行 SQL 查詢。它提供結構發現、即時查詢與健康摘要報告,同時確保資料保留在使用者電腦上。

ksenxx/kiss_ai

KISS Sorcar 是一個開源、本地優先的 AI 代理框架,運行守護程序(`kiss‑web`),並透過 VS Code、Web/行動與 Python 介面發出自然語言任務。支援您設定的任意 LLM(OpenAI、Anthropic、Gemini、本地端點等),可在單一工作流程中混合多個模型,並提供 43 個內建第三方代理,用於訊息、郵件、智慧家居與生產力服務。自訂 Python「擴充代理」可讓您為每個任務定義提示、工具、預算與安全鈎子。所有提示皆保留在您的機器上;系統處理 git worktree 隔離、語音喚醒詞、定時自動化與工具呼叫,是一款注重隱私、可擴充的個人 AI 助手。

linuxrebel/DocuBrowser

DocuBrowse 是一款離線、AI增強的文件搜尋工具。它可索引多種檔案類型,支援關鍵字、語意和混合搜尋(使用本地Ollama嵌入),提供文件內「深度連結」,並能使用本地模型生成AI摘要。所有操作均在本地執行,保障隱私,且已打包為Linux、Windows和macOS版本。

kstonekuan/tambourine-voice

一個開源的通用語音轉文字介面,利用 AI 將語音轉錄並格式化為乾淨文字,直接輸入到任何活躍應用程式中。

Lamatic/AgentKit

AgentKit 是一個開源 SDK,提供 70 個現成的「套件」(完整應用、流程或範本),用於建立、測試與部署 AI 代理。套件由簡單的設定檔定義,可在視覺化流程工作室中編輯,並以無伺服器運行的 Next.js 應用形式交付。該集合涵蓋支援分診、程式碼審查、RAG 聊天、招聘助理、法律/醫療機器人等多種業務導向代理,是一個即時可用的平台,可快速建立可靠、企業級的 AI 代理。

istupakov/onnx-asr

一個用於自動語音識別 (ASR) 的輕量級 Python 套件,使用 ONNX 模型,無需 PyTorch 或 Transformers 即可在邊緣與伺服器硬體上實現快速部署。

cyberofficial/Synthalingua

一个用于实时转录和翻译直播流、麦克风音频和视频文件到英文和其他语言的自托管 AI 工具。

AudarAI/Audar-ASR-V1

一套以阿拉伯語為首要目標的生成式語音辨識模型家族,可為方言阿拉伯語與代碼切換語音提供業界領先的轉錄表現。

janvarev/Irene-Voice-Assistant

一款預設離線運行的俄語語音助手,支援可擴充的插件與 LLM 驅動的自然語言指令處理。

cmusphinx/pocketsphinx

PocketSphinx 是一個開源、離線的語音轉文字引擎(C 庫,附帶 Python 繫結),可在低資源裝置上高效運行。它提供命令列工具與 API,用於辨識或對齊音訊,並將結果輸出為 JSON 格式。

ManimCommunity/manim-voiceover

一個將 AI 配音與錄音工具直接整合至 Python 中的 Manim 插件,利用 OpenAI Whisper 實現逐字動畫同步。

Migushthe2nd/MsEdgeTTS

一個簡單的 Azure Speech Service 模組,利用 Microsoft Edge Read Aloud API 為伺服器端執行階段提供文字轉語音合成。

PowerBeef/Vocello

一個適用於 macOS 和 iOS 的本地首選語音工作室,使用 MLX 和 Swift 生成高品質語音,支援語音克隆與自訂語音設計,且無需依賴雲端。