modal-labs/quillman

一個由 Moshi 語音對語音模型驅動的語音聊天應用程式,提供低延遲、雙向音訊串流,實現類人互動。

flashlight/wav2letter

wav2letter++ 是一個端到端自動語音識別框架,提供實現最先進語音轉文本架構的方案 (recipes) 與預訓練模型。

Uberi/speech_recognition

一個為語音辨識提供統一介面的 Python 函式庫,支援 OpenAI Whisper、Google Speech 和 Vosk 等多種線上與離線引擎。

elevenlabs/elevenlabs-js

ElevenLabs 官方 Node.js SDK,讓開發者能將逼真的 AI 語音合成、即時音訊串流與語音驅動的 AI 代理整合至其應用中。

wildminder/ComfyUI-VoxCPM

VoxCPM 的 ComfyUI 自定義節點集成。VoxCPM 是一個無需分詞器(tokenizer-free)的 TTS 系統,能夠實現富有表現力的語音生成、自然語言語音設計以及高級語音克隆。

codeforequity-at/botium-speech-processing

一個用於開源與雲端語音轉文字 (STT) 及文字轉語音 (TTS) 服務的統一 API,簡化聊天機器人與語音應用程式的音訊處理流程。

hengruiyun/AI-Stock-Master

AI Stock Master 是一個 Windows/macOS 桌面應用程式,結合定量股票分析演算法(RTSI、TMA、MSCI)與本地運行的 LLM(Mini Ollama),為中國、香港與美國股票生成自然語言市場報告與交易信號。它是一個研究導向的工具,而非商業交易平台。

24kchengYe/MemoMind

MemoMind 是一個本地托管、GPU 加速的記憶系統,專為 AI 編碼代理設計。它將聊天、文件和日常事件中提取的事實儲存在 PostgreSQL + pgvector 中,建立知識圖譜,並提供快速的 4 方向混合檢索(語意、BM25、圖譜、時間)。代理可保留新資訊、回憶相關記憶,並對整個儲存庫進行反思。所有資料皆留在使用者機器上,可與任何 OpenAI 相容 LLM 搭配使用,並提供 Web 介面以瀏覽與匯出記憶。

adobe-research/dynasaur

DynaSaur 是一個 AI agent 框架,透過編寫與重用 Python 程式碼作為動作來解決任務,並在預定義工具不足時進行動態調整。

Paritok-official/paritok-4b-v1

Paritok 是一個開源代理,位於程式代理(Claude Code、Cursor、Codex、OpenHands 等)與 LLM API 之間。它透過(1)過濾無關工具模式,(2)使用 4B 模型壓縮檔案讀取/工具輸出/歷史記錄,(3)總結舊回合,來減少輸入 token 使用量。網關是一個 Python 套件(`paritok[proxy]`),可透過 Ollama 或 vLLM 本地執行,或透過託管 GPU 服務執行。報告的節省效果為首次回合約 25%,長時間會話超過 60%,顯著降低使用成本。專案採用 Apache-2.0 許可證,包含儀表板與 VS Code 擴充。

Picovoice/speech-to-text-benchmark

一個極簡框架,用於在各種資料集上基準測試語音轉文字引擎,以比較準確度、延遲與計算效能。

mrwadams/attackgen

AttackGen 是一個基於 Streamlit 的開源源碼工具,利用 LLM (透過 LiteLLM) 結合 MITRE ATT&CK、MITRE ATLAS 與 AI‑insider‑threat 模型來產生完整的事件響應桌面演練場景、檢測與響應報告,以及 ATT&CK Navigator layers。它支援多種 LLM 提供商,提供 chat‑assistant 進行精煉製成,可本地運行或作為 Docker container 運行,並包含一個可選的 FastMCP server 用於 agentic 整合。

nullpointexception-i/agent-sphere

AgentSphere 是一個基於 Java-Spring/React 的平台,支援 LLM 驅動的 ReAct 循環、多代理子執行、透過 Chrome 擴充套件實現的真實瀏覽器自動化、模型路由、持久化多層記憶體、人機協同澄清、OIDC SSO 以及可嵌入的聊天元件。

csdcorp/speech_to_text

一個 Flutter 插件,讓應用程式能夠在 Android、iOS 和 web 上透過原生設備的語音辨識功能來執行短語音指令與短語。

Picovoice/leopard

Leopard 是一款裝置端語音轉文字引擎,可在多個平台上提供私密、準確且運算效率高的轉錄服務。

Picovoice/cheetah

一個在裝置上執行的串流語音轉文字引擎,提供跨平台的私密即時音訊轉錄。

innovatorved/whisper.api

一個由 whisper.cpp 提供驅動、高效能的自託管語音轉文字 API,且與 Deepgram 相容,方便進行整合。

deepgram/deepgram-python-sdk

Deepgram 官方 Python SDK,提供自動語音辨識、文字轉語音與語言理解 API 的便捷整合。

CortexReach/memory-lancedb-pro

memory-lancedb-pro 是一個生產級 OpenClaw 插件,為 AI 代理提供持久、可搜尋的記憶。它自動捕獲對話片段,使用 LLM 進行分類,儲存在 LanceDB 向量+BM25 索引中,並自動將最相關的記憶注入提示。功能包括混合檢索、交叉編碼器重排序、基於 Weibull 的遺忘、按代理/使用者/專案的作用域隔離,以及對任何 OpenAI 相容嵌入提供者的支援。可透過一鍵腳本或 OpenClaw CLI 安裝,用簡短 JSON 塊配置,並透過內建 CLI 管理儲存。

ankane/neighbor

Neighbor 是一個 Rails gem,為 ActiveRecord 模型加入基於向量的最近鄰搜尋功能。支援 PostgreSQL(pgvector 或 cube)、MariaDB、MySQL(HeatWave)、SQLite、Redis 和 S3,提供多種距離度量、多種向量類型,以及精確與近似索引。可直接在 Rails 應用中建構語意搜尋、推薦或混合檢索功能。

nii-yamagishilab/project-NN-Pytorch-scripts

一個聚焦於神經語音合成器與語音偽造防禦(偽造音訊檢測)的 PyTorch 指令碼與工具集合。

elyra-ai/elyra

Elyra 是一組 JupyterLab 擴充的集合,提供 AI 專注功能,如視覺化管道編輯器、筆記本/Python/R 程式碼的批次作業執行、可重複使用的程式碼片段、基於 LLM 的程式碼協助、透過 Jupyter Enterprise Gateway 實現的混合執行環境支援,以及 Git 整合。可透過 pip 或 conda(或透過 Docker)安裝,讓資料科學團隊無需離開筆記本環境即可建構、執行與版本控制 AI 管道。

QJHWC/PaperForge

PaperForge Research OS v3 是一款基於 Python 的工具,整合了 AI 輔助論文寫作、實驗編排、產出物追蹤及可驗證的出版流程。它將每個主張與證據的連結儲存在 SQLite「科學記憶庫」中,強制執行三種執行設定檔(僅寫作、研究、完整),並支援本地、Docker、SSH、Slurm、Kubernetes 及雲端運算後端。透過 CLI (`paperforge …`) 與本地網頁 UI,使用者可執行工作流程、批准提案、使用內建模板(generic、CVPR、IEEE、Elsevier)編譯 LaTeX,並在進行密鑰掃描後發布確定性的原始碼包。專為可重現的學術研究設計,以非商業授權開源。

steipete/sag

一個命令列 TTS 工具,使用 ElevenLabs 或 60db 提供高品質 AI 語音合成,帶來 macOS 風格的 'say' 體驗。

opendilab/LightRFT

LightRFT 是一個開源、分散式強化學習框架,用於微調大型語言和多模態生成模型。它統一了訓練後端(DeepSpeed, FSDP)與 Rollout 引擎(SGLang, vLLM),支援多種 RL 演算法(GRPO, REINFORCE++, DAPO 等),並可跨文本、圖像、影片和音訊模態運作。該函式庫提供即插即用的範例(例如使用 Qwen2.5 進行 GSM8K)、詳盡的文檔與 Docker 鏡像,非常適合開發 RL 基於對齊管道的研究人員與工程師。

SaynaAI/sayna

一個基於 Rust 的高效率伺服器,為跨多個供應商的即時語音辨識(STT)與語音合成(TTS)服務提供統一 API。

optimatika/ojAlgo

ojAlgo 是一個用於高性能線性代數、數值優化(LP/QP/MIP)以及輕量級數據科學工具(神經網絡、聚類)的純 Java 庫。零外部依賴、採用 MIT 授權,適用於基於 Java 的 AI/ML 工作負載。

kitlangton/Hex

專為 Apple Silicon Mac 設計的語音轉文字工具,可在本地設備上即時轉錄語音,並將結果貼上至任何活躍應用程式中。

bootphon/phonemizer

一個 Python 程式庫與命令列工具,可使用多種後端在多種語言之間轉換文字為音標。

nv-legate/cupynumeric

cuPyNumeric 是一個在 Legate 執行時期實作 NumPy API 的 NVIDIA 函式庫,能讓 NumPy 程式碼在 GPU 和分散式叢集上執行。它提供隨插即用的相容性,支援 Linux Python 3.11-3.14,並可透過 Conda 或 PyPI 安裝。該專案現已終止維護(最終版本為 v26.06.01),但在 Apache-2.0 授權下仍可供歷史使用。

duckbugio/flock

Flock 是一個基於 Docker 的服務,透過聊天(Telegram、VK 或純文字適配器)控制一個由 Claude-Code 驅動的開發團隊。從一條訊息開始,它即可規劃、撰寫、測試、審查並提交 PR,支援可選的自檢、目標評估、定時任務和 CI 監控循環。每個聊天會話擁有獨立的隔離工作區和分支,系統與 GitHub/GitLab/Gitea 透過 PAT 集成。填寫一個小型 `.env` 檔案後,透過 `docker compose up -d` 一行命令即可部署;核心邏輯位於 `core/agents/`,適配器為輕量級封裝。

Gremble-io/Detto

一款為 Apple Silicon 設計的本地優先 macOS 應用,為會議、語音備忘錄與系統級語音輸入提供私密、本地化的語音轉錄功能,輸出結構化 Markdown 檔案。

allgpt-co/QuickVoice

QuickVoice 是一個開源、可自託管的平台,用於構建語音 AI 智能體(入站/出站通話),並對從行銷網站、控制台、API 到電話連接、RAG、計費和隱私功能在內的整個技術棧擁有完全控制權。

aws-samples/amazon-bedrock-client-for-mac

一款原生 macOS Swift 應用,可直接連接 Amazon Bedrock,讓使用者與文字、影像及其他基礎模型對話,支援檔案附加、本地工具/技能執行與自動化提示排程,所有資料均本地儲存在 Mac 上。

Palm1r/QodeAssist

QodeAssist 是一款 GPL-v3 授權的外掛程式,為 C++/QML 提供 AI 驅動的程式碼補全、聊天與行內重構。它支援本地 (Ollama, llama.cpp, LM Studio) 與雲端 LLM 供應商 (Claude, OpenAI, Gemini, Mistral, Qwen, DeepSeek, 等) 並透過 Model Context Protocol (MCP) 暴露其專案感知工具,供其他編輯器使用。該專案目前已封存,不再維護。

jayminwest/mulch

Mulch 是一個由 CLI 驅動、基於 Git 的知識庫,允許 AI 代理將結構化學習(慣例、失敗、決策等)記錄在各領域的 JSONL 檔案中,並在後續檢索上下文優化的摘錄用於提示注入。它支援自訂記錄類型、基於證據的範圍劃分、健康檢查與清理,使團隊能累積並共享跨代理會話的專業知識。

izwi-ai/izwi

一個本地優先的語音 AI 平台,提供桌面應用、CLI 和伺服器,無需雲端 API 即可實現語音轉文字、文字轉語音與聊天工作流程。

6drf21e/ChatTTS_colab

ChatTTS 的精簡化部署包裝器,提供 WebUI 和一鍵式 Colab 設定,用於進階的文字轉語音生成。

KlaatAI/klaatcode

Klaat Code 是一款終端機 AI 編碼助手,可與託管的 Klaatu-o1 路由器對接。該路由器會自動為每個請求選擇最便宜的模型層級,並僅在需要時升級,從而大幅降低成本。客戶端會將您的專案索引為語義調用圖,免費執行工具調用(文件編輯、Shell 命令、網頁搜索),並透過智慧壓縮和驗證來管理上下文。功能包括豐富的 UI、斜線命令、Git 整合、子代理委派、廣泛的安全/權限檢查,以及可重現的基準測試,顯示每個已解決任務的成本為 $0.027,中位數時間為 23 秒。

crabwise-ai/crabwalk

Crabwalk 是一個即時的 Web UI,能視覺化 OpenClaw AI 代理人在 WhatsApp、Telegram、Discord 與 Slack 上的活動。它透過 WebSocket 從 OpenClaw gateway 串流事件,顯示即時的會話節點圖,讓你檢查工具呼叫,並支援 Docker、CLI 或原始碼安裝部署。

shibing624/agentica

Agentica 是一個開源、Apache-2.0 許可的框架,可讓你在本地運行多個 LLM 驅動的代理。它提供統一的 CLI、Web UI 和桌面應用,共享相同的對話歷史與設定。功能包括非同步優先工具執行、多模型與多模態支援、持久記憶與上下文壓縮、基於 Markdown 的自進化技能系統、安全防護機制,以及內建協作功能(對等訊息、任務/子代理、委任流程)。Python 與 TypeScript SDK 可讓你在程式碼中嵌入代理,Docker/uv-tool 安裝器讓設定變得簡單。

jitsi/jiwer

一個用於透過 Word Error Rate (WER) 和 Character Error Rate (CER) 等指標評估自動語音辨識系統的快速 Python 套件。

shiwenwen/hope-agent

Hope Agent 是一個開源、基於 Rust 的桌面 AI 助手,可作為原生應用程式、帶有 Web UI 的無頭伺服器或 IDE 整合後端運行。它提供目標驅動的任務自動化、持久記憶、設計空間生成,以及完整的電腦控制(檔案、Shell、瀏覽器),並具有強大的安全性(本地優先資料、工具審批、Docker 沙箱)。可透過套件管理器或 Docker 安裝於 macOS、Windows 和 Linux,內建數十個 LLM 提供者範本、多平台 IM 整合,以及外掛技能系統。

resemble-ai/Perth

一個用於在音訊檔案中嵌入與偵測不可察覺浮水印的 Python 函式庫,利用神經網路方法來確保對操作的強健性。

qqqqqf-q/Arkloop

Arkloop 是一個開源、本地優先的 AI 代理平台。它整合了 Go 後端、SQLite 儲存和基於 Electron 的桌面應用(帶有 React 網頁 UI),支援多模型路由、工具呼叫、持久或語意記憶,以及與 Telegram、Discord、QQ、Feishu 和 WeChat 的整合。可透過 GitHub 發布版、Homebrew 或 AUR 安裝,完全在使用者機器上執行,無需任何雲基礎設施。

jasonppy/VoiceCraft

一種僅需幾秒參考音訊即可實現高品質零樣本文字轉語音與語音編輯的 token infilling 神經編碼語言模型。

LnYo-Cly/ai4j

ai4j 是一個以Java為首要目標的SDK(JDK 8+),統一了對多個LLM提供者的存取,並增加了代理功能(工具呼叫、多代理協調、A2A、RAG)。它包含核心函式庫、代理執行時、程式碼助手CLI/TUI/IDE橋接器、Spring Boot啟動器與插件系統。透過Maven/Gradle安裝,設定提供者(例如OpenAI),即可在幾行程式碼中呼叫聊天/補全API,或在本機執行內建的程式碼代理。

ollama4j/ollama4j

Ollama4j 是一個 Java 函式庫,封裝了 Ollama 本地 LLM 伺服器,提供文字生成、對話、工具呼叫、嵌入向量、圖片輸入、模型管理以及 Prometheus 指標。它透過 Maven Central/Gradle 發佈,並可與任何 Java 專案整合。