jasonppy/VoiceCraft
一種僅需幾秒參考音訊即可實現高品質零樣本文字轉語音與語音編輯的 token infilling 神經編碼語言模型。
LnYo-Cly/ai4j
ai4j 是一個以Java為首要目標的SDK(JDK 8+),統一了對多個LLM提供者的存取,並增加了代理功能(工具呼叫、多代理協調、A2A、RAG)。它包含核心函式庫、代理執行時、程式碼助手CLI/TUI/IDE橋接器、Spring Boot啟動器與插件系統。透過Maven/Gradle安裝,設定提供者(例如OpenAI),即可在幾行程式碼中呼叫聊天/補全API,或在本機執行內建的程式碼代理。
ollama4j/ollama4j
Ollama4j 是一個 Java 函式庫,封裝了 Ollama 本地 LLM 伺服器,提供文字生成、對話、工具呼叫、嵌入向量、圖片輸入、模型管理以及 Prometheus 指標。它透過 Maven Central/Gradle 發佈,並可與任何 Java 專案整合。
fishaudio/Bert-VITS2
Bert-VITS2 是一個將 VITS2 骨幹網路與多語言 BERT 整合的文字轉語音系統,旨在產生高品質、自然的語音合成。
adshao/flounder
Flounder 是一個開源框架,讓 LLM 編碼代理能執行自主、沙盒化的安全稽核。給定一個儲存庫、合約地址、交易雜湊或類似線索,它會準備工作區、繪製攻擊面、讓模型在 OCI 沙盒中編寫並執行 PoC 測試、在本地驗證發現、可選擇對真實目標進行確認,並生成 Markdown 報告。它支援多種情境(盲測稽核、事件調查、漏洞賞金工作),並透過基於守護行程的控制平面與各種模型提供者協作。
OLmatter/glm-coding-helper
glm‑coding‑helper 是一個 Tampermonkey userscript 與本地 CPU/GPU OCR 伺服器結合的專案,用於自動化搶購 Zhipu GLM Coding Plan。它支援早期按鈕點擊、計畫選項循環、本地解決中文點選驗證碼(使用 YOLO + PP‑OCRv6)、可配置自動點擊、多視窗和安全設定。專案提供便攜式 Windows 建構和 macOS/Linux 在線安裝器,包含一鍵啟動腳本,可自動設定 Python 環境並啟動 FastAPI OCR 服務。
inducer/pyopencl
PyOpenCL 是一個 Python 庫,提供對 OpenCL GPU 及其他平行裝置的完整、Python 友好存取。它具備 RAII 風格資源清理、自動錯誤轉異常、快速 C++ 綁定,並支援跨平台二進位輪子與 MIT 授權,是 AI 與科學計算中實作自訂 GPU 加速程式碼的實用工具。
athola/claude-night-market
Claude Night Market 是一個插件市場,透過 23 個安全防護插件擴展 Anthropic 的 Claude Code IDE,支援 Git 工作流程、測試驅動開發、規格驅動開發、自主代理及多項領域專用工具。安裝市場,挑選所需插件,執行如 `/attune:mission` 等高階指令,即可在 Claude Code 內管理完整的功能生命週期。
tak-bro/aicommit2
aicommit2 是一個 CLI 工具,使用廣泛的 LLM 提供商自動產生 Git/YADM/Jujutsu 提交訊息,具備多提供者串流、差異壓縮、程式碼審查、鈎子整合與 LazyGit 支援等功能。
Azure-Samples/Cognitive-Speech-TTS
Azure Cognitive Service Text-to-Speech 的範例集合,讓開發者能透過 Speech SDK 或 REST API 將自然聽感的 AI 語音整合至應用程式中。
shengsheng90/DSH-taskboard
DSH Taskboard 是一個 DeepSeek Harness 插件,新增原生 SQLite 支援的任務板 UI、JSON CLI,以及用於管理專案、任務與自動化的代理工具。人類批准並接受工作;代理認領、處理並提交任務以供審核。安裝需建構外掛、加入 Harness 設定檔,並重新啟動 Harness 伺服器。
digimata/quill
僅限 macOS 的 Swift 工具,本地錄製麥克風與系統音訊,使用 Core ML 語音模型在裝置上對兩條音軌進行轉錄,無需將任何資料傳送至雲端,即可生成帶說話人標籤的轉錄文字。
voicepaw/so-vits-svc-fork
一款支援實時變聲與高品質聲音克隆的歌唱語音轉換工具,具備改進的 GUI 與更快的訓練速度。
Bitterbot-AI/bitterbot-desktop
Bitterbot 是一個本地優先的AI代理,擁有生物啟發的持久記憶,可運行自主的「夢境」週期以整合知識,能執行工具(網頁瀏覽、程式碼、WhatsApp),並可選擇性地參與USDC的P2P技能市場。透過 Node ≥ 22 安裝,執行引導向導後,即可透過 http://127.0.0.1:19001 的瀏覽器UI進行互動。
oleksiijko/pmb
PMB 是一個開源的 Python 套件,為基於 LLM 的編碼助理提供本地、以 SQLite 為後端的記憶體。它會自動索引程式碼、PDF、git 歷史與使用者記錄的事實,並透過 Model‑Context‑Protocol 將最相關的內容注入代理。系統完全離線運作,提供混合 BM25‑+‑向量搜尋(約 35 ms 暖路徑延遲),具備視覺化儀表板,並包含既可在模型思考前回憶記憶,也能自動記錄觀察到動作的監聽器。透過 `pip install pmb-ai` 安裝,執行 `pmb setup` 綁定代理,代理即可在重啟後記住決策、學習內容與專案背景,無需任何 API 金鑰或雲端呼叫。
AtomicBot-ai/atomic-agent
Atomic Agent 是一款開源、本地優先的 AI 助手,透過 `llama.cpp` 使用量化模型在您的機器上執行。它執行工具呼叫 JSON 迴圈,用於瀏覽、檔案編輯、shell 命令、記憶體管理等,將狀態保存在磁碟上,並提供 TUI/CLI 和 HTTP 邊車。
jinzijian/EvoTrace
EvoTrace 是一個本地優先工具,可匯入 Claude Code 或 Codex 會話歷史,挖掘連貫的編碼事件,並編譯為可驗證的、Docker 就緒的任務、偏好資料與獎勵候選,用於 AI 訓練與評估。它在 DeepSeek Harness UI 上運行,採用四代理審查流程,確保所有資料始終由使用者掌控。
wk42worldworld/cybercode
CyberCode 是一個基於 Claude‑Code 互動風格的開源、本地執行的 AI 編碼助手。它提供永久記憶、自我進化、TUI、跨平台桌面 GUI、透過 Telegram/Feishu 的遠端控制、模型無關的提供者支援、程式圖索引、令牌優化、定時任務以及可擴展的插件/技能。
minghe36/haoone-app
一款利用先進ASR模型與自訂對齊演算法,為影片編輯者提供高準確度本地轉錄與翻譯的專業AI字幕軟體。
org2AI/ORG2
ORG‑2 是一個基於 Rust 的桌面工具,記錄 AI 編碼代理的完整工作流程(提示、工具呼叫、檔案編輯等),讓團隊像影片一樣重播會話,並透過「AI 責任追溯」將每一行程式碼精確連結到生成它的代理決策。支援 20 多個代理 CLI,提供協作功能、內建終端/Git 工作區,以及可選的瀏覽器自動化。以 macOS、Windows 和 Linux 的原生安裝檔分發,採用 AGPL‑3.0 許可證。
AutoArk/GPA
GPA 是一個統一的自回歸式 Transformer 模型,將語音辨識(ASR)與文字轉語音(TTS)整合至單一系統中,性能接近最尖端水準。
dob323/session-kit
Session Kit 是一個本機命令列儀表板,會列出您所有的 Claude Code 和 Codex AI 編碼工作階段,顯示它們的狀態(例如:等待輸入),並讓您可以透過輸入其固定編號來跳至任何工作階段。工作階段在終端機或 SSH 斷線後仍會繼續執行,可以使用不同的供應商帳戶,並受到安全模型的保護,該模型會在執行動作前重新驗證確切的供應商程序。它透過已驗證的發布版本進行安裝,可在 Linux (systemd) 或 macOS 14+ 上執行,並將所有資料儲存在本機,不收集任何遙測資料。
agentlas-ai/Agentlas-OS
Agentlas OS 是一個開源、跨平台的框架(Hephaestus 引擎),讓您能建構、借用與擁有可攜式的 LLM 驅動代理或團隊。代理是帶有嚴格 JSON 合約的打包方法文件,可儲存在私人「代理雲」中,或從公開 Hub 取得,並可在任何支援的主機(macOS、Windows、Linux)上,使用您已有的任意 LLM 執行。安裝僅需一個指令;命令列介面(`/agentlas build`、`/agentlas hub`、`/agentlas upload` 等)與視覺化桌面 UI 讓您能組合、驗證與執行代理,同時將憑證與權限保留在本地。
sv-number/skills
一個極簡、採 MIT 授權的 *技能*,讓 AI 代理透過商業 API 取得一次性電話號碼並讀取簡訊驗證碼,實現自動化註冊與雙重驗證,無需人工干預。
netease-youdao/Confucius4-R2T2
Confucius4-R2T2 是一個低延遲、高準確率的即時語音辨識模型,提供穩定、僅追加(append-only)的轉錄結果,以避免即時應用中的文字修正。
bendlang/bend
Bend 是一門開源語言,可編譯為原生速度的 CPU/GPU 程式碼,並要求使用者定義的不變量(`LAWS.bend`)必須具備形式化證明。編譯器能在數秒內檢查證明,使 AI 生成的程式碼能自動驗證其安全性或正確性規則。它提供隱式並行處理、類似 Python 的語法與依賴型別,並支援 C、Metal、CUDA 與 JavaScript。該專案包含編譯器、標準函式庫、基準測試、學術論文與極簡格式化 LSP,但目前仍處於早期階段——程式碼較冗長、工具有限且缺少許多函式庫。
FatihMakes/Mark-LIV
MARK LIV 是一款跨平台、語音優先的 AI 助理(支援 Windows/macOS/Linux),利用 Gemini 3.1 Flash Live 進行即時對話。它顯示一個軟體渲染的 3D 人臉,具備口型同步、眨眼和視線追蹤功能,作為視覺狀態指示器。功能包括按鍵通話、本地喚醒詞、自我回音防護、無限會話記憶、復原、插件系統、系統控制、網頁搜尋、硬體監控及多種語音驅動工具。無需 GPU 或額外依賴,僅使用 25 KB 的臉部資產與現有的 PyQt6/numpy 堆疊。
databricks-demos/dbdemos
dbdemos 是一個可透過 pip 安裝的 Python 工具包,可自動化設定 Databricks Lakehouse 示範套件——透過單一指令安裝筆記本、叢集、流水線、儀表板以及可選的 ML 模型。
jin-zi-xuan/kaobuddy-pwa
KaoBuddy 是一個 PWA,可讓你上傳 PDF、文件、手寫影像和 B 站影片字幕,然後使用 LLM(DeepSeek、Kimi、OpenAI 等)提取考試相關知識點,生成解釋、閃卡、練習題和完整模擬考試。它會建立每日學習計畫,所有內容本地儲存在 IndexedDB,透過 FastAPI 後端 + React-TypeScript 前端運行。Windows 使用者可使用便攜 zip;macOS 及其他平台可從原始碼或 Docker 運行。MIT 許可證。
karansinghgit/speaktype
一款免費、開源的語音轉文字工具,可在您的電腦上本地完成全部轉錄,為任何應用程式提供私密、離線的語音輸入。
kiyoon/jupynium.nvim
Jupynium.nvim 是一個 Neovim 插件,可將 Jupytext 風格的檔案 (*.ju.py) 同步到透過 Selenium 在 Firefox 中開啟的 Jupyter Notebook。它提供單向 (Neovim → 瀏覽器) 即時預覽、執行快捷鍵、選用補全、程式碼摺疊以及小型 Lua API,讓您無需離開編輯器即可完成完整的筆記本工作流程。
google/sec-gemini
Sec-Gemini SDK 是一套輕量級客戶端程式庫(Python、TypeScript)與網頁元件,讓開發者能呼叫 Google 實驗性的網路安全 AI 模型。本儲存庫僅為簡單的整合層,並非 Google 官方支援的產品。
RchGrav/claudebox
ClaudeBox 是一個基於 Docker 的工具,可在隔離的容器中啟動 Anthropic 的 Claude Code AI 編碼助手。它提供專案專屬的 Docker 映像檔、持久化驗證/歷史記錄,以及一組預先配置的開發設定檔(C/C++、Python、Rust、Go 等)。功能包括多實例支援、防火牆白名單、macOS 剪貼簿橋接、tmux 整合以及簡單的任務引擎。安裝方式為自解壓縮的 .run 安裝程式,若有需要也會自動設定 Docker。使用者可為每個專案建立「插槽」(持久化的 Claude 工作階段)、新增設定檔,並以自訂旗標執行 Claude,同時保持專案資料的隔離性與可重現性。
filtalgo/Filtmall-Shopping-Skill
一個 Node.js 技能,讓 AI 代理程式能夠透過基於 JSON 的 CLI,在 Filtmall 市場瀏覽、比較並購買真實產品,並處理發現、結帳、訂單追蹤及售後服務。
ideaplexa/voicetypr
Voicetypr 是一款適用於 macOS 和 Windows 的開源、優先離線的聽寫應用程式。它透過全域熱鍵擷取語音,使用 Whisper(在 Apple Silicon 上可使用 Parakeet)在本地進行轉錄,或選擇性地透過雲端 STT 服務進行轉錄,並能利用 LLM 清理文字,最後將結果插入目前游標位置。配套的 CLI 讓腳本或 AI 代理能夠使用相同的轉錄管道,並回傳純文字或 JSON。該應用程式採用 Tauri (Rust 後端) 和 React 建構,提供基於區域網路的私人轉錄伺服器,並以 AGPL-3.0 授權發布。
emperorclaw/emperorclaw
EmperorClaw 是一個自架設的 Node.js/Next.js 應用,為 AI 代理增加組織層:任務看板、客戶目錄、知識庫、安全檔案儲存、聊天、工作流程和完整審計日誌。代理透過通用 MCP API(OpenClaw、Hermes 或任何相容執行時)註冊。系統運行在 Docker 上,狀態儲存在 PostgreSQL 中,採用公平來源授權(Fair-Source),發布兩年後自動轉為 Apache 2.0。
ref-tools/ref-tools-mcp
Ref MCP 是一個 Node-JS MCP 伺服器,讓 LLM 編碼代理程式能夠搜尋文件並僅擷取相關片段,大幅降低 Token 使用量與成本。
Claude-Reverser/IDA-instances-MCP
ida-pro-mcp 的一個分支,提供一個強化、多實例的 MCP 伺服器,用於無頭 IDA Pro,使 AI 代理(如 Claude Code 等)可透過安全的 HTTP API 驅動逆向工程任務。
nasa-petal/bidara
BIDARA 是一個基於 GPT-4 的聊天機器人,可引導使用者完成生物模仿研究所的設計流程,協助定義問題、將問題轉化為生物學問題、發現自然模型、抽象策略,並模擬自然啟發的解決方案。它可作為 Discord 機器人、Web 應用,或 OpenAI Playground 的可重用系統提示運行。
HeartMuLa/heartlib
一套用於高保真音樂生成、音訊標記化以及基於歌詞和標籤進行歌詞轉錄的開源音樂基礎模型系列。
brennercruvinel/CCPlugins
CCPlugins 提供 24 個現成的 Claude Code CLI 指令(例如 /cleanproject、/commit、/security-scan、/scaffold),可自動化重複性的開發任務、增加 git 安全檢查點,並提供快速且確定的結果。透過單行腳本即可安裝;指令適用於任何語言或作業系統,並可在 CI/CD 管線中串聯使用。該專案維護活躍且採用 MIT 授權。
antvis/AVA
AVA 是一個 TypeScript 函式庫,讓您可以載入 CSV/JSON 資料、提出自然語言問題,並獲得 AI 生成的分析、程式碼/SQL 以及視覺化圖表。它會自動為小型資料集選擇記憶體內 JavaScript,為大型資料集選擇 SQLite/IndexedDB,適用於瀏覽器和 Node.js,並透過 LLM 提供查詢建議與圖表生成。
localgpt-app/localgpt
LocalGPT 是一個基於 Rust 的本地運行工具,可將自然語言提示轉換為 3D Bevy 世界(localgpt-gen),並提供一個具備持久化、可搜尋記憶、自主背景任務及輕量級 HTTP API 的隱私優先 AI 助手(localgpt)。它適用於任何 LLM(本地或雲端),以單一二進位檔案運行,並包含沙盒安全功能。
jrswab/axe
Axe 是一個基於 Go 的 CLI 工具,用於執行定義在 TOML 檔案中的 LLM 代理。這些代理專注於單一任務,可使用內建沙盒工具(檔案操作、Shell 指令、網頁抓取/搜尋)、委派給子代理,並維護持久化的 Markdown 記憶。它支援 Anthropic、OpenAI、Ollama、OpenCode 和 Bedrock,提供 Token 預算限制、重試策略、乾跑模式、JSON 輸出,並可與標準 Unix 管線、cron 或 Docker 結合使用。可透過預編譯二進位檔、`go install` 或從原始碼編譯進行安裝。
existence-master/Sentient
Sentient 是一款開源、可自託管的 AI 個人助理,具備聊天(文字/語音)、記憶用戶偏好、自動化多步驟與重複性任務,以及主動管理電子郵件/日曆的功能,並整合了超過 20 種應用程式。
DanMcInerney/architect-loop
一個由 LLM 驅動的 CLI 工具,能將高階需求轉化為規格,啟動基於 Claude 的設計代理與基於 Codex 的程式碼生成代理,執行隔離的 builder worktrees,透過凍結檢查進行驗證,最終產出單一 PR 或本地完成記錄,無需人工審核。
GoDiao/dreamcoder
DreamCoder 是一個開源的原生桌面 GUI(使用 Tauri 2、React 18 和 Bun 建構),封裝了 Claude Code LLM。它提供多模型支援、視覺化會話管理、整合終端與透明工具呼叫功能,採用隱私優先設計,API 金鑰本地儲存。
asanchezyali/talking-avatar-with-ai
結合 OpenAI GPT、Whisper、Eleven Labs TTS 與 Rhubarb Lip-Sync 的示範,打造一個帶有面部表情與身體動畫的 3D 虛擬形象。安裝相依套件,設定 API 金鑰,執行 `yarn dev`,即可透過文字或語音進行互動。