AudarAI/Audar-ASR-V1
一套以阿拉伯語為首要目標的生成式語音辨識模型家族,可為方言阿拉伯語與代碼切換語音提供業界領先的轉錄表現。
janvarev/Irene-Voice-Assistant
一款預設離線運行的俄語語音助手,支援可擴充的插件與 LLM 驅動的自然語言指令處理。
cmusphinx/pocketsphinx
PocketSphinx 是一個開源、離線的語音轉文字引擎(C 庫,附帶 Python 繫結),可在低資源裝置上高效運行。它提供命令列工具與 API,用於辨識或對齊音訊,並將結果輸出為 JSON 格式。
ManimCommunity/manim-voiceover
一個將 AI 配音與錄音工具直接整合至 Python 中的 Manim 插件,利用 OpenAI Whisper 實現逐字動畫同步。
Migushthe2nd/MsEdgeTTS
一個簡單的 Azure Speech Service 模組,利用 Microsoft Edge Read Aloud API 為伺服器端執行階段提供文字轉語音合成。
PowerBeef/Vocello
一個適用於 macOS 和 iOS 的本地首選語音工作室,使用 MLX 和 Swift 生成高品質語音,支援語音克隆與自訂語音設計,且無需依賴雲端。
cboard-org/cboard
一款讓有語言障礙者透過符號與文字轉語音進行溝通的增強式與替代式溝通(AAC)網頁應用。
nateshmbhat/pyttsx3
一個利用原生系統引擎在離線狀態下產生語音輸出的 Python 套件,無需網路連接即可進行文字轉語音轉換。
readbeyond/aeneas
用於強制對齊的 Python/C 庫與工具集,可自動將音訊朗讀與對應的文字片段同步。
showlab/Kiwi-Edit
Kiwi‑Edit 是一個開源的影片編輯系統,透過自然語言指令(以及可選的參考圖像)來修改整個影片。它將多模態 LLM 編碼器與影片 Diffusion Transformer 融合,提供風格轉移、物件新增/替換/移除以及背景變更功能。該儲存庫提供了完整的訓練腳本(包含使用 Qwen2.5‑VL‑3B + Wan2.2‑TI2V‑5B 的三階段課程學習)、預訓練的 Diffusers 權重,以及在 OpenVE‑Bench 和 RefVIE‑Bench 上的評估流程。
ashbuilds/payload-ai
一個為 Payload CMS 添加 AI 驅動的文本、影像和語音生成功能的插件,支援多個模型提供者,並提供細粒度設定與存取控制。
Chaoses-Ib/ComfyScript
用於 ComfyUI 的 Python 前端與函式庫,允許使用者使用 Python 腳本而非視覺化節點圖來定義並執行圖像生成工作流。
VibiumDev/vibium
一個為 AI 編碼代理提供驗證能力的層,可透過 CLI、MCP 或客戶端程式庫實現網頁任務的瀏覽器自動化與驗證。
Mengqi-Lei/count-anything
Count Anything 是一種基於自然語言查詢在影像中計數物件的研究模型。它透過結合稀疏區域計數器與密集像素計數器,並以無參數融合步驟整合結果,在六個領域(場景、衛星、醫學等)中跨域運作。該倉庫提供預訓練檢查點、訓練/評估腳本,以及大型 CLOC 資料集的準備說明。
Intellindust-AI-Lab/EdgeCrafter
EdgeCrafter 提供專為邊緣裝置優化之緊湊視覺變換器(ViTs),在低延遲下實現高效率的物件檢測、實例分割與姿態估計。
microsoft/TimeCraft
TimeCraft 是 Microsoft Research 基於擴散模型的合成時間序列資料生成框架。它透過原型字典支援跨領域少樣本適應、自然語言控制與目標感知生成,優化合成樣本以提升下游任務表現。擴展功能包括因果約束、基礎模型預訓練的線上增強,以及從不規則觀測中生成連續時間序列。
open-ribbi/velocut
結合多軌影片編輯與3D場景導演的瀏覽器端工作室,整合AI以實現自動場景構圖與編輯。
yan5xu/codexloom
CodexLoom 是一個自托管平台,為 Codex 聊天代理添加持久身份、個人檔案和組織工具,支援長期運行的「領域代理」,可從多個裝置存取,透過有界訊息通訊,並可透過介面代理暴露給外部聊天平台(Feishu、Slack、Parall)。針對高階單人使用者,提供 UI、CLI 和治理功能,採用 Elastic License 2.0 發布。
kris-hansen/comanda
在倉儲中執行持久且自我改善代理工作流程的終端原生執行環境,透過品質門檻與程式碼庫索引確保工作確實已完成。
Cocolalilal/LastChat
一款面向 Android 的隱私導向 AI 助手應用,具備基於 RAG 的記憶、多模態輸入以及內建的 Python 與 JavaScript 引擎。
lhotse-speech/lhotse
一個用於靈活多模態資料準備的 Python 庫,可優化機器學習訓練中語音、音訊、影片與影像資料的載入與操作。
SkyworkAI/Skywork-R1V
Skywork-R1V 是一個開源多模態推理模型,透過強化學習與視覺思維鏈(Visual Chain-of-Thought),在複雜的視覺邏輯、數學與物理任務中實現最先進的性能。
do-md/domd
專為大檔案、即時協作與 AI 輸出串流設計的高效率 WYSIWYG Markdown 編輯器與內核
NVlabs/physical_ai_av
用於存取並處理 NVIDIA Physical AI Autonomous Vehicles Dataset 以建構端到端駕駛系統的 Python 開發工具包。
fajarhide/omni
透過精煉雜訊命令輸出並用可檢索句柄取代重複資料,減少 AI 代理令牌使用量的工具。
gobii-ai/gobii-platform
一個 AI 員工平台,用於運行持久、永遠在線的自主代理,這些代理可透過電子郵件或簡訊聯絡,並執行生產環境的瀏覽器自動化。
AmberSahdev/Open-Interface
一款使用 LLM 以視覺回饋模擬鍵盤與滑鼠輸入,自動駕駛電腦的 AI 驅動電腦自動化工具。
SponsioLabs/Sponsio
Sponsio 是一個開源函式庫,為基於 LLM 的代理程式提供確定性、微秒級的防護機制。它讓您能編寫基於形式化方法的合約(YAML 規則集),並在每次工具呼叫時強制執行,無需呼叫任何模型即可封鎖、警告或允許操作。該函式庫與 Python 或 TypeScript 中的 LangChain、Claude、OpenAI、CrewAI 及其他代理框架整合,隨附 22 個現成的合約套件,並提供用於審計與檢視的託管控制台。基準測試顯示,錯誤行為減少超過 95%,每次呼叫延遲低於 0.2 毫秒,使其成為生產環境 AI 代理快速且可靠的安全層。
av/harbor
Harbor 是一個以 CLI 驅動的 Docker‑Compose 協調器,讓你僅需一個 `harbor up` 命令,即可啟動完整的本地 LLM 堆疊——包含模型後端(Ollama、llama.cpp、vLLM、MLX 等)、聊天前端(Open WebUI、LibreChat、AnythingLLM、…)、網路搜尋、語音、影像生成,以及基於 Boost 的智能工作流程。
artivis/manif
一個用於機器人狀態估計的 Lie 理論函式庫,提供 C++ 與 Python 工具來處理各種 Lie 群的旋轉、平移與速度。
marcusquinn/aidevops
aidevops 是一個 MIT 許可的 AI-DevOps 框架,提供 CLI 和 OpenCode 插件,用於在程式碼、基礎設施、產品、行銷等領域協調 AI 代理。它將工作分解為 14 個主要代理和數千個子代理,使用脈衝監督者路由任務、管理 token 預算、保護密鑰安全並維護 Git 清潔。透過 npm 或 Homebrew 安裝後,執行 `aidevops init`、`aidevops pulse` 或特定領域的斜線命令,即可自動化建置、部署、報告和業務流程,同時保持可審計性。
pinecone-io/python-sdk
一個用於 AI 應用的 Python 客戶端,支援建立、管理與查詢向量索引。
ZhixiangLuo/10xProductivity
一個本地優先的堆疊,透過利用現有使用者權限與工具存取,將程式編寫代理人轉變為工作上的個人 AI 助手,繞過企業 IT 限制。
SonySemiconductorSolutions/mct-model-optimization
A model compression toolkit for PyTorch and Keras that optimizes AI models for edge deployment using quantization, pruning, and hardware-aware optimization.
ultralytics/xview-yolov3
一種專為在 xView 衛星影像資料集上進行遙測應用的物件偵測訓練與執行而設計的 YOLOv3 特化實作。
study8677/repobrain
一個跨 IDE 的程式碼庫知識引擎,為程式碼庫建立有根據的問答系統,讓 AI 代理能提供包含檔案路徑與行號的準確答案。
norse/norse
Norse 是一個基於 PyTorch 的函式庫,加入了脈衝神經網路原語(LIF、LSNN 等),用於建構、訓練與評估事件驅動模型。它提供 pip/conda/Docker 安裝方式、即用的範例任務(MNIST、CIFAR‑10、cart‑pole),並可與 PyTorch‑Lightning 整合以支援可擴展的訓練。
mlmed/torchxrayvision
一個用於胸部 X 光資料集與模型的函式庫,提供預訓練模型以及統一介面,以便在多個公開胸部 X 光資料集上工作。
netket/netket
NetKet 是一個基於 JAX 的 Python 函式庫,利用神經網路和機器學習來研究多體量子系統。
DougTrajano/pydantic-ai-skills
Pydantic AI 的配套程式庫,讓代理能從本地或遠端註冊表載入模組化技能,執行封裝腳本,並透過逐步揭露機制管理資源。
jahala/tilth
一種語法感知的程式碼導航工具,為人類與 AI 代理提供結構化洞察,減少探索程式碼庫所需的工具呼叫次數。
tschnz/Live-Video-Magnification
一種使用 Eulerian video magnification 技術,即時放大微小運動與顏色變化的影片放大工具。
LvcidPsyche/auto-browser
一個 MCP 原生瀏覽器控制平面,為 AI 代理提供具有人機回環(human-in-the-loop)接管功能、可重用身分驗證設定檔以及內建安全護欄的真實瀏覽器。
MigoXLab/dingo
Dingo 是一個開源的 Python 庫(以及 SaaS 產品),用於評估 AI 資料、模型輸出和 RAG 系統。支援基於規則、基於 LLM 和基於代理的檢查,可從檔案、資料庫、S3 或 Hugging Face 流式讀取資料,並提供 JSON 報告及可選的視覺化儀表板。透過 `pip install dingo-python`(含可選擴充)安裝,透過 CLI(`dingo eval …`)或 Python SDK 執行,並可透過自訂規則、LLM 提示或代理進行擴展。
papercopilot/paperlists
一個全面的結構化 AI 會議論文記錄庫,以及用於分析主要會議(如 NeurIPS 和 ICLR)學術文獻的本地搜尋工具。
ome-projects/ome
一款針對企業級大語言模型(LLM)服務的Kubernetes Operator,可自動化模型管理、執行環境選擇與GPU資源優化。
OtterMind/Nubase
一個 AI 原生的後端與部署層,允許程式碼代理直接部署資料庫、邊緣函數與前端,將 AI 生成的程式碼轉化為即時應用。
xorq-labs/xorq
一個可執行、Git 原生的表格資料工作目錄,可將暫時的代理生成指令碼轉化為可重現、內容位址化的流程。