Picovoice/leopard

Leopard 是一款裝置端語音轉文字引擎,可在多個平台上提供私密、準確且運算效率高的轉錄服務。

Picovoice/cheetah

一個在裝置上執行的串流語音轉文字引擎,提供跨平台的私密即時音訊轉錄。

jitsi/jiwer

一個用於透過 Word Error Rate (WER) 和 Character Error Rate (CER) 等指標評估自動語音辨識系統的快速 Python 套件。

innovatorved/whisper.api

一個由 whisper.cpp 提供驅動、高效能的自託管語音轉文字 API,且與 Deepgram 相容,方便進行整合。

noahgsolomon/brainrot.js

一個使用 Groq、OpenAI 與 Speechify,自動生成包含名人聲音克隆與產出內容的 AI 影片的工具。

THU-BPM/MarkDiffusion

一個開源的 Python 工具包,用於潛在擴散模型的生成水印,提供嵌入、檢測與評估 AI 生成圖像與影片水印的工具。

OpenImagingLab/AnyRecon

AnyRecon 是一個 3D 重建框架,利用影片擴散模型從一組捕獲視角生成高品質、任意視角的場景重建。

nachifur/RDDM

一個用於高品質影像修復與生成的殘差去噪擴散模型框架,支援去雨、去模糊等任務。

rohitgandikota/sliders

一個用於建立 LoRA 適配器的框架,這些適配器充當滑桿,可在 Stable Diffusion 與 FLUX 等擴散模型中精確控制特定視覺概念。

helblazer811/Diffusion-Explorer

一個用於教育目的的互動式視覺化工具,解釋擴散模型與流式生成模型的幾何直覺。

viiika/Meissonic

Meissonic 是一種非自回歸掩碼生成 Transformer,專為在消費級 GPU 上執行而設計,可實現高效的高解析度文本到圖像合成。

Karine-Huang/T2I-CompBench

一個針對文本生成圖像模型(text-to-image generation models)的全面基準測試與評估套件,重點關注其處理複雜組合式提示詞、屬性綁定以及空間關係的能力。

LHRLAB/HyperGraphRAG

一個檢索增強生成(Retrieval‑Augmented Generation)框架,使用超圖結構的知識表示,以更好地捕捉實體之間的複雜關係。

neuml/rag

一個以 txtai 為後端的 Streamlit 應用程式,實作向量與圖形 RAG,提供具事實根據的 LLM 回應。

LightningRAG/LightningRAG

一個具備視覺化代理編排畫布與 Webhook 連接器,可用於將 AI 代理部署到第三方通訊平台的全棧 RAG 框架。

DataScienceUIBK/Rankify

一個用於檢索、重排序與 RAG 的全面 Python 工具包,提供統一的介面來實驗與部署最先進的模型。

graniet/llm

一個 Rust 函式庫,提供統一的 API 以與多個 LLM 後端互動,支援多步驟鏈、代理工作流程,以及標準化的 REST API。

Farzad-R/LLM-Zero-to-Hundred

一個涵蓋 RAG、代理型工作流、多模態聊天機器人和微調流水線的 LLM 專案與教學集合,旨在從基礎邁向進階的 AI 應用開發。

maze-agent/Maze

支援異構資源排程與自動模型服務的 LLM 代理分散式框架,可將代理程式轉換為可觀測的工作流程。

suyoumo/ClawProBench

一個透明的即時優先基準測試框架,使用確定性評分在 OpenClaw 執行環境中評估 AI 代理的能力與表現。

OpenManus/OpenManus-RL

一個開源框架,使用強化學習優化 LLM 代理人的推理、工具使用與決策能力。

mkalten/reacTIVision

一個跨平台的電腦視覺框架,用於追蹤基準標記與多點觸控手指,讓實體使用者介面的開發變得可能。

frgfm/holocron

一個提供近期深度學習技巧與電腦視覺任務模型架構的高品質 PyTorch 實作函式庫。

rapidsai/cucim

cuCIM 是一個 GPU 加速的電腦視覺與影像處理函式庫,專為生醫、地理空間與遙測應用中使用的大型多維影像而設計。

commaai/rednose

一個用於感測器融合、視覺里程計和 SLAM 的 Kalman filter 框架,可自動化 Jacobian 計算並支援 ESKF 和 MSCKF 等進階濾波器。

theICTlab/3DUNDERWORLD-SLS-GPU_CPU

一個結構光掃描工具,能從受圖案光照射的物件影像中重建 3D 點雲,支援 CPU 與 GPU 加速。

alicevision/popsift

一個使用 CUDA 加速的 SIFT 演算法實作,可即時進行影像特徵擷取。

thp/psmoveapi

一個開源函式庫,支援 Linux、macOS 與 Windows,讓 PC 能夠存取 Sony Move 動作控制器,用於 AR/VR 應用的 3D 追蹤與感測器融合。

rgeirhos/Stylized-ImageNet

一個用於建立 Stylized-ImageNet 的工具,該版本的 ImageNet 會扭曲紋理,以鼓勵 CNN 更優先考慮物體形狀而非紋理,從而提升魯棒性。

Fabric-Project/Fabric

一個基於視覺節點的創意編碼環境,用於在 macOS 上快速原型設計互動式 3D 圖形、影像/影片處理和 AI 增強視覺。

VSLAM-LAB/VSLAM-LAB

透過統一設定與基準測試,簡化視覺 SLAM 系統的開發、評估與應用的綜合性框架。

askui/python-sdk

一個 Python SDK,讓 AI agent 可以透過基於視覺的自動化,而非脆弱的 UI selector,來控制桌面和行動裝置。

l3p-cv/lost

一個彈性的、基於網頁的協作影像標註框架,支援半自動化流程以加速機器學習資料集的標記。

roboflow/roboflow-python

Roboflow 的官方 Python 套件,讓開發者能以程式化方式與模型、資料集和專案互動,從而自動化建立與部署電腦視覺模型。

genicam/harvesters

一個用於簡化電腦視覺應用中影像擷取流程的 Python 函式庫,透過提供符合 GenICam 標準的裝置統一介面來實現。

zju3dv/Diffuman4D

Diffuman4D 是一個用於高保真度 4D 一致性人類視角合成的時空擴散模型,能夠從稀疏視角的影片中實現自由視角渲染。

open-edge-platform/datumaro

一個用於構建、轉換和分析 AI 資料集的資料集管理框架和 CLI 工具,特別專注於各種標註格式之間的轉換。

basler/pypylon

Basler pylon C++ API 的官方 Python 綁定,使 Python 應用程式能夠控制 Basler 機器視覺相機並執行圖像處理任務。

10up/classifai

一個 WordPress 外掛,整合雲端與本地 AI 服務,自動化內容產生、影像處理與網站管理任務。

cyrusbehr/YOLOv8-TensorRT-CPP

一個使用 TensorRT 的 C++ 實作 YOLOv8,以高效能 GPU 推論為目標,支援目標偵測、語意分割與姿勢估計。

insight-platform/Savant

一個高階框架,用於在 Nvidia 硬體上構建即時、高效能的電腦視覺與影片分析管線,抽象化 DeepStream 的複雜性。

luispedro/mahotas

一個以 C++ 實作的快速 Python 電腦視覺函式庫,提供超過 100 種在 NumPy 陣列上運作的影像處理演算法。

FORTH-ModelBasedTracker/MocapNET

即時 2D‑to‑3D 人體姿態估計器,將 RGB 影片串流轉換為標準 BVH 動作捕捉檔案,用於 3D 動畫。

imagej/imagej2

ImageJ2 是一個科學成像框架,它擴展了原始的 ImageJ,以支援多維圖像數據以及跨多種程式語言的無頭處理。

IliasHad/edit-mind

一個本地影片知識庫,透過轉錄與視覺分析為影片建立索引,讓使用者能以自然語言語意搜尋影片內容。

opendatacam/opendatacam

一個開源的電腦視覺工具,可偵測、追蹤並計算影片串流中移動物體的數量,以量化現實世界的移動,常用於交通研究。

MRPT/mrpt

一個為移動機器人提供 SLAM、導航、建圖與感測器整合所需工具的穩健、模組化 C++ 框架。

ARM-software/ComputeLibrary

一套針對 Arm Cortex-A、Neoverse 與 Mali GPU 架構優化的低階機器學習函式庫,提供高效能的 ML 推論。