651

comfyui_LLM_party: 一套用於構建複雜 LLM 與代理工作流的全面 ComfyUI 節點套件

一套用於構建 LLM 工作流的全面 ComfyUI 節點,支持將 AI 代理、RAG 和 VLMs 集成到視覺化圖像生成管線中。

652

OpenManus-RL:用於提升 LLM 推理與決策的 RL 代理調校框架

一個開源框架,利用強化學習優化 LLM 代理,提升其推理、工具使用與決策能力。

653

llm-beginner:透過從頭實作的漸進式實作課程,掌握 LLM 與 AI 代理人

一套完整、實作導向的教學系列,讓初學者透過六個漸進式實作任務,從構建 mini‑GPT 到打造程式碼代理人,學習 LLM 與 AI 代理人。

654

SkillOpt:一種使用類深度學習優化迴圈來實現代理技能自我演化的執行策略

SkillOpt 是一個將代理技能文件視為可訓練狀態的框架,使用類深度學習的優化迴圈來演化並提升代理性能,而無需修改模型權重。

655

mrpt:一個完整的 C++ 行動機器人框架,具備 SLAM、導航與 3D 可視化功能

一個穩健且模組化的 C++ 行動機器人框架,提供 SLAM、導航與感測器整合等關鍵工具。

656

unrealcv: 一個連接 Unreal Engine 與 AI 框架以建立合成電腦視覺環境的橋樑

UnrealCV 是 Unreal Engine 的一個插件,讓電腦視覺研究人員能夠以程式化方式與虛擬世界互動,以生成合成數據,並整合了 PyTorch/Tensorflow。

657

paperlib: 一款具備 AI 摘要功能與語義圖書館搜尋功能的開源學術論文管理器

一款開源的學術論文管理工具,簡化了元數據抓取與組織,並具備 LLM 驅動的摘要功能與語義搜尋。

658

bgslibrary:一個用於視訊串流前景‑背景分離的完整 C++ 框架

一個用於電腦視覺背景減除的完整 C++ 框架,提供超過 40 種演算法來偵測視訊串流中的移動物體。

659

emgucv:跨平台的 .NET 包裝器,用於 OpenCV 影像處理函式庫

跨平台的 .NET 包裝器,用於 OpenCV 影像處理函式庫,使 .NET 相容語言能在多種作業系統上使用 OpenCV 功能。

660

MaaNTE: 一款基於圖像與音頻識別的自動化工具,用於簡化遊戲 *異環* 中的重複性任務

一款針對遊戲 *異環* (The Ring) 的自動化工具,利用圖像與音頻識別來模擬用戶交互,以簡化重複性的遊戲玩法。

661

stitching: 一個用於快速於快速且強健的圖像拼接與全景圖製作的 Python 套件

一個用於快速且強健的圖像拼接的 Python 套件,使用 OpenCV 將多張重疊的圖像組合在一起,形成單一的全景圖。

662

CV-CUDA:高吞吐量 GPU 加速的電腦視覺函式庫,用於 AI 前處理管線

NVIDIA 提供的 GPU 加速電腦視覺函式庫,為 AI 管線提供高吞吐量、低延遲的影像與影片處理。

663

comic-translate:一款利用 LLM 與 inpainting 技術在漫畫格子內翻譯文字的 AI 漫畫翻譯器

一款利用 LLM、OCR 與 inpainting 技術,將多語言漫畫翻譯成其他語言,同時保留原始畫面之 AI 漫畫翻譯器。

664

habitat-lab: 一個用於在室內環境中訓練與評估具身智能代理的模組化框架

一個用於具身智能端到端開發的模組化高階函式庫,用於訓練與評估在室內環境中執行任務的代理。

665

WebPlotDigitizer: 一款利用電腦視覺輔助從數據視覺化圖像中提取數值數據的工具

WebPlotDigitizer 是一款利用電腦視覺輔助,為研究人員和科學家從數據視覺化圖像中提取數值數據的工具。

666

ComputeLibrary:針對 Arm 硬體優化的低階機器學習函式集合

一套針對 Arm Cortex‑A、Neoverse 與 Mali GPU 架構優化的低階機器學習函式集合,旨在提供高效能的 ML 推論。

667

LichtFeld-Studio:一個模組化工作站,用於訓練、編輯與自動化 3D Gaussian Splatting 場景

一個模組化的 3D Gaussian Splatting 工作站,將訓練、即時可視化、編輯與匯出整合於單一原生應用程式中。

668

anylabeling: 一款透過 YOLOv8 與 Segment Anything 提供自動標記功能的 AI 輔助影像標記工具

一款 AI 驅動的影像標記工具,整合了 YOLOv8 與 Segment Anything Model (SAM) 系列,以自動化並加速電腦視覺的數據標記流程。

669

AliceVision: 一個用於 3D 重建與相機追蹤的攝影測量電腦視覺框架

一個用於從照片或影片中進行 3D 重建與相機追蹤的攝影測量電腦視覺框架,提供相關演算法。

670

habitat-sim:一個高效能、具物理模擬的 3D 模擬器,供具身 AI 研究使用

一個高效能、具物理模擬的 3D 模擬器,供具身 AI 研究使用,提供快速渲染與剛體動力學,以在真實 3D 環境中訓練代理人。

671

scenic: 一個基於 JAX 的研究函式庫,用於開發大型注意力機制電腦視覺模型的原型

一個基於 JAX 和 Flax 的電腦視覺研究函式庫,為開發跨圖像、影片和音訊的注意力機制模型提供可擴展的函式庫和專案範本。

672

torchgeo: 一個用於處理多光譜地理空間與遙感數據深度學習的 PyTorch 領域函式庫

一個專為地理空間與遙感數據設計的 PyTorch 領域函式庫,提供數據集、取樣器和預訓練模型。

673

VLMEvalKit: 一個支援 70+ 基準測試的大型視覺語言模型統一評估工具包

一個用於大型視覺語言模型評估的開源工具包,可實現跨 70+ 基準測試和 200+ 模型的指令式評估。

674

MaaFramework: 一個用於構建低代碼黑盒自動化工具的跨平台圖像識別框架

一個基於圖像識別的黑盒測試自動化框架,使開發者能夠通過低代碼 Pipeline 創建視覺驅動的自動化工具。

675

obs-backgroundremoval: 一個用於 OBS Studio 的虛擬綠幕與低光源增強插件

一個使用神經網路為人像影片與圖像提供虛擬綠幕背景移除與低光源增強功能的 OBS Studio 插件。

676

webots: 一款用於建模與編寫機械系統程式的開源機器人模擬器

一款開源機器人模擬器,提供完整的開發環境來對機器人、車輛和機械系統進行建模、編寫程式與模擬。

677

ceres-solver: 一個用於解決大規模非線性最小平方法與一般優化問題的成熟 C++ 函式庫

Ceres Solver 是一個用於建模與解決大型且複雜的非線性最小平方法與一般無約束優化問題的 C++ 函式庫。

678

sparrow: 一個用於結構化數據提取與代理工作流的 API-first 文件智能平台

一個專為企業文件智能設計的 API-first 平台,利用 Vision LLMs 和代理工作流將發票、收據和對帳單轉換為結構化 JSON。

679

Chinese-CLIP:大型中文視覺語言模型,用於跨模態檢索與零樣本圖像分類

一個中文版本的 CLIP 模型,於 2 億條圖文對上訓練,用於跨模態檢索與零樣本圖像分類。

680

scikit-image: 一個用於科學影像處理與分析的全面 Python 函式庫

scikit-image 是一個用於影像處理的 Python 函式庫,提供了一系列用於分析與操作影像的演算法。

681

Final2x: 一款支援自定義模型與 Nvidia 50 系列 GPU 的跨平台影像超解析度工具

一款使用 AI 模型來放大影像並提升其解析度的跨平台影像超解析度工具。

682

gocv:Go 語言綁定 OpenCV 4 計算機視覺函式庫

GoCV 為 OpenCV 4 提供 Go 語言綁定,使 Go 開發者能將先進的計算機視覺與硬體加速影像處理整合到他們的應用程式中。

683

librealsense:一個跨平台的函式庫,用於從 RealSense 相機串流深度與彩色資料

一套跨平台的 RealSense 深度相機 SDK,能實現深度與彩色串流,並提供校正資料,適用於電腦視覺與機器人領域。

684

rerun: 實體 AI 與機器人技術的多模態數據層與視覺化除錯器

一個針對實體 AI 的多模態數據層與視覺化除錯器,讓開發者能夠即時記錄、查詢並視覺化多速率感測器數據。

685

pcl: 一個用於 // 2D 和 3D 影像與點雲處理的大型開源程式庫

一個用於 2D/3D 影像與點雲處理的大型開源程式庫,廣泛應用於機器人技術與 3D 感知。

686

segmentation_models.pytorch:一個高階 PyTorch 函式庫,用於影像語意分割,提供超過 800 個預訓練編碼器

一個 PyTorch 函式庫,提供高階 API,讓使用者能輕鬆建立與訓練影像語意分割模型,支援多種預訓練編碼器與架構。

687

colmap:一個通用的結構光束恢復與多視角立體管線,用於 3D 重建

一個通用的結構光束恢復與多視角立體管線,用於從圖像集合重建 3D 結構。

688

Meshroom: 一個用於 3D 重建與電腦視覺管線的節點式視覺化程式設計框架

一個用於 3D 重建與電腦視覺的節點式視覺化程式設計框架,讓使用者能夠利用 AI 與攝影測量技術建立複雜的數據處理管線。

689

open_clip:一個用於訓練與部署大規模對比式語言‑影像與音訊‑文字模型的開源框架

一個 OpenAI CLIP 的開源實作,能夠訓練與使用大規模對比式語言‑影像模型,以執行零樣本分類與檢索。

690

carla: 一個用於訓練與驗證自動駕駛系統的開源城市駕駛模擬器

一個用於自動駕駛研究的開源模擬器,用於在模擬的城市環境中開發、訓練與驗證自動駕駛系統。

691

labelme: 一款具備 AI 輔助遮罩與多格式數據集匯出的圖形化圖像標註工具

一款圖形化圖像標註工具,允許用戶使用各種形狀與 AI 輔助工具來標註圖像,以建立電腦視覺模型的數據集。

692

cvat: 一個用於建立高品質電腦視覺資料集的專業資料標註平台

一個用於建立高品質電腦視覺視覺資料集的開源資料標註平台,支援圖像、影片和 3D 標註。

693

AirSim: 一個用於自動駕駛車輛與 AI 研究的高保真視覺與物理模擬器

一個基於 Unreal Engine 構建的無人機與汽車開源模擬器,旨在作為深度學習、電腦視覺和強化學習 AI 研究的平台。

694

MaaAssistantArknights: 一款基於圖像識別的 Arknights 自動化助手,可自動執行日常任務與基建管理

一款為 Arknights 設計的自動化助手,利用圖像識別與深度學習技術來自動執行日常任務、基建管理與資源收集。

695

vit-pytorch: 使用 PyTorch 實作的 Vision Transformer (ViT) 及其變體綜合集合

一個全面的 PyTorch 函式庫,實作了原始的 Vision Transformer (ViT) 以及數十種用於圖像分類的高階變體。

696

label-studio: 一款具備 ML 輔助預標記與主動學習功能的跨模態開源數據標記工具

一款開源數據標記工具,允許使用者標註音訊、文本、圖像與影片,以準備或改進機器學習模型的訓練數據。

697

espnet:一個全面的端到端語音處理工具包,支援 ASR、TTS 與口語語言理解

一個端到端語音處理工具包,提供統一框架,使用 PyTorch 支援 ASR、TTS、語音翻譯與增強。

698

leon: an open-source personal AI assistant with agentic execution and local-first privacy

一個開源的個人 AI 助手,透過使用工具、記憶和代理執行來執行任務,同時支援本地 AI 模型以確保隱私。

699

HunyuanVideo-1.5: 一款用於消費級 GPU 高品質合成的輕量化 8.3B 參數影片生成模型

一款輕量化 8.3B 參數的影片生成模型,可在消費級 GPU 上實現高品質的文字轉影片與圖片轉影片合成。

700

OpenMontage:一個將研究、腳本編寫與剪輯整合進完整製作流程的代理式影片製作系統

一個開源的代理式影片製作系統,透過協調研究、腳本編寫、素材生成與剪輯,從自然語言提示詞來製作專業影片。