LongxingTan/Time-series-prediction
TFTS 是一個基於 TensorFlow 的程式庫,提供統一介面,用於實作時間序列預測、分類與異常檢測的最尖端深度學習模型。
BobMcDear/attorch
基於 Triton 的 PyTorch nn 模組子集,為開發自定義深度學習算子提供易讀且易於修改的神經網路層集合。
relari-ai/continuous-eval
continuous-eval 是一個用於模組化、資料驅動評估 LLM 驅動流程的 Python 庫。它提供檢索、生成、程式碼和代理指標的目錄,讓您可將這些指標附加至單一流程模組,在資料集上執行,並可強制執行回歸測試。也支援自訂 LLM-as-a-judge 指標。
hgneng/ekho
Ekho 是一個中文文本轉語音引擎,可將書面文本轉換為口語音訊,並支援自定義語音數據整合。
jasonppy/VoiceCraft
一種僅需幾秒參考音訊即可實現高品質零樣本文字轉語音與語音編輯的 token infilling 神經編碼語言模型。
realsee-developer/RealSee3D
專為 3D 重建與語義分割 AI 模型訓練設計的包含 10,000 個室內場景的大規模多視圖 RGB-D 資料集。
Open-X-Humanoid/HEX
一種支援跨體態技能遷移和長時程操作的人形機器人全身視覺語言行動框架。
stack-of-tasks/tsid
一個用於剛性多體機器人(如人型機器人與四足機器人)進行基於優化的逆向動力學控制的 C++ 函式庫。
ihmcrobotics/ihmc-open-robotics-software
一個用於類人機器人控制與模擬的全面軟體堆疊,提供動力學、感知與即時通訊的工具。
graspnet/graspnetAPI
一個用於 GraspNet-1Billion 資料集的 Python API,提供載入、處理與驗證機器人抓取研究所需的抓取標籤與點雲資料的工具。
google-research/language-table
一套用於開放詞彙視覺-語言-運動學習的人類收集數據集及基準測試,使機器人能夠執行大量的自然語言指令。
ClemensElflein/xESC
專為機器人設計的開源、低成本無刷直流馬達電子調速器 (ESC),支援 FOC 與多種控制模式。
Tobias-Fischer/rt_gene
使用 PyTorch 與 ROS 2 的即時眼動與眨眼估計系統,用於在自然環境中追蹤視線方向與眨眼機率。
PX4/PX4-SITL_gazebo-classic
使用Gazebo外掛模組為PX4自動駕駛儀提供SITL與HITL模擬的探測車、船隻與飛機飛行模擬器。
napframework/nap
一個低開銷、即時的控制與視覺化平台,用於建立能與硬體、感測器和媒體互動的回應式應用程式。
RoboStack/ros-noetic
一個使用 Conda 套件管理器的跨平台 ROS Noetic 發行版,可簡化在 Linux、macOS 和 Windows 上的安裝與相依性管理。
Le0nX/ModernRoboticsCpp
一個與《Modern Robotics: Mechanics, Planning, and Control》教科書搭配的 C++ 套件,提供機器人學、規劃與控制演算法的教育性實作。
Simple-Robotics/proxsuite
專為高性能量機器人學與優化任務設計的、數值上穩健且高效的線性與二次規劃問題數值求解器集合。
openrr/urdf-viz
基於 Rust 的 URDF 與 Xacro 機器人描述檔案視覺化工具,支援透過 JSON API 進行互動式關節操作與遠端控制。
robotology/yarp
YARP 是一個用於機器人的通訊函式庫與工具包,提供軟體組件之間的標準化裝置介面與訊息傳遞。
makeecat/Peng
以 Rust 寫成的最小化多旋翼自主框架,提供即時動力學模擬、軌跡規劃與控制。
Stable-Baselines-Team/stable-baselines3-contrib
一個為 Stable-Baselines3 提供的貢獻套件,包含實驗性強化學習演算法與研究人員與開發者所需的特殊工具。
gkjohnson/urdf-loaders
一個用於 Unity 與 THREE.js 的 URDF 載入函式庫集合,讓開發者能在 3D 環境中匯入與視覺化機器人模型。
UniversalRobots/Universal_Robots_ROS2_Driver
這是一個為 Universal Robots 機械臂開發的 ROS2 驅動程式,可實現硬體通訊、透過 MoveIt2 進行運動規劃,並將 ROS2 行為整合至工業協作機器人中。
RobotWebTools/roslibjs
一組 JavaScript 用戶端函式庫,使 Web 應用程式能夠與 ROS (Robot Operating System) 系統通訊,以建置機器人介面。
UniversalRobots/Universal_Robots_ROS_Driver
用於 Universal Robots CB3 與 e-Series 機械手臂的 ROS 驅動程式,提供穩定用於即時控制、校準以及與 ROS-control 整合的介面。
hungpham2511/toppra
用於計算機器人時間最優路徑參數化的函式庫,使其能夠在遵守運動學和動力學約束的同時,盡可能快地沿幾何路徑移動。
Phylliade/ikpy
支援 URDF 與 MuJoCo MJCF 匯入,並具備加速 JAX 後端的純 Python 逆運動學計算庫。
neka-nat/cupoch
用於機器人領域快速 3D 數據處理的 GPU 加速庫,提供高效率點群演算法、碰撞避免與路徑規劃。
RoboVerseOrg/RoboVerse
一個用於可擴展機器人學習的統一平台與基準,將多個模擬框架和資料集整合到單一介面中。
TIGER-AI-Lab/Pixel-Reasoner
Pixel Reasoner 是一個研究框架,為視覺-語言模型添加視覺操作(如縮放、選幀等),透過指令微調與好奇心驅動的強化學習進行訓練。該倉庫提供安裝指南、SFT 與 RL 階段的腳本、預訓練的 7B 檢查點、資料集,以及圖像與影片基準的評估流程。
jabberjabberjabber/ImageIndexer
一款本地 AI 工具,可自動生成圖像的說明文字和關鍵字,並將其直接寫入圖像元數據中,以便於索引和搜尋。
yuanze-lin/Olympus
一個電腦視覺的通用任務路由器,可將單一自然語言指令轉換為一系列專業模型呼叫,以產生影像、影片和3D模型。
facebookresearch/mmf
MMF 是一個基於 PyTorch 的模組化視覺與語言多模態研究框架,提供最先進模型的參考實作以及分散式訓練工具。
om-ai-lab/VLM-FO1
VLM-FO1 是一個用於視覺語言模型 (Vision-Language Models) 的即插即用模組,能在不損害通用推理能力的情況下,增強細粒度感知與空間意識。
OpenEnvision/Awesome-Multimodal-Modeling
Awesome‑Multimodal‑Modeling 是一個社群維護的「awesome-list」,全面調查多模態 AI 模型。它定義了四個清晰的類別——Traditional、MLLMs、Unified 和 Native——解釋其架構差異,並連結至 Hugging Face 上的開源模型集合。該倉儲為需要結構化視角來理解快速演進的多模態領域的研究人員與工程師提供支援。
OpenBMB/UltraEval-Audio
一個用於評估大型音訊基礎模型(large audio foundation models)的統一開源框架,支援跨 34 個基準測試(benchmarks)的語音理解與生成。
Sharrnah/whispering-ui
Whispering Tiger 應用程式的原生 Windows UI,可實現音訊串流與遊戲內圖像的即時轉錄與翻譯。
daanzu/kaldi-active-grammar
Kaldi‑Active‑Grammar 是 Kaldi 語音辨識引擎的 Python 包裝器,可編譯多個小型語法,並在每個語音輸入中僅啟用所需部分。支援所有主要作業系統的二進位 wheel,內建預訓練英文模型,並為 Dragonfly 與 Caster 語音控制框架提供後端。透過 pip 安裝,下載模型,定義規則,即可動態啟用情境感知的指令控制。
cubist38/mlx-openai-server
一個用於在 Apple Silicon 上本地執行 MLX 模型的 OpenAI 相容 API 伺服器,支援文字、多模態、影像與音訊模型。
filippogiruzzi/voice_activity_detection
一種基於深度學習的語音活動檢測(VAD)系統,使用 1D-ResNet 和 MFCC 特徵將音訊訊號分類為語音或雜訊。
dictation-toolbox/dragonfly
一個允許使用者建立自訂語音指令以自動化電腦操作與透過語音程式設計的 Python 語音辨識框架。
algolia/voice-overlay-ios
一個提供精緻語音轉文字覆蓋層 UI 的 iOS 函式庫,使用 Apple 的原生 `SFSpeechRecognizer` 處理權限與語音辨識。
judahpaul16/gpt-home
一個基於 Raspberry Pi 的自托管 AI 家庭助理,使用 LiteLLM 和 LangGraph 將 LLM 與家庭自動化及個人生產力工具整合。
sveinbjornt/hear
macOS 的命令列介面,可使用系統內建語音辨識功能對即時麥克風輸入與音訊檔案進行轉錄。
Picovoice/rhino
Rhino 是 Picovoice 的裝置端語音轉意圖引擎,能即時將口語指令轉換為結構化的意圖與槽位。它可在從微控制器到手機、瀏覽器和桌面的各種裝置上本地運行,支援多種語言,並提供 Python、.NET、Java、Flutter、React Native、Android、iOS、Web、Node.js 和 C 的 SDK。
openspeech-team/openspeech
一個用於建構端對端自動語音辨識系統的框架,提供 20 多種 ASR 模型的參考實作與多種語言的配方。
yeyupiaoling/MASR
一個基於 PyTorch 的自動語音辨識框架,支援多種模型架構與語言的串流與非串流推論。