NEKOparapa/ReaDreamAI

一個自動化小說創作的 AI 平台,包括文字生成、一致的角色插圖和影片改編。

OpenEnvision/WorldFoundry

一個開源基礎設施,為影片生成、3D/4D 表示與具身 AI 提供統一的推論、資產階段化與基準評估堆疊。

alexiglad/EBT

一個針對能量基礎變壓器(EBTs)的框架,能在文字、圖像與影片等多模態上實現可擴展的推理與 System 2 思考。

potamides/DeTikZify

DeTi*k*Zify 是一個開源的多模態 LLM,可將草圖或點陣科學圖形轉換為可編輯的 TikZ 程式碼。它支援影像轉 TikZ、透過 Ti*k*Zero 適配器進行文字轉 TikZ,以及使用蒙地卡羅樹搜尋進行迭代最佳化。可透過 pip 安裝,需要完整的 TeX Live、Ghostscript 和 Poppler 安裝,並可在 GPU(8‑b 模型)或 CPU(1‑b)上執行。此儲存庫提供 CLI/Web UI、Python API 範例、Hugging Face 上的模型權重,以及重建訓練資料集的腳本。

apple-aiml-research/ml-hierarchical-confusion-matrix

Neo 是一個開源 JavaScript 庫(npm 套件 `@apple/hierarchical-confusion-matrix`),提供支援階層式與多輸出類別標籤的互動式混淆矩陣視覺化。透過 npm 安裝,傳入一個規格與 `{actual, observed, count}` 記錄陣列,即可將矩陣嵌入任何網頁。支援平面、階層式(`:`)、多輸出(`,`)以及組合標籤結構,並附帶即時示範、單元測試與完整的 TypeScript 原始碼樹。

lxtGH/OMG-Seg

一個將圖像、影片和像素級分割整合進單一模型的視覺感知與推理統一框架,減少了對專門化模型的需求。

baxtree/subaligner

Subaligner 是一個開源的 Python/CLI 工具,可將字幕與影片/音訊同步,支援透過 Whisper 進行語音轉錄、使用 HuggingFace 模型進行字幕翻譯,甚至訓練自訂對齊模型。支援多種字幕與媒體格式,提供快速全域偏移(`single`)與高精度雙階段(`dual`)對齊,並支援 Docker、pip 及 LLM 增強功能的可選擴充。

Softlandia-Ltd/vision-is-all-you-need

一種視覺 RAG(V-RAG)示範,使用 VLM 將 PDF 頁面作為影像嵌入,以消除文件檢索過程中的文字分塊需求。

openaiotlab/CUHK-X

用於人類行為識別與推理的大規模多模態資料集與基準,整合七種同步感測器模態,以實現複雜動作理解。

EleutherAI/gpt-neox

GPT‑NeoX 是一個開源、基於 Megatron 的函式庫,用於在多 GPU 叢集上訓練數十億參數的語言模型。它加入了 DeepSpeed 風格的最佳化,支援多種啟動器(Slurm、MPI 等),可在 NVIDIA 和 AMD GPU 上運行,並包含 Flash Attention、Mixture‑of‑Experts 和偏好學習微調等現代功能。非常適合擁有龐大運算預算的研究實驗室;若僅用於推論,建議使用 Hugging Face `transformers`。

mbzuai-oryx/Video-ChatGPT

結合 LLM 與時空視覺編碼器的影片對話模型,可實現對影片內容的詳細、自然語言討論。

mbzuai-oryx/groundingLMM

GLaMM 是一個像素定位的大型多模態模型,它將自然語言回應與物件分割遮罩整合在一起,以實現精確的視覺定位。

mbzuai-oryx/LLaVA-pp

LLaVA++ 透過整合 LLaMA-3 與 Phi-3 LLM,增強了 LLaVA 1.5 的視覺指令遵循能力與學術任務表現。

NVlabs/OmniVinci

OmniVinci 是一款開源的全模態大語言模型 (LLM),透過專門的時間與對齊架構,共同理解視覺、音訊與文本,以提升跨模態推理能力。

blendi-remade/falcraft

一款使用 fal.ai 從文字提示生成 3D 結構並直接在遊戲世界中即時播放 AI 影片串流的 Minecraft Fabric 模組。

TetreesEX/TetreesAgent_EX

Tetrees Agent EX 是一個 Node.js SDK/CLI,讓開發者透過公開 MCP 合約,在 Tetrees EX 市場上搜尋、報價、執行、擴充和發佈 AI 套件。提供購買者、建構者與銷售者的範例腳本,並將所有憑證本地保存。

JavisVerse/JavisDiT

一種用於聯合音訊-影像生成的擴散 Transformer 框架,可確保從文字提示生成的音訊與影像在語意與時間上保持一致。

caiyuanhao1998/Open-DiffusionGS

一種將高斯點陣整合到擴散去噪器中的單階段圖像到3D生成與重建框架,實現快速、可擴展的3D創作。

open-gigaai/giga-models

GigaModels 是一個開源 Python 工具箱,將數十個預訓練的視覺、擴散與多模態模型(例如:Grounding DINO、Depth Anything、GigaBrain‑0、Pi0、Cosmos‑Predict2.5)封裝在統一的 `load_pipeline` API 後方。支援推論與訓練,提供即用型指令碼,並可透過 conda + pip 安裝。

huggingface/huggingface-gemma-recipes

一套用於實現 Gemma 模型家族的多模態推論、微調與 RAG 的最小化配方與筆記本集合。

microsoft/XPretrain

XPretrain 是 Microsoft Research 的一個儲存庫,提供用於影片-文本與圖像-文本對進行大規模多模態預訓練的代碼、預訓練權重與 HD‑VILA‑100M 影片-語言數據集。它包含 HD‑VILA、LF‑VILA、CLIP‑ViP、Pixel‑BERT、SOHO 與 VisualParsing 等模型,每個模型都與近期發表的會議論文相關聯。

OliverDOU776/Few-step-probabilistic-glucose-forecasting-from-continuous-glucose-monitoring-and-meal-images

一種利用條件化修正流將大型來源資料集的知識遷移到小型目標資料集的快速機率預測工具。

wit-ai/pywit

Wit.ai 的 Python SDK,讓開發者能輕鬆將文字與語音自然語言理解功能整合至其應用程式中。

6551Team/opentwitter-mcp

opentwitter‑mcp 是一個 Python MCP 伺服器,讓 AI 助手能透過一組預先準備好的工具與 WebSocket 推送 API,取得 Twitter/X 使用者資料、推文、搜尋及即時追蹤者事件。

wladradchenko/wunjo.wladradchenko.ru

用於人臉替換、語音複製和影片生成的全能型 AI 媒體工具,可在本地執行以保護隱私

erdogant/pca

一個 Python 套件,透過封裝 scikit‑learn 的 PCA/SparsePCA/TruncatedSVD,並加入預設雙標圖、解釋變異圖、異常值檢測(Hotelling T²、SPE/D‑ModX)、特徵重要性提取、模型儲存/載入,以及變異歸一化與新資料投影等實用功能,簡化主成分分析(PCA)的使用。

MemeMeow-Studio/MemeMeow

一個使用嵌入模型與視覺 AI 根據情緒或場景描述檢索迷因的自然語言檢索工具。

tensorflow/model-analysis

TensorFlow Model Analysis (TFMA) 是一個用於大規模、切片感知的 TensorFlow 模型評估的程式庫。它執行分散式 Beam 流水線,在 Jupyter 中可視化結果,並與 TFX/Kubeflow 流水線整合。

tensorflow/data-validation

TensorFlow Data Validation (TFDV) 是一個可擴展的 Python 庫,用於計算機器學習資料集的統計、推斷模式並偵測異常。它與 TensorFlow/TFX 流水線整合,使用 Apache Beam 進行分散式處理,並提供用於檢視資料品質的視覺化 UI 工具。

polyaxon/haupt

Haupt 是 Polyaxon 的一個服務,提供實驗血緣元資料、工件/指標串流傳輸、互動式沙盒會話(SSH/tmux)、本地檢視器 API 以及托管的筆記本空間等 API,協助管理、監控與重現機器學習實驗。

tonywu71/colpali-cookbooks

用於實現、微調與解讀基於視覺的文件檢索模型 ColPali 與 ColQwen2 的筆記本集合。

vincentarelbundock/marginaleffects

`marginaleffects` 是一個 R/Python 套件,可從超過 100 種統計與機器學習模型類型中簡化提取預測、對比、邊際效果與假設檢定結果,並附帶一本免費配套書。

eeeXun/gtt

gtt 是一個基於 Go 的終端 UI,支援使用 Google、DeepL、Bing、Apertium、LibreTranslate、Reverso、ChatGPT 等多種線上服務進行文字翻譯。支援 API 金鑰設定、自訂快捷鍵、色彩主題、剪貼簿整合與文字轉語音功能,可透過二進位檔、套件管理器、Docker 或從原始碼建置安裝。

deeplearning4j/deeplearning4j-examples

一組基於 Maven 的 Java 範例,展示如何使用 Eclipse Deeplearning4J 生態系統(DL4J、ND4J、SameDiff、DataVec、RL4J 等)完成從基礎神經網路訓練到 Spark 分散式與 GPU 加速學習,以及模型匯入和 Android 部署等任務。

wandb/examples

一組精心挑選的即用腳本與 Colab 記事本,展示如何將 Weights & Biases 追蹤套件整合至主流 ML 框架(PyTorch、TensorFlow/Keras、Hugging Face、XGBoost、scikit‑learn 等)中。示範記錄執行、設定、指標、梯度與製品的功能,幫助使用者僅用幾行程式碼即可為模型加入實驗追蹤與可重現性。

ai-ng/2txt

一個使用 Next.js 與 Vercel AI SDK 建構,採用 GPT-5-nano 模型的快速圖像轉文字轉換工具。

leamsigc/ShortsGenerator

一個自動化流水線,用於創建短格式影片,涵蓋 AI 腳本生成、素材取得、TTS 語音旁白和社群媒體發布排程。

win4r/openclaw-a2a-gateway

OpenClaw A2A Gateway – 一個 Node.js 外掛程式,實作 Google 的 Agent-to-Agent v0.3.0 協定。提供零設定安裝、自動對等發現(DNS-SD/mDNS)、多傳輸回退(JSON-RPC、REST、gRPC)、生物啟發式路由、電路斷路器彈性、Bearer 令牌認證與檔案傳輸工具。

duolahypercho/fusion-fable

Fusion‑Fable 是一個 Claude Code 技能,可在多個 LLM(Opus 4.8、GPT-5.5、Gemini 3.1 Pro)上並行執行提示,讓 Opus 4.8 判定獨立回答,並合成最終結構化回應。它以斜杠命令形式安裝,保存溯源檔案,並包含與 OMC 計畫系統整合的迭代規劃模式(`/fusion-plan`)。零設定面板(兩次 Opus 4.8 執行)開箱即用;更豐富的面板需要 `codex` 和 `agy` CLI。權衡是更高的令牌成本和延遲,但結果是更高质量、可審計的回答。

nikkigallery/Whimbox

一個利用 LLM 與影像識別技術,透過螢幕截圖與輸入模擬來自動化《Infinity Nikki》遊戲中日常任務、導航與活動的 AI 代理。

commaai/commavq

一個用於自駕車的世界模型框架與資料集,利用 VQ-VAE 進行影片壓縮,並使用基於 GPT 的模型預測未來駕駛場景。

kyegomez/MultiModalMamba

一個整合 Vision Transformer (ViT) 與 Mamba 的多模態 AI 模型,能高效處理並解析文字、影像、音訊與影片資料。

ashnkumar/sketch-code

一個使用影像字幕架構將手繪網頁原型轉換為 HTML 程式碼的深度學習模型。

mlcommons/training

一個收錄 MLPerf Training 基準測試套件參考(未最佳化)實作的倉儲,涵蓋視覺、語言、推薦與圖模型。每個基準測試均包含模型程式碼、Dockerfile、資料集腳本,以及測量達到目標品質所需時間的訓練執行腳本。適用於基準測試提交、硬體評估與學習,但不適用於真實世界效能。

luciddreamer-cvlab/LucidDreamer

LucidDreamer 是一個從單張影像與文字提示中實現領域無關的 3D 高斯點陣場景生成的系統。

HITsz-TMG/Uni-MoE

Uni-MoE 是一個基於混合專家(Mixture-of-Experts)的全模態大模型,能夠跨多種模態(包括文字、影像和音訊)進行理解和生成。

J3n5en/EnsoAI

EnsoAI 是一款基於 Electron 的桌面工作台,將 Git worktree 管理與持久化的 AI‑agent 會話(Claude, Gemini, Codex 等)結合在一起。它提供內建的 Monaco editor、視覺化 Git UI、3‑way merge 工具以及一鍵式 IDE 橋接功能,讓開發者能夠在在多個分支上並行開發,同時讓每個分支都擁有其專屬的 LLM 上下文。

tensorflow/java

TensorFlow‑Java 提供可發布至 Maven 的 Java/JVM 綁定,包含低階 JNI 包裝(`tensorflow‑core`)、高階神經網路 API(`tensorflow‑framework`)以及獨立的 ndarray 庫。支援 Linux(x86_64、arm64)與 macOS(Apple Silicon)二進位檔,可選 GPU 建構,並與標準 Java 建構工具整合。