Lightning-AI/litData
LitData 是 Lightning AI 的一個庫,透過提供快速、雲原生的資料管道來加速 PyTorch 訓練。它提供兩種主要模式:(1) `StreamingRawDataset` 可直接從 S3/GCS/Azure/HF Hub 串流傳輸原始檔案,支援非同步、批次下載;(2) `ld.optimize` 可將資料集轉換為 LitData 自有的分塊二進位格式,實現高達 20 倍的串流傳輸、洗牌與可恢復 epoch 速度提升。該庫還包含用於預處理(如影像縮放、嵌入生成)的並行 `map` 原語,以及對影像、音訊、影片、張量、圖等多種模態的完整支援。與 PyTorch Lightning、Hugging Face datasets 和 Lightning Cloud 的整合,使其成為 I/O 成為瓶頸的大規模 ML 專案的實用工具。
ZebangCheng/Emotion-LLaMA
Emotion-LLaMA 是一種多模態大語言模型,透過專用編碼器與指令微調整合音訊、視覺與文字輸入,旨在實現情感識別與推理。
RTGS2017/NagaAgent
NagaAgent 是一個跨平台桌面 AI 助手(Windows/macOS/Linux),支援與任何 OpenAI 相容 LLM 聊天,透過 JSON 塊自訂工具呼叫,使用 Neo4j 儲存圖-RAG 記憶,整合 Live2D 動畫頭像,支援語音合成/識別與唇形同步,提供天氣、網頁搜尋、遊戲指南等插件的 MCP 框架,以及論壇、技能市場等社群功能。以 Electron/Vue 前端 + Python FastAPI 後端建構,可透過 `uv sync`(或 pip)安裝,採用 AGPL-3.0 + 專有商業授權的雙重授權。
microsoft/foldingdiff
一種用於生成新蛋白質骨架結構的擴散模型,可實現計算蛋白質設計中新蛋白質摺疊的創造。
HKU-BAL/Clair3
Clair3 是一個針對長讀長測序的開源深度學習變異檢測工具。它先以基於 pileup 的神經網絡快速掃描,再以完整比對模型精細修正不確定位點,達成高準確度且執行時間合理。提供 CPU、GPU 與 Apple‑Silicon 版本,可透過 Docker、Singularity、Bioconda 或 Conda 環境安裝,並內建 ONT、PacBio HiFi 與 Illumina 資料的預訓練 PyTorch 模型。
tin2tin/Pallaidium
一個整合至 Blender Video Editor 的生成式 AI 電影工作室,允許使用者利用 AI 生成的影片、音訊與文字,原型化完整的電影製作。
Sharrnah/whispering
專為串流覆疊層與遊戲內使用設計的本地開源工具,支援即時音訊轉錄、翻譯與 OCR。
jtydhr88/ComfyUI-HY-Motion1
基於 HY-Motion 1.0 的 ComfyUI 插件,支援從文字生成 3D 人類動作,具備提示優化功能,並可匯出為 GLB 與 FBX。
InternRobotics/PointLLM
PointLLM 是一個能夠讓 LLM 理解彩色 3D 點雲的多模態大型語言模型,適用於物體分類與描述生成等任務。
OpenBMB/VisRAG
一種將文件作為影像嵌入以防止文字解析導致的資訊損失,並使用證據引導推理進行多影像問答的視覺-語言 RAG 管道。
zju3dv/Diffuman4D
Diffuman4D 是一個用於高保真度 4D 一致性人類視角合成的時空擴散模型,能夠從稀疏視角的影片中實現自由視角渲染。
apple-aiml-research/ml-neuman
NeuMan 是一種神經輻射場實作,能夠從單一影片中重建可動畫化的人體及其背景場景,支援在原始環境中合成新視角與新姿態。
uezo/ChatdollKit
一個用於 Unity 的 3D 虛擬助手 SDK,可將 3D VRM 模型轉換為具備語音功能的聊天機器人,並實現同步語音、唇同步與自主動畫。
apple-aiml-research/ml-lito
LiTo 是一個 3D 潛在表示系統,聯合建模物件幾何和視點相關外觀,實現具有真實光照效果的高品質影像到 3D 生成。
monatis/clip.cpp
一個無相依的 C/C++ 實作 CLIP,適用於記憶體受限裝置與無伺服器部署,實現高效推論。
android/androidify
一個開源的 Android 範例應用,展示如何使用 Gemini API、Imagen 和 Jetpack Compose 建構 AI 驅動的體驗,以重新建構 Android 機器人製造器。
Voine/ChatWaifu_Mobile
一個整合 ChatGPT、本地 VITS 語音合成與 Live2D 動畫的 Android 應用程式,創造出沉浸式的角色型 AI 伴侶。
kyegomez/Gemini
一個可在單一架構中原生處理文字、影像與音訊的開源多模態 Transformer 模型實作。
PozzettiAndrea/ComfyUI-UniRig
一個使用 UniRig 和 Make it Animatable (MIA) 在 ComfyUI 中自動完成 3D 角色網格綁定與蒙皮的擴展。
theopenconversationkit/tock
Tock 是一個開源對話式 AI 平台,提供 NLP 堆疊、用於設計對話流程的視覺化工作室、基於 Kotlin 的 DSL(支援 Python、Node.js 與 REST 綁定)、現成的聊天/語音渠道連接器,以及基於 Docker 的部署方式。
Angel-ML/angel
Angel 是一個基於 Java/Scala 的分布式機器學習與圖計算平台,採用參數伺服器架構。支援多種經典 ML 算法(LR、SVM、GBDT、LDA* 等)與圖算法(PageRank、GCN、GraphSAGE 等),可在 YARN 或本機執行,並提供 Spark 集成(Spark on Angel)以實現便捷的任務提交。
facebookresearch/multimodal
一個用於大規模訓練最先進多模態模型的 PyTorch 函式庫,為 CLIP 和 BLIP-2 等模型提供模組化構建塊與預訓練權重。
mattmireles/gemma-tuner-multimodal
Gemma‑tuner‑multimodal 是一個僅支援 macOS 的 Python 套件,可在 Apple Silicon(MPS)上使用 LoRA 對 Google 的 Gemma 模型(3n 和 4 系列)進行文字、影像或音訊資料的微調。支援原生執行、從 GCS/BigQuery 流式載入大資料集、向導式 CLI 和即時 Web 可視化,並可匯出用於 Core ML 或 GGUF 推理的合併檢查點。
flutter-ml/google_ml_kit_flutter
一組 Flutter 外掛程式,讓行動應用能使用 Google 的獨立 ML Kit 實現裝置端的視覺、自然語言與生成式 AI 功能。
aws-samples/sample-mobile-ai-assistant
一款適用於Android、iOS與macOS的跨平台AI助理應用,支援即時對話、多模態分析,以及透過多種LLM供應商即時建立Web應用。
Osilly/Vision-DeepResearch
一個用於開發能夠透過跨影像與影片的迭代視覺與文字搜尋執行深度研究的多模態大語言模型的框架與基準。
PozzettiAndrea/ComfyUI-TRELLIS2
實現微軟TRELLIS.2模型的自訂ComfyUI節點,可從單一影像生成具PBR材質的高品質3D網格。
wuxiran/cc-pane
CC‑Panes 是一款開源桌面應用程式(Windows/macOS/Linux),可讓您並行執行、組織和協調多個 AI 編碼 CLI 代理。它提供工作區級儀表板、可重複使用的啟動設定檔、基於 MCP 的編排層、整合終端分割、Git/歷史工具、規劃表面以及 Web/Android 存取——全部使用 Tauri、xterm.js 和 Rust 建置。
deepmodeling/dpgen
DP‑GEN是一個Python平台,可自動化建立深度學習原子間勢(Deep Potential模型)。它執行一個並發學習循環——取樣結構、選擇資訊量最大的結構進行DFT計算、重新訓練模型——同時處理HPC叢集上的作業排程,並與許多MD和量子化學程式碼介面。
vinavfx/ComfyUI-for-Nuke
一個將 ComfyUI 節點整合至 Nuke 的 API,讓 VFX 藝術家能直接在其專業合成軟體中使用生成式 AI 工作流程。
PEPETII/danmuai
一款 Windows 桌面助手,使用視覺模型即時分析螢幕內容,並生成滾動的 AI 評論(彈幕),可選配語音合成。
kkirchheim/pytorch-ood
pytorch‑ood 是一個基於 PyTorch 建構的真正 Python 庫,專為分布外檢測而設計。它整合了超過 30 種檢測器、損失函數、預訓練模型、資料集與實用工具,與 pytorch‑lightning 集成,並提供簡單 API 與基準輔助工具。透過 `pip install pytorch-ood` 安裝,僅需幾行程式碼即可開始使用 `EnergyBased` 等檢測器。
Utopai-Research/pai-pro
一個結合了編碼代理程式、視覺畫布與統一 API 的本地優先 AI 電影製作工作空間。
elder-plinius/GL4SS
一個時空影像與影片引擎,能從 2.52 億年前到西元 3050 年,生成地球上任何地點在任何時間點的 AI 視覺效果。
microsoft/Tutel
Tutel 是 Microsoft 開源的高性能 MoE 函式庫,適用於大型語言模型。它提供動態並行、低精度推理(NVFP4、MXFP4、FP8、BF16)、支援高達 1M token 的上下文,以及視覺擴展功能,並提供 Docker 映像檔來運行 DeepSeek-V3.2、Kimi-K3、GLM-5.x、Qwen-3 和 GPT-OSS 等模型,支援 NVIDIA 和 AMD GPU。可以透過 pip 從 Git 儲存庫安裝,或從源碼構建,然後運行提供的 Docker 容器,或使用 Python API 進行自定義 MoE 路由。
IDEA-CCNL/Fengshenbang-LM
一個開源的中文預訓練基礎模型生態系統,以及用於自然語言理解、生成和多模態任務的支援框架。
open-ribbi/velocut
結合多軌影片編輯與3D場景導演的瀏覽器端工作室,整合AI以實現自動場景構圖與編輯。
yan5xu/codexloom
CodexLoom 是一個自托管平台,為 Codex 聊天代理添加持久身份、個人檔案和組織工具,支援長期運行的「領域代理」,可從多個裝置存取,透過有界訊息通訊,並可透過介面代理暴露給外部聊天平台(Feishu、Slack、Parall)。針對高階單人使用者,提供 UI、CLI 和治理功能,採用 Elastic License 2.0 發布。
SkyworkAI/Skywork-R1V
Skywork-R1V 是一個開源多模態推理模型,透過強化學習與視覺思維鏈(Visual Chain-of-Thought),在複雜的視覺邏輯、數學與物理任務中實現最先進的性能。
datawhalechina/torch-rechub
Torch-RecHub 是一個支援 30 種以上模型、模組化設計、ONNX 匯出以及多種硬體後端的 PyTorch 框架。
OpenImagingLab/AnyRecon
AnyRecon 是一個 3D 重建框架,利用影片擴散模型從一組捕獲視角生成高品質、任意視角的場景重建。
jd-opensource/JoyAI-Image
一個集圖像理解、文本生成圖像以及指令引導的圖像編輯於一體的統一多模態基礎模型,專注於空間智能。
Capsize-Games/airunner
一個私密、本機優先的 AI 夥伴與藝術生成平台,結合可自訂的聊天夥伴與分層創意畫布。
yuqie6/ProductFlow
一個開源、自托管的工作空間,專為小型商家設計,利用AI驅動的視覺工作流自動化產品行銷素材的創建,包括文案與影像生成。
mintdotgg/mint-playground
一組開源的Three.js體驗,展示使用Mint資產管道建構的互動式3D展廳、遊戲與資料視覺化。
openbezal/rhema
一個即時AI驅動的桌面應用,可檢測直播音訊串流中的聖經經文,並透過NDI渲染為可廣播的覆疊層
lucidrains/transfusion-pytorch
一個 PyTorch 實作的 Transfusion 架構,將文字的下一個標記預測與影像等連續模態的流匹配統一於單一模型中。
landing-ai/ade-python
LandingAI ADE API 的 Python 套件,可將 PDF 與影像解析為結構化 Markdown,並使用 Pydantic 模型提取類型化資料。