tensorflow/java
TensorFlow‑Java 提供可發布至 Maven 的 Java/JVM 綁定,包含低階 JNI 包裝(`tensorflow‑core`)、高階神經網路 API(`tensorflow‑framework`)以及獨立的 ndarray 庫。支援 Linux(x86_64、arm64)與 macOS(Apple Silicon)二進位檔,可選 GPU 建構,並與標準 Java 建構工具整合。
mistralai/client-python
Mistral AI 的雲端 API(聊天、嵌入、音訊、檔案、代理等)官方 Python SDK。透過 pip/uv/poetry 安裝,設定 `MISTRAL_API_KEY`,即可同步或使用 `asyncio` 呼叫 `client.chat.complete(...)`。包含 Azure 與 GCP 封裝,支援串流、分頁、重試等。
nextcloud/recognize
一個使用本地 AI 模型自動對照片、影片和音樂進行分類的 Nextcloud 智慧媒體標籤應用
inclusionAI/Ming
Ming-flash-omni 2.0 是一個開源的全模態MLLM,透過單一MoE架構統合了文字、影像、音訊與影片的多模態感知與生成。
cgnomads/GSOPs
一個 SideFX Houdini 外掛程式,提供全面的工具集,用於 VFX 生產中的高斯點雲場景匯入、編輯與動畫。
sambanova/bloomchat
BLOOMChat 是一個從開源 BLOOM 模型微調而來的 1760 億參數多語系聊天 LLM。該倉庫提供資料準備、分詞與訓練腳本(後者適用於 SambaNova 的 RDU 硬體),以及使用 Hugging Face 的 Bloom 推論程式碼的詳細 GPU 推論說明。這是一個真正的大規模 LLM 專案,旨在協助研究人員與開發者複製或執行該模型。
remyxai/VQASynth
一個將影像資料集轉換為空間 VQA 資料集的流程,以提升視覺-語言模型的 3D 空間推理與距離估計能力。
smartscanapp/smartscan-android
一款使用裝置端處理與自動媒體分組,將圖片和影片轉換為可搜尋個人知識庫的 Android 應用。
AIGeeksGroup/3D-R1
3D-R1 是一種通用 3D 視覺-語言模型,透過合成 CoT 資料與強化學習提升空間推理與場景理解能力。
kozistr/pytorch_optimizer
一個與 PyTorch 相容的函式庫,透過單一且一致的 API,整合了 100 多種研究型優化器、多種學習率調度器(LR schedulers)與損失函數,並提供低精度訓練的選用整合功能。
OmniCustom-project/OmniCustom
OmniCustom 是一個聯合音訊影像生成框架,根據參考輸入與文字提示生成保持特定視覺身份與聲音音色的同步影片。
kyegomez/ScreenAI
一個專為理解使用者介面與資訊圖表而設計的 ScreenAI 視覺-語言模型實作。
Cerlancism/chatgpt-subtitle-translator
一個使用 OpenAI ChatGPT API(或相容服務)的 Node.js CLI/Web UI,可逐行翻譯 SRT 字幕檔案,保留時間戳。支援批次處理、結構化 JSON 輸出、提示快取、可選審核,以及用於更豐富翻譯的高階多輪「代理」模式。
HUANGLIZI/LViT
LViT 是一個結合語言與視覺變換器的多模態框架,旨在提升 CT 掃描及其他醫學影像中醫學影像分割的準確性。
MME-Benchmarks/Video-MME-v2
一個用於評估 MLLM 影片理解能力的穩健基準,採用三級漸進難度量表與分組非線性評分機制,以衡量真實的時間推理能力。
software-mansion-labs/private-mind
一款完全離線的行動 AI 應用,可在裝置上實現私密、本地化的聊天、文件分析與多模態互動,無需依賴雲端服務。
VrchStudio/comfyui-web-viewer
一個為 ComfyUI 設計的自訂節點集合,透過整合串流與 MIDI、OSC、遊戲手把等外部控制,實現 AI 藝術的即時互動。
ixaxaar/pytorch-dnc
一個 PyTorch 庫,實作可微神經電腦(DNC)、稀疏 DNC(SDNC)和稀疏存取記憶(SAM),包含安裝說明、API 使用方式、除錯支援和範例訓練任務(複製、加法、argmax)。
tianclll/Ace-Translate
一款專注於隱私的離線文件翻譯工具,使用本地 LLM 和 OCR 翻譯多種檔案格式,同時保留原始版面配置。
PipeNetwork/kimi-k3-mlx
一個 Moonshot 的 Kimi-K3 多模態 MoE 模型的 MLX 版本,支援串流轉換器與 REAP 剪枝,可在 Apple Silicon 上執行。
pipecat-ai/pipecat-client-web
用於連接與互動使用 Pipecat 框架建構的語音與多模態 AI 應用程式的 Web 客戶端 SDK 與 React 套件。
facebookresearch/mmf
MMF 是一個基於 PyTorch 的模組化視覺與語言多模態研究框架,提供最先進模型的參考實作以及分散式訓練工具。
om-ai-lab/VLM-FO1
VLM-FO1 是一個用於視覺語言模型 (Vision-Language Models) 的即插即用模組,能在不損害通用推理能力的情況下,增強細粒度感知與空間意識。
OpenEnvision/Awesome-Multimodal-Modeling
Awesome‑Multimodal‑Modeling 是一個社群維護的「awesome-list」,全面調查多模態 AI 模型。它定義了四個清晰的類別——Traditional、MLLMs、Unified 和 Native——解釋其架構差異,並連結至 Hugging Face 上的開源模型集合。該倉儲為需要結構化視角來理解快速演進的多模態領域的研究人員與工程師提供支援。
Sharrnah/whispering-ui
Whispering Tiger 應用程式的原生 Windows UI,可實現音訊串流與遊戲內圖像的即時轉錄與翻譯。
ardha27/AI-Waifu-Vtuber
一款集成了語音識別、LLM 和文本轉語音技術的 AI 驅動 VTuber 助手,用於創建用於直播和個人使用的互動式虛擬角色。
tongjingqi/Thinking-with-Video
一種全新的多模態推理範式與基準測試 (VideoThinkBench),用於評估影片生成模型解決複雜視覺與文本推理任務的能力。
AceDataCloud/Nexior
Nexior 是一個 MIT 許可的 Vue 基礎應用,將 40 多個聊天、影像、音訊與影片 AI 模型整合到一個可自托管的統一介面中。支援一鍵 Vercel 或 Docker 部署,BYOK 或單一 AceData 金鑰,內建使用者帳戶、付款與推薦機制,是 AI 產品即用型 SaaS 的理想起點。
awekrx/ChatGPT-MidJourney-prompt
一個利用 LLM 根據簡單的文本提示為 MidJourney 圖像自動生成詳細且具創意提示詞的 Python 函式庫。
HorizonWind2004/reconstruction-alignment
一種用於統一多模態模型的自我監督式後訓練方法,透過訓練模型從其自身的視覺特徵中重建影像,從而提升影像生成與影像編輯能力。
Licoy/GoAmzAI
一個為個人與企業設計的私有化、多模態 AIGC 平台,將文字、圖像、影片、音樂與 PPT 生成功能整合進一個統一的管理系統中。
a616567126/GPT-WEB-JAVA
一個基於Java的Web平台,將GPT、Midjourney與Stable Diffusion整合為具備使用者管理與支付系統的商業AI服務。
lone-cloud/gerbil
一個跨平台桌面應用程式,可在您自己的硬體上運行本地文字和圖像生成,具備整合模型搜尋功能並支援多種 GPU 加速器。
SkyworkAI/UniPic
一個用於影像編輯、生成與理解的統一多模態模型系列,具備高速多圖編輯與自回歸建模能力。
noahgsolomon/brainrot.js
一個使用 Groq、OpenAI 與 Speechify,自動生成包含名人聲音克隆與產出內容的 AI 影片的工具。
Fabric-Project/Fabric
一個基於視覺節點的創意編碼環境,用於在 macOS 上快速原型設計互動式 3D 圖形、影像/影片處理和 AI 增強視覺。
askui/python-sdk
一個 Python SDK,讓 AI agent 可以透過基於視覺的自動化,而非脆弱的 UI selector,來控制桌面和行動裝置。
IliasHad/edit-mind
一個本地影片知識庫,透過轉錄與視覺分析為影片建立索引,讓使用者能以自然語言語意搜尋影片內容。
nv-tlabs/XCube
XCube 是一個用於高解析度稀疏 3D 體素網格的生成模型,它利用層級式潛在擴散與 VDB 資料結構來建立細緻的 3D 物件與大規模場景。
FoundationVision/Liquid
Liquid 是一個統一的自回歸多模態生成器,將視覺理解與圖像生成整合於單一 LLM,且不需要外部視覺嵌入。
WHU-USI3DV/VistaDream
VistaDream 是一個無需訓練的框架,透過確保生成的新視角之間的一致性,從單張視圖圖像重建高品質 3D 場景。
OpenDCAI/OpenWorldLib
一個用於先進世界模型的統一代碼庫和框架,整合了用於影片生成、3D 場景生成和視覺-動作推理的各種開源研究。
livekit/python-sdks
LiveKit Python SDK 提供異步客戶端工具,用於加入 LiveKit 房間、發布/接收音訊-影片軌道、執行 RPC 呼叫,以及控制硬體編碼器。配套的 `livekit-api` 套件封裝了 LiveKit 的伺服器 REST 端點,用於房間建立、權杖產生、SIP、導出等。它也與 LiveKit Agents 整合,支援結合 STT、LLM 和 TTS 模型的語音 AI 機器人。
ChilloutCharles/BrainFlowsIntoVRChat
一個將生物感測器的 EEG 和生物指標數據轉換為 OSC 參數的工具,使 VRChat 實現腦控偵像動畫和效果。
Nutlope/make-comics
一個利用 Google Flash Image 2.5 和 Qwen3 80B 生成故事、角色與畫面的 AI 驅動漫畫創作工具。
vual/lobe-chat-pro
Lobe Chat Pro 是一個開源、自托管的 AI 聊天平台(lobe‑chat 的分叉),增加了完整的管理控制台、使用者/分組管理、多供應商模型定價、支付整合(WeChat、Stripe 等)以及用於圖像、音樂和影片生成的多模態「無限畫布」面板。可透過 Docker 以三種形式部署:完整後端、僅網關登入、僅網關無登入。
GitHpriyanshu23/Smart-Plant-Doctor
結合 ESP32 即時環境感測、影像基礎疾病偵測與 Gemma 4 驅動的照護助手的 AI 與物聯網植物健康平台。
worm128/AI-YinMei
整合 LLM、串流式 TTS 與虛擬形象的一站式 AI 直播平台,可為多個直播平台創建互動式 AI 機器人。