Mobile-Artificial-Intelligence/maid

Maid 是一個開源的 Android 應用程式(React Native),可透過 llama.cpp 在本機執行 GGUF LLM 模型,並連接到多個遠端 LLM API。它提供一鍵模型下載、對話管理、可調整的生成設定、可選的雲端同步,以及附屬的語音合成應用程式(Maise)。可從 GitHub 發布版本或 Google Play 安裝,也可自行建置 APK。

raysonmeng/agent-bridge

AgentBridge 是一個本地工具,連接 Claude Code 和 OpenAI Codex,讓它們能自動交換訊息、拆分任務、審查彼此的程式碼。它執行一個基於 Bun 的守護程序和一個簡短 CLI(`abg`/`agentbridge`),啟動兩個代理、處理回合協調、配額交接,並過濾雜訊輸出。專為想要兩個 LLM 編碼助手協作而無需手動複製貼上的開發者設計。

ZiYang-xie/WorldGen

WorldGen 是一款工具,能在數秒內從文字提示或圖像生成沉浸式 3D 場景,支援 Gaussian Splatting 與 mesh 輸出,適用於 VR、遊戲與模擬。

bcurts/agentchattr

agentchattr 是一個跨平台的本地聊天伺服器,讓你和多個 AI 編碼代理能即時對話。透過在 Web UI 中 @ 提及代理,伺服器會透過 MCP 將提示注入代理的終端,代理自動讀取聊天並回覆,實現免手操作的協調、多代理工作流程、任務、規則、會話、頻道、置頂、決策卡片、排程、語音輸入等豐富功能。

sorker/ai-shotlive

AI ShotLive Director 是一個開源的 React + Express(或 Electron)平台,能將小說或故事大綱轉換為短影片或動態漫畫。它使用關鍵幀驅動的工作流程(第一/最後幀 → 插值),並允許您插入任何文字、影像、影片或音訊模型(OpenAI、Anthropic、Google、AntSK 等)。功能包括小說轉腳本、資產生成(角色造型手冊、場景概念)、格子分鏡圖編輯器、支援 AI 字幕/TTS 的多軌影片編輯,以及完整的備份/還原機制。可透過 Docker、本地 SQLite 或桌面應用程式部署,並以 CC BY‑NC‑SA 4.0 授權。

ChrisChen667788/wind-comic

一個將單句轉化為完整短片戲劇的多智能體 AI 工作室,自動化從劇本、角色設計、配音到最終 MP4 導出的全部流程。

NVIDIA-AI-Blueprints/video-search-and-summarization

一個用於建構使用自然語言搜尋、總結與推理即時或錄製視訊串流的GPU加速視覺代理的參考架構。

saddam213/AmuseAI

一個本地多模態 AI 應用程式,使用各種開源管道與 GPU 後端生成與編輯圖像、影片、音訊與文字。

aaronyi97/image-story-video-wizard

為Codex與WorkBuddy設計的AI影片製作工作流程,從主題選擇到故事型影片的最終渲染,提供逐步引導。

Evianis/travel-photo-abstraction

一種 Codex 技能,透過將形狀與空間節奏等視覺證據映射為極簡的抽象標記,分析照片以建立稀疏的編輯風格抽象畫。

lidge-jun/ima2-gen

一個本地優先的視覺生成工作室,提供跨多個 AI 提供商的統一圖像與影片生成介面,並配備高階迭代工具。

scraed/LanPaint

一種無需訓練的通用擴散模型圖像修復取樣器,透過「思考模式」提升圖像、影片與音訊的修復品質。

facebookresearch/fairchem

fairchem 是Meta的開源庫,提供用於化學和材料科學的機器學習原子間勢(UMA模型)。它提供可pip安裝的 `fairchem-core` 套件、ASE相容的計算器、多GPU推論能力,以及分子、聚合物、無機晶體、催化劑、MOFs等的預訓練模型,實現快速且量子精度的模擬。

songlab-cal/gpn

一套專為預測全基因組變異功能效應而設計的基因組語言模型,可處理對齊與未對齊的基因組序列。

corvo007/MioSub

一個基於 Gemini 與 Whisper 的 AI 驅動字幕編輯器,可自動化實現轉錄、翻譯與毫秒級精準時間軸對齊。

anliyuan/Ultralight-Digital-Human

一個輕量級數位人模型,專為行動裝置上的即時說話頭生成而設計,可透過短影片進行個人化訓練。

NVIDIA/cudnn-frontend

NVIDIA 的 cuDNN Frontend 是一個開源的純頭檔案 C++ API 加上 Python 綁定,簡化了在 Hopper 和 Blackwell GPU 上建構高效能深度學習核心(注意力機制、GEMM、融合操作)的過程。它提供了現成的 JIT 編譯核心,包括 Flash-Attention、混合專家 GEMM 融合、稀疏/線性注意力等,均可透過統一的 Graph API 和 PyTorch 相容操作存取。

omnichar/OmniChar

一個開源工作室,使用可移植的 .char 格式創建一致的 AI 角色,該格式可在多個圖像和視頻生成模型中工作。

kunchenguid/autopreso

一個使用 AI 代理根據講者語音即時繪製與重新排列 Excalidraw 白板的免手簡報工具。

safetensors/safetensors

safetensors 是一個基於 Rust 的 Python 庫,定義了一種小型、帶 JSON 標頭的二進位格式,用於安全儲存張量(無 pickle 程式碼執行),同時支援零複製、懶加載與現代 dtype。它被用於 Hugging Face 分發大型模型權重,可透過 `pip install safetensors` 安裝。

zhizinan1997/jimeng-free-api-all

一個為 Jimeng AI 提供 OpenAI 相容 API 服務的專案,支援多帳戶輪換與管理儀表板,實現程式化圖像與影片生成。

kyleskom/NBA-Machine-Learning-Sports-Betting

一個Python專案,抓取NBA統計資料與體育賭盤賠率,建構對位特徵,訓練XGBoost與TensorFlow模型以預測比賽勝者與大/小分總和,並輸出期望值與凱利準則建議投注金額。包含資料收集、模型訓練、命令列預測腳本與簡單Flask網頁UI。

NVIDIA/cosmos-framework

一個用於訓練與部署多模態世界模型(包含 Cosmos 3 系列)的端到端框架,旨在統一語言、視覺、音訊與動作,服務於物理人工智慧。

xmarre/ComfyUI-Spectrum-MiniMax-H3

Spectrum 的 ComfyUI 實作透過預測隱藏狀態來跳過昂貴的 Transformer 評估,加速 MiniMax H3 音訊-影像生成。

openxla/xprof

XProf 是一個開源、可擴展的分析器(附帶 TensorBoard 插件),適用於現代機器學習工作負載。它可視化步驟時間分解、操作時間軸、記憶體使用情況和 HLO 圖,支援分散式處理,並可透過 `pip install xprof` 安裝。

EvolvingLMMs-Lab/LLaVA-OneVision-2

一個完全開源的 8B 多模態模型,使用編解碼器對齊的視覺編碼器統一圖像、長影片和空間理解,以實現高效的長影片推理。

facebookresearch/meshflow

MeshFlow 是一個高效的 3D 網格生成系統,它使用 MeshVAE 和 flow-matching Diffusion Transformer 在約一秒內創建藝術網格。

AlayaLab/WildWorld

一個來自 AAA ARPG 的大規模、具備明確狀態標註的世界模型數據集,旨在用於訓練生成式遊戲環境。

dineshsoudagar/local-llms-on-android

一款使用 ONNX 與 LiteRT 後端,支援語音、影像與相機輸入的完全離線、私密 Android 應用。

jedzqer/manga-translator-android

一款使用本地氣泡檢測與 OCR 結合 LLM 翻譯,在原始影像上疊加翻譯文字的 Android 漫畫翻譯應用。

OneMoreGres/ScreenTranslator

一個利用線上翻譯服務,透過螢幕擷取與OCR技術翻譯螢幕上出現文字的工具。

GalTransl/GalTransl

GalTransl 是一個桌面 GUI,可自動提取、翻譯(透過 GPT-4/Claude/DeepSeek 等)並重新注入日文 galgame 腳本為中文,支援 GPT 驅動詞典、快取和字幕功能。

Wing900/ManimCat

一個利用 Manim 和 matplotlib 驅動的 AI 工作空間,可透過自然語言建立數學動畫與靜態視覺圖表。

mll-lab-nu/VAGEN

VAGEN 是一個強化學習框架,用於訓練多輪對話 VLM 代理,透過顯式的視覺狀態推理來強化其內部世界模型,從而提升性能。

tmustier/pi-for-excel

Pi for Excel 是一個開源的 Office 增益工具,將對話式 AI 代理嵌入 Microsoft Excel。該代理可使用您設定的任意 LLM 讀取、寫入、格式化和分析電子試算表,提供 16 個內建電子試算表工具、會話管理、一鍵回滾的自動檢查點,以及可擴充的沙箱擴充。

google-deepmind/tips

TIPS 是一系列專為通用電腦視覺與多模態人工智慧設計的基礎影像-文字編碼器,具備增強的空間意識與區塊-文字對齊能力。

xikhar/persona

一款跨平台桌面應用程式,提供即時、富有表現力的 3D 角色頭像,可響應 AI 助手的語音輸出。

vinhhien112/img2obj

透過結構化分析與審查工作流生成必要的建置程式碼,將參考圖像轉換為可用於動畫製作的程序化 Three.js 物件,這是一個 Codex 插件。

RareSense/Nova3D

Nova3D 是一個程式碼原生的 3D 生成系統,將資產作為可執行的 Blender Python 程式碼生成,從而實現帶有命名部件的結構化、可編輯且可動畫化的 3D 模型生產。

OrRon/EpicInfographics

一項專為 AI 代理設計的技能,透過以場景為基礎的設計與數學精確度取代通用範本,使其能夠創建專業、工作室等級的資訊圖表與動畫。

gradio-app/trackio

Trackio 是一個免費、輕量級的實驗追蹤函式庫(與 wandb 相容),將日誌儲存在本機 SQLite 中,提供快速的非阻塞 API、Gradio 風格的儀表板、CLI/SQL 查詢工具、警報,以及可選的 Hugging Face Spaces 免費託管或自行託管。

nodetool-ai/nodetool

一個以節點圖系統與整合式 AI 代理為基礎,支援圖像、影片、音訊與文字生成的代理優先創意工作區。

ATH-MaaS/Ovis

Ovis 是一個多模態大語言模型 (MLLM) 架構,透過結構化對齊視覺與文本嵌入,實現高解析度感知與反思性推理。

morsoli/aimangastudio

一個提供從腳本生成、分鏡設計到角色風格控制的全流程AI漫畫創作工具。

jeremychone/rust-genai

genai 是一個 Rust crate,提供單一、易用的非同步 API,可與 26+ 提供商(OpenAI、Anthropic、Gemini、Ollama、Bedrock 等)提供的 200+ LLM 模型對話。它會自動選擇正確的原生協定,支援自訂 OpenAI 兼容端點、串流、工具呼叫、影像分析,並透過 ChatOptions 提供豐富的設定。該庫積極維護中(v0.6 已釋出,v0.7 beta 即將推出),並包含許多範例與文件。

X-GenGroup/Flow-Factory

一個用於跨圖像、影片與音訊-影片模態的擴散模型與流匹配模型的線上RL與離線微調統一框架。

tiiuae/Falcon-Perception

Falcon‑Perception 是一個開源的 PyTorch/MLX 推理庫,專為 Falcon 多模態變換器設計,可根據自然語言查詢執行物件檢測、實例分割或 OCR。它提供高度優化的分頁與批次引擎、FastAPI 伺服器、Streamlit UI、Docker/vLLM 部署用於 OCR,以及 Colab 筆記本。270 M 參數的 Falcon‑OCR 1.5 模型在保持三倍更小體積的同時,實現了與更大 VLM 相當的端到端 OCR 質量。

notepower2k1/CapCap

一款用於影片在地化處理的 Windows 應用程式,利用 Faster-Whisper 等 AI 模型與各種 TTS 引擎來自動化逐字稿製作、翻譯與配音。