LYL1015/JarvisHub
一個以可編輯畫布作為共享專案狀態的畫布原生開源框架,用於管理長期創意工作。
NVIDIA-AI-IOT/live-vlm-webui
一個用於透過即時網路攝影機或 IP 相機串流進行視覺語言模型 (VLM) 即時互動與基準測試的通用網頁介面。
dnhkng/GLaDOS
一個具備視覺、長期記憶與低延遲回應管道的主動式多模態AI人格框架。
Everless321/dYm
一款結合無水印影片下載與 AI 驅動內容分析的桌面應用程式,可自動標記並摘要抖音內容。
pipecat-ai/pipecat-examples
使用 Pipecat 框架構建語音與多模態 AI 代理的進階範例應用程式集合。
meangrinch/MangaTranslator
基於Gradio的Web應用,透過檢測對話氣泡、清理原始文字並渲染AI翻譯文字,實現漫畫和漫畫的自動化翻譯。
OpenTSLM/OpenTSLM
OpenTSLM 是一個開源套件,為 Llama 3.2 與 Gemma LLM 加入原生時間序列處理功能,支援對醫療訊號(ECG、EEG、加速度計等)進行自然語言提示與推理。提供預訓練檢查點、簡單的 `OpenTSLM` Python API、多個基準任務的推論示範腳本,以及涵蓋 MCQ、描述生成與鏈式思考推理階段的課程學習訓練管道。透過 `pip install opentslm` 安裝,從 Hugging-Face 加載模型,並使用提供的腳本進行微調或評估。採用 MIT 授權。
livekit/agents-js
一個基於插件架構的 Node.js 框架,用於建構能聽、看、理解的即時多模態語音 AI 代理,支援 STT、LLM 和 TTS 的彈性整合。
uezo/aiavatarkit
一個模組化框架,用於建置低延遲的對話式 AI 化身,整合了跨多個管道的 VAD、STT、LLM 和 TTS 管線。
Nanako0129/pilotfish
pilotfish 是一個針對 Claude Code 的策略驅動協調層,能自動將低耗能的程式設計任務委派給較便宜的 Claude 模型(Haiku、Sonnet),同時將高階規劃與最終判斷保留在主 Opus 會話中。它可透過 macOS/Linux 插件或舊版全域設定安裝,以 markdown 定義角色代理,並根據互動形狀與風險程度,使用調度流程來分配工作。專案包含文件、基準測試與 MIT 授權。
IvanWng97/pixtuoid
pixtuoid 是一個基於 Rust 的終端 UI,將多個 AI 程式碼助手以動畫像素藝術同事的形式可視化為多樓層辦公室。支援多種助手 CLI(Claude Code、Codex 等),顯示令牌使用量、工具活動,並提供主題、天氣、寵物和 LoFi 背景音樂——全部在本機運作,無遙測。
Djdefrag/QualityScaler
一款使用 DirectX12 相容 GPU 在本地對影像與影片進行增強、放大與去雜訊的 Windows AI 上採樣器。
Tencent-Hunyuan/HY-Motion-1.0
一系列十億參數級的文本轉 3D 人體動作生成模型,利用 Diffusion Transformers 和 Flow Matching 技術,從文本提示詞生成基於骨架的動畫。
huohua325/Memslides
MemSlides 是一個開源、具備分層記憶的 LLM agent 框架,可建立個人化的簡報投影片,並支援多輪、局部化的修改。它維護使用者設定檔、工作記憶與工具記憶,以保持偏好一致性並避免重複勞動,並提供 CLI 與 Docker 映像檔以便於實驗。
AHEKOT/ComfyUI_VNCCS_Utils
用於 3D Gaussian Splatting、無限畫布圖像編輯以及專業 3D 角色姿勢與光照的高級 ComfyUI 實用節點集。
AnubhavChaturvedi-GitHub/jarvis-ai-assistant
一款模組化、語音啟動的 AI 桌面助手,結合了語音識別、LLM 推理、圖像生成和系統自動化,實現免手操作控制電腦。
yangjian102621/geekai
一個一站式 AI 多模態內容創作平台,將文字、圖像、音訊和影片生成工具整合到一個商業就緒的工作空間中。
timmyy123/LLM-Hub
一款適用於 Android 和 iOS 的開源行動應用程式,利用硬體加速實現私密的裝置端 LLM 對話、圖像生成與影片生成。
resend/resend-mcp
Resend MCP Server 是一個開源的 Node.js 套件,實作了 MCP 介面,讓 AI 代理(Claude、Cursor、Copilot 等)能透過託管的遠端伺服器或本機執行的 stdio/HTTP 伺服器,完全管理 Resend 電子郵件平台——包括寄送訊息、處理聯絡人、範本、廣播、網域、Webhook 等功能。
NickPittas/DirectorsConsole
一個統一的AI視覺特效製作管線,通過將提示詞錨定於真實世界的攝影機、鏡頭和燈光限制,確保圖像和視頻生成中的電影攝影精確度。
tensorforger/FluxRT
一個為 FLUX.2 設計的即時串流編輯管線,能在消費級 GPU 上以低延遲和互動式提示詞更新來轉換器械或影片串流。
OpenGVLab/Ask-Anything
專為以聊天為中心的影片和圖像理解而設計的多模態大語言模型系列,能夠就視覺內容進行自然語言對話。
web-infra-dev/midscene-skills
一個視覺驅動的自動化函式庫,能夠使用螢幕截圖在網頁、桌面和行動平台上實現 UI 的自然語言控制。
ZJUI-AI4H/Hulu-Med
Hulu‑Med 是一個開源的多元模態醫療視覺語言模型,能夠處理文本、2D 影像、3D 掃描和影片。 它提供多種模型尺寸(4 B-235 B)、完整的訓練程式碼,並在數十個醫療基準測試中取得了最先進的結果。 該儲存庫提供容易安裝、HuggingFace 相容的載入以及用於高吞吐量推論的選配 vLLM 服務。
pytorch/benchmark
PyTorch Benchmarks 是一組標準化、輕量級的流行深度學習模型(如 BERT、ResNet、Stable Diffusion 等)的集合,可用於衡量不同 PyTorch 建構、CUDA 版本與後端的性能。它提供統一 API、安裝腳本、多種執行器(簡單測試、pytest-benchmark、自訂使用者基準)以及用於在 AWS g4dn.metal 實例上進行低雜訊調校的實用工具。
agentuniverse-ai/agentUniverse
agentUniverse 是一個 Apache-2.0 授權的 Python 框架,用於建構與編排 LLM 驅動的多智慧體應用。它提供即用型協作模式(PEER、DOE),支援數十個 LLM 提供商,包含領域知識注入工具、透過 OpenTelemetry 的可觀測性,以及視覺化工作流程 UI。該套件已在螞蟻集團的真實金融產品中使用,並提供完整的文件、範例應用與 GitHub/Discord 社群。
landing-ai/ade-cli
一種用於代理文件提取的命令列工具,可將複雜文件轉換為具備可驗證證據(頁面與框座標)的結構化 Markdown 與資料。
meme-search/meme-search
一個使用 AI 視覺模型根據內容和文字對影像進行索引,支援語意與關鍵字搜尋的自架設迷因搜尋引擎。
tonyd2wild/DeepSeek-v4-Flash-Vision-Exp-DSpark-1M-NVFP4-KV-2x-DGX-Spark
在 DGX Spark 集群上部署 DeepSeek-V4-Flash-Vision-Exp 的高效率部署方案,支援原生視覺、100萬 token 上下文,以及透過 vLLM 實現的高吞吐推測解碼。
hawk86104/three-vue-tres
基於 Three.js 和 Vue 3 建構的 AI 協作型 Web 3D 工程生態系統,用於建立可投入生產的數位雙生與工業可視化。
pengchujin/jzsub
一個自動化工具,可從多個平台下載高畫質影片,並使用 GPT 生成並內嵌雙語字幕。
thanhkeke97/RSTGameTranslation
一款適用於 Windows 遊戲的即時螢幕翻譯工具,利用 OCR 與大語言模型將螢幕上的文字與音訊翻譯成使用者的語言。
OpenGVLab/InternVideo
一系列旨在用於多模態影片理解、長上下文建模及上下文推理的影片基礎模型與大規模數據集。
horang-labs/tessera
Tessera 是一款本機桌面/網頁應用程式,可讓您並行執行多個 Claude Code、Codex 或 OpenCode AI 編碼代理程式,每個代理程式各自位於獨立的 Git worktree 中。它提供看板、分割窗格介面、終端機聊天檢視、完整的 Git 整合,以及行動裝置遠端存取,同時使用您機器上已安裝的提供者 CLI。
apple-aiml-research/ml-4m
一個利用分詞與遮罩建模來實現跨數十種模態與任務的任意模態間多模態基礎模型擴展的框架。
inclusionAI/UI-Venus
一個通用型基礎 GUI 代理,透過閉環的感知-推理-行動系統統一行動裝置、網頁和桌面互動。
Anionex/dsh-vision-toolkit
一個為 DeepSeek Harness 所設計的視覺工具包,讓純文字模型具備執行 UI 復原、長截圖 OCR 和 GUI 自動化等任務的視覺能力。
google/spatial-media
一套用於360度影片與空間音訊的規範與工具,確保沉浸式媒體能被正確識別並播放。
yincongcyincong/MuseBot
MuseBot 是一個開源的 Go 機器人,可將 Telegram、Discord、Slack、Lark、釘釘、企業微信、QQ 和微信連接到多種 LLM API(OpenAI、DeepSeek、Gemini、OpenRouter 等)。它支援 AI 回覆串流輸出、圖像/語音輸入、函數呼叫、RAG、管理介面、指標與定時任務,可本地執行或透過 Docker 部署。
strnad/CrewAI-Studio
CrewAI Studio 是一個基於 Streamlit 的 GUI,支援透過 Conda、虛擬環境、Docker 或一鍵部署輕鬆安裝。它允許您設計、執行與匯出基於 CrewAI 框架的多代理 AI 團隊,支援多種 LLM 提供者與自訂工具。
facebookresearch/brain2qwerty
一種從非侵入性腦記錄中解碼自然句子的系統,可實現打字過程中腦活動到文字的重建。
redis/mcp-redis
Redis MCP Server 是一個基於Python、支援Docker的伺服器,讓AI代理能透過自然語言命令與Redis互動。它實作了Model Content Protocol,為每種Redis資料類型(字串、雜湊、列表、集合、串流、JSON、向量索引、發布/訂閱等)提供工具,並支援Azure Entra ID認證。可從PyPI或Docker安裝,透過CLI旗標或環境變數設定,並可接入Claude Desktop、OpenAI Agents SDK或任何MCP客戶端。
wjq-learning/CBraMod
一個為臨床和腦機介面(BCI)應用設計的 EEG 解碼基礎模型,透過預訓練與微調流程實現。
awwaiid/ghostwriter
一個為 reMarkable 平板設計的 AI 助手,透過截圖捕捉手寫輸入,並直接在螢幕上繪製或打字回應。
nvidia-cosmos/cosmos-transfer2.5
一個用於物理AI的多控制網平台,可將深度與分割等影片模態轉換為機器人與自駕車的高保真訓練資料。
bytedance/Lance
Lance 是一個 30 億參數的統一多模態模型,將圖像與影片的理解、生成與編輯整合至單一框架中。
bytedance/Sa2VA
Sa2VA 是 ByteDance 的一個研究級代碼庫,它將 SAM‑2 分隔模型與多模態 LLM (InternVL, Qwen‑VL) 融合,為圖像和影片提供像素級的具身化理解。它包含核心 Sa2VA 模型、VRT 推理基準測試、SAMTok 遮罩‑token 介面,以及 SaSaSa2VA 等擴展。該存儲庫使用 `uv` 包管理器來確保環境的可重現性,並提供設置腳本、論文、模型庫和數據集連結。
fikrikarim/parlor
一個完全在裝置端運行的即時多模態 AI 助手,利用 Gemma 4 和 Kokoro TTS 實現低延遲的語音與視覺互動。