new-sankaku/manga-editor-desu

結合專業佈局與文字排版工具,並支援可選AI圖像生成和LLM提示輔助的網頁漫畫創作工具。

EvolvingLMMs-Lab/NEO

NEO 是一系列原生視覺語言模型,採用無編碼器密集架構,統一了像素與文字處理,以實現高效的多模態理解。

TIGER-AI-Lab/VLM2Vec

一個用於訓練與評估全模態嵌入模型的統一框架,該模型可為文本、圖像、影片、音訊及視覺文件生成固定維度的向量。

roboflow/maestro

一個用於加速 Florence-2、PaliGemma 2 和 Qwen2.5-VL 等多模態視覺語言模型微調的精簡工具。

R3gm/SoniTranslate

SoniTranslate 是一個用於將影片翻譯成不同語言並同步音訊的網頁應用,將轉錄、翻譯與語音配音整合於一個介面中。

ailia-ai/ailia-models

包含419個跨視覺、音訊和文字等不同領域的預訓練AI模型,全部可透過統一CLI執行,並自動下載權重。

ohdearquant/lionagi

lionagi 是一個用於建構、執行與治理多智能體 LLM 工作流程的 Python 庫與 CLI。它提供類型化、持久化的對話狀態,支援平行扇出與基於 DAG 的流程,整合模型專用 CLI 與 API 提供者,並包含用於視覺化執行管理的 Web UI(Lion Studio)

nikvdp/cco

cco 是一個用於 AI 編碼代理(如 Claude Code、Codex 等)的沙箱包裝器,可在隔離環境中執行它們,以保護您的系統免受提示注入與意外損壞的影響,同時保持無縫的終端體驗。

Sportinger/MasterSelects

一款支援影片、音訊與 3D 編輯的瀏覽器端媒體編輯器,允許 AI 編碼代理在創作過程中直接將新工具與效果建構至工作區中。

OfficeDev/microsoft-365-agents-toolkit

由 Microsoft 提供的工具包(VS Code/Visual Studio 擴充與 CLI),可為 Microsoft 365 Copilot、Teams 和 Office 建立 AI 驅動的代理、聊天機器人及其他擴充功能。整合了驗證助手、Azure Functions 支援、熱重新載入除錯與 CI/CD 管道,針對 JavaScript/TypeScript 與 .NET 開發者設計。

shrimbly/node-banana

用於跨多個提供方建立圖像、影片、音訊與 3D 內容複雜 AI 媒體生成流程的視覺化節點工作流編輯器。

modelstudioai/cli

Aliyun Model Studio CLI (bailian‑cli) 是 Alibaba Cloud AI 平台的終端工具,提供多模態生成(文字、影像、影片、語音)、資產理解、托管代理編排、資料集驗證、微調、部署與帳戶管理的指令。可透過 npm 或單行指令安裝,使用 API 金鑰或 OAuth 認證後,執行 `bl …` 指令,或讓 AI 代理將自然語言提示翻譯為 CLI 呼叫。

NetManAIOps/ChatTS

ChatTS 是一種專為多變量時間序列設計的多模態 LLM,能原生理解並推理時間序列資料,讓使用者能對數值資料進行對話式問答。

jimmysu0309/shinkansen

Shinkansen 是一款真正的 AI 驅動瀏覽器擴充功能,使用 Google Gemini、Google Translate 或自訂 OpenAI 相容模型來翻譯網頁、YouTube 字幕和文件(PDF、Word、EPUB 等)。它保留原始版面和時間戳記,提供雙語輸出,並在本地處理檔案以保護隱私。

Graylab/IgFold

IgFold是一種從胺基酸序列預測抗體3D結構的深度學習工具,能夠為藥物發現提供快速準確的結構建模。

apple-aiml-research/ml-fastvlm

FastVLM 是一種高效的視覺編碼框架,採用名為 FastViTHD 的混合編碼器,可大幅降低高解析度影像在視覺語言模型中的延遲與 token 數量。

apple-aiml-research/ml-flextok

FlexTok 是一種將影像重取樣為靈活長度的 1D 標記序列的系統,允許影像以可截斷的序列形式表示,同時仍能實現影像重建。

merveenoyan/smol-vision

一系列用於縮小、優化和客製化前沿視覺與多模態 AI 模型的食譜,以提升效率與效能。

sign/translate

一個即時雙向翻譯系統,可將手語影片轉換為口語文字與音訊,也可將口語轉換為透過角色或GAN生成的手語。

Pangu-Immortal/MagicWX

一款使用 ONNX、MediaPipe 和 MNN 等本地執行環境,實現完全離線文字聊天與 Stable Diffusion 圖像生成的 Android 應用。

AIFrontierLab/TorchUMM

一個用於多模態模型推論、評估和後訓練的統一框架,透過單一介面支援影像理解、生成和編輯。

aiqm/torchani

TorchANI 2.0 是一個 PyTorch 函式庫,用於訓練與使用 ANI 風格的神經網絡原子間勢能,提供 GPU 加速的能量/力預測以及分子動力學與 ML/MM 模擬工具。

escalante-bio/mosaic

mosaic 是一個基於 JAX 的 Python 庫,為數十種蛋白質性質與結構預測模型提供統一、可梯度優化的介面。透過允許使用者組合可微分的損失項(結合親和力、穩定性、溶解性、逆摺疊機率等)並以自訂優化器執行連續鬆弛設計,它在單一、JIT 加速的框架中實現多目標蛋白質工程。該倉儲包含許多最前沿模型(Boltz、AlphaFold、OpenFold‑3、Protenix、ProteinMPNN、ESM 等)、範例筆記本與詳細文件,但需使用者調整超參數並安裝 GPU/TPU 相容的 JAX。

PozzettiAndrea/ComfyUI-Sharp

Apple 的 SHARP 模型的 ComfyUI 封裝器,可在不到一秒內從單張影像實現 3D 高斯點雲。

2U1/Qwen-VL-Series-Finetune

用於微調 Qwen-VL 系列模型(Qwen2-VL、Qwen2.5-VL、Qwen3-VL、Qwen3.5)的訓練工具包,支援 SFT、DPO、GRPO 和多模態資料。

tong-io/tongflow

TongFlow 是一個開源的可視化工作室,允許您透過連接簡單的「新增」、「轉換」和「合併」節點來建構多模態生成式 AI 流水線。它支援文字、影像、影片、音訊、3D 和文件,擁有豐富的插件生態系統(官方 API 插件、路由器和 GPU/CPU 計算插件),可透過輕量級桌面客戶端或自架後端使用。採用 AGPL-3.0 授權。

Simbastack-hq/framedex

一個為影片與照片檔案生成純文字 AI 描述、轉錄與元資料邊車檔案的可查詢知識庫。

geekyutao/Inpaint-Anything

一個結合SAM與生成式修復模型的統一框架,可實現影像、影片和3D場景中的物件移除、填補或替換。

dai-hongtao/InkTime

一款 AI 驅動的 e-ink 相框,利用視覺模型對回憶進行評分與標註,每天展示「歷史上的今天」中最精彩的照片。

AlexGladkov/claude-in-mobile

`mcp-devices`(又稱 `claude‑in‑mobile`)是一個模組化的 Node/Rust 伺服器,讓 Claude 風格的 AI 代理能控制 Android、iOS、網頁、桌面、Aurora 和 HarmonyOS 裝置。安裝基礎包(`npm i -g mcp-devices`),新增平台插件(如 `@mcp-devices/plugin-android`),啟用它們,並將 MCP 兼容客戶端指向伺服器。該工具提供截圖、點擊、UI 檢查、即時除錯與測試等功能,支援 AI 驅動的裝置自動化與具身智能體研究。

OTeam-AI4S/ODesign

一個全原子生成式世界模型,用於設計能與特定靶標結合的蛋白質、配體和核酸。

qntx/ovo

Ovo 是一個 Rust 庫,提供可嵌入的多代理執行時核心。它讓主應用程式能夠啟動輕量級代理(turns),執行 Rhai 腳本,並可選擇作業系統層級的沙盒(macOS Seatbelt 或 Linux Landlock)。該套件提供可配置的批准策略、沙盒後端特徵,以及可選的工具包功能以取得受監管的檔案系統存取權。目前處於預穩定階段(0.9.x),並以 MIT/Apache-2.0 雙重授權。

facebookresearch/MetaCLIP

一種全球擴展的CLIP配方,可在不降低英語性能的前提下實現高效率多語言影像-文字對齊

skrub-data/skrub

skrub 是一個 Python 函式庫,提供以資料框架為中心的清理、編碼和相似性分組工具,全部包裝為 scikit-learn 相容的轉換器,以簡化表格機器學習管線的預處理階段。

liangnjupt/VisTouch

用於材質辨識與跨模態學習的機器人滑動接觸大型同步視頻、音訊與觸覺力資料集。

livekit/rust-sdks

LiveKit 的 Rust 客戶端 SDK,支援跨桌面與行動裝置平台的即時影音/數據流串流、房間管理以及硬體加速編碼。

pinellolab/DNA-Diffusion

一種基於擴散模型的生成式模型,用於創建 200bp 的細胞類型特異性合成調控 DNA 序列。

OpenMOSS/AnyGPT

AnyGPT 是一個開源的多模態大語言模型(文字、語音、影像、音樂),透過離散標記化統一所有模態。它提供基礎模型與聊天模型檢查點、推論腳本,以及用於訓練和零樣本多模態任務的 AnyInstruct 資料集。

MoonshotAI/Kimi-K2.5

Kimi K2.5 是一個開源、原生多模態代理模型,採用 1T 參數 MoE 架構,整合視覺與語言理解,實現複雜任務執行。

muthuishere/mcp-server-bash-sdk

MCP 2026-07-28 的純 Bash 實作,為 AI 代理工具呼叫提供零開銷的 stdio 和本地 HTTP 綁定。自動發現 `tool_*` 函數,使用官方模式驗證 JSON,包含完整測試套件,並提供建構自訂 Bash 基 MCP 伺服器的逐步文件。

receptron/mulmocast-cli

一個使用 JSON 基礎中間語言 MulmoScript 生成影片、播客與簡報等多模態內容的 AI 原生簡報平台。

lupantech/MathVista

MathVista 是一個用於評估基礎模型在視覺情境中數學推理能力的基準測試,整合了來自 31 個多模態資料集的 6,141 個範例。

jiaxiaogang/HE

he4o 是一個基於 Helix 熵減理論的 AGI 系統,結合預先設計的規則與動態學習,實現具身智能與終身學習。

Yu-Yang-Li/StarWhisper

一個用於自動化天文觀測、光變曲線與脈衝星分類,並提供天文研究專用技能包的AI框架。

gokayfem/ComfyUI_VLM_nodes

面向視覺-語言模型的生產導向 ComfyUI 節點套件,提供結構化檢測、分割與自適應影片推理,並優化 VRAM 使用。

AlekPet/ComfyUI_Custom_Nodes_AlekPet

一組用於 ComfyUI 的自訂節點,新增提示翻譯、AI 驅動內容生成與影像操作工具。

MatteoFasulo/Whisper-TikTok

一款利用 OpenAI-Whisper 和 Edge TTS 自動生成帶有自然語音旁白的字幕 TikTok 影片的 AI 工具。

fudan-generative-vision/Hallo-Live

Hallo-Live 是一個即時文字驅動的框架,使用因果雙流 Diffusion Transformer 為數位化身產生同步的音訊與影像。