deepgram/deepgram-python-sdk
Deepgram 官方 Python SDK,提供自動語音辨識、文字轉語音與語言理解 API 的便捷整合。
vargHQ/sdk
一個開源的 TypeScript SDK,讓開發者與 AI 代理能使用宣告式 JSX 語法以及統一的 API,為多家 AI 供應商建立 AI 生成影片。
sdv-dev/SDGym
一個用於建模與產生合成資料的基準測試框架,讓使用者能比較不同機器學習技術的效能、記憶體使用量與品質。
digital-go-jp/genai-ai-api
由日本數位廳開發的一系列生成式 AI 微服務與雲端範本,旨在協助政府官員部署特定任務的 AI 應用程式。
inseq-team/inseq
一個基於 PyTorch 的工具套件,用於序列生成模型的事後可解釋性,提供各種特徵歸因方法來說明模型輸出。
aws-samples/bedrock-engineer
一款由 Amazon Bedrock 驅動的自主軟體開發代理應用程式,能夠建立檔案、執行指令,並透過可自訂的代理介面管理專案。
aws-samples/well-architected-iac-analyzer
一款 AI 驅動的工具,用於分析基礎設施即代碼(IaC)和架構圖是否符合 AWS Well-Architected 最佳實務,並提供優先排序的修復建議。
eidolon-ai/eidolon
一個開源 SDK,用於將 AI 代理構建並部署為具備內建 HTTP 伺服器與動態代理間通信的模組化、可擴展服務。
GoogleCloudPlatform/genai-for-marketing
一個基於 Google Cloud 的解決方案,利用 Vertex AI 與 Google Workspace 整合,自動化行銷內容產生、趨勢分析與資料查詢。
digital-go-jp/genai-web
由日本數位廳開發的生成式 AI 利用平台,讓政府官員能快速且安全地部署專門的 AI 應用程式。
nv-tlabs/XCube
XCube 是一個用於高解析度稀疏 3D 體素網格的生成模型,它利用層級式潛在擴散與 VDB 資料結構來建立細緻的 3D 物件與大規模場景。
alexiglad/EBT
一個針對能量基礎變壓器(EBTs)的框架,能在文字、圖像與影片等多模態上實現可擴展的推理與 System 2 思考。
FoundationVision/Liquid
Liquid 是一個統一的自回歸多模態生成器,將視覺理解與圖像生成整合於單一 LLM,且不需要外部視覺嵌入。
sdv-dev/Copulas
一個用於建模多變量分佈並使用 copula 函數生成合成數值資料的 Python 函式庫。
SomeOddCodeGuy/WilmerAI
一個用於高階語意提示路由與多 LLM 協調的節點式工作流引擎,讓使用者能夠建立複雜且具上下文感知的 AI 代理。
Azure-Samples/serverless-chat-langchainjs
使用 LangChain.js 與 Azure 的無伺服器 AI 聊天機器人實作,支援檢索增強生成(RAG),可根據企業文件回答查詢。
jdh-algo/JoyVASA
JoyVASA 是一個基於 diffusion 的框架,利用音訊為人類與動物肖像製作動畫,將臉部身份與動作解耦,以實現高品質、長時段的影片生成。
Coframe/coffee
一個 AI 驅動的前端引擎,讓開發者能在 IDE 中直接使用特殊的 JSX 元件與屬性產生、迭代與精緻化 React 元件。
LLPhant/LLPhant
一個用於生成式 AI 與向量資料庫的 PHP 套件,提供統一介面,將 LLM 與向量儲存整合至 PHP 應用中。
alan-ai/alan-sdk-web
一個 SDK,用於在 Web 應用程式中嵌入智慧層,實現即時產生商業邏輯與 UI 元件。
nxnai/Voost
Voost 是一個統一的 Diffusion Transformer,能夠高品質地雙向虛擬試穿與脫衣,讓使用者可以在人物照片中添加或移除服裝。
quantgirluk/aleatory
一個用於模擬與視覺化各種一維與二維隨機過程的 Python 函式庫。
Ammmob/PixelSmile
PixelSmile 是一款細緻的臉部表情編輯工具,能在保留人物或動畫角色身份的前提下,改變圖像中的情緒。
Visionary-Laboratory/visionary
一個基於 WebGPU 的平台,使用 ONNX Runtime 在瀏覽器中直接進行 Gaussian Splatting 變體和 3D meshes 的即時渲染。
WHU-USI3DV/VistaDream
VistaDream 是一個無需訓練的框架,透過確保生成的新視角之間的一致性,從單張視圖圖像重建高品質 3D 場景。
EzioBy/Ditto
Ditto 是一個用於產生高品質合成影片編輯資料的框架,供訓練 Editto——最先進的指令式影片編輯模型使用。
thu-ml/DiT-Extrapolation
一個用於 Diffusion Transformers 的即插即用框架,透過位置嵌入外推法實現更長的影片與更高解析度的圖像生成。
PKU-YuanGroup/ConsisID
ConsisID 是一個無需調校、基於 DiT 的文字轉影片生成模型,使用頻率分解在生成的影片幀中保持一致的人類身份。
UCSC-VLAA/story-iter
一個無需訓練的迭代框架,用於長篇故事視覺化,透過全域參考交叉注意力模組在最多 100 幀中保持語意一致性。
haidog-yaqub/MeanFlow
A PyTorch implementation of Mean Flows and Improved Mean Flows for high-quality, one-step image generation.
PKU-YuanGroup/MagicTime
MagicTime 是一個變形影片生成管線,旨在根據文字提示創建真實的時序縮時影片,呈現顯著的物理變化。
DaoyuanLi2816/can-i-finetune-this
一個用於在消費級 GPU 上使用 LoRA 和 QLoRA 微調 LLM 時,估算 VRAM 使用量、基準測試效能並生成訓練方案的 CLI 工具。
nolabs-ai/deepfabric
一個合成數據生成與評估框架,透過真實工具執行和佈題圖譜映射,為代理型 LLM 建立高品質的訓練數據集。
open-edge-platform/geti_v2
Geti 是一個端到端的電腦視覺平台,可簡化從智慧數據標註與主動學習到模型訓練與邊緣部署的整個 AI 生命週期。
kaito-project/aikit
一個使用容器化映像與 OpenAI 相容 API 的綜合性平台,用於主機、部署與微調大型語言模型。
Koldim2001/YOLO-Patch-Based-Inference
一個 Python 函式庫,透過影像切片與結果合併,實現基於補丁的 YOLO 推論,提升在大型影像中對小物件的偵測能力。
zhiqwang/yolort
一個為 YOLOv5 設計的運行時堆疊,透過將預處理與後處理嵌入到模型圖中,簡化了各種硬體加速器的目標檢測部署。
run-house/kubetorch
一個 Pythonic 的無伺服器介面,讓機器學習開發者能直接從本機環境在 Kubernetes 叢集上執行與擴展工作負載,啟動時間近乎即時。
facebookincubator/nimble
由 Meta 設計的列式文件格式,專為大型、寬度大的數據集設計,優化了機器學習訓練表和特徵工程的存儲與存取。
VIAME/VIAME
VIAME 是一個開源電腦視覺工具包,透過模組化、多語言的管線框架,提供偵測、追蹤、標註、搜尋以及許多其他影像/影片處理功能。它附帶桌面版和網頁版圖形介面、命令列工具、預建二進位檔和 Docker 映像檔,並可透過 C++、Python 或 MATLAB 外掛程式擴充。
tensorflow/model-optimization
一套用於透過量化和剪枝等技術來優化機器學習模型以進行部署和執行的工具套件。
google/uncertainty-baselines
一系列高品質、標準化的基準線與模板,供研究人員評估深度學習模型中的不確定性與魯棒性。
microsoft/Semi-supervised-learning
一個基於 PyTorch 的半監督學習統一基準測試,提供涵蓋 CV、NLP 和 Audio 分類任務的 14 種演算法與 15 種任務的實作。
EnzymeAD/Enzyme
用於 LLVM 和 MLIR 的高性能自動微分插件,可為優化後的程式碼(包括 GPU 核心與並行程式)合成快速梯度。
meta-pytorch/tnt
一個為 PyTorch 使用者提供訓練工具與公用程式的函式庫,旨在簡化模型訓練流程。
probcomp/Gen.jl
一個在 Julia 中運行的通用型概率編程系統,可實現可編程的貝葉斯推斷和生成模型的梯度下降式訓練。
visual-layer/fastdup
透過識別重複、異常值與錯誤標籤,對大規模影像與影片資料集進行分析與清理的開源工具。
diffgram/diffgram
一個用於存放 schema、BLOB 和預測結果的 AI 資料儲存庫,提供人工監督與多模態數據標記工具。