LinuxMD 將 Linux 帶到 Sega MegaDrive(Genesis)
LinuxMD 示範了完整的 Linux 核心可以在使用 EverDrive 卡帶的 Sega MegaDrive 上啟動,顯示了在基於 68000 的主機上實現 Unix 的可行性。
Meshroom: 一個用於 3D 重建與電腦視覺管線的節點式視覺化程式設計框架
一個用於 3D 重建與電腦視覺的節點式視覺化程式設計框架,讓使用者能夠利用 AI 與攝影測量技術建立複雜的數據處理管線。
open_clip:一個用於訓練與部署大規模對比式語言‑影像與音訊‑文字模型的開源框架
一個 OpenAI CLIP 的開源實作,能夠訓練與使用大規模對比式語言‑影像模型,以執行零樣本分類與檢索。
carla: 一個用於訓練與驗證自動駕駛系統的開源城市駕駛模擬器
一個用於自動駕駛研究的開源模擬器,用於在模擬的城市環境中開發、訓練與驗證自動駕駛系統。
labelme: 一款具備 AI 輔助遮罩與多格式數據集匯出的圖形化圖像標註工具
一款圖形化圖像標註工具,允許用戶使用各種形狀與 AI 輔助工具來標註圖像,以建立電腦視覺模型的數據集。
cvat: 一個用於建立高品質電腦視覺資料集的專業資料標註平台
一個用於建立高品質電腦視覺視覺資料集的開源資料標註平台,支援圖像、影片和 3D 標註。
AirSim: 一個用於自動駕駛車輛與 AI 研究的高保真視覺與物理模擬器
一個基於 Unreal Engine 構建的無人機與汽車開源模擬器,旨在作為深度學習、電腦視覺和強化學習 AI 研究的平台。
MaaAssistantArknights: 一款基於圖像識別的 Arknights 自動化助手,可自動執行日常任務與基建管理
一款為 Arknights 設計的自動化助手,利用圖像識別與深度學習技術來自動執行日常任務、基建管理與資源收集。
vit-pytorch: 使用 PyTorch 實作的 Vision Transformer (ViT) 及其變體綜合集合
一個全面的 PyTorch 函式庫,實作了原始的 Vision Transformer (ViT) 以及數十種用於圖像分類的高階變體。
label-studio: 一款具備 ML 輔助預標記與主動學習功能的跨模態開源數據標記工具
一款開源數據標記工具,允許使用者標註音訊、文本、圖像與影片,以準備或改進機器學習模型的訓練數據。
espnet:一個全面的端到端語音處理工具包,支援 ASR、TTS 與口語語言理解
一個端到端語音處理工具包,提供統一框架,使用 PyTorch 支援 ASR、TTS、語音翻譯與增強。
leon: an open-source personal AI assistant with agentic execution and local-first privacy
一個開源的個人 AI 助手,透過使用工具、記憶和代理執行來執行任務,同時支援本地 AI 模型以確保隱私。
Cursor iOS 應用在未取得同意的情況下切換使用者至新隱私模式
安裝 Cursor iOS 應用會自動將帳號從舊版「不儲存我的程式碼」隱私模式切換至較寬鬆的新模式,且舊版選項在應用內無法恢復。
PlayStation Store Studio Canal 影片下架
索尼在未提供退款的情況下,從 PlayStation Store 用戶帳號中移除數百部 Studio Canal 電影,引發了關於數位所有權本質的討論。
美國最高法院裁定地理圍欄令須遵守憲法保護
美國最高法院裁定地理圍欄令必須遵守第四修正案的保護,駁回了加入定位服務即放棄使用者隱私權的論點。
Tidal AI 政策:AI 生成音樂的去貨幣化
Tidal 推出新 AI 政策,允許平台上存在 AI 生成的音樂,但禁止其貨幣化,以確保版稅保留給人類藝術家。
HunyuanVideo-1.5: 一款用於消費級 GPU 高品質合成的輕量化 8.3B 參數影片生成模型
一款輕量化 8.3B 參數的影片生成模型,可在消費級 GPU 上實現高品質的文字轉影片與圖片轉影片合成。
OpenMontage:一個將研究、腳本編寫與剪輯整合進完整製作流程的代理式影片製作系統
一個開源的代理式影片製作系統,透過協調研究、腳本編寫、素材生成與剪輯,從自然語言提示詞來製作專業影片。
Ornith-1.0: 用於代理編碼的自我改進開源模型
Ornith-1.0 是一套採用 MIT 授權的自我改進開源模型(9B、35B 和 397B),專為代理編碼設計,是在 Gemma 4 和 Qwen 3.5 的基礎上進行後訓練而成的。
Outer Shell:用於 SSH 的原生圖形外殼
Outer Shell 透過 SSH 提供基於瀏覽器的遠端伺服器圖形介面,使用 Unix domain socket 來提供原生與 HTML 應用程式,且不需公開 HTTP 埠口。
Rocket Lab 收購 Iridium
Rocket Lab 已收購 Iridium,整合了有利可圖的衛星通信網路與寶貴頻譜,打造垂直整合的太空公司。
三星、SK Hynix 與美光在美國因記憶體價格操縱被起訴
三星、SK Hynix 與美光面臨美國訴訟,指控他們協同減少 DRAM 供應並停產舊有記憶體標準以抬高價格。
ZLUDA 6 發佈:在非 NVIDIA GPU 上執行未經修改的 CUDA 應用程式
ZLUDA 6 引入了對 32-bit PhysX 的支援、Blender 的基礎紋理支援,以及顯著提升了在非 NVIDIA 硬體上執行 CUDA 應用程式的 Windows 易用性。
Mullvad VPN 爭議:共同創辦人 Daniel Berntsson 的政治捐款
Mullvad VPN 共同創辦人 Daniel Berntsson 為瑞典 Örebro 党提供資金,引發了關於企業中立性以及私人政治捐款與公司價值觀交叉的辯論。
與 AI 共事:巫師學徒問題的一個具體案例
Carson Gross 透過 hyperscript 解析器中一個真實世界的錯誤修復案例,探討了 AI 在軟體開發中的優缺點,並強調了盲目接受 AI 提出的解決方案的危險性。
BAIR 2026 畢業生展示
Berkeley 人工智慧研究 (BAIR) 實驗室宣布了其 2026 屆博士畢業生,凸顯了機器人、大型語言模型、AI 安全與醫療領域的研究。
genai-processors: 一個用於構建非同步且可組合式多模態 AI 流水線的模組化框架
一個用於構建模組化、非同步且可組合式 AI 流水線的輕量級 Python 函式庫,旨在統一多模態內容處理與串流。
instill-core: 一個用於數據處理、流水線編排與模型託管的端到端 AI 基礎設施平台
一個端到端的 AI 平台,簡化了非結構化數據、AI 流水線和模型部署的編排,用於構建 RAG 和 AI 優先的應用程序。
YTPro: 一款具備 AI 影片摘要功能與進階播放控制的修改版 YouTube 用戶端
一款整合了 Google Gemini AI 影片摘要功能,並具備廣告攔截與內容下載工具的修改版 YouTube 用戶端。
alan-sdk-web: 一個可實現業務邏輯與 UI 即時生成的智能應用平台 SDK
一個用於將智能層嵌入 Web 應用程式的 SDK,可實現業務邏輯與 UI 組件的即時生成。
presentation-ai: 一個支援本地 LLMs 與自定義主題的開源 AI 簡報生成器
一個開源且由 AI 驅動的簡報生成器,透過「大綱優先」的工作流程,從一個主題生成可自定義的投影片。
TTS-WebUI: 一個用於執行與管理數十種開源文字轉語音及音訊生成模型的統一網頁介面
一個用於管理與執行各種開源文字轉語音、音訊生成及音訊轉換 AI 模型的統一網頁介面。
Gemini-API: 一個針對 Google Gemini 網頁版應用程式的逆向工程非同步 Python 封裝庫
一個針對 Google Gemini 網頁版應用程式的逆向工程非同步 Python 封裝庫,可程式化地存取圖片生成、深度研究與自定義 Gems 等功能。
hallucination-leaderboard: 一個追蹤 LLM 在摘要任務中幻覺率的公開排行榜
一個使用 Vectara 的 Hallucination Evaluation Model (HHEM) 來衡量並比較不同 LLMs 在摘要文件時產生幻覺頻率的公開排行榜。
semantic-router: 一個使用語義向量空間進行路由,為 LLMs 和 agents 提供超快速決策層的工具
一個為 LLMs 和 agents 提供高速決策層的工具,利用語義向量空間根據意義而非緩慢的 LLM 生成來路由請求。
transformer-explainer: 一個用於學習 GPT-2 內部運作機制的互動式瀏覽器視覺化工具
一個在瀏覽器中執行即時 GPT-2 模型的互動式視覺化工具,旨在幫助使用者學習基於 Transformer 的模型如何預測文字。
ChatGPT-Shortcut: 一個用於提升多平台 AI 輸出品質的精選提示詞庫與管理工具
一個 AI 提示詞管理工具,提供超過 5,000 個精選提示詞的庫,以及用於在各種 AI 平台中整理、建立和分享自定義提示詞的工具。
morphic: 一個具備生成式 UI 的 AI 搜尋引擎,能從串流 JSON 渲染豐富的內嵌組件
一款由 AI 驅動的搜尋引擎,使用生成式 UI 來渲染豐富且附帶引用來源的答案,並以互動式組件取代純文字。
krita-ai-diffusion: 一款為 Krita 開發的生成式 AI 外掛程式,整合了擴散模型以實現精確的圖像編輯與繪畫
一款將生成式 AI 擴散模型整合到繪畫工作流程中的 Krita 外掛程式,提供局部重繪、即時繪畫以及精確的結構控制工具。
outlines: 一個透過類型約束生成來保證 LLM 結構化輸出的函式庫
一個透過將生成過程約束為符合特定 Python 類型或 Pydantic models 以來保證 LLM 結構化輸出的函式庫。
Open-Generative-AI:一個具備本地推論與多模型支援、不受限制的 AI 影片平台開源替代方案
一個開源且不受限制的 AI 工作室,可使用 200 多種模型生成圖像與影片,具備本地推論選項與視覺化工作流構建器。
openui: 一個開源的 AI 驅動 UI 生成器,可將即時描述渲染為框架就緒的程式碼
一個開源工具,讓您能以自然語言描述 UI 元件並即時查看渲染結果,並具備將其轉換為 React、Svelte 或 Web Components 的能力。
TurboDiffusion:一個將擴散延遲降低 100-200 倍的影片生成加速框架
TurboDiffusion 是一個影片生成加速框架,透過注意力優化與時間步蒸餾,在單一 GPU 上將擴散生成速度提升 100-200 倍。
MAGI-1:一種用於可擴展高保真影片生成且具備強大物理準確性的自回歸世界模型
MAGI-1 是一種自回歸影片生成模型,透過分塊生成高保真影片,以確保時間一致性和物理準確性。
ComfyUI-LTXVideo:用於進階 LTX-2 影片生成與音訊合成的自訂 ComfyUI 節點
一套自訂的 ComfyUI 節點與工作流程,為 LTX-2 影片生成模型加入 HDR 輸出、口型同步與生成式升級等功能。
transformerlab-app:一個開源機器學習平台,統一 AI 研究工具與叢集編排
一個開源機器學習平台,將訓練、微調、推論與評估統合於單一介面,適用於個人與研究實驗室。
當執行 CUDA 核心時會發生什麼事:從原始碼到 SASS
深入探討 CUDA 核心的生命週期,從 nvcc 編譯、PTX/SASS 產生一路追溯到 RTX 4090 上的硬體層級執行。
HackerRank 招聘代理:AI 簡歷篩選非決定性的分析
對 HackerRank 開源 hiring-agent 工具的分析揭示了顯著的分數不一致性與設計缺陷,同一份簡歷在多次執行中可能得到截然不同的分數。
maestro: 一款加速多模態視覺語言模型微調的精簡工具
一款用於加速 Florence-2、PaliGemma 2 和 Qwen2.5-VL 等多模態視覺語言模型微調的精簡工具。
SimpleTuner: 一個用於微調多模態生成式模型並具備企業級編排功能的統一訓練框架
一個用於微調圖像、影片和音訊生成式模型的全面訓練框架,支援廣泛的架構,並專注於簡單易用與記憶體效率。