diffusers:一個模組化工具箱,用於在圖像、音訊和 3D 結構上執行與訓練最先進的擴散模型
一個模組化的庫,提供最先進的預訓練擴散模型,用於生成圖像、音訊與 3D 分子結構。
ACM 提議允許在數位圖書館上訓練大型語言模型 – 好處、風險與社群回應
ACM 主張,允許大型語言模型存取其數位圖書館將提升 AI 的準確性並擴大研究影響力,同時也承認存在署名、授權與集中化的風險。
Qwen3.5-9B 使用強化學習微調後在目錄審閱上勝過前沿模型,每 1k 列表成本為 $0.5
經 GRPO 微調的 Qwen3.5-9B 模型在目錄審閱任務上達到可達成最高分數的 87.3%,成本約為每 1,000 列表 $0.50,擊敗前沿模型(後者得分 76.9%,成本為 $19–$172 每 1,000 列表)。
Yap: 開放原始碼在裝置上語音輸入 適用於 macOS
Yap 是一個免費的開放原始碼 macOS 應用程式,利用 Apple 的 Speech 框架提供快速的在裝置上語音輸入,無需外部模型或 API 金鑰。
開放模型在軟體開發中的轉變
開發者發現,像 Kimi K3 這樣的開放權重模型,在與私有推理端點配對時,能提供與閉源前沿模型相當的資料擁有權和迭代速度,適用於目標編碼任務。
Vimgolf.ai: 遊戲化 Vim 學習平台
Vimgolf.ai 是一個互動式、以關卡為基礎的學習平台,旨在透過遊戲化挑戰與與「vimbot」的競賽來教授 Vim 與 Neovim 指令。
在 SlopCodeBench 上對 Opus 5 進行基準測試
Opus 5 在 SlopCodeBench 上達到了 24% 的嚴格通過率,這表明儘管它優於先前的模型,但當前的前沿 LLM 仍難以在長期、迭代的開發任務中維護代碼品質。
mockserver-monorepo:一個多協議的模擬伺服器與代理,用於模擬 API 依賴與執行混沌工程
一個用於測試的 HTTP(S) 模擬伺服器與代理,讓開發者能模擬 API 依賴、記錄網路流量,並執行混沌工程。
Lyria 3.5 版本說明 / 新功能
Google DeepMind 在 Google Flow Music 中推出 Lyria 3.5,帶來音樂性、歌詞生成、聲音表現以及節奏與時長創作控制方面的改進。
軟體消費的倫理:分析 DHH 與 Hey 的爭議
技術社群的辯論探討使用者是否應該基於創作者的政治與社會觀點取消軟體訂閱,這場辯論是由 David Heinemeier Hansson 關於移民與羅姆人的人言論所引發的。
OpenAI GPT-5.6 Sol ARC-AGI-3 基準測試效能最佳化
OpenAI 發現,在 Responses API 中啟用保留推理和壓縮使 GPT-5.6 Sol 在 ARC-AGI-3 基準測試上的分數從 13.3% 提升至 38.3%,提升了約三倍。
理解 ClickFix 驗證碼惡意軟體攻擊
新一波的 'ClickFix' 攻擊利用假 CAPTCHA 頁面欺騙使用者透過 Windows 執行對話框執行惡意的 PowerShell 腳本,常透過被入侵的網站傳遞。
蘋果在AI市場泡沫中的戰略定位
分析蘋果優先考慮端裝置AI和邊緣晶片作為對潛在AI市場泡沫破裂的對沖策略,與AI供應商的高資本基礎設施投資形成對比。
rf-detr: 一種用於 SOTA 物件偵測、實例分割與關鍵點偵測的即時 Transformer 架構
一種基於 DINOv2 的即時 Transformer 架構,用於實現頂尖的物件偵測、實例分割與關鍵點偵測。
codex-slides:原生於代理的 AI 投影片工作室,將程式碼與文件轉換為可直接投入生產的簡報
一個開源的 AI 投影片工作室,供 Codex 程式編寫代理使用,透過可操控的即時編輯工作流程,將提示、程式碼庫或檔案轉換為專業簡報。
Apple 車輛運動提示適用於晕動症
Apple 的車輛運動提示功能使用螢幕上的視覺指標來減少使用者在移動車輛中閱讀或使用設備時的晕動症。
理解 Forth:堆疊導向程式設計以及 xkcd 的觀點
Forth 是一種以堆疊為導向的程式語言,其特徵是逆波蘭表示法和極簡設計,經常被誤解其可讀性。
bitsandbytes:一個用於 PyTorch 的 k-bit 量化函式庫,可降低 LLM 推論與訓練的記憶體消耗
一個 PyTorch 函式庫,透過針對推論與訓練的 4-bit 與 8-bit 量化,讓大型語言模型變得更易於使用。
PINTO_model_zoo: 一個用於邊緣裝置跨框架部署的預轉換與預量化模型集合
一個包含預轉換與預量化 AI 模型的綜合性儲存庫,支援 TensorFlow Lite, ONNX, 與 CoreML 等各種框架,旨在簡化邊緣裝置的部署。
opencvsharp: 一個為 OpenCV 提供全面電腦視覺與影像處理功能的跨平台 .NET 封裝庫
一個為 OpenCV 提供全面影像處理與電腦視覺功能的跨平台 .NET 封裝庫,為 .NET 生態系統帶來了強大的功能。
XY – 快速、可組合且具 GPU 加速功能的 Python 圖表函式庫 (alpha)
XY 是一個處於 alpha 階段、具備 GPU 加速功能的 Python 圖表函式庫,透過 Rust 核心與密度表面技術,能從小型圖表渲染至包含數十億個點的互動式網頁與 notebook 圖表。
您應該清洗太陽能板嗎?
作者的測試顯示,清洗太陽能板使功率提升了 2‑5%,相當於每年適度的節省,但這些節省可能會隨時間衰減。
AI 訓練與稀有書籍的破壞性掃描
報告指出,AI 公司大量購買稀有書籍,在高速掃描後將其粉碎,以製作訓練資料,該做法據稱在合理使用原則下被視為合法,以確保只存在一份副本。
Google v. SerpApi: 法官駁回針對搜尋結果刮取的 DMCA 指控
一位美國法官駁回了 Google 對 SerpApi 的訴訟,裁定 DMCA 的反規避條款不適用於非受版權保護搜尋結果的刮取。
opencv: 一個用於視覺感知與 AI 的全面開源電腦視覺函式庫
OpenCV 是一個開源的電腦視覺函式庫,為開發者提供工具與演算法,以便在軟體中實現視覺感知與 AI。
OpenAI ChatGPT for Academic Researchers 計畫公告
OpenAI 宣布了 ChatGPT for Academic Researchers,這是一項免費計畫,將於 2027 年前提供 10 萬名研究人員使用其 GPT‑5.6 模型,以加速科學發現,同時保護資料隱私。
水域缺氧與行星界限框架
加州大學聖地亞哥分校斯克里普斯海洋研究所的研究人員警告說,快速的水域缺氧正將地球推向一個「不安全的空間」,對全球穩定可能產生不可逆轉的後果。
透過 WebGPU 與 Rust 在瀏覽器中使用 Manim
Manim 動畫引擎的一種全新瀏覽器實作方案,利用 Rust、WebAssembly 與 WebGPU,實現數學動畫的即時渲染與即時預覽。
在 Lean 4 中實現的正式驗證 3D CSG 網格交集
在 Lean 4 中實現的正式驗證 3D 構造實體幾何網格交集,具有 93 行規格說明與 AI 生成的證明,讓人類審核者無需檢查 1000 行實作即可信任其正確性。
python-build-standalone: 打造高可攜性的 Python 發行版
python-build-standalone 提供具有最小化執行時依賴項的自我包含 Python 發行版,能夠在各種系統上實現可靠的嵌入與安裝。
K-Search: 將 CUDA 核心專業知識轉移到 Apple Silicon MLX
研究人員已將 CUDA-to-MLX 翻譯層擴充到 K-Search 演化框架,使得能夠自動生成高效能的 Apple Silicon 核心,其性能可達近專家水準。
WindsurfAPI: 一個將 Windsurf 內部模型存取轉換為標準 OpenAI 與 Anthropic 相容端點的 API gateway
一個將 Windsurf/Devin 的內部 AI 模型存取轉換為標準 OpenAI、Anthropic 與 Gemini API,以便在第三方客戶端中使用的 proxy 服務。
Moonshot AI Kimi-K3 發佈
Moonshot AI 即將發佈 Kimi-K3,這是全球首個專為長程編碼、推理和代理任務設計的開源 3T 等級模型。
tale.fyi: 一個用於同步小說和有聲書的網頁閱讀器
tale.fyi 是一個新興的網頁平台,旨在透過使用公共領域函式庫和神經對齊來提供同步的文本與音頻體驗,以慶祝小說。
倫理衝突與離開 Google DeepMind
前員工描述了他們離開 Google DeepMind 的決定,原因是對公司政府合約的倫理擔憂以及被感覺到的公司問責不足。
Anthropeum:一款以 Geoguessr 風格的人類人工製品遊戲
Anthropeum 是一款每日教育遊戲,玩家需要猜測大都會藝術博物館開放存取收藏中人工製品的來源與年代。
fsrs4anki:基於機器學習的間隔重複排程器,優化 Anki 複習間隔
一個現代化的 Anki 間隔重複排程器,利用機器學習根據使用者自身的記憶模式優化卡片複習間隔。
m_flow:使用路徑成本評分的圖形導向 RAG 系統,實現認知式記憶檢索
M-flow 是一個基於圖形的 RAG 框架,利用階層式記憶結構與路徑成本評分,為 AI 代理提供更精確、以推理為基礎的檢索。
Skywork‑R1V:具備先進視覺思考鏈能力的多模態推理模型,於複雜基準測試中達到 SOTA 表現
Skywork‑R1V 是一個開源的多模態推理模型,透過強化學習與視覺思考鏈,實現於複雜的視覺邏輯、數學與物理任務中的最先進表現。
太空人報告六個月國際太空站任務後持續的觀察者感受
摘要: 從六個月國際太空站任務返回的太空人描述了一種持續的觀察者感受——彷彿從稍遠的距離觀看自己的生活,且飛行醫師指出對大多數船員而言,這種感受會在數週至數月內消退。
FeyNoBg 與 NoBg: SOTA 背景移除模型與訓練庫
Feyn 推出 FeyNoBg,這是一個最先進的背景移除模型,在八個類別中優於或匹配領先的基準測試;以及 NoBg,一個用於訓練和運行此類模型的開源 Python 庫。
Misago 從 React.js 遷移至 HTMX 以提升效能與可維護性
Misago 論壇專案正在用 HTMX 取代 React.js,透過回歸伺服器端渲染來消除重複的 UI 邏輯、減少 JavaScript bundle 大小並簡化開發流程。
Bun Rust 重寫:AI 驅動開發與軟體移植的現實
對使用 Anthropic AI 進行 Bun Rust 重寫的分析,強調了「已完成」重寫的行銷說法與實現穩定發佈所需的持續工程投入之間的差距。
Segue:跨 AI 上下文轉移(透過 MCP)
Segue 是一個中立的中繼,允許使用者透過模型上下文協議(MCP)使用簡短、易發音的代號,將工作上下文從一個 AI 助手保存後載入至另一個 AI 助手。
llm-space: 為 AI agent builder 打造的桌面原型設計與除錯環境
一款為 agent builder 打造的桌面應用程式,用於原型設計、追蹤、除錯與評估 AI agent,並採用本地優先的數據儲存方式。
Helios:即時 14B 影片生成模型,用於高品質分鐘級合成
Helios 是一個 14B 即時長影片生成模型,能在單顆 H100 GPU 上以最高 19.5 FPS 產生高品質的分鐘級影片。
AI 與前沿科技綜述:Kimi K3 發布與代理工作流的崛起
前沿 AI 版圖正轉向如 Moonshot 的 Kimi K3 這類大規模開放權重模型,以及自主代理迴路的實務落地。
AI × 加密概覽:代理支付、可驗證 AI 與去中心化運算
AI 代理現在正透過像 x402 這樣的加密支付通道自主支付資料、運算與服務,同時正構建可驗證 AI、去中心化運算與身份層,以支援可信賴的代理經濟。
LightX2V: 高效能推理框架,適用於跨多樣硬體的高效圖像與影片合成
一個輕量級推理框架,用於高效能圖像與影片生成,透過步驟蒸餾與量化來大幅降低推理時間與 VRAM 使用量。
vLLM 在 Arm CPU 上的最佳化
vLLM 為基於 Arm Neoverse 的伺服器實施了一系列全堆疊最佳化,透過記憶體配置、同步與量化的改進,達到最高 6.2 倍的吞吐量提升。