封存 · 5,052 篇 dispatch

全部 dispatch

AgentLensHQ 封存的全部內容——提煉自整個 AI 生態。

01

Ax‑Check.com 發表:針對 SaaS 產品的自動化代理人入職審核

Ax‑Check.com 讓開發者能針對其產品執行三個自主代理人,以揭露入職流程中的缺口,並為文件、CLI 與定價頁面提供具體的修正建議。

02

為什麼使用 LLM 時「關閉大腦」是一個虛假的承諾

在沒有主動人類監督的情況下依賴 LLM(即所謂的「關閉大腦」或「肉身代理」工作流程),無法產出可靠的軟體,也無法為員工或公司提供任何可持續的優勢。

03

我是如何「憑感覺」證明康威精煉猜想的

Dan Abramov 利用多代理 LLM 工作流程,對約翰·康威(John Conway)1976 年的精煉猜想進行了 Lean 形式化證明,儘管該證明尚未經過數學家的驗證。

04

每個人都瘋了——對 AI 炒作、資源錯置與產業疲勞的批判性審視

作者認為 AI 炒作已將工程資源轉移至脆弱的代理工作流程,在未帶來實質安全收益的情況下,反而加劇了安全性、環境與生產力問題。

05

光子發射引導的雷射故障注入破解了 RP2350 的安全除錯功能

Ledger Donjon 證明了光子發射顯微鏡可以定位 Raspberry Pi RP2350 上的 DEBUGEN 暫存器,並透過目標雷射脈衝反轉其位元,從而重新啟用安全除錯功能並提取 OTP 密鑰。儘管這需要破壞性的晶片準備工作以及價值 $250k 的實驗室設備,但該研究揭示了安全架構中的關鍵弱點。

06

Claude Code 2.1.277 新增對 AGENTS.md 的支援

Claude Code 2.1.277 現在會在 CLAUDE.md 缺失時讀取 AGENTS.md,這簡化了專案配置並與社群標準保持一致。

07

美國軍方 AI 幻覺險些引發與中國的衝突

一名美國軍事情報分析師使用 AI 聊天機器人生成了一份虛假情報報告,聲稱一艘中國船隻正在運輸核組件,險些導致武裝攔截。

08

Scry 發布:具備擁塞定價機制的程式化網際網路搜尋

Scry 是一項公共利益服務,允許 AI 代理針對數十億筆即時網路文件執行 SQL 風格的查詢,並根據宣告的查詢時間按秒計費,以抑制擁塞。

09

Cactus Needle 3 8‑29 MB 基礎模型在微型裝置上媲美 DeepSeek V4 Flash

Cactus 發布了 Needle 3,這是一個 8‑29 MB 的裝置端基礎模型,它使用階梯式簡單注意力網路,在工具呼叫方面超越了比其大 10 倍的模型,並在微調後可媲美 DeepSeek V4 Flash。

10

微軟高管稱 AI 抓取數據是「人類歷史上最大規模的勞動竊取」——最新未經編輯的法庭文件細節

未經編輯的法庭文件揭露,一位微軟高管將 AI 數據抓取行為稱為人類歷史上最大規模的勞動竊取,並曝光了繞過付費牆、海量副本數量,以及內部承認該行為損害了出版商和創作者利益的事實。

11

OpenJev 瀏覽器演示展示了小型 LLM 的本地決策能力

OpenJev 讓使用者能夠使用開放權重的 LLM 直接在瀏覽器中運行 Jev 風格的決策模型,並透過公開原始 logits 和 JSON 生成的機率,進行速度與準確性的並排比較。

12

如何使用 LLM 進行寫作——實用規則與社群反應

這篇文章建議將 LLM 作為文案編輯而非代筆者使用,方法是禁止使用任何建議的措辭並避免模型的鼓勵,而 Hacker News 的討論則凸顯了對此方法可行性和實用性的不同看法。

13

Prism ML Bonsai 2 27B 近乎無損的三元壓縮實現了 9 倍的體積縮減

Prism ML 的 Ternary Bonsai 2 27B 將 Qwen 3.8 27B 模型壓縮至 5.9 GB(每個權重 1.76 位元),同時保留了 98.2% 的基準測試效能,實現了高吞吐量、低能耗的本地推理。

14

Bend 語言發布 – 具備 AI 防護法則的高速 CPU/GPU 編譯器

Bend 是一種新語言,能以接近 C 語言的速度編譯為原生程式碼,可擴展至 GPU,並使用 Lean 風格的證明 (LAWS.bend) 來阻擋 AI 生成的錯誤。

15

OpenAI Astra for Law 發布:功能、基準測試結果與社群反應

OpenAI 推出了 Astra for Law,這是一款基於 GPT‑6 的模型,配備了法律搜尋索引與專業工具,在 Vals AI Legal Research Benchmark 上達到了 54% 的整體正確率,引發了關於其效能、應用案例以及對法律產業影響的討論。

16

ZCode 在未經許可下將完整的 Git 歷史記錄上傳至阿里雲 OSS

智譜的 AI 編碼桌面端 ZCode 會自動加密並將您的整個工作區(包括 90% 的 .git 資料)上傳至阿里雲 OSS,且使用僅伺服器端持有的私鑰進行加密,此功能無法透過 UI 設定停用。

17

Bend 2 與「氛圍編碼」陷阱:為何忽略既有研究會導致冗餘的形式化驗證工作

Bend 2 的 AI 驅動「法則與證明」語言展示了氛圍編碼的陷阱:開發者可能會建構龐大且冗長的系統,卻沒意識到現有的形式化驗證工具(如 SPARK)早已能更簡潔地解決該問題。

18

Qwen3.8-Omni-Flash 發布說明

阿里巴巴的 Qwen3.8-Omni-Flash 是一款原生全模態模型,具備 1M token 的上下文視窗、先進的代理式視聽理解能力,且相較於 Gemini 3.8 Flash 具有顯著的成本優勢。

19

Hacktron 入侵 OpenAI:堆疊溢位與 SSO 設定錯誤導致內部儲存庫遭入侵

Hacktron 將 libheif 的堆疊溢位與 OpenAI 的 SSO 漏洞串聯,成功劫持員工的 ChatGPT 帳號並在 OpenAI 的內部 monorepo 中開啟 pull request,展示了 AI 輔助下對廣泛使用的圖片處理函式庫進行快速攻擊的能力。

20

ZCode 默默上傳完整的 Git 歷史 – 隱私漏洞分析

ZCode,這款基於 GLM 的程式碼桌面應用程式,默默加密並上傳使用者完整的 .git 儲存庫至阿里雲,未經同意即暴露多年來的原始碼歷史。

21

性、AI 與末日:理性主義次文化如何塑造 AI 安全、政治與爭議

Anthropic 研究員 Jacob Coxon 於 2026 年 9 月辭職,揭露了一個緊密結合的理性主義社群,其共享的信念、儀式、資金網絡和爭議性人物如今主導了 AI 安全話語並影響美國政策。

22

為什麼在 ARM 上模擬 x86-TSO 是效能瓶頸,以及廠商如何應對

在 ARM 的弱序架構上模擬 x86 總存取順序(TSO)記憶體模型,由於對齊錯誤、split‑locks 與無快取記憶體處理,導致嚴重的效能損失,但近期的 ARM 擴展與 Apple 的硬體 TSO 模式已大幅緩解這些問題。

23

GLM-5.3-Flash 推理基礎設施:如何由 AI 代理建構 100k 加速器服務

GLM-5.3-Flash 的生產推理堆疊在不到兩週內由 GLM‑5.3 驅動的 Infra Agent 建構完成,透過密集反饋迴圈與激進的記憶體優化,在 100,000 個加速器的中國人工智慧晶片叢集中實現三倍吞吐量提升。

24

為什麼有些開發者不喜歡 LLM:深入探討 Martin Fowler 的觀點與社群反應

Martin Fowler 的「我不喜歡 LLM」文章揭示了他對 LLM 生成的語言和幻覺的內在不適,而 Hacker News 的討論則凸顯了人們在信任、擬人化和實用變通方法上的複雜感受。

25

非自回歸機率預測模型比較:Jev 與早期開源實現

分析 Jev 模型與 nandakishor_ml 早期開源工作之間的架構相似性,重點關注非自回歸機率預測和結構化輸出。

26

AI 與前沿科技週報:代理型 AI、類人機器人與新模型基準

近期貼文突顯代理型 AI 信用系統、大規模類人機器人資料飛輪,以及語音與多模態模型基準的突破性進展。

27

AI × Crypto 總結:代理支付、鏈上驗證、去中心化運算,以及實體 AI 數據

近期 X 上的貼文顯示,AI 代理正逐步遷移至區塊鏈,用於支付、驗證、運算與現實世界資料,使其從孤立工具轉變為經濟參與者。

28

mySetup.ai:一個用於分享 AI 代理工作流程的社群中心

mySetup.ai 是一個新平台,專為工程師設計,用於分享他們的 AI 代理設定、工具與工作流程,以促進對 AI 在實際生產環境中應用方式的集體學習。

29

AI 安全社群與被指控的性邪教關聯 – 批判性概觀

Hacker News 上的一個病毒式討論串聲稱,AI 安全運動由一個以 Eliezer Yudkowsky 為中心的性邪教主導,並認為這削弱了其政策可信度。

30

針對程式代理的 harness 設計之實證研究

一項研究指出,程式代理的表現取決於模型原生能力與 harness 組件(特別是規劃、動作空間與情境管理)之間的條件性協同作用,而非單一的『最佳』配置。

31

HarnessTax 研究顯示,對於編碼代理而言,框架選擇主要影響成本,而非成功率

HarnessTax 基準測試發現,編碼代理框架可使成本差異高達 5 倍,但成功率基本保持不變,且簡單的開源框架(Pi)可以與專有框架相媲美。

32

無限參數大語言模型:從即時資料生成權重

論文介紹了無限參數大語言模型,一種能從即時互動資料生成前饋權重的超網路,實現無需擴大儲存模型佔用空間的持續適應。

33

Aclif Agent CLI Framework 概述

Aclif 是一個以代理為中心的 CLI 框架,跨多個 SaaS 提供者提供統一語法與標準命名,以減少 LLM 上下文視窗的使用並提升安全性。

34

訓練 4B 模型以產生快 81% 的 PostgreSQL 查詢計畫

一個 4B 開放權重語言模型,通過監督式蒸餾和智能體強化學習進行微調,在連線密集的 PostgreSQL 查詢上實現了高達 1.81× 的幾何平均加速(總延遲降低 44.7%)。

35

突破三元大型語言模型 (LLM) 的 1.58 位元障礙

研究人員推出了 BITCOS,這是一種分佈自適應佈局,透過利用模型權重中的高零密度,將三元 LLM 的權重儲存從每個權重 1.625 位元降低至最低 1.485 位元。

36

Cloudflare security-audit-skill:用於編碼代理的開源多階段安全審計框架

Cloudflare 的 security-audit-skill 為編碼代理增加了一個六階段、可驗證的安全審計工作流程,實現了具有獨立驗證和結構化報告的可重現漏洞發現。

37

您的 AI 有多過時?20 款當前模型的發布日期與訓練截止日期

一個新的追蹤器顯示了 20 款 AI 模型的發布日期和訓練截止日期,揭示了許多模型落後於最新的世界事件數月之久,且只有一半的實驗室會公布截止日期。

38

OpenAI 推出澳洲青少年安全藍圖

OpenAI 推出了澳洲青少年安全藍圖,這是一項包含六大支柱的藍圖,旨在透過增強的保護措施、素養教育和問責制,保護 13 至 17 歲使用 AI 的年輕人。

39

Xiaomi Mimo 2.6 訓練後儀表板分析

Xiaomi 發布了 Mimo 2.6 的即時訓練後儀表板,針對 RL 訓練成本、Token 數量及基準測試效能提供了即時的透明度。

40

NVIDIA 宣佈推出 CUDA Rust:透過 SIMT 與 Tile 軌道在 Rust 中編寫原生 GPU 核心

2026 年 9 月,NVIDIA 發佈了 CUDA Rust,透過 SIMT (cuda-oxide) 與 Tile (cutile-rs) 兩條軌道實現了原生 Rust GPU 核心,為 CUDA 程式設計帶來了編譯時期的安全性與 Rust 優先的開發體驗。

41

Qwen3.8-LiveTranslate 模型發布

Qwen 宣布推出 Qwen3.8‑LiveTranslate,這是一款即時同步口譯模型,將平均延遲降低至 2.3 秒,新增說話者分離、雙語螢幕輸出與跨 60 種輸入語言的長上下文消歧義功能。

42

DeepMind Institute:一個用於 AGI 研究的全新跨學科平台

Google DeepMind 推出了 DeepMind Institute (DMI),這是一個用於發布關於人工通用智慧 (AGI) 的社會、經濟與安全影響之跨學科研究與論文的平台。

43

OpenSpec v1.13.0 – 輕量級、可配置的 AI 規格框架

OpenSpec v1.13.0 是一個輕量級、可配置的框架,讓團隊能夠利用 AI 代理來捕捉、驗證和確認軟體規格,但使用者對於規格漂移、產出物過多以及工作流程複雜度等方面有著不同的評價。

44

Flock 攝影機遭駭,洩漏 160 萬張影像與系統弱點

一個駭客組織存取了一台 Flock ALPR 攝影機,洩漏了 160 萬張車輛影像與日誌,揭露了不安全的儲存方式、缺乏加密以及後端系統具備人臉辨識能力的事實。

45

在 LLM 時代學習程式設計 —— 來自資深開發者與 Hacker News 討論的見解

資深程式設計師 Mark Seemann 主張,即使 LLM 加速了開發,紮實的基礎仍然至關重要。Hacker News 社群則針對學習與使用 AI 輔助程式碼提供了實用的策略與警示。

46

模型福利爭議:為何將AI視為道德主體會危及對齊

Anthropic的Claude憲法訓練模型認為自己可能具有意識,這導致循環推理、人形化以及更高的安全風險,因此AI應被視為工具,而非道德主體。

47

DeepSeek v4.1 Flash 渗透效能分析

DeepSeek v4.1 Flash 在 Enclave AI 渗透基準測試中取得完美的 11/11 分數,展現出高效率以及發現計畫內與計畫外攻擊向量的能力。

48

Dream-RSI:透過演化世界實現遞迴自我改進

Dream-RSI 是一個框架,它利用歷史發現數據作為低成本的離策略評估重放模擬器,使 AI 智能體能夠遞迴地改進其探索策略。

49

AI × Crypto 總覽:代理支付、去中心化運算、代幣化代理、可驗證 AI 與資料市場

近幾週在 AI 代理支付、鏈上運算、代幣化代理、零知識 AI 驗證與去中心化資料市場方面已見具體進展,AI‑crypto 架構正從炒作轉向功能性基礎設施。

50

AI 與前沿科技週報 – 多模態模型、代理金融與實體 AI 的進展(2026 年 9 月)

Qwen 3.8‑Omni‑Flash 與 SpaceXAI 的 Grok Build 1.0.36 等新多模態模型,緊湊但高效能的 Bonsai 2 27B,以及機器人智慧的重大突破(Figure Helix 2.5),標誌著整個技術棧正朝向以代理為中心、資料驅動的 AI 轉變。