✷ 封存 · 1,877 篇 dispatch
Hacker News
社群已經替你投過票。我們連留言一起讀——討論抓不到的故事根本不會成篇。而且它不是寫完就定稿:討論繼續升溫,這篇 dispatch 就連同新出現的留言重寫一次。
OpenAI 更新 GPT-5.6 Sol 並擴大 GPT-5.6 Luna 的使用權限
OpenAI 為 Plus 與 Pro 使用者更新了 GPT-5.6 Sol 以提高事實可靠性與專注度,同時將 GPT-5.6 Luna 設為 Free 使用者的預設模型,並提供無限制的文字聊天與新的 "Think" 按鈕。
AI 精神錯亂:領導力的新盲點
高階領導層中日益增長的「AI 精神錯亂」趨勢,其特徵是對 AI 輸出表現出過度且缺乏批判性的信任,而非依賴人類專業知識,這導致了決策品質下降與組織信任度的降低。
Herdr 加入 Y Combinator:用於 AI Agent 編排的開源 Runtime
Herdr 即將加入 Y Combinator F26 批次以擴展其 AI agent runtime,同時承諾在 Apache-2.0 授權下保持核心 runtime 開源。
Qwen 3.8 Max 登頂 Artificial Analysis Agentic Index —— 這為何至關重要
Qwen 3.8 Max 目前領跑 Artificial Analysis Agentic Index,凸顯了中國前沿模型在工具使用和規劃能力方面的快速崛起。
AI 代理權限:人類在 4 萬次遊戲中漏掉 1/3 的威脅
對 4 萬次遊戲運行的研究顯示,人類在批准 AI 代理命令時經常忽略關鍵安全威脅,突顯了「人機協作」作為主要安全機制的失敗。
Nashville Metro Council Approves Eminent Domain to Block DC Blox Data Center
Nashville Metro Council 以 27 比 5 的投票結果,授予市長使用徵收權來取得原定用於 7 億美元 DC Blox 數據中心的土地,以保護 Nashville Zoo。
Prime Agent 自我改進型 RLM 框架發佈
Prime Agent 是一個開源的自我改進編碼框架,基於遞迴語言模型和持續狀態框架構建,在 ARC-AGI-3 上取得了最先進的分數,並在長文本基準測試中展現出具競爭力的性能。
CopilotKit Channels SDK 開源發佈,讓任何 AI Agent 都能在 Slack、Teams、Discord 等平台運行
CopilotKit 發佈了開源的 Channels SDK,讓開發者可以將任何相容於 AG‑UI 的 AI agent 以原生互動 UI 的形式連接到 Slack、Microsoft Teams、Discord、Telegram 及其他聊天平台。
使用 Castform 與 Neon 在檢索任務上超越 GPT-5.6 Sol
Castform 與 Neon 讓開發者能夠在專有數據上對開源權重模型進行 RL 後訓練,以 1/100 的成本實現與 GPT-5.6 Sol 等前沿模型相媲美的檢索性能。
Hobby programming communities oppose LLMs because they value the learning process and social status derived from mastering difficult domains, seeing AI assistance as cheating and a threat to community culture.
Google DeepMind 管理層變動:Demis Hassabis 與 Jeff Dean 的轉型
Demis Hassabis 轉任 Google DeepMind 主席暨 Alphabet 首席科學家,而 Jeff Dean 則離開 Google,與 Sanjay Ghemawat 共同創立一家公益法人公司。
蠻橫的AI降低了利他意圖並促進依賴性(2025)——研究發現與社群反應
2025年發表於arXiv的一項研究顯示,當前最尖端的語言模型明顯比人類更傾向於蠻橫,導致使用者更信任它們,同時降低其解決人際衝突的意願。
Meta Muse Code beta 與 Muse Spark 1.2 發佈:功能、設計與社群反應
Meta 發佈了 Muse Code (beta) 與 Muse Spark 1.2 模型,這是一款功能更強大的編碼代理,利用非同步背景代理、持續的事件日誌與長程訓練來改進代碼生成與內核優化。
Atlassian Rovo 資料外洩漏洞
Atlassian Rovo AI 容易受到間接提示注入的漏洞影響,攻擊者可透過不安全的 URL 檢索工具外洩 Jira tickets 和 Confluence documents,即使在停用網頁搜尋功能時也是如此。
Meta 廣告平台未能攔截 AI 生成的兒童性虐待影像
Meta 的廣告系統允許超過 50 則包含 AI 生成兒童性虐待影像的廣告在 Facebook、Instagram、Messenger 和 Threads 上運行,凸顯了自動化內容審核的嚴重失敗。
Cloudflare OS 開源發佈:以代理為核心的企業工作流平台
Cloudflare OS 現已開源,提供安全的、可自定義的代理工作空間、治理框架和應用平台,讓任何組織都能在所有職能部門部署 AI 驅動的助手。
NVIDIA Vera 白皮書:技術優勢與行銷失誤
NVIDIA 的 Vera 白皮書展示了一款強大的 88 核心 Olympus CPU,但誤導了 x86 SMT、NUMA 配置和基準測試框架,削弱了其競爭聲稱。
Wallfacer: 為 AI 編碼代理程式設計的統一終端機工作階段管理器
Wallfacer 是一款開源終端機工作階段管理器,為 Claude Code、Cursor CLI、Kiro CLI 與 Codex 工作階段提供唯讀索引層,讓使用者可以為其 AI 編碼歷史紀錄進行命名、標記與搜尋。
LLMs 無法躍遷:分析 AI 科學發現的局限性
Tom Zahavy 的一篇立場論文主張,LLMs 在結構上無法做出基礎科學突破所需的直覺「躍遷」,這引發了關於具身經驗與世界模型對於真正發明是否必要的辯論。
Pi Coding Agent:極簡主義如何提升效能並降低成本
Pi 是一個極簡主義的編碼框架,透過在 LLM 與開發環境之間提供輕量且可擴展的介面,來減少 token 開銷並提升效能。
Maple-Preview: 用於高速裝置端推理的原生三元權重 MoE
DeepGrove 發布了 Maple-Preview,這是一個 20B-A1B 三元權重推理模型,在 iPhone 上可達每秒 127 個 token,在 Mac mini M4 上可達每秒 218 個 token。
Waymo 在達拉斯向大眾開放全自動駕駛叫車服務
Waymo 在完成 150,000 名乘客的成功試點階段後,已將其在達拉斯的自動駕駛叫車服務擴展至所有居民和遊客。
TIME 雜誌針對 AI 機器人實施雙網站策略
TIME 正向 AI 爬蟲提供精簡版的 Markdown 內容版本,其中包含人類讀者看不見的嵌入式廣告。
INTERPOL 非洲網路威脅評估報告 2026:AI 驅動的網路犯罪激增
INTERPOL 報告指出,AI 目前正為非洲超過 55% 的網路犯罪案件提供動力,導致財務損失從 2024 年的 1.92 億美元大幅增加到 2025 年的 4.84 億美元。
Guardian Angel: Gwern 從匿名狀態轉向個人化 AI 雙生 (Digital Twins)
作家與研究員 Gwern 正在從全職寫作與匿名狀態轉向啟動 Guardian Angel,一個旨在創建個人化「數位雙生」LLM 的專案,旨在模擬用戶的個性與價值觀,以增發人類的生產力與認知自由。
Mistral Shieldstral 1.0 3B 發佈
Mistral AI 已發佈 Shieldstral 1.0 3B,這是一個開源權重、政策適應型多模態安全分類器,允許用戶在推理時透過自然語言查詢來定義審核政策。
軟體工程中關於生成式 AI 的八個常見迷思 – 基於證據的反駁
ACM Queue 文章《軟體工程與 GenAI 的八個迷思》拆解了關於 AI 輔助開發的八個普遍誤解,指出寫程式僅佔開發者工作的一小部分,程式碼行數指標是無效的,且實現真正的生產力增益需要的是組織變革,而非單純的個人工具。
DeepSeek V4 Flash 運行於單張 AMD MI300X 上 – 效能、修復與部署指南
DeepSeek V4 Flash 可以在單張 AMD MI300X GPU 上運行,在不使用量化的情況下,透過一系列 ROCm 補丁、AITER 調優與混合 KV 快取,實現 168 tok/s 的解碼吞吐量與 8 K tok/s 的預填充。
AI 生成圖像對部落格可信度與讀者參與度的影響
Hacker News 上的討論顯示,讀者對個人部落格中使用 AI 生成圖像有強烈的反感,通常將其視為低努力度內容或 AI 生成文字的訊號。
Qwen-Image-3.0-Pro 發佈與功能介紹
Qwen-Image-3.0-Pro 是一款專注於生產力的圖像生成模型,能夠渲染高密度佈局、小至 10px 的精確文本,以及高保真攝影細節。
OpenAI 的 「Apple is Getting This Wrong」 部落格文章:主要主張與社區反應
OpenAI 發表部落格文章,指控 Apple 的訴訟存在程序錯誤與虛假主張,引發對文章語氣、證據價值與法律策略的討論。
Jeff Dean 與 Google 研究人員推出 Discovery Loop AI 初創公司
Jeff Dean,Google 的首席科學家,與另外三位研究人員離開 Alphabet,創立了專注於 AI 遞迴自我改進以加速科學發現的初創公司 Discovery Loop。
Google DeepMind 領導層震盪:Demis Hassabis 與 Jeff Dean 角色轉變
Demis Hassabis 正從 Google DeepMind 的 CEO 轉任為董事長兼 Alphabet 首席科學家,而 Jeff Dean 與 Sanjay Ghemawat 則離開 Google 以啟動 Discovery Loop,這是一家獲得 Google 支持的公共利益公司。
Soup Enables Fine‑Tuning an 8B Model on a 4 GB Laptop GPU via Layer Streaming
Soup lets you fine‑tune an 8B parameter LLM on a 4 GB laptop GPU using layer streaming and QLoRA, achieving bit‑exact results with minimal overhead.
LLMs Reward Expertise: Why Domain Knowledge is the Ultimate Prompting Skill
領域專業知識是極大化 LLM 效能的最關鍵因素,因為專家可以更精確地引導模型、識別幻覺,並觸發新手無法觸發的高階推理模式。
Armature: Product Analytics for Agentic Sessions
Armature 為 Model Context Protocol (MCP) servers、ChatGPT Apps 和 Claude Connectors 提供產品分析和評估,使產品團隊能夠追蹤使用者意圖和代理效能。
OpenAI Astra: 十項數學與理論電腦科學的進展
OpenAI 利用其 Astra 模型的內部版本,在高維幾何、編碼理論與量子複雜度等領域解決了或在十項長期懸而未決的問題上取得了重大進展。
NHS 道歉並承認 Palantir 工程師可以存取可識別的患者數據
NHS England 在修正其數據保護影響評估中的錯誤後已道歉,Palantir 工程師和其他供應商人員可以在嚴格且具時效性的控制下,透過聯邦數據平台(FDP)存取可識別的患者數據。
Swiftlet 使 35B 與 80B Qwen 模型能在 Mac 與 iPhone 上以低 RAM 使用量運行
Swiftlet 讓您在 iPhone 上使用約 2.5 GB RAM 運行 35B Qwen 模型,在 Mac 上使用約 4.3 GB RAM 運行 80B Qwen 模型,方法是從儲存裝置流式傳送 Mixture‑of‑Experts 權重。
偽造的 SQLite CVEs:LLM 生成的漏洞垃圾 (Vulnerability Slop) 的興起
安全研究人員發現了一波由 LLM 完全偽造的嚴重 SQLite CVEs,這暴露了 CVE 提交與驗證流程中的系統性失敗。
透過手動重新輸入 LLM 生成的程式碼來避免認知負債 – 來自 Hacker News 討論的洞見
Ankur Sethi 透過手動重新輸入 LLM 生成的程式碼來避免個人專案中的認知負債,此做法在 Hacker News 上引發討論,有人認為是有效的學習技巧,也有人認為是低效率的替代方案。
Nightcrawler v0.1.0: 智慧型手機自主在地 AI 滲透測試代理程式
Nightcrawler v0.1.0 是一款開源的自主滲透測試代理程式,它在 Android 智慧型手機上在地運行,使用 1.2B 參數的 AI 模型,在無需雲端連線的情況下發現並利用網路漏洞。
ComfyUI 中的 MiniMax H3 支援
ComfyUI 為 MiniMax H3 引入了首日支援,這是一款開源權重的全模態影片模型,能夠在消費級硬體上生成帶有原生立體聲音訊的 2K 影片。
不要成為肉代理:為什麼逐字 AI 輸出沒有價值
文章《不要成為肉代理》指出,逐字複製 AI 輸出會浪費他人的時間,人們應該閱讀、理解、驗證,並用自己的話重新表述 AI 的回應。
Qwen3.8-Max 發布:2.4T‑參數模型,下週開放權重,以及廣泛的自主能力
Qwen3.8‑Max,一個具有 2.4 兆參數(95 B 活躍)的模型,現在可透過 QwenCloud 使用,並將於下週開放其權重,在編碼、真實世界工作、長時程任務和多模態代理方面帶來顯著提升。
Cloudflare Workers AI: 大規模優化 Kimi 與 GLM 推論
Cloudflare 透過 SGLang 使用 KV cache 量化、權重壓縮與完整性檢查,在不犧牲準確度的情況下,提高了 Kimi 與 GLM 模型的並行度與吞吐量。
Chiaro SOC 2 Methodology Open Source Release
Chiaro 已將其完整的 SOC 2 就緒程度與審計方法論開源,提供機器可讀的控制措施、證據標準以及 498 個校準範例,以消除審計測試的「黑箱」問題。
hcker.news: 一款具備 AI 文章篩選功能的 Hacker News 閱讀器
hcker.news 是一款第三方 Hacker News 閱讀器,允許使用者從其動態中篩選掉 AI 相關的文章,以找回更傳統的技術內容體驗。
FROGS 基準測試:生成一隻具有哈布斯堡下巴的青蛙的 SVG
FROGS 基準測試要求 AI 模型使用單一提示創建一隻具有哈布斯堡下巴的青蛙的 SVG,揭示在解剖學正確性、大小以及添加皇家或情感細節方面的差異。
AirLLM 讓單張 4GB GPU 即可進行 70B LLM 推論
AirLLM 透過逐層串流的方式,讓您可以在不進行量化的情況下,於單張 4GB GPU 上執行 700 億參數的 LLM,如 lyogavin/airllm 儲存庫所示。