封存 · 5,056 篇 dispatch

全部 dispatch

AgentLensHQ 封存的全部內容——提煉自整個 AI 生態。

301

AI 與前沿科技摘要 – GPT‑6 Astra、Grok Bot 工作流程與實體 AI 的崛起

OpenAI 的 GPT‑6 Astra 發布、圍繞 Grok Bot 的新代理工作流程,以及不斷加速的實體 AI 資料管線,主導了最新的 AI 話題。

302

OpenAI GPT-6 Astra 在 ARC-AGI-3 基準測試中的表現

OpenAI 的 GPT-6 Astra 使用 Provider Adapter harness 在 ARC-AGI-3 基準測試中取得了 99.9% 的尖端分數,其動作效率在 96% 的關卡中超越了人類。

303

申真諝擊敗卡塔戈,贏得歷史性的兩子讓先系列賽

圍棋大師申真諝成為首位在兩子讓先條件下,擊敗頂尖圍棋引擎卡塔戈的正式人類棋手,展現頂尖棋手仍能在現代AI面前獲勝。

304

Grok 停機與 SpaceXAI 計算基礎設施的影響

SpaceXAI 位於 Memphis 的計算中心停機導致 Grok 及其他幾款前沿 AI 模型出現服務中斷,凸顯了業界對集中式計算基礎設施的依賴。

305

OpenAI GPT-6 Astra 推出與網路安全防護措施

OpenAI 於 2026 年 9 月開始推出 GPT‑6 Astra,最初僅提供給少數合作夥伴,因為該模型達到了 OpenAI 新的「Critical」網路安全門檻。

306

紐約市教育部禁止小學與中學學生使用人工智慧

紐約市教育部將從 2026‑27 學年起,禁止約 60 萬名小學與中學學生使用人工智慧工具,理由是發展上的考量以及保護年幼學習者的需求。

307

Meta Muse Spark 1.3 發佈

Meta 已發佈 Muse Spark 1.3,這是一款針對代理工作流和競爭性編碼性能進行了優化的模型,並根據數據使用情況提供基於訓練的的分層定價模式。

308

Nvidia 收購 Hugging Face

Nvidia 已同意以 129.3 億美元收購 Hugging Face,旨在擴大開源模型平台的規模,同時為開發者維持其開放存取的生態系統。

309

Gemini 3.8 Flash 與 3.8 Flash Cyber 發布說明

Google 推出 Gemini 3.8 Flash 與 3.8 Flash Cyber,於長程軟體工程、資安漏洞偵測及多步驟推理方面有顯著提升,且成本與 3.7 Flash 相同。

310

Perplexity AI Grounding Analysis: Manufactured Sources and AI-Generated Buying Guides

對 Perplexity AI 引用來源的研究顯示,其 83.2% 的軟體推薦是基於低排名或未排名的網域,其中包括一個由三個網站構成的網絡,該網絡專門為 AI 檢索生成了超過 215,000 個機器生成的 "best software" 頁面。

311

Anthropic Claude 故障 Sep 3 2026:多個模型出現高錯誤率

2026 年 9 月 3 日,Anthropic 經歷了 Claude Mythos 5.1、Fable 5.1、Opus 5、Opus 4.8 和 Opus 4.6 的高錯誤率問題,暫時中斷了 Claude.ai、Claude API、Claude Code 和 Claude Cowork 的服務。

312

Mistral AI 資料訓練退出機制政策

Mistral AI 現在對大多數使用者預設進行使用者輸入與輸出資料的訓練,並為非企業使用者提供退出機制,而企業客戶則預設退出。

313

Fable 5.1 世界建模:真實世界地點的自主 3D 重建

PhiloLabs 使用 Claude Fable 5.1 代理群來自主研究、建模並透過 Three.js 與開源數據驗證瀏覽器原生的真實世界地點 3D 重建。

314

FrontierHarness Eval: Benchmarking AI Coding Harnesses

FrontierHarness Eval 顯示,在不同的編碼 harness 下使用相同的模型,可能導致通過率從 50% 到 66.7% 之間變動,且成本差異可達 17 倍。

315

AI × Crypto 總覽:代理支付、去中心化運算與可驗證的 AI 基礎設施

AI 代理現已能在鏈上交易,存取去中心化運算,並使用可驗證身份與零知識證明,建立初具規模的 AI 驅動經濟。

316

AI 與前沿科技週報:GPT‑6 Astra 發布、代理工作流程與機器人發展動能

OpenAI 的 GPT‑6 Astra 發布引發創紀錄的基準測試成績、新代理工作流程與更高的安全擔憂,同時更廣泛的前沿領域也見到開放原始碼推論堆疊、AI 驅動機器人與新興模型生態系的快速進展。

317

ChatGPT 404 中斷:原因、影響與社群洞察

ChatGPT 與多個其他 LLM 服務回傳 404 錯誤,突顯可能的共用基礎設施故障,並在開發者社群中引發廣泛猜測。

318

Quasar 438B 發佈:歐洲得分最高的推理模型

Multiverse Computing 已發佈 Quasar 438B,這是一款專為企業級代理和編碼設計的推理模型,在 Artificial Analysis Intelligence Index 上獲得了歐洲模型中的最高分。

319

Anthropic Claude 自動將費馬大定理形式化

Anthropic 宣布其 Claude 模型在 11 天內完成了第一個完整的電腦檢查式費馬大定理證明,展示了 AI 可以使用 Lean 自主地將深奧的數學進行形式化。

320

Compute Cheap H100/H200 GPU 雲端定價每小時 2.04 美元和 3.00 美元

Compute Cheap 提供 H100 GPU 按需定價每小時 2.038 美元,H200 GPU 每小時 2.995 美元,透過利用閒置容量和輕量級服務模式,使其成為全球最便宜的 GPU 雲端服務。

321

AISLE AI 在 OpenAI 與 Anthropic 發現零個漏洞後,發現六個 curl 的 CVE

AISLE 的自主 AI 系統在 curl 8.22.0 中識別出六個低嚴重性 CVE,這些漏洞被 OpenAI Codex Security 與 Anthropic Mythos 所遺漏。

322

在 M4 Pro Mac Mini 上設置本地 LLM

技術指南:使用配備 48GB RAM 的 M4 Pro Mac Mini、oMLX 與 Tailscale,在多個裝置上提供私密且成本可預測的 AI 服務。

323

Apple 在 OpenAI 商業機密訴訟中提出鑑識 MacBook 證據

Apple 於 2026 年 8 月 31 日提交密封補充簡報,顯示前員工 MacBook 的鑑識資料,證明該員工在 OpenAI 使用 Apple 的電源轉換電路設計,並企圖銷毀證據,促使 Apple 提出加速發掘的動議。

324

Claude Fable 5.1 和 Claude Mythos 5.1 發行說明

Anthropic 推出 Claude Fable 5.1 與 Claude Mythos 5.1,具備快取讀取成本大幅降低、先進的科學研究能力,以及新的企業前沿防護系統以確保資料隱私。

325

Anthropic 發布使用 C2PA 元資料的 Claude 檔案來源檢查工具

Anthropic 新推出的 Claude 檔案檢查工具可讀取影像、影片與音訊檔案中的 C2PA 元資料,以揭示該檔案是否由 Claude 生成或處理,是朝向 AI 生成內容透明化的重要一步。

326

OpenAI ChatGPT 桌面應用程式內建 LibreOffice – 為何這很重要

ChatGPT 桌面應用程式包含完整的 LibreOffice 安裝,揭示了 OpenAI 在本地支援複雜文件格式的策略,其代價是龐大的執行檔體積。

327

Ed Zitron AI 懷疑論者的預測:對準確性與推理的驗證

Ed Zitron 在 2024–2025 年間的 AI 懷疑論預測已全面錯誤,其推理依賴於誤解的數字與情緒化言論,而非穩固的分析。

328

LLM 推論的效率前沿:用於權衡與前沿突破的技術

Baseten 的文章解釋了推論工程師如何透過批次大小、平行處理、量化、核心優化、預測解碼和去耦合等方法,在延遲-吞吐量的權衡曲線上移動,或將整個前沿向外推進。

329

Nori Robotics A3: 一款用於開發的低成本雙臂人形機器人

Nori Robotics 推出了 NORI A3,這是一款售價 1,688 美元的雙臂人形機器人,旨在用於居家任務自動化與開發者實驗,預計於 2026 年秋季出貨。

330

Google DeepMind WeatherNext 3 發佈

Google DeepMind 已發佈 WeatherNext 3,這是一款利用即時衛星數據與每小時更新的全球天氣 AI 模型,可提供高解析度預報,顯著提升了降水預測精準度與局部預測能力。

331

Martin von Zweigbergk 加入 East River Source Control 擔任首席技術官

Jujutsu 版本控制系統的創作者 Martin von Zweigbergk 擔任 East River Source Control 首席技術官,標誌著公司朝向超越 Git 的下一代 VCS 基礎設施邁進。

332

OpenAI Daybreak for Frontline Defenders Initiative

OpenAI 推出了 Daybreak for Frontline Defenders,這是一項價值 10 億美元的全球性倡議,透過提供補貼型的尖端 AI 網路模型與培訓,來保護水務、電力和銀行等基本服務。

333

NeoMME: 高效率的多模態原生與多語言編碼器

Hugging Face 推出了 NeoMME,這是一個包含 260M 和 800M 參數版本的多語言多模態編碼器系列,通過使用單一雙向 Transformer 從頭開始處理文本和圖像,優化了視覺文檔檢索。

334

Dwarf Fortress 創作者 Tarn Adams 表示,AI 與裁員正在摧毀遊戲產業

Dwarf Fortress 的共同創作者 Tarn Adams 在 2026 年 Gamescom 上警告,生成式 AI 的炒作與由裁員驅動的執行長們正將遊戲產業推向崩潰。

335

slotstream: 在 48GB Mac 上執行 104GB Qwen3.8-Flash-Next

slotstream 是一款基於 Swift 的工具,透過將專家模型從 SSD 串流到 RAM,讓 Apple Silicon Mac 使用者能夠執行 104GB 的 Qwen3.8-Flash-Next 模型,在 48GB 硬體上可達每秒 12 個 token 的速度。

336

GPT-6 Astra: Legora 財務報表審查效能

Legora 利用 GPT-6 Astra 在幾分鐘內自動化完成跨越 41 份文件的財務報表對帳,透過 Legora Benchmark for Agentic Reasoning 實現了該特定工作流程近 40% 的效能提升。

337

OpenAI GPT-6 Astra 為 Playco 的 Playbot 提供動力,減少 50% 的手動修復

OpenAI 宣布 Playco 在其 Playbot IDE 中使用 GPT-6 Astra,將遊戲原型製作中的手動修復減少了一半,並實現了快速創建多個可玩的遊戲世界。

338

人工神經網絡的顯現符號結構(arXiv 2608.29530)——關鍵發現與影響

該論文證明,無論是小型神經網絡還是大型語言模型的內部向量表示,都可以被封閉形式的符號結構密切近似,從而實現分析性蒸餾與目標行為修改。

339

Weedout: Safari 擴充功能,用於過濾標記為 AI 的 YouTube 內容

Weedout 是一款 macOS Safari 擴充功能,可從 YouTube 饋送、搜尋結果和 Shorts 中移除標記為「Made with AI」的影片,以減少 AI 生成內容造成的雜亂。

340

GPT-6 Astra 發布說明 / 新功能介紹

OpenAI 發布了 GPT-6 Astra,這款模型具備領先業界的電腦使用能力、先進的科學推理能力,以及在對齊與資安能力上的顯著提升。

341

OpenAI Astra 關鍵網路安全能力與前沿防護措施

OpenAI 宣布其 Astra 模型已達關鍵網路安全能力門檻,並詳細說明了其安全釋出所需的強化防護措施。

342

mdlARC: 以高樣本效率在 ARC-AGI-1 達到 44%

A small transformer model 在測試時從頭開始訓練,僅以 67 美分的計算成本在 ARC-AGI-1 基準測試中達到 44%,證明了在不需要大規模 LLM 或合成數據的情況下,也能實現抽象推理任務的高性能。

343

GPU世界:探索無處不在的前沿AI未來

GPU世界是一個故事競賽,挑戰參與者想像2040年的情境:每個人皆可獲得B300 GPU的運算能力與前沿LLM,但AI智慧已陷入停滯。

344

E-Commerce Bench evaluates LLM agents on long‑horizon e‑commerce operations

Qwen 發布了 E‑Commerce Bench,這是一個確定性、多維度的驗證基準,用於衡量 LLM agent 在模擬的線上商店經營一年中的表現,揭示了在利潤、談判、詐騙規避、效率與學習能力方面的巨大差距。

345

AI × Crypto 總覽:代理支付、去中心化運算、代幣化代理與可驗證人工智慧

AI 代理正獲得鏈上支付連結、去中心化運算層、代幣化身分與零知識驗證,為機器驅動經濟奠定基礎。

346

AI 與前沿科技週報 – Muse Spark 1.3、Gemini 3.8 Flash、Qwen 3.8 與機器人技術進展

Meta 的 Muse Spark 1.3、Google 的 Gemini 3.8 Flash、Qwen 3.8 更新,以及新機器人 AI 示範,主導了最新的 AI 前沿新聞。

347

Atlas: 空間智能的世界模型

World Labs 推出了 Atlas,這是一款專為高保真 3D 重建、相機控制影片生成以及機器人模擬而設計的多模態自回歸擴散 Transformer。

348

Qwen-Drive-1.0 發佈說明 / 更新內容

Qwen-Drive-1.0 是一款用於自動駕駛的視覺語言基礎模型,它在不改變核心 VLM 架構的情況下,統一了 3D 感知、視覺問答與運動規劃。

349

使用 TRL 和 OpenEnv 訓練程式碼模型繪製水彩畫

Hugging Face 展示了如何使用 TRL 和 OpenEnv 透過 JavaScript 產生水彩畫,利用強化學習 (RL) 來優化美學偏好。

350

funes:用於程式碼代理的持久記憶層

Hugging Face 宣布 funes,一個單一二進位、本地執行的記憶層,可索引程式碼代理的會話追蹤,並讓代理在不同執行、機器與模型之間回憶原始證據。