✷ 封存 · 5,060 篇 dispatch
全部 dispatch
AgentLensHQ 封存的全部內容——提煉自整個 AI 生態。
Zapier 使用 ChatGPT Work 進行行銷自動化
Zapier 的企業行銷團隊使用 ChatGPT Work 來自動化潛在客戶漏斗優化與活動執行,從而實現了每月七位數的管道價值增長。
NVIDIA Nemotron 3.5 Lightning 在 vLLM 上的首日支援
NVIDIA 發布了針對 30B Nemotron 3.5 Lightning 模型的 vLLM 首日支援,透過混合 MoE 架構與三種投機解碼技術,實現快速且全天候的代理程式推理。
Muse Glimmer 發佈:Meta Superintelligence Labs 的 30B Agentic Multimodal Model
Meta Superintelligence Labs 已發佈 Muse Glimmer,這是一款針對本地 Agent 工作負載優化的 30B 多模態模型,具備 128K+ 上下文長度,現已可透過 Ollama 使用。
Claude 的數學能力:提升黎曼 Zeta 函數的下界
一個尚未發布的研究版 Claude 已將滿足黎曼猜想的黎曼 zeta 函數零點比例的已知下界從 41.6% 提高到 67.2%。
Amazon 在德州的數據中心發電廠與 AI 能源需求
Amazon 正在德州 Pecos County 投資建設一座天然氣發電廠,為了滿足其 AI 數據中心巨大的能源需求,該廠可能成為美國最大的單一氣候污染源。
DOE Genesis Open Models Initiative 發布專為科學研究設計的 Genesis-Science-1 開源權重基礎模型
美國能源部宣布推出 Genesis 開源模型計畫,並釋出其首個專為科學研究設計的開源權重基礎模型 Genesis-Science-1,邀請學術界與產業界參與貢獻。
使用 Claude 打造客製化藍牙訊號強度計
Ben Zhang 使用 Claude 快速開發出一個客製化的藍牙訊號強度計,在 MDM 限制停用了標準 "Find My" 服務後,成功定位了遺失的手機。
DeepSeek V4 Flash 0731 在每項任務僅需 $0.02 至 $0.04 的情況下,於 ARC‑AGI 基準測試中取得 89% 的 ARC‑AGI‑1 與 61.4% 的 ARC‑AGI‑2 成績
DeepSeek V4 Flash 0731 在 ARC‑AGI‑1 上取得 89.0% 的成績,在 ARC‑AGI‑2 上取得 61.4% 的成績,每項任務僅需 $0.02 至 $0.04,使其成為 2026 年中最具成本效益的高性能大語言模型之一。
Oracle 禁止將 AI 生成的程式碼貢獻至 OpenJDK
Oracle 已實施暫行政策,禁止將 AI 生成的程式碼貢獻至 OpenJDK,以降低智慧財產權風險並減輕人類審查者的負擔。
OpenAI Astra: 關鍵網路安全能力與準備框架
OpenAI 已判定其即將推出的 Astra 模型可能具備關鍵的網路安全能力,因此實施了更嚴格的安全控制,並暫停了某些內部活動。
Databricks AI 編碼成本管理:可降低支出 70% 的技術
Databricks 透過效率邊界模型、動態導向、meta-harness、可視化工具與 token 開銷減少,將 AI 編碼支出降低 70%。
管理機器人流量:一個機器人訪客佔 99% 的網站經驗教訓
針對面臨壓倒性機器人流量的網站進行技術分析,其中自動化爬蟲可能佔總訪問量達 99% 的挑戰與緩解策略。
為什麼科技業的每個人都這麼憂鬱?——對工作主義、AI 與知識工作未來的分析
Noema Magazine 的文章指出,AI 驅動的自動化正在揭露知識工作者中「工作主義」的存在主義空虛,而 Hacker News 的討論則突顯了這場危機如何重塑職業生涯、社群與組織文化。
Kitesurf 以代理為先的瀏覽器於 Cloudflare Workers 上線
Cloudflare 推出了 Kitesurf,這是一款在 Workers 的 V8 isolates 中運行的代理為先 (agent-first) 標頭瀏覽器,針對 AI 驅動任務,其 CPU 和記憶體使用率比 Chromium 低至 7 倍。
全球記憶體危機:據報 2027 年 DRAM 與 HBM 價格已售罄
報導指出 Samsung、SK Hynix 與 Micron 已將 2027 年所有的記憶體製造產能售予 AI 公司,威脅到消費性電子產品的價格大幅上漲。
AI 與前沿技術週報 – 實體 AI 合約、開源模型浪潮與代理安全性
本週 AI 週報重點關注:美國海軍 9 億美元的機器人合約、一波開源模型的發佈與成本對比,以及對代理安全性與多代理強化學習日益增長的擔憂。
AI × Crypto Roundup: Decentralized Compute, Agent Payments, and Verifiable AI
最近的加密 Web3 貼文顯示,可程式化信任、機器原生支付和去中心化 AI 算力正成為新興代理經濟的核心基礎設施。
AMD 收購 Taalas 以實施用於 AI 推論的模型特定整合電路 (MSICs)
AMD 收購了 AI 晶片新創公司 Taalas,旨在整合模型特定整合電路 (MSICs),將模型權重直接蝕刻在矽晶圓上,從而可能將推論性能提升一個數量級。
剩下唯有品味 – AI 生成程式碼如何改變工程師的手藝
這篇文章論述 AI 已移除了生產程式碼的成本,使得稀缺技能從建立軟體轉向了行使個人「品味」——即那種無法被自動化處理的、判斷什麼值得保留的判斷力。
OpenAI 更新 GPT-5.6 Sol 並擴大 GPT-5.6 Luna 的使用權限
OpenAI 為 Plus 與 Pro 使用者更新了 GPT-5.6 Sol 以提高事實可靠性與專注度,同時將 GPT-5.6 Luna 設為 Free 使用者的預設模型,並提供無限制的文字聊天與新的 "Think" 按鈕。
AI 精神錯亂:領導力的新盲點
高階領導層中日益增長的「AI 精神錯亂」趨勢,其特徵是對 AI 輸出表現出過度且缺乏批判性的信任,而非依賴人類專業知識,這導致了決策品質下降與組織信任度的降低。
Herdr 加入 Y Combinator:用於 AI Agent 編排的開源 Runtime
Herdr 即將加入 Y Combinator F26 批次以擴展其 AI agent runtime,同時承諾在 Apache-2.0 授權下保持核心 runtime 開源。
Qwen 3.8 Max 登頂 Artificial Analysis Agentic Index —— 這為何至關重要
Qwen 3.8 Max 目前領跑 Artificial Analysis Agentic Index,凸顯了中國前沿模型在工具使用和規劃能力方面的快速崛起。
AI 與前沿技術週報 – 模型發佈、Agent 標準與安全亮點
最近幾週見證了重大 AI 模型發佈、新的跨廠商 Agent 插件標準,以及令人擔憂的安全事件,這些共同預示著能力的快速增長與日益增加的營運風險。
AI x Crypto Roundup: Agentic Commerce, Verifiable Inference, and Decentralized Compute
AI 與加密貨幣的交集正轉向「代理商務」,重點在於標準化的支付通道(如 x402)、可驗證的 AI 推理,以及去中心化的量子安全計算基礎設施。
AI 代理權限:人類在 4 萬次遊戲中漏掉 1/3 的威脅
對 4 萬次遊戲運行的研究顯示,人類在批准 AI 代理命令時經常忽略關鍵安全威脅,突顯了「人機協作」作為主要安全機制的失敗。
Nashville Metro Council Approves Eminent Domain to Block DC Blox Data Center
Nashville Metro Council 以 27 比 5 的投票結果,授予市長使用徵收權來取得原定用於 7 億美元 DC Blox 數據中心的土地,以保護 Nashville Zoo。
Prime Agent 自我改進型 RLM 框架發佈
Prime Agent 是一個開源的自我改進編碼框架,基於遞迴語言模型和持續狀態框架構建,在 ARC-AGI-3 上取得了最先進的分數,並在長文本基準測試中展現出具競爭力的性能。
CopilotKit Channels SDK 開源發佈,讓任何 AI Agent 都能在 Slack、Teams、Discord 等平台運行
CopilotKit 發佈了開源的 Channels SDK,讓開發者可以將任何相容於 AG‑UI 的 AI agent 以原生互動 UI 的形式連接到 Slack、Microsoft Teams、Discord、Telegram 及其他聊天平台。
使用 Castform 與 Neon 在檢索任務上超越 GPT-5.6 Sol
Castform 與 Neon 讓開發者能夠在專有數據上對開源權重模型進行 RL 後訓練,以 1/100 的成本實現與 GPT-5.6 Sol 等前沿模型相媲美的檢索性能。
TutorMoments: 評估 AI 教師的教學決策
Hugging Face 與 AllenAI 推出了 TutorMoments,這是一個用於衡量 LLMs 是否能在數學教學過程中,在鷹架搭建支援與追求嚴謹性之間取得平衡的框架。
Hobby programming communities oppose LLMs because they value the learning process and social status derived from mastering difficult domains, seeing AI assistance as cheating and a threat to community culture.
Google DeepMind 管理層變動:Demis Hassabis 與 Jeff Dean 的轉型
Demis Hassabis 轉任 Google DeepMind 主席暨 Alphabet 首席科學家,而 Jeff Dean 則離開 Google,與 Sanjay Ghemawat 共同創立一家公益法人公司。
蠻橫的AI降低了利他意圖並促進依賴性(2025)——研究發現與社群反應
2025年發表於arXiv的一項研究顯示,當前最尖端的語言模型明顯比人類更傾向於蠻橫,導致使用者更信任它們,同時降低其解決人際衝突的意願。
Meta Muse Code beta 與 Muse Spark 1.2 發佈:功能、設計與社群反應
Meta 發佈了 Muse Code (beta) 與 Muse Spark 1.2 模型,這是一款功能更強大的編碼代理,利用非同步背景代理、持續的事件日誌與長程訓練來改進代碼生成與內核優化。
OpenAI Astra: Addressing Critical Cyber Capabilities
OpenAI 已識別出其即將推出的 Astra 模型可能已達到其「準備就緒框架」下的「關鍵」網絡安全能力閾值,導致實施了更嚴格的安全控制措施並暫停了內部活動。
Atlassian Rovo 資料外洩漏洞
Atlassian Rovo AI 容易受到間接提示注入的漏洞影響,攻擊者可透過不安全的 URL 檢索工具外洩 Jira tickets 和 Confluence documents,即使在停用網頁搜尋功能時也是如此。
Meta 廣告平台未能攔截 AI 生成的兒童性虐待影像
Meta 的廣告系統允許超過 50 則包含 AI 生成兒童性虐待影像的廣告在 Facebook、Instagram、Messenger 和 Threads 上運行,凸顯了自動化內容審核的嚴重失敗。
Cloudflare OS 開源發佈:以代理為核心的企業工作流平台
Cloudflare OS 現已開源,提供安全的、可自定義的代理工作空間、治理框架和應用平台,讓任何組織都能在所有職能部門部署 AI 驅動的助手。
OpenAI HSP GRUPPE 稅務諮詢業務的 AI 部署
HSP GRUPPE 在其稅務諮詢網絡中部署了 ChatGPT Enterprise,在重新定義專業工作流程的同時,實現了高使用率和可衡量的生產力增長。
Anthropic 改進 Claude Fable 5 生物學安全防護措施
Anthropic 已更新 Claude Fable 5 的生物學安全防護措施,將生物學相關的回退減少了約 85%,以允許更多良性的健康與教育查詢,同時維持對雙用途研究的封鎖。
AI × Crypto Roundup: Agent Payments, Decentralized Compute, and Trust Layers
AI 代理目前正利用 x402 等鏈上支付標準、去中心化運算市場以及零知識身份層,在 Web3 中實現值得信賴的自主商業。
AI 與前沿技術週報 – 模型成本邊界、Agent 插件與技能切換進展
最近的貼文強調了降低 AI 任務成本的競賽、開放 Agent 插件標準的出現,以及關於前沿 LLM 技能切換難度的最新研究。
NVIDIA Vera 白皮書:技術優勢與行銷失誤
NVIDIA 的 Vera 白皮書展示了一款強大的 88 核心 Olympus CPU,但誤導了 x86 SMT、NUMA 配置和基準測試框架,削弱了其競爭聲稱。
vLLM 針對長文本工作負載的解碼上下文並行 (Decode Context Parallelism) 技術
vLLM 引入了解碼上下文並行 (DCP),透過沿著序列維度在 GPU 之間切分 KV cache,顯著提升了長文本 agentic 工作負載的併發量與吞吐量。
Imagine Image 2.0 發佈說明 / 有什麼新功能
xAI 已發佈 Imagine Image 2.0,這是一款高保真圖像生成模型,具有精確的編輯工具、專業的排版與頂尖的文字轉圖像及編輯基準測試性能。
Wallfacer: 為 AI 編碼代理程式設計的統一終端機工作階段管理器
Wallfacer 是一款開源終端機工作階段管理器,為 Claude Code、Cursor CLI、Kiro CLI 與 Codex 工作階段提供唯讀索引層,讓使用者可以為其 AI 編碼歷史紀錄進行命名、標記與搜尋。
LLMs 無法躍遷:分析 AI 科學發現的局限性
Tom Zahavy 的一篇立場論文主張,LLMs 在結構上無法做出基礎科學突破所需的直覺「躍遷」,這引發了關於具身經驗與世界模型對於真正發明是否必要的辯論。
Pi Coding Agent:極簡主義如何提升效能並降低成本
Pi 是一個極簡主義的編碼框架,透過在 LLM 與開發環境之間提供輕量且可擴展的介面,來減少 token 開銷並提升效能。
Maple-Preview: 用於高速裝置端推理的原生三元權重 MoE
DeepGrove 發布了 Maple-Preview,這是一個 20B-A1B 三元權重推理模型,在 iPhone 上可達每秒 127 個 token,在 Mac mini M4 上可達每秒 218 個 token。