Stanford CS329A 關於代理評估與長時程任務的講座
這場講座解釋了 METR 如何衡量 AI 代理的時程能力(大約每七個月翻倍一次),GDPVal 如何針對經濟價值任務將模型性能與行業專業人士進行比較評分,以及 DeepScholar‑Bench 如何評估文獻回顧綜述,並強調了重複出現的失敗模式,例如規劃能力不足、工具使用錯誤、過早放棄以及重複動作循環。
agent-vault: 一個防止 AI agent 透過 prompt injection 洩漏秘密的憑證代理與 HTTP proxy
一個開源的憑證 proxy 與 vault,透過安全的 MITM proxy 代理 API 存取,防止 AI agent 洩漏秘密。
3D 列齒輪減速器:設計與實現
一位 15 歲的建造者開發了一款具有 1:9 減速比的 3D 列齒輪減速器,並使用自定義 Python 腳本在 Fusion 360 中進行參數化生成。
Google 新聞搜尋退化與向 AI 轉移
記者 Mike Elgan 與其他使用者報告稱,Google 新聞的日期、語言與地點過濾器日益失效,顯示 Google 正在策略性地向 AI 轉移,削弱傳統搜尋的實用性。
pipeshub-ai: PipesHub – 開源企業 AI 內容層
PipesHub 是一個開源、可自行托管的 AI 內容層,讓企業能連接他們的資料、強制執行權限、獲得帶引用的答案,並在不將資料移出 VPC 的情況下建構代理或搜尋應用。它結合了圖形和向量檢索,提供 50+ 個連接器、多模態理解、無代碼代理建構器,並透過 API/SDK 暴露以進行擴充。部署基於 Docker-Compose,附有互動式安裝程式。
oracle: 一個將專案檔案打包成 AI 提示詞以進行實證模型審查的 CLI 與 MCP 伺服器
一個將專案檔案與提示詞打包成 AI 模型上下文的 CLI 與 MCP 伺服器,同時支援 API 與基於供應商的瀏覽器自動化。
dbhub: DBHub – AI 客戶端存取資料庫的極簡 MCP 伺服器
DBHub 是一個輕量級的 MCP 伺服器,讓 AI 輔助工具能以極低的 Token 開銷,安全地查詢與探索多個關聯式資料庫。
openai-agents-js: OpenAI Agents SDK – 一個用於在 JS/TS 中建立多代理 LLM 工作流的供應商無關框架。
OpenAI Agents SDK (JavaScript/TypeScript) 讓開發者能夠建立文字、沙盒與即時代理,這些代理可以呼叫 LLM、使用工具、執行護欄、移交工作並追蹤執行過程。它可在 Node.js、Deno、Bun 以及實驗性的 Cloudflare Workers 中執行。
axonhub: AxonHub – AI gateway for zero‑code model switching
AxonHub 是一個可自託管的 AI gateway,讓開發者無需更改應用程式程式碼即可在 LLM 提供者與模型之間進行切換,提供統一的 SDK 相容性、觀測性、存取控制、負載平衡與成本追蹤。
semble: 為 AI 編碼代理提供快速且節省 Token 的程式碼搜尋
Semble 是一個僅限 CPU 執行的 Python 函式庫/CLI/MCP 伺服器,能在約 500 毫秒內建立程式碼庫索引,並在約 1 毫秒內回答自然語言程式碼查詢,提供與 Transformer 模型相當的相關性,同時比「先 grep 再讀取」的方法節省約 99% 的 Token。它支援 Claude Code, Codex, 和 Cursor 等代理,支援本地或遠端儲存庫,遵循 .gitignore/.sembleignore,並提供簡單的安裝程式、CLI 與 Python API。
worktrunk: 一個簡化 AI agent 並行開發的 git worktree 管理器
一個用於 git worktree 管理的 CLI,旨在通過讓 worktree 的使用變得像分支一樣簡單,來促進多個 AI agent 的並行運行。
agentmemory: 適用於任何程式碼 LLM agent 的持久化、高 token 效率記憶體
agentmemory 是一個自託管、基於 SQLite 的 AI 程式碼助手記憶引擎。它透過 hooks 自動擷取 agent 的行為,並以混合 BM25/向量/圖形搜尋方式儲存,並為任何符合 MCP 或 REST 的 agent (Claude Code, Copilot CLI, Gemini CLI, 等) 提供知識。基準測試顯示 ~95% recall @5 且 token 節省量超過 10 倍,同時提供即時檢視器供您檢查記憶。使用 `npm i -g @agentmemory/agentmemory` 安裝,啟動伺服器,並使用 `agentmemory connect <agent>` 連接您的 agent。
J. Kenji López-Alt 的 30 分鐘壓力鍋雞肉河粉 (Pho Ga) 食譜
J. Kenji López-Alt 展示了如何使用壓力鍋在不到 30 分鐘內製作出濃郁且清澈的越南雞肉河粉 (Pho Ga),省去了數小時慢燉的需求。
agent-governance-toolkit: 為自主 AI Agent 提供確定性的策略執行與治理層
一個為自主 AI Agent 設計的治理框架,提供確定性的策略執行、身分管理與稽核日誌,以防止未經授權的動作。
agent-framework: Microsoft Agent Framework – 一個用於構建與運行生產級 AI agent 與工作流的跨平台框架。
Microsoft Agent Framework 是一個開源、多語言 (Python/.NET) 工具包,用於創建生產就緒的 AI agent 與多 agent 工作流,提供與提供商無關的編排、middleware、可觀測性、聲明式 YAML 定義、基於技能的知識以及如 Microsoft Foundry 等的託管選項。
hindsight: 一個能從經驗與世界事實中學習的代理人仿生長期記憶系統
一種代理人記憶系統,透過仿生數據結構讓 AI 代理人能夠從經驗與世界事實中學習,超越了簡單的對話歷史。
graphiti: 一個為 AI agent 設計的時序上下文圖形引擎,可追蹤事實如何隨時間變化
一個用於構建時序上下文圖形的框架,可讓 AI agent 追蹤演進中的事實並從原始數據流中維護歷史來源。
iPolloWork:一個透過代理程式建立可編輯程式碼、文件與多媒體內容的本地優先視覺化 AI 工作台
一個本地優先的視覺化 AI 工作台,讓代理程式能在單一工作空間內建立並維護可編輯的程式碼、文件、簡報與影片。
voice-pro: 專為 YouTube 處理、聲音複製與多語言翻譯打造的一站式 AI 配音工作室
一款 AI 驅動的網頁應用程式,用於語音辨識、翻譯與多語言配音,將 ASR、TTS 與聲音複製整合進單一工作流程中。
二十年 RISC OS Open:里程碑與社群影響
二十年來,自 2006 年成立以來,RISC OS Open 已將一套專有作業系統轉變為由社群驅動的開放原始碼項目,擁有現代硬體支援以及持續的 Moonshots 計畫。
Seedance 2.5 發佈說明:長篇敘事與多模態參考
ByteDance 推出了 Seedance 2.5,這款影片創作模型將單次生成長度增加至 30 秒,並引入了進階的多模態參考功能,以實現專業級的創意控制。
NetBSD 11.0 發行說明
NetBSD 11.0 引入了 RISC-V 移植版、適用於 x86 的高速 MICROVM 核心,並擴展了對舊硬體的支援,同時保持對公開安全問題的透明處理方式。
opencodex: 一個通用的供應商代理,讓您可以在 Codex、Claude Code 和 Grok Build 中執行任何 LLM
一個本地代理,透過轉換 API 回應,讓您可以在 OpenAI Codex、Claude Code、Claude Desktop 和 Grok Build 中使用任何 LLM 供應商。
mesh-llm: 一個跨機器整合 GPU 與記憶體資源以執行大型模型的分散式推論系統
一個分散式 LLM 推論系統,透過 OpenAI 相容的 API,跨多台機器整合 GPU 與記憶體以執行大型模型。
omnigent: 一個用於跨裝置編排與管理多個 AI agent 的開源 meta-harness
一個為 AI agent 提供通用編排層的開源 meta-harness,允許使用者切換 runtime、執行策略並在跨裝置間進行即時協作。
EverOS: 一個為代理程式設計、以 Markdown 作為權威事實來源的本地優先記憶執行環境
一個為 AI 代理程式設計、以 Markdown 作為事實來源的本地優先記憶執行環境,旨在跨應用程式和裝置提供可移植、持久的長期記憶。
semantic-router: 跨異質 LLM 基礎設施構建 Mixture-of-Models 系統的可程式化路由層
一個用於 Mixture-of-Models 系統的可程式化路由層,可優化跨異質運算和基礎設施的 LLM 請求路由,以提升品質、成本和延遲。
openmed: 一個用於 PII 去識別化與醫療實體提取的本地優先臨床文本管線
一個用於臨床實體提取與 PII 去識別化的本地優先醫療保健 AI 執行環境,可跨 Python、Swift、Android 和瀏覽器在裝置端運行。
加拿大簽署聯合國網絡犯罪公約:對監控與數位權利的影響
加拿大已簽署《聯合國打擊網絡犯罪公約》,批評者認為該公約透過為廣泛的犯罪類型提供跨境電子證據共享,使其功能如同全球監控協議。
wigolo: wigolo: 本地優先網路智慧,適用於 AI 代理
wigolo 是一種適用於 AI 代理的本地優先網路智慧工具包,提供搜尋、抓取、爬取、提取、快取、尋找相似、研究和代理工具,核心功能無需 API 金鑰。它可作為 MCP 伺服器、REST 端點或 SDK 運行,所有數據私密地存放在 `~/.wigolo/`,並提供可選的 LLM 基礎合成用於進階任務。 ## 主要功能 - 十種整合網路工具(搜尋、抓取、爬取、提取、快取、find_similar、研究、代理、diff、watch) - 作為 MCP 伺服器(供編碼代理使用)、REST 端點或可嵌入的 SDK(TypeScript/Python)運行 - 本地優先設計:數據停留在 `~/.wigolo/`;除非明確選擇啟用 LLM 合成,否則不會進行第三方呼叫 - 核心工具零 API 金鑰需求;使用公共搜尋引擎和設備端 ML 模型 - 每個結果返回逐字摘錄,附帶位元組偏移來源範圍和每個結果的可解釋評分 - 初始設定後每次查詢零成本(結果會在本地快取,實現即時重新查詢) - 與主要 AI 代理框架整合:LangChain、CrewAI、LlamaIndex、Vercel AI SDK - 支援直接連接至熱門代理:Claude Code、Cursor、Codex、Gemini CLI、OpenCode、VS Code、Windsurf、Zed、Antigravity ## 運作方式 wigolo 作為單一 Node.js 進程運行,公開三種介面:MCP(透過 stdio 的 JSON-RPC,用於代理通訊)、REST API 和 SDK。搜尋工具使用 18 個直接適配器,進行排名融合和設備端 ML 重新排名。抓取工具採用分層路由器,根據可觀測信號(SPA 標記、反機器人挑戰)從純 HTTP 升級至無頭瀏覽器。結果存放在結合關鍵字和向量索引的本地快取中。可選的 LLM 合成(適用於研究/代理工具)可透過環境變數設定(例如 `WIGOLO_LLM_PROVIDER=gemini`)。所有重量級組件(瀏覽器引擎、嵌入模型)會懶加載並儲存在本地 `~/.wigolo/` 下。 ## 限制 - 某些受驗證保護的站點依賴 IP 聲譽;資料中心 IP 可能失敗,而家庭網路則成功(參見自託管指南以了解代理選擇加入) - 沒有 LLM API 金鑰時,`research` 和 `agent` 工具僅返回原始證據簡報,而非合成答案 - 初始設定需要約 1.5 GB 的可用磁碟空間,並下載瀏覽器引擎與設備端模型 - 需要 Node.js >= 20 ## 生態系統 - CLI:`npx wigolo <tool>` 用於終端使用 - 互動式殼層:`wigolo shell` 用於 NDJSON 管道 - REST API:`wigolo serve` 公開 JSON 端點 - Docker:官方映像於 GitHub Container Registry 和 Docker Hub - 框架整合:官方套件適用於 LangChain、CrewAI、LlamaIndex 和 Vercel AI SDK - 代理技能:11 種技能目錄透過 `wigolo skills` 管理 ## 授權 AGPL-3.0 ## 狀態 公開測試 ## 連結 - 文件:[docs/README.md](docs/README.md) - 範例:[examples/README.md](examples/README.md) - 安裝:[docs/installation.md](docs/installation.md) - 設定:[docs/configuration.md](docs/configuration.md) - 工具參考:[docs/tools.md](docs/tools.md) - SDK:[docs/sdks.md](docs/sdks.md) - 自託管:[docs/self-hosting.md](docs/self-hosting.md) - 技能:[docs/skills.md](docs/skills.md) - 貢獻:[CONTRIBUTING.md](CONTRIBUTING.md)
markstream-vue: Markstream — 用於 AI 聊天的串流 Markdown 渲染器
一個 Vue 3 / Nuxt / VitePress 套件,可在 Markdown 被串流(例如來自 LLM 令牌流)時逐步渲染,以減少閃爍並在 AI 聊天介面中提供流暢體驗。
note-gen: 一款使用 AI 將零散資訊片段整理成結構化筆記的本地優先 Markdown 應用程式
一款使用 AI 將零散的資訊片段(如語音錄音和螢幕截圖)整理成結構化筆記的本地優先 Markdown 應用程式。
ms-swift: ms‑swift: 用於微調 LLM 與多模態模型的可擴展輕量級基礎設施
ms‑swift 是一個輕量級、全棧式框架,用於微調、服務與評估數百種 LLM 與多模態模型,提供 LoRA 式的高效訓練、進階並行技術、量化、RLHF 以及基於 Gradio 的 UI。
banana-slides: 一款從自然語言提示與文件生成可編輯投影片與旁白影片的 AI 原生簡報生成器
一款 AI 原生簡報應用程式,透過自然語言編輯與 nano banana pro 模型,從想法、文件或圖片生成可編輯且專業的投影片。
airllm: 一種記憶體高效的推理引擎,透過一次載入一層來在消費級 GPU 上運行巨大的 LLM
AirLLM 是一個函式庫,能透過一次只將單一模型層載入 VRAM,在低端 GPU 上運行巨大的 LLM(多達 671B 參數)。
DeepSeek-Reasonix: DeepSeek‑Reasonix:一個以配置驅動、插件為基礎的終端機 AI 編碼代理。
DeepSeek-Reasonix 是一個終端機 AI 編碼代理,透過配置與外掛驅動的架構使用 DeepSeek 模型,以單一靜態 Go 二進位檔案發布,並針對 DeepSeek 的前置快取進行優化,以維持低 token 成本。
WrenAI:一個開源的生成式 BI 引擎,讓 AI Agent 可以從任何資料庫部署受控的儀表板
一個開源的生成式 BI 引擎,為 AI Agent 提供上下文層,使其能從任何資料庫生成受控的 SQL、建立圖表並部署可分享的儀表板。
screenpipe: 一個透過擷取螢幕與音訊來驅動可搜尋歷史紀錄與 AI agent 的本地優先 AI 記憶系統
一款本地優先的 AI 記憶工具,透過擷取螢幕與音訊活動來建立可搜尋的歷史紀錄,並為 AI agent 提供上下文。
openai-agents-python: 一個支援語音與沙盒執行的提供者無關型多代理工作流構建框架
一個輕量級、提供者無關型的框架,用於構建多代理工作流,支援各種 LLM 的文字、語音與沙盒執行。
LightRAG:一個結合向量與圖形檢索以實現高效大規模索引的輕量級圖形 RAG 框架
一個輕量級、基於圖形的 RAG 框架,結合了知識圖譜與向量嵌入,以提供深度的上下文理解與高效的增量更新。
vox-director: 從單一主題建立社論風格紙貼畫風格解說影片的自動化流程
一種代理技能,可自動化製作 Vox 風格的紙貼畫風格解說影片,處理從腳本、關鍵影格到動畫與音訊的所有流程。
caveman: Caveman – token‑saving plug‑in for AI coding agents
Caveman 是一款插件,能讓 AI 編碼代理以簡練的原始人風格語言進行交談,在保留所有技術內容的同時,將散文內容的輸出 token 減少高達 65%。
browser-use: 一個讓 LLM 能夠控制網頁瀏覽器以執行自動化網頁任務的 AI agent 框架
一個讓 AI agent 能夠透過自然語言指令控制網頁瀏覽器,以執行填寫表單、提取數據和 QA 測試等任務的 library 和框架。
sglang: 一個具備 RadixAttention 與廣泛硬體支援的高性能 LLM 與多模態模型推理框架
SGLang 是一個針對 LLM 與多模態模型的高性能推理服務框架,透過先進的快取與排程技術,在各種硬體上優化推理吞吐量與延遲。
CodeWhale: 一款支援 BYOK 與細粒度權限控制的模型無關型終端機編碼代理程式
一款開源、模型無關型的終端機編碼代理程式,可以使用任何 LLM 提供商來讀取程式碼、編輯檔案並執行命令。
mempalace: 一個具備逐字儲存與可插拔向量後端的本地優先 AI 記憶系統
一個本地優先的 AI 記憶系統,將對話歷史儲存為逐字文本,並使用語義搜尋進行高精確度檢索,而不使用摘要。
mnemosyne: Mnemosyne: 本地優先 AI 記憶層
Mnemosyne 是一個本地優先、以 SQLite 為後端的 AI 代理記憶層,提供工作記憶、情節記憶以及時間知識圖譜(TripleStore),無需外部服務或雲端依賴。
Mu – 代理工具:統一的 MCP 啟用工具包,適用於 AI 代理
Mu 提供單一 MCP 端點,讓 AI 代理能夠使用真實世界的工具——網頁搜尋、郵件、儲存、行事曆等等——通過自行運行服務,而非僅僅包裝第三方 API。
ECC:AI 程式碼助理的代理平台作業系統
ECC 提供一個代理平台作業系統,為 AI 程式碼代理配備協調的工程系統——代理、技能、指令、掛鉤、記憶體與安全掃描,從而規劃、測試、實作、審查、驗證、記憶與改進程式碼。
inkos: 一個具備多維度連續性審計與開放世界互動式小說能力的專業故事創作代理系統
一個用於長篇故事創作與互動式小說的 AI Agent 系統,透過多代理審計管線與結構化長期記憶來確保敘事的一致性。