151

スタンフォード CS329A 自己改善型 AI エージェント 今後の研究分野 講義サマリー

スタンフォード CS329A 講義では、自己改善型 AI エージェントの今後の研究方向性について、推論チェーンの多様性、検証のボトルネック、自己生成タスクカリキュラム、およびワットあたりの知能の効率向上が示されており、ローカルモデルが現在ほとんどのチャットボットクエリを処理できることを示しています。

152

Stanford CS329A 講義:エージェンティックな評価と長期ホライゾン・タスク

この講義では、METR が AI エージェントのタイムホライゾン能力(約 7 か月ごとに倍増)をどのように測定するか、GDPVal が経済的に価値のあるタスクにおいてモデルのパフォーマンスを業界の専門家と比較してどのようにスコア化するか、そして DeepScholar‑Bench が文献レビューの合成をどのように評価するかを説明し、不適切な計画、誤ったツール使用、早期の放棄、および反復的なループといった、繰り返し発生する失敗モードを明らかにしています。

153

agent-vault: プロンプトインジェクションを介したAIエージェントによる機密情報の漏洩を防ぐ、クレデンシャルブローカーおよびHTTPプロキシ

セキュアなMITMプロキシを通じてAPIアクセスを仲介することで、AIエージェントによる機密情報の漏洩を防ぐ、オープンソースのクレデンシャルプロキシおよびVault。

154

3D Printed Cycloidal Gearbox: Design and Implementation

15歳のビルダーが、1:9の減速比を持つ3Dプリントされたサイクロイド減速機を開発しました。Fusion 360 でのパラメータ生成のために、カスタム Python スクリプトを使用しています。

155

Googleニュース検索の劣化とAIへのシフト

ジャーナリストのMike Elganや他のユーザーは、Googleニュース検索の日時、言語、地域フィルターが次第に機能しなくなっていると報告しており、これは従来の検索機能よりもAIへ戦略的にシフトしていることを示唆しています。

156

pipeshub-ai: PipesHub – オープンソースのエンタープライズAIコンテキストレイヤー

PipesHubは、エンタープライズがデータを移動させることなくVPC内でデータを接続し、権限を適用し、引用付きの回答を得て、エージェントや検索アプリを構築できる、オープンソースでセルフホスト可能なAIコンテキストレイヤーです。グラフとベクトル検索を組み合わせ、50以上のコネクタ、マルチモーダル理解、ノーコード・エージェントビルダー、および拡張のためのAPI/SDKを提供します。デプロイメントはDocker-Composeベースで、インタラクティブなインストーラーを備えています。

157

oracle: プロジェクトファイルをAIプロンプトにまとめて、根拠に基づいたモデルレビューを行うCLIおよびMCPサーバー

プロジェクトファイルをプロンプトとまとめてAIモデルのコンテキストとし、APIとプロバイダーベースのブラウザ自動化の両方をサポートするCLIおよびMCPサーバー。

158

dbhub: DBHub – AIクライアントによるデータベースアクセスのための最小限のMCPサーバー

DBHubは、最小限のトークンオーバーヘッドで、AI支援ツールが複数のリレーショナルデータベースを安全にクエリし、探索できるようにする軽量なMCPサーバーです。

159

openai-agents-js: OpenAI Agents SDK – JS/TS でマルチエージェント LLM ワークフローを構築するためのプロバイダー非依存フレームワーク。

OpenAI Agents SDK (JavaScript/TypeScript) を使用すると、開発者は LLM を呼び出し、ツールを使用し、ガードレールを適用し、タスクを引き継ぎ、実行を追跡できるテキスト、サンドボックス、およびリアルタイム・エージェントを作成できます。Node.js、Deno、Bun、および実験的な Cloudflare Workers で動作します。

160

axonhub: AxonHub – AI gateway for zero‑code model switching

AxonHubは、アプリケーションのコードを変更することなくLLMプロバイダーとモデルを切り替えられる、セルフホスト可能なAIゲートウェイです。統一されたSDK互換性、オブザーバビリティ、アクセス制御、ロードバランシング、およびコスト追跡を提供します。

161

semble: AIコーディングエージェントのための高速かつトークン効率の良いコード検索

Sembleは、コードベースを約500msでインデックス化し、自然言語によるコード検索クエリに約1msで回答する、CPUのみで動作するPythonライブラリ/CLI/MCPサーバーです。Transformerレベルの関連性を提供しつつ、「grepしてファイル全体を読み込み込む」アプローチと比較してトークンを約99%節約できます。Claude Code, Codex, や Cursor などのエージェントと連携可能で、ローカルまたはリモートリポジトリを、、.gitignore/.sembleignore を尊重し、シンプルなインストーラー、CLI、および Python API を提供します。

162

worktrunk: AIエージェントの並列開発を簡素化するgit worktreeマネージャー

worktreeをブランチと同じくらい簡単に扱えるようにすることで、複数のAIエージェントを並列に実行することを容易にするために設計された、git worktree管理用のCLI。

163

agentmemory: あらゆるコーディングLLMエージェントのための、永続的でトークン効率の高いメモリ

agentmemory は、AIコーディングアシスタントのための、セルフホスト型で SQLite をベースとしたメモリエンジンです。フックを介してエージェントの動作を自動的にキャプチャし、BM25/ベクトル/グラフ検索のハイブリッド方式で保存し、MCP または REST 互換のエージェント (Claude Code, Copilot CLI, Gemini CLI, など) に知識を提供します。ベンチマークでは @5 で約 95% の想起率を示し、10倍以上のトークン節約を実現します。リアルタイムビューアでメモリを検査できます。`npm i -g @agentmemory/agentmemory` でインストールし、サーバーを起動し、`agentmemory connect <agent>` でエージェントを接続します。

164

30分間の圧力鍋で作るフォー・ガー レシピ by J. Kenji López-Alt

J. Kenji López-Alt は、圧力鍋を使って 30 分以内に濃厚で澄んだベトナム風チキンヌードルスープ(フォー・ガー)を作る方法を示しており、何時間も煮込む必要をなくしています。

165

agent-governance-toolkit: 自律型AIエージェントのための決定論的なポリシー適用およびガバナンスレイヤー

不正なアクションを防ぐために、決定論的なポリシー適用、アイデンティティ管理、および監査ログを提供、自律型AIエージェントのためのガバナンスフレームワーク。

166

agent-framework: Microsoft Agent Framework – 本番環境グレードのAIエージェントおよびワークフローを構築・運用するためのクロスプラットフォーム・フレームワーク

Microsoft Agent Frameworkは、本番環境向けのAIエージェントおよびマルチエージェント・ワークフローを作成するための、オープンなマルチ言語(Python/.NET)ツールキットです。プロバイダーに依存しないオーケストレーション、ミドルウェア、オブザーバビリティ、宣言的なYAML定義、スキルベースの知識、およびMicrosoft Foundryなどのホスティング・オプションを提供します。

167

hindsight: 経験と世界の事実から学習するエージェントのためのバイオミメティック(生体模倣)長期記憶システム

バイオミメティックなデータ構造を使用して、AIエージェントが単純な会話履歴を超えて、経験と世界の事実から学習することを可能にするエージェント記憶システム。

168

graphiti: AIエージェント向けに事実の変化を追跡する時間的コンテキストグラフエンジン

AIエージェントが進化する事実を追跡し、生のデータストリームから歴史的なプロベナンスを維持できるようにする、時間的コンテキストグラフ構築のためのフレームワーク。

169

iPolloWork: エージェントを介して編集可能なコード、ドキュメント、マルチメディアコンテンツを作成するためのローカルファーストな視覚的AIワークベンチ

エージェントが単一のワークスペース内で編集可能なコード、ドキュメント、プレゼンテーション、ビデオを作成し、維持することを可能にする、ローカルファーストな視覚的AIワークベンチ。

170

voice-pro: YouTube処理、音声クローニング、多言語翻訳のためのオールインワンAI吹き替えスタジオ

ASR、TTS、および音声クローニングを単一のワークフローに統合した、音声認識、翻訳、および多言語吹き替えのためのAI搭載ウェブアプリケーション。

171

RISC OS Open の20年:マイルストーンとコミュニティへの影響

2006 年の設立から20年、RISC OS Open は専有OSをオープンソースプロジェクトへと変え、コミュニティ主導のリリース、最新ハードウェア対応、そして継続中の Moonshots イニシアティブを実現しました。

172

Seedance 2.5 リリースノート: 長編ストーリーテリングとマルチモーダル参照

ByteDanceは、シングルパス生成を30秒に延長し、プロフェッショナルグレードの創造的コントロールのための高度なマルチモーダル参照を導入したビデオ作成モデルであるSeedance 2.5を発表しました。

173

NetBSD 11.0 リリースノート

NetBSD 11.0 は、RISC-V ポート、x86 用の高速度 MICROVM カーネル、およびビンテージ ハードウェアへのサポート拡大を導入し、一方で、未解決のセキュリティ問題に対する透明性のあるアプローチを維持しています。

174

opencodex: Codex, Claude Code, および Grok Build で任意の LLM を実行可能にするユニバーサル・プロバイダー・プロキシ

API レスポンスを変換することで、OpenAI Codex、Claude Code、Claude Desktop、および Grok Build で任意の LLM プロバイダーを使用可能にするローカル・プロキシ。

175

mesh-llm: マシン間でGPUとメモリリソースをプールして大規模モデルを実行する分散推論システム

OpenAI互換のAPIを介して、複数のマシンにわたってGPUとメモリをプールし、大規模モデルを実行するための分散LLM推論システム。

176

omnigent: デバイス間で複数のAIエージェントをオーケストレーションおよび管理するためのオープンソースのメタハーネス

AIエージェントのための共通のオーケストレーション層を提供するオープンソースのメタハーネス。ランタイムの切り替え、ポリシーの適用、およびデバイスを越えたリアルタイムの共同作業を可能にします。

177

EverOS: エージェントのための、Markdownを正準な信頼できる情報源として使用するローカルファーストなメモリランタイム

アプリやデバイスを横断してポータブルで持続的な長期メモリを提供するために、Markdownを信頼できる情報源として使用する、AIエージェント向けのローカルファーストなメモリランタイム。

178

semantic-router: 異種混合LLMインフラストラクチャ全体でMixture-of-Modelsシステムを構築するためのプログラマブルなルーティングレイヤー

品質、コスト、およびレイテンシを向上させるために、異種混合のコンピューティングおよびインフラストラクチャ全体でLLMリクエストのルーティングを最適化する、Mixture-of-Modelsシステム用のプログラマブルなルーティングレイヤー。

179

openmed: PII非識別化と医学的エンティティ抽出のためのローカルファーストな臨床テキストパイプライン

Python、Swift、Android、およびブラウザにわたってデバイス上で動作する、臨床エンティティ抽出とPII非識別化のためのローカルファーストなヘルスケアAIランタイム。

180

カナダ、国連サイバー犯罪条約に署名:監視とデジタル権利への影響

カナダは、国連サイバー犯罪条約に署名しました。批判的な人々は、この条約が広範な犯罪に対する国境を越えた電子証拠の共有を可能にすることで、グローバルな監視協定として機能すると主張しています。

181

wigolo: wigolo: AIエージェントのためのローカルファーストなWebインテリジェンス

wigoloは、AIエージェント向けのローカルファーストなWebインテリジェンス・ツールキットであり、コア機能にAPIキーを必要とせず、検索、フェッチ、クロール、抽出、キャッシュ、類似検索、リサーチ、エージェントツールを提供します。MCPサーバー、RESTエンドポイント、またはSDKとして動作し、すべてのデータを `~/.wigolo/` 内にプライベートに保持し、高度なタスクのためにオプションのLLMベースの合成機能を提供します。 ## 主要機能 - 10個の統合Webツール (search, fetch, crawl, extract, cache, find_similar, research, agent, diff, watch) - MCPサーバー (コーディングエージェント用)、RESTエンドポイント、または埋め込み可能なSDK (TypeScript/Python) として動作 - ローカルファースト設計: データは `~/.wigolo/` に保持されます。LLM合成を明示的にオプトインしない限り、サードパーティへの呼び出しは行いません - コアツールはAPIキー不要; 公開検索エンジンとデバイス上のMLモデルを使用します - バイトオフセットによるソーススパンを含む逐次的な抜粋を返し、結果ごとに説明可能なスコアリングを提供します - セットアップ後のクエリあたりのコストはゼロ (結果をローカルにキャッシュして即座に再クエリが可能) - 主要なAIエージェントフレームワークと統合: LangChain, CrewAI, LlamaIndex, Vercel AI SDK - 人気のエージェントと直接連携: Claude Code, Cursor, Codex, Gemini CLI, OpenCode, VS Code, Windsurf, Zed, Antigravity ## 仕組み wigoloは、MCP (agent通信用のstdio経由のJSON-RPC)、REST API、およびSDKの3つのインターフェースを公開する単一のNode.jsプロセスとして動作します。検索ツールは、ランクフュージョンとデバイス上のMLによるリランキングを備えた18個の直接アダプターを使用します。フェッチツールは、観測可能なシグナル (SPAマーカー、アンチボット・チャレンジ) に基づいて、プレーンHTTPからheadless browserへとエスカレートする階層型ルーターを採用しています。結果は、キーワードとベクトルインデックスを組み合わせたローカルキャッシュに保存されます。オプションのLLM合成 (リサーチ/エージェントツール用) は、環境変数 (例: `WIGOLO_LLM_PROVIDER=gemini`) を介して設定可能です。すべての重いコンポーネント (ブラウザエンジン、埋め込みモデル) は、`~/.wigolo/` 内にローカルに保存され、遅延読み込みされます。 ## 制限事項 - 一部のチャレンジ保護されたサイトはIPレピュテーションに依存しています。データセンターIPでは、ホーム接続が成功する場所で失敗する可能があり、プロキシのオプトインについてセルフホスティングガイドを参照してください - LLM APIキーがない場合、`research` および `agent` ツールは合成された回答ではなく、生の証拠ブリーフを返します - 初期のセットアップには約1.5 GBの空きディスク容量が必要であり、ブラウザエンジンとデバイス上のモデルをダウンロードします - Node.js >= 20 が必要です ## エコシステム - CLI: ターミナル使用用の `npx wigolo <tool>` - インタラクティブシェル: NDJSONパイピング用の `wigolo shell` - REST API: `wigolo serve` がJSONエンドポイントを公開します - Docker: GitHub Container Registry および Docker Hub 上の公式イメージ - フレームワーク統合: LangChain, CrewAI, LlamaIndex, および Vercel AI SDK 用の公式パッケージ - エージェントスキル: `wigolo skills` で管理される11個のスキルカタログ ## ライセンス AGPL-3.0 ## ステータス パブリックベータ ## リンク - ドキュメント: [docs/README.md](docs/README.md) - 例: [examples/README.md](examples/README.md) - インストール: [docs/installation.md](docs/installation.md) - 設定: [docs/configuration.md](docs/configuration.md) - ツールリファレンス: [docs/tools.md](docs/tools.md) - SDKs: [docs/sdks.md](docs/sdks.md) - セルフホスティング: [docs/self-hosting.md](docs/self-hosting.md) - スキル: [docs/skills.md](docs/skills.md) - 貢献: [CONTRIBUTING.md](CONTRIBUTING.md)

182

markstream-vue: Markstream — Streaming Markdown renderers for AI chat

Vue 3 / Nuxt / VitePress パッケージで、Markdown をストリーム(例:LLM トークンストリーム)からインクリメンタルにレンダリングし、ちらつきを最小限に抑えて AI チャットインターフェースでの滑らかな体験を提供します。

183

note-gen: AIを使用して散らばった情報の断片を構造化されたノートに整理するローカルファーストのMarkdownアプリ

AIを使用して、音声録音やスクリーンショットなどの散らばった情報の断片を、構造化されたノートに整理するローカルファーストのMarkdownアプリ。

184

ms-swift: ms‑swift: LLMおよびマルチモーダルモデルのファインチューニングのためのスケーラブルで軽量なインフラストラクチャ

ms‑swiftは、数百のLLMおよびマルチモーダルモデルのファインチューニング、サービング、および評価を行うための、軽量でフルスタックなフレームワークです。LoRAスタイルの効率的な学習、高度な並列化、量子化、RLHF、およびGradioベースのUIを提供します。

185

banana-slides: 自然言語のプロンプトやドキュメントから編集可能なスライドとナレーション付き動画を作成するAIネイティブなプレゼンテーションジェネレーター

nano banana proモデルと自然言語編集を使用して、アイデア、ドキュメント、または画像から編集可能なプロフェッショナルなスライドを生成するAIネイティブなプレゼンテーションアプリ。

186

airllm: 1レイヤーずつロードすることで、コンシューマー向けGPUで巨大なLLMを実行するメモリ効率の高い推論エンジン

AirLLMは、モデルのレイヤーを一度に1つずつVRAMにロードすることで、低スペックなGPUで巨大なLLM(最大671Bパラメータ)を実行できるようにするライブラリです。

187

DeepSeek-Reasonix: DeepSeek‑Reasonix: ターミナル用の設定駆動型・プラグインベースのAIコーディングエージェント

DeepSeek-Reasonixは、設定およびプラグイン駆動のハーネスを使用し、DeepSeekモデルを利用するターミナルAIコーディングエージェントです。DeepSeekのprefix cacheに最適化された単一の静的Goバイナリとして提供され、トークンコストを低く抑えます。

188

WrenAI: AIエージェントが任意のデータベースから統制されたダッシュボードをデプロイできるオープンソースの生成型BIエンジン

AIエージェントが、任意のデータベースから統制されたSQLを生成し、チャートを作成し、共有可能なダッシュボードをデプロイするためのコンテキストレイヤーを提供する、オープンソースの生成型BIエンジン。

189

screenpipe: 画面と音声をキャプチャして、検索可能な履歴とAIエージェントを強化するローカルファーストのAIメモリシステム

画面と音声をキャプチャして、検索可能な履歴を作成し、AIエージェントにコンテキストを提供するための、ローカルファーストのAIメモリツール。

190

openai-agents-python: 音声およびサンドボックス実行をサポートする、マルチエージェント・ワークフロー構築のためのプロバイダー非依存フレームワーク

さまざまなLLMにわたってテキスト、音声、およびサンドボックス実行をサポートする、マルチエージェント・ワークフロー構築のための軽量でプロバイダー非依存のフレームワーク。

191

LightRAG: ベクトル検索とグラフ検索を橋渡しし、効率的な大規模インデックス作成を実現する軽量グラフベースRAGフレームワーク

知識グラフとベクトル埋め込みを組み合わせることで、深い文脈理解と効率的な増分更新を実現する、軽量なグラフベースのRAGフレームワーク。

192

vox-director: 単一のトピックからエディトリアルなペーパーコラージュ解説動画を作成するための自動化パイプライン

Voxスタイルのペーパーコラージュ解説動画の制作を自動化するエージェントスキル。スクリプト作成からキーフレーム、モーション、オーディオまで、すべてを処理します。

193

caveman: Caveman – AI コーディングエージェント用トークン節約プラグイン

Caveman は、AI コーディングエージェントが簡潔な原始人風の言語で話すようにし、技術的な内容はすべて維持しながら、散文における出力トークンを最大65%削減するプラグインです。

194

browser-use: LLMがウェブブラウザを制御して自動化されたウェブタスクを実行できるようにするAIエージェントフレームワーク

自然言語のコマンドを通じて、フォームの入力、データの抽出、QAテストなどのタスクを実行するために、AIエージェントがウェブブラウザを制御できるようにするライブラリおよびフレームワーク。

195

sglang: RadixAttentionと幅広いハードウェアサポートを備えた、LLMおよびマルチモーダルモデル向けの高性能サービングフレームワーク

SGLangは、高度なキャッシュとスケジューリングを通じて、多様なハードウェア上でLLMおよびマルチモーダルモデルの推論スループットとレイテンシを最適化する、高性能なサービングフレームワークです。

196

CodeWhale: BYOKと詳細な管理をサポートするモデルに依存しないターミナルコーディングエージェント

任意のLLMプロバイダーを使用して、コードの読み取り、ファイルの編集、およびコマンドの実行ができる、オープンソースのモデルに依存しないターミナル用コーディングエージェント。

197

mempalace: verbatim 形式での保存とプラグ可能なベクトルバックエンドを備えたローカルファーストAIメモリシステム

会話履歴を要約ではなく逐語的なテキストとして保存し、要約なしで高精度な検索を実現するセマンティック検索を利用したローカルファーストAIメモリシステム。

198

mnemosyne: Mnemosyne: ローカルファーストAIメモリレイヤー

Mnemosyneは、外部サービスやクラウドへの依存を必要とせず、ワーキングメモリ、エピソードメモリ、および時間的知識グラフ(TripleStore)を提供する、ローカルファーストでSQLiteベースのAIエージェント用メモリレイヤーです。

199

Mu – エージェント向けツール:AI エージェントのための統一された MCP 対応ツールキット

Mu は単一の MCP エンドポイントを提供し、AI エージェントに Web 検索、メール、ストレージ、カレンダーなどの実世界ツールを、サードパーティ API をラップするのではなく自らサービスを実行させる形で利用可能にします。

200

ECC: ECC: AIコーディングアシスタントのためのエージェントハーネス・オペレーティングシステム

ECCは、AIコーディングエージェントに、コードの計画、テスト、実装、レビュー、検証、記憶、および改善を行うための、調整されたエンジニアリングシステム(エージェント、スキル、コマンド、フック、メモリ、およびセキュリティスキャン)を備えさせるエージェントハーネス・オペレーティングシステムを提供します。