yusukebe/ax

The AI-era curl

解決的問題

ax 取代了編碼代理通常執行的低效率網頁資料取得、理解與提取循環。無需依賴 curl 傳送至脆弱的解析腳本,或將大量原始 HTML 寫入上下文視窗,ax 提供單一指令即可取得頁面、發現其結構,並以針對 LLM 令牌限制優化之格式提取結構化資料。

工作原理

該工具作為本地、決定性的二進位檔運作,整合多項功能:

  • 取得:為每個請求提供完整報告(狀態、標頭、重導向),確保代理在回應體為空時不會陷入猜測。
  • 發現:使用 --outline 等標誌顯示重複結構,使用 --locate 在不轉儲整個 HTML 頁面的情況下定位特定選擇器。
  • 提取:可提取多欄位行(--row)、將 HTML 表格轉換為帶鍵的行(--table),並使用安全表達式語言(--where)過濾結果。
  • 令牌管理:實作令牌預算(--budget)與結果上限,防止上下文視窗溢出,並為代理提供精確偏移量,以便無重疊地取得剩餘資料。

適用對象

主要針對需要與網頁互動以取得資訊、閱讀文件或抓取結構化資料,但無需為每個任務撰寫與除錯自訂 Python 腳本的 AI 編碼代理。

特色亮點

  • 代理優化輸出:專為 LLM 上下文視窗設計,結構化且令牌成本低廉。
  • 整合工作流程:將取得、結構發現與提取整合至一個工具中,無需多個二進位檔或腳本。
  • 本地且決定性:本地運作,無需 API 金鑰或雲端 Markdown 轉換服務。
  • 分頁支援:使用 --json-envelope--offset 支援大規模資料集的機器可讀續傳。
  • Markdown 轉換:透過 --md 標誌可直接將頁面轉換為可讀的 Markdown 格式。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案