yusukebe/ax
The AI-era curl
解決的問題
ax 取代了編碼代理通常執行的低效率網頁資料取得、理解與提取循環。無需依賴 curl 傳送至脆弱的解析腳本,或將大量原始 HTML 寫入上下文視窗,ax 提供單一指令即可取得頁面、發現其結構,並以針對 LLM 令牌限制優化之格式提取結構化資料。
工作原理
該工具作為本地、決定性的二進位檔運作,整合多項功能:
- 取得:為每個請求提供完整報告(狀態、標頭、重導向),確保代理在回應體為空時不會陷入猜測。
- 發現:使用
--outline等標誌顯示重複結構,使用--locate在不轉儲整個 HTML 頁面的情況下定位特定選擇器。 - 提取:可提取多欄位行(
--row)、將 HTML 表格轉換為帶鍵的行(--table),並使用安全表達式語言(--where)過濾結果。 - 令牌管理:實作令牌預算(
--budget)與結果上限,防止上下文視窗溢出,並為代理提供精確偏移量,以便無重疊地取得剩餘資料。
適用對象
主要針對需要與網頁互動以取得資訊、閱讀文件或抓取結構化資料,但無需為每個任務撰寫與除錯自訂 Python 腳本的 AI 編碼代理。
特色亮點
- 代理優化輸出:專為 LLM 上下文視窗設計,結構化且令牌成本低廉。
- 整合工作流程:將取得、結構發現與提取整合至一個工具中,無需多個二進位檔或腳本。
- 本地且決定性:本地運作,無需 API 金鑰或雲端 Markdown 轉換服務。
- 分頁支援:使用
--json-envelope和--offset支援大規模資料集的機器可讀續傳。 - Markdown 轉換:透過
--md標誌可直接將頁面轉換為可讀的 Markdown 格式。
相關
- 專案
- 專案
- 專案
- 專案
- 專案