Hugging Face AI Sheets 視覺更新
Hugging Face 已發布 AI Sheets 的重大更新,這是一款開源工具,旨在使用開放式 AI 模型在不需撰寫程式碼的情況下建構、轉換與豐富資料集。主要新增功能是完整的視覺支援,使用者可以在試算表工作流程中直接分析、從影像中提取資料,並產生視覺內容。
基於視覺的資料提取與分析
AI Sheets 允許使用者上傳影像或使用基於影像的資料集,透過視覺模型提取並結構化資訊。此功能可將非結構化的視覺資料(例如收據、商品目錄與掃描文件)轉換為有條理的表格。
主要功能包括:
- 結構化資料提取:使用者可透過自訂提示從收據中抽取特定項目、從圖表中取得資料,或從掃描文件中擷取文字。
- 影像說明與分類:工具能為照片產生說明文字、分類文件類型,或根據內容為影像加上標籤。
- 中繼資料產生:模型可自動為影像標註品質分數、相關屬性或自訂註解。
使用者可以透過反覆調整提示、手動編輯結果,並使用「讚」機制提供 few‑shot 範例給模型,以提升準確度。
整合式影像生成與編輯
除了提取之外,AI Sheets 也整合了 image‑to‑image 與 text‑to‑image 模型,讓使用者能在試算表內直接創作內容。
- 文字轉影像生成:使用者可根據文字欄位產生社群媒體圖形、縮圖或插圖(例如依食譜標題生成食物照片)。
- 影像轉換:可對現有影像進行風格變更、加入元素或調整構圖。
- 影像變體:工具支援大規模產生同一視覺的多個版本,以供測試與品牌使用。
技術實作與模型彈性
AI Sheets 採用 Hugging Face Inference Providers,讓使用者能存取數千個開源模型。使用者可依任務需求切換模型,以在速度與準確度之間取得平衡。
在一個手寫食譜文字提取的示例中,工具展示了不同模型層級的差異:
- Qwen/Qwen2.5-VL-7B-Instruct:作為預設模型,兼顧速度與準確度。
- Qwen/Qwen3-VL-235B-A22B-Reasoning:最先進的推理模型,在偵測細微細節(如特定食材「菠菜」與精確烹飪時間「50‑60 分鐘」)方面更為精確,較小的模型則可能遺漏。
工作流程與匯出選項
AI Sheets 的工作流程從資料匯入到最終匯出呈線性流程:
- 上傳:使用者上傳影像資料夾或連接資料集。
- AI 操作:使用者對欄位套用操作。影像欄位支援文字提取、物件偵測與上色,文字欄位則支援摘要、翻譯與關鍵字抽取。
- 豐富:提取的文字可進一步處理(例如將原始轉錄轉換為結構化 HTML)。
- 匯出:最終資料集可匯出至 Hugging Face Hub(公開或私有),支援 CSV 或 Parquet 格式。
AI Sheets 可作為即時使用的託管 Space,亦可透過其 GitHub 倉庫在本地部署。