kyegomez/ScreenAI
Implementation of the ScreenAI model from the paper: "A Vision-Language Model for UI and Infographics Understanding"
解決的問題
ScreenAI 是為理解使用者介面(UI)與資訊圖表而設計,讓模型能同時處理視覺元素與文字,以解析螢幕內容。
工作原理
此模型採用視覺-語言架構。它接收影像與文字作為輸入,透過分塊大小與視覺變換器(ViT)處理影像,將資料嵌入並串接,再透過一系列注意力與前饋網路(FFN),包含交叉注意力與自我注意力機制,產生輸出。
適用對象
從事 UI 自動化、無障礙工具,或任何需要機器理解圖形使用者介面與資訊圖表之應用的開發者與研究人員。
主要特色
- 實作研究論文《面向 UI 與資訊圖表理解的視覺-語言模型》。
- 支援多模態輸入處理(影像與文字)。
- 可自訂模型參數,例如分塊大小、影像大小,以及編碼器與解碼器的深度。
相關
- 專案
- Dispatch
- 專案
- 專案
- 專案