WebSight 데이터셋 및 Sightseer 모델
WebSight: UI 변환을 위한 대규모 합성 데이터셋
WebSight는 시각적 웹 디자인을 코드로 변환하는 AI 모델을 훈련시키기 위해 스크린샷과 HTML 코드 쌍을 대규모로 제공한다. 합성 데이터를 활용함으로써, 이 데이터셋은 실제 HTML에서 흔히 발견되는 잡음과 복잡성을 피하고 보다 효율적인 모델 학습을 가능하게 한다.
데이터셋은 두 가지 주요 버전을 통해 발전해 왔다:
- WebSight-v0.1: 2024년 1월에 출시되었으며, HTML 코드와 해당 스크린샷 823,000쌍을 포함한다.
- WebSight-v0.2: 200만 개 예제로 확장된 업데이트 버전이다. 이 버전은 스크린샷에 실제 이미지를 도입하고 기존 CSS에서 Tailwind CSS로 전환한다.
Sightseer: 스크린샷을 기능적 HTML로 변환
Sightseer는 WebSight 데이터셋을 기반으로 파인튜닝된 비전-언어 모델이다. 이 모델은 웹페이지 스크린샷을 입력으로 받아 해당 기능적 HTML 코드를 생성할 수 있다.
기본적인 구조와 스타일링을 넘어, Sightseer는 생성된 HTML에 원본 스크린샷에 있는 이미지와 매우 유사한 이미지를 포함시킬 수 있다.
웹 개발 및 UI 디자인에 대한 시사점
WebSight와 Sightseer와 같은 모델의 등장으로 UI 개발 워크플로우에 변화가 예상된다. 시각적 디자인(종이 UI 스케치 포함)을 빠르게 기능적 코드로 변환함으로써, 이러한 도구는 전문 개발자의 반복 시간을 크게 단축시킬 수 있다.
또한, 이 기술은 정식 코딩 경험이 없는 사람들도 기능적 웹 인터페이스를 만들 수 있게 하여, 저코드 소프트웨어 개발에서 비전-언어 모델의 실용적인 적용 사례를 보여준다.
SUMMARY: Hugging Face는 200만 개의 스크린샷-HTML 쌍으로 구성된 합성 데이터셋인 WebSight와 웹 스크린샷을 기능적 HTML 코드로 변환할 수 있는 비전-언어 모델인 Sightseer를 소개했다.
TITLE: WebSight 데이터셋 및 Sightseer 모델