elliottdehn/open-jobs

~3M live jobs from 36 ATS, enriched with LLM-extracted fields + embeddings, released CC0. Includes agent tooling to search them (hull -> learn -> rank).

해결하는 문제

Open Jobs는 기존 채용 게시판의 "유령 채용 공고" 및 오래된 게시물 문제를 해결합니다. 기존 플랫폼은 플랫폼을 가득 차 보이게 하기 위해 만료된 채용 공고를 계속 게시하는 경우가 많습니다. 저희는 기업 채용 사이트를 직접 크롤링하고 각 게시물을 실제 경과 기간과 행동에 따라 평가하여 투명하고 검증된 채용 데이터 세트를 제공합니다.

작동 방식

이 시스템은 65,000개의 Cloudflare Durable Objects를 사용한 분산 크롤링 아키텍처를 통해 기업 채용 사이트를 매일 모니터링합니다. 게시물이 처음 발견된 정확한 날짜를 기록하여 "재스탬핑"(기업이 채용 공고를 실제보다 새것으로 주장하는 것)을 방지합니다.

매일 밤 배치 프로세스가 급여, 직급, 근무 형태에 대한 추정 모델을 훈련하고 임베딩을 사용한 검색 인덱스를 생성합니다. 사용자는 브라우저 또는 AI 에이전트를 통해 채용 공고를 검색할 수 있습니다. 시스템은 사용자의 요청을 임베딩하고 인덱스에서 가장 가까운 채용 그룹을 찾은 다음, 사용자 기기에서 로컬로 순위 지정 및 필터링을 수행하여 개인정보를 보호합니다.

대상 사용자

  • 구직자: 오래된 또는 가짜 채용 공고에 시간을 낭비하고 싶지 않은 분.
  • AI 에이전트 사용자 (예: Claude Code, Cursor): 적격한 채용 매치의 숏리스트 작성을 자동화하려는 분.
  • 데이터 과학자 및 개발자: 분석이나 애플리케이션 구축을 위해 수백만 개의 채용 공고로 구성된 고품질 임베딩 데이터 세트가 필요한 분.

주요 기능

  • 검증된 평가: 크롤러 데이터를 기반으로 채용 공고를 Fresh, Stale, Re-stamped, Ghost로 분류.
  • 에이전트 준비 완료: Claude Code용 플러그인과 다른 AI 에이전트가 사용자에게 인터뷰하고 채용 공고를 숏리스트로 정리할 수 있는 도구를 제공.
  • 개인정보 우선: 검색 순위 및 개인 데이터(이력서, 라벨)는 로컬 머신에 유지.
  • 대규모 데이터 세트: 1536차원 임베딩이 포함된 310만 개의 채용 공고에 대한 액세스를 제공.
  • 오픈 데이터: 전체 검색 인덱스와 과거 변경 사항을 다운로드 가능한 정적 파일로 제공.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트