elliottdehn/open-jobs
~3M live jobs from 36 ATS, enriched with LLM-extracted fields + embeddings, released CC0. Includes agent tooling to search them (hull -> learn -> rank).
解決する課題
Open Jobsは、従来の求人ボードにおける「ゴースト求人」や古い掲載情報の問題に取り組みます。従来のプラットフォームは、見た目を充実させるために廃止された求人を掲載し続けることがよくあります。当社は、企業のキャリアサイトを直接クロールし、各掲載情報を実際の経過期間と挙動に基づいて評価することで、透明性のある検証済みの求人データセットを提供します。
仕組み
このシステムは、65,000のCloudflare Durable Objectsを使用した分散クローリングアーキテクチャを採用し、企業のキャリアサイトを毎日監視します。掲載情報が最初に確認された正確な日付を記録し、「再スタンプ」(企業が求人を実際よりも新しいと主張すること)を防ぎます。
毎晩のバッチ処理で、給与、シニアレベル、勤務形態の推定モデルをトレーニングし、埋め込みを使用した検索インデックスを生成します。ユーザーはブラウザまたはAIエージェントを介して求人を検索できます。システムはユーザーのリクエストを埋め込み、インデックス内で最も近い求人グループを見つけ、ユーザーのマシン上でローカルにランキングとフィルタリングを実行してプライバシーを確保します。
対象ユーザー
- 求職者: 古いまたは偽の掲載情報に時間を無駄にしたくない方。
- AIエージェントユーザー(例: Claude Code、Cursor): 適格な求人マッチの絞り込みを自動化したい方。
- データサイエンティストおよび開発者: 分析やアプリケーション構築のために、高品質な埋め込み済み求人データセット(数百万件)を必要とする方。
主な特徴
- 検証済み評価: クローラーデータに基づいて、求人を「Fresh」「Stale」「Re-stamped」「Ghost」に分類。
- エージェント対応: Claude Code用プラグインと、他のAIエージェントがユーザーにインタビューして求人を絞り込むためのツールを提供。
- プライバシー最優先: 検索ランキングと個人データ(履歴書、ラベル)はローカルマシンに保持。
- 大規模データセット: 1536次元の埋め込みを持つ310万件の掲載情報へのアクセスを提供。
- オープンデータ: 検索インデックス全体と履歴差分をダウンロード可能な静的ファイルとして提供。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト