tinyfish-io/bigset-oss

Open-source BigSet — self-hostable live datasets populated by TinyFish web agents

解决的问题

BigSet 允许用户使用自然语言描述从实时网络中创建结构化数据集。它消除了手动拼接搜索 API、爬虫框架、模式设计和调度工具来构建和维护最新数据表的繁琐工作。

工作原理

  1. 描述:用户提供所需数据集的自然语言描述。
  2. 模式推断:AI 自动确定所需的列名、数据类型和主键。
  3. 发现:编排代理使用网络搜索查找相关实体。
  4. 填充:并行子代理研究每个实体,获取实时数据,并与来源进行验证。
  5. 输出:生成的结构化数据在 UI 中展示,可导出为 CSV 或 XLSX。
  6. 维护:用户可设置刷新频率(从 30 分钟到每周),自动保持数据最新。

适用人群

需要从公开网页中获取经过验证、结构化且定期更新的数据,但又不想编写自定义爬虫的研究人员、潜在客户开发专家和 AI 代理开发者。

特色亮点

  • 自主研究:使用代理进行搜索、获取和验证数据,而非依赖静态爬取。
  • 自动模式:根据用户提示自动推断表格结构。
  • 定时刷新:内置类似 cron 的功能,防止数据过期。
  • CLI 支持:提供命令行界面,可编程地创建和导出数据集。
  • 集成:基于 TinyFish APIs 实现网络搜索和页面获取。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目