tinyfish-io/bigset-oss
Open-source BigSet — self-hostable live datasets populated by TinyFish web agents
解决的问题
BigSet 允许用户使用自然语言描述从实时网络中创建结构化数据集。它消除了手动拼接搜索 API、爬虫框架、模式设计和调度工具来构建和维护最新数据表的繁琐工作。
工作原理
- 描述:用户提供所需数据集的自然语言描述。
- 模式推断:AI 自动确定所需的列名、数据类型和主键。
- 发现:编排代理使用网络搜索查找相关实体。
- 填充:并行子代理研究每个实体,获取实时数据,并与来源进行验证。
- 输出:生成的结构化数据在 UI 中展示,可导出为 CSV 或 XLSX。
- 维护:用户可设置刷新频率(从 30 分钟到每周),自动保持数据最新。
适用人群
需要从公开网页中获取经过验证、结构化且定期更新的数据,但又不想编写自定义爬虫的研究人员、潜在客户开发专家和 AI 代理开发者。
特色亮点
- 自主研究:使用代理进行搜索、获取和验证数据,而非依赖静态爬取。
- 自动模式:根据用户提示自动推断表格结构。
- 定时刷新:内置类似 cron 的功能,防止数据过期。
- CLI 支持:提供命令行界面,可编程地创建和导出数据集。
- 集成:基于 TinyFish APIs 实现网络搜索和页面获取。
相关
- 项目
- 项目
- 项目
- 项目
- 项目