xAI Grok Collections API 发布

xAI 宣布推出 Collections API,这是一种托管式知识库服务,允许开发者上传并搜索整个数据集——包括 PDF、Excel 表格和代码库——从而构建检索增强生成 (RAG) 应用,而无需管理自己的索引和检索基础设施。

托管式索引与文档理解

Collections API 处理数据摄取和存储的复杂性。它利用 OCR 和布局感知解析技术来提取文本,同时保留文档的结构完整性,例如 Excel 表格的层级结构、PDF 的布局以及代码的语法。

关键管理功能包括:

  • 广泛的格式支持:该 API 支持多种文件类型。
  • 高效的重新索引:系统会在文件更改时自动重新索引,以确保知识库保持最新。
  • 文件管理:开发者可以在其集合 (collections) 中上传、更新和下载文件。

检索方法与搜索能力

为了针对不同的用例进行优化,Collections API 提供了三种不同的检索方法:

  • 语义搜索 (Semantic Search):用于基于含义和意图的查询。
  • 关键词搜索 (Keyword Search):用于精确的术语匹配。
  • 混合搜索 (Hybrid Search):结合了关键词和语义搜索以实现最高准确度。此方法支持倒排排名融合 (reciprocal rank fusion) 和专门的重排序模型 (reranker model)。

性能基准测试

xAI 报告称,Collections API 与 Grok 4.1 Fast 配合使用时,在以长篇、密集文档为特征的领域(如金融、法律和编程)中提供了最先进的检索性能。

特定领域准确度

根据内部基准测试,Grok 4.1 Fast 在几项关键任务中表现优于或等同于竞争对手:

Task xAI Grok 4.1 Fast Google Gemini Pro 3 OpenAI GPT 5.1
金融 (表格和数值问题) 93.0 85.9 84.7
法律 (跨多个分块的复杂推理) 73.9 74.5 71.2
编程 (代码理解与大型文件系统) 86 85 81

专业数据集评估

  • 金融分析:混合搜索被强调为从 SEC filings 等来源检索表格和数值数据的关键工具。
  • 法律分析:使用 LegalBench 数据集(来自商业合同的 128 个问答对),测试了 API 处理细微法律语言和交叉引用的能力。
  • DeepCodeBench:API 的代码理解能力通过 DeepCodeBench 数据集进行了评估,该数据集包含来自真实世界开源仓库和复杂算法问题的任务。端到端回答性能在包含 8,000 个文件的 8 个仓库中进行了测试。

数据隐私与定价

数据隐私:xAI 表示,存储在 Collections 中的用户数据不会用于模型训练,除非用户提供明确同意。

定价:在初始发布阶段,文件索引和存储在第一周内是免费的免费。检索费用按每 1,000 次搜索 2.50 美元的固定费率计算。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch