flagos-ai/FlagPerf

FlagPerf is an open-source software platform for benchmarking AI chips.

解决的问题

FlagPerf 是一个集成的 AI 硬件评估引擎,旨在测量 AI 硬件在完整软件栈(模型 + 框架 + 编译器)内的实际能力。它超越了简单的“完成时间”指标,提供全面、面向产业的评估,以衡量硬件在真实 AI 训练和推理场景中的表现。

如何工作

FlagPerf 从多个维度和环境中评估硬件:

  • 多维度指标: 测量功能正确性(芯片是否支持特定模型)、性能、资源利用率和生态适应性。
  • 多样化工作负载: 包含 30 多个经典模型和 80 多个训练示例,覆盖计算机视觉(CV)、自然语言处理(NLP)、语音和多模态领域,包括大语言模型(LLM)的训练和推理。
  • 软件集成: 通过支持 PyTorch、TensorFlow、PaddlePaddle、MindSpore 等框架,以及 TensorRT、XTCL、IxRT、TorchInductor 等推理引擎,将硬件与软件生态系统连接起来。
  • 可扩展测试: 在单卡、单机(通常为 8 卡)和多机环境中测试性能。
  • 公平性控制: 为确保客观结果,芯片厂商仅允许修改与硬件相关的代码(如分布式通信、批大小)以进行适配,最终测试由北京人工智能研究院(BAAI)使用开源的 FlagPerf 平台完成。

适用对象

  • AI 硬件厂商: 对其芯片进行行业标准对比基准测试,并验证软件栈兼容性。
  • AI 基础设施工程师: 评估不同硬件/软件组合在训练和部署大模型时的性能和稳定性。
  • 研究人员: 获得可复现且公平的 AI 加速器性能数据。

亮点

  • 全面覆盖: 支持 Llama 2/3、GPT-3、Mixtral 等多种模型。
  • 跨框架支持: 集成多个国内外训练框架和推理引擎。
  • 多尺度评估: 从单芯片到多节点集群,验证性能。
  • 透明流程: 所有测试代码均为开源,确保测试过程和数据完全可复现。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目