tidymodels/yardstick

Tidy methods for measuring model performance

解决的问题

提供一种基于 tidy data 原则的标准化方法来估计模型性能,使用户无需手动管理复杂的数据结构,即可计算分类和回归模型的常见性能特征。

工作原理

yardstick 使用类似 dplyr 的语法来计算指标。它接收一个包含真实值和预测值的数据框,并返回结果为一个数据框。支持二分类、多分类(支持多种估计器,如宏平均和微平均),以及通过分组数据框在多个重采样上计算指标。

适用人群

使用 R 进行机器学习模型评估的数据科学家和机器学习实践者。

主要亮点

  • tidy 接口:以数据框形式返回指标,便于集成到分析管道中。
  • 多分类支持:提供多分类指标的广泛扩展,支持多种计算方法。
  • 重采样评估:简化了在多个模型重采样上同时计算性能的过程。
  • 集成可视化:通过 ggplot2 提供 autoplot() 方法,支持 ROC、PR 和增益曲线等基于曲线的指标的可视化。

相关

  • 项目
  • 项目
  • 项目
  • 项目