PacificAI/langtest
Deliver safe & effective language models
解決的問題
LangTest 的設計旨在協助資料科學家確保語言模型的安全性、穩健性與公平性。它解決了超出簡單準確率之外,模型品質評估工具不足的問題,特別針對現實情境下的族群偏差、毒性與不一致性等議題。
運作方式
該套件提供一個 Harness 物件,讓使用者能產生、執行並報告超過 60 種不同類型的測試。支援多種 NLP 任務(NER、翻譯、文字分類),並與 Hugging Face、Spark NLP 及多種 LLM 提供商(OpenAI、Cohere、AI21、Azure-OpenAI)整合。
適用對象
專為需要在將模型部署至生產系統前,嚴格測試其穩健性、公平性與安全性的 NLP 實務者與資料科學家所設計。
主要特色
- 全面測試:涵蓋穩健性、偏差、代表性、公平性與準確性。
- 自動資料增強:可根據測試結果,自動為特定模型增強訓練資料。
- LLM 支援:提供專為 LLM 設計的測試,包括事實正確性、奉承性(sycophancy)與毒性。
- 廣泛整合:支援多種 NLP 框架與 LLM API。
相關
- 專案
- 專案
- 專案
- 專案
- 專案