๐ค Evaluate ๋ก ์ธ์ด ๋ชจ๋ธ ํธํฅ ํ๊ฐ
TL;DR
Hugging Face๋ ๐ค Evaluate ๋ผ์ด๋ธ๋ฌ๋ฆฌ์ ์๋ก์ด ํธํฅ ํ๊ฐ ๋ฉํธ๋ฆญโtoxicity, language polarity (Regard), HONESTโ์ ์ถ๊ฐํ์ฌ, ์ฐ๊ตฌ์๋ค์ด GPTโ2 ๋ฐ BLOOM๊ณผ ๊ฐ์ ์ธ๊ณผ ์ธ์ด ๋ชจ๋ธ์ ํด๋กญ๊ฑฐ๋ ๊ณ ์ ๊ด๋ ์ ์ธ ์ถ๋ ฅ์ ์ ๋ํํ ์ ์๊ฒ ํ์ต๋๋ค.
์๋ก์ด ํธํฅ ํ๊ฐ ์ํฌํ๋ก์ฐ ๊ฐ์
ํธํฅ ํ๊ฐ ์ํฌํ๋ก์ฐ๋ ๋ ๋จ๊ณ๋ก ๊ตฌ์ฑ๋ฉ๋๋ค:
- Prompting ์ฌ์ ์ ์๋ ํ๋กฌํํธ ์งํฉ์ ์ฌ์ฉํด ์ธ๊ณผ ์ธ์ด ๋ชจ๋ธ(CLM)์ ํธ์ถํฉ๋๋ค. ์ด ํ๋กฌํํธ๋ ๐ค Datasets์ ํธ์คํ ๋ฉ๋๋ค.
- Scoring ์์ฑ๋ ์์ฑ๋ค์ ๐ค Evaluate์ ๋ฉํธ๋ฆญ์ผ๋ก ์ ์ํํฉ๋๋ค. ์ด ์ ๊ทผ ๋ฐฉ์์ ์์ ํ์ ํ ์คํธ๋ฅผ ์์ฑํ ์ ์๋ ๋ชจ๋ CLM์์ ์๋ํ๋ฉฐ, ํน์ ํ๋กฌํํธ ๋ฐ์ดํฐ์ ์ ์์กดํ์ง ์์ต๋๋ค.
๋ ์ฑ ์ธก์
Takeaway: ๊ฐ๋จํ ๋๋ช ์ฌ ๊ต์ฒด๋ง์ผ๋ก ์ธก์ ๋ ๋ ์ฑ ๋น์จ์ด ๋ ๋ฐฐ๊ฐ ๋ ์ ์์ผ๋ฉฐ, ์ด๋ ๋ชจ๋ธ ์์ฑ์์ ์ฑ๋ณ ๊ด๋ จ ํธํฅ์ ๋ณด์ฌ์ค๋๋ค.
- Dataset used: WinoBias ๋ฐ์ดํฐ์ ์์ ์ถ์ถํ ํ๋กฌํํธ.
- Model: GPTโ2๊ฐ ๋จ์ฑ ๋๋ช ์ฌ์ ์ฌ์ฑ ๋๋ช ์ฌ ํ๋กฌํํธ์ ๋ํ ์์ฑ์ ์์ฑํฉ๋๋ค.
- Metric:
toxicity์ธก์ ์ผ๋ก, Facebook์ R4 ํ์ค ๋ฐ์ธ ๋ถ๋ฅ๊ธฐ๋ฅผ ๋ํํฉ๋๋ค. - Result example:
์ฌ์ฑ ๋๋ช ์ฌ ์์ฑ์ ๋ ์ฑ ์ถ๋ ฅ ๋น์จ์ด ๋ ๋์ต๋๋ค.{"toxicity_ratio": 0.0} // male prompts {"toxicity_ratio": 0.333} // female prompts - Usage: ๋ฉํธ๋ฆญ์
evaluate.load("toxicity")๋ก ๋ก๋ํ๊ณcompute(predictions=..., aggregation="ratio")๋ฅผ ํธ์ถํฉ๋๋ค.aggregation์ ์๋ตํ๋ฉด ๊ฐ ์์ฑ์ ๋ํ ์์ ์ ์๊ฐ ๋ฐํ๋ฉ๋๋ค(์: 0.0002 vs. 0.85). - Caveat: ๋์ ๋ ์ฑ ์ ์์๋ ํธ๋ฆฌ๊ฑฐ๊ฐ ๋๋ ์ธ์ด๊ฐ ํฌํจ๋ ์ ์์ผ๋ฏ๋ก, ์ฌ์ฉ์๋ ํด๋น ์ฝํ ์ธ ๋ฅผ ์ฑ ์๊ฐ ์๊ฒ ๋ค๋ฃจ์ด์ผ ํฉ๋๋ค.
์ธ์ด ๊ทน์ฑ (Regard) ์ธก์
Takeaway: CEO ํ๋กฌํํธ์ ๋ํ ๋ชจ๋ธ ์์ฑ์ ํธ๋ญ ์ด์ ์ฌ ํ๋กฌํํธ๋ณด๋ค ๋ ๊ธ์ ์ ์ธ ๊ทน์ฑ์ ๋ณด์ด๋ฉฐ, ์ง์ ๊ธฐ๋ฐ ํธํฅ์ ๋๋ฌ๋ ๋๋ค.
- Dataset used: ๋ค์ํ ์ธ๊ตฌ ์ง๋จ์ ๋ํ ํ๋กฌํํธ๋ฅผ ํฌํจํ๋ BOLD ๋ฐ์ดํฐ์ ์ ์๋ธ์ .
- Model: GPTโ2๊ฐ ๋ ์ง์ ๊ทธ๋ฃน(ํธ๋ญ ์ด์ ์ฌ vs. CEO)์ ๋ํ ์์ฑ์ ์์ฑํฉ๋๋ค.
- Metric:
regard์ธก์ (evaluate.load("regard", "compare")๋ก ๋ก๋). negative, neutral, other, positive์ ๋ํ ๊ทน์ฑ ๋ถํฌ๋ฅผ ๋ฐํํฉ๋๋ค. - Result example:
CEO ์์ฑ์ ๊ธ์ ์ ์๊ฐ ๋ ๋์ ํด๋น ์ง์ ์ ๋ํ ๋ ํธ์์ ์ธ ์๊ฐ์ ๋ํ๋ ๋๋ค.{"negative": 0.14, "neutral": 0.29, "other": -0.11, "positive": -0.32} - Interpretation: ๊ทธ๋ฃน ๊ฐ regard ์ ์ ์ฐจ์ด๋ฅผ ๊ณ์ฐํจ์ผ๋ก์จ, ์ค๋ฌด์๋ ํน์ ์ ์ฒด์ฑ์ ๋ํ ์ฒด๊ณ์ ์ธ ํธ์ ๋๋ ๋น๋์ ๋๋ฌ๋ผ ์ ์์ต๋๋ค.
์์ฒ๋ฅผ ์ฃผ๋ ๋ฌธ์ฅ ์์ฑ (HONEST)
Takeaway: HONEST ๋ฉํธ๋ฆญ์ ๋ ์ฆ๋น์ธ ํ๋กฌํํธ์ ๋ํด ๋ ๋ง์ ์์ฒ๋ฅผ ์ฃผ๋ ์์ฑ์ ํ์ํ๋ฉฐ, ์ด๋ ์ฑ๋ณ ๋ฐ ์ฑ์ ์งํฅ ํธํฅ์ ๋ณด์ฌ์ค๋๋ค.
- Dataset used: HONEST ํ๋กฌํํธ ์ธํธ(LGBTQAI+ ๊ทธ๋ฃน์ ์ํ ์์ด ํ ํ๋ฆฟ).
- Model: GPTโ2๊ฐ "lesbian" ๋ฐ "gay" ๊ทธ๋ฃน์ ๋์์ผ๋ก ํ๋ ํ๋กฌํํธ์ ๋ํ ์์ฑ์ ์์ฑํฉ๋๋ค.
- Metric:
honest์ธก์ ,evaluate.load("honest", "en")๋ก ๋ก๋. - Result example:
์ ์๊ฐ ๋์์๋ก ๋ ์์ฒ๋ฅผ ์ฃผ๋ ์์ฑ์ ์๋ฏธํ๋ฉฐ, ๋ ์ฆ๋น์ธ ๊ทธ๋ฃน์ด ๋ ๋์ ์ ์๋ฅผ ๋ฐ์์ต๋๋ค.{"honest_score_per_group": {"lesbian": 0.333, "gay": 0.0}} - Flexibility: ์ฌ์ฉ์๋
topโk์ํ๋ง ํ๋ผ๋ฏธํฐ๋ฅผ ์กฐ์ ํ์ฌ ๋์ฒด ์์ฑ ์๊ฐ HONEST ์ ์์ ์ด๋ป๊ฒ ์ํฅ์ ๋ฏธ์น๋์ง ํ์ํ ์ ์์ต๋๋ค(์๋ณธ HONEST ๋ ผ๋ฌธ ์ฐธ๊ณ ).
๋ ผ์ ๋ฐ ํ๊ณ
Takeaway: ๊ธฐ์กด ํธํฅ ๋ฐ์ดํฐ์ ์ ๋ฒ์๊ฐ ์ ํ์ ์ด๋ฉฐ ๋ณต์กํ ์ ์ฒด์ฑ์ ์ด์ง ๋๋ ๋ฒ์ฃผํ ๋ผ๋ฒจ๋ก ์ถ์ํ๋ ๊ฒฝ์ฐ๊ฐ ๋ง์ต๋๋ค; ์ฌ๋ฌ ๋ณด์์ ์ธ ๋ฉํธ๋ฆญ์ ํจ๊ป ์ฌ์ฉํด์ผ ํฉ๋๋ค.
- Hugging Face๋ ๋ฅ๋ ฅ ์ํ์ ์ฐ๋ น๊ณผ ๊ฐ์ ์์ธ๋ ์ฐจ์์ ํฌ์ฐฉํ๋ ์ถ๊ฐ ๋ฐ์ดํฐ์ ๊ธฐ์ฌ๋ฅผ ์ปค๋ฎค๋ํฐ์ ์ฅ๋ คํฉ๋๋ค.
- ๋ธ๋ก๊ทธ๋ ํ์ฌ ๋ฐ์ดํฐ์ ๊ธฐ๋ฐ ํธํฅ ํ๊ฐ๊ฐ ์ ์ฒด ์ง์ค๋ก ๊ฐ์ฃผ๋์ด์๋ ์ ๋๋ฉฐ, ๋ชจ๋ธ ํ๋์ ๋ํ ๋ถ๋ถ์ ์ธ ๊ด์ ์ ์ ๊ณตํ๋ค๋ ์ ์ ๊ฐ์กฐํฉ๋๋ค.
- ๋ ์ฑ, regard, HONEST ์ ์๋ฅผ ๊ฒฐํฉํ๋ฉด ๋ค์ํ ์ฌํ ์ถ์ ๊ฑธ์น ๋ชจ๋ธ ์ ํฉ์ฑ์ ๋ํ ๋ณด๋ค ์ ์ฒด์ ์ธ ๊ด์ ์ ์ ๊ณตํ ์ ์์ต๋๋ค.
๊ฐ์ฌ
์ ์๋ค์ Federico Bianchi, Jwala Dhamala, Sam Gehman, Rahul Gupta, Suchin Gururangan, Varun Kumar, Kyle Lo, Debora Nozza, ๊ทธ๋ฆฌ๊ณ Emily Sheng์๊ฒ ๐ค Evaluate ๋ฐ Datasets ๋ผ์ด๋ธ๋ฌ๋ฆฌ์ ๋ฐ์ดํฐ์ ๊ณผ ํ๊ฐ ์คํฌ๋ฆฝํธ๋ฅผ ์ถ๊ฐํ ๊ณตํ์ ๋ํด ๊ฐ์ฌ๋ฅผ ํํฉ๋๋ค.