๐Ÿค— Evaluate ๋กœ ์–ธ์–ด ๋ชจ๋ธ ํŽธํ–ฅ ํ‰๊ฐ€

TL;DR

Hugging Face๋Š” ๐Ÿค— Evaluate ๋ผ์ด๋ธŒ๋Ÿฌ๋ฆฌ์— ์ƒˆ๋กœ์šด ํŽธํ–ฅ ํ‰๊ฐ€ ๋ฉ”ํŠธ๋ฆญโ€”toxicity, language polarity (Regard), HONESTโ€”์„ ์ถ”๊ฐ€ํ•˜์—ฌ, ์—ฐ๊ตฌ์ž๋“ค์ด GPTโ€‘2 ๋ฐ BLOOM๊ณผ ๊ฐ™์€ ์ธ๊ณผ ์–ธ์–ด ๋ชจ๋ธ์˜ ํ•ด๋กญ๊ฑฐ๋‚˜ ๊ณ ์ •๊ด€๋…์ ์ธ ์ถœ๋ ฅ์„ ์ •๋Ÿ‰ํ™”ํ•  ์ˆ˜ ์žˆ๊ฒŒ ํ–ˆ์Šต๋‹ˆ๋‹ค.

์ƒˆ๋กœ์šด ํŽธํ–ฅ ํ‰๊ฐ€ ์›Œํฌํ”Œ๋กœ์šฐ ๊ฐœ์š”

ํŽธํ–ฅ ํ‰๊ฐ€ ์›Œํฌํ”Œ๋กœ์šฐ๋Š” ๋‘ ๋‹จ๊ณ„๋กœ ๊ตฌ์„ฑ๋ฉ๋‹ˆ๋‹ค:

  1. Prompting ์‚ฌ์ „ ์ •์˜๋œ ํ”„๋กฌํ”„ํŠธ ์ง‘ํ•ฉ์„ ์‚ฌ์šฉํ•ด ์ธ๊ณผ ์–ธ์–ด ๋ชจ๋ธ(CLM)์„ ํ˜ธ์ถœํ•ฉ๋‹ˆ๋‹ค. ์ด ํ”„๋กฌํ”„ํŠธ๋Š” ๐Ÿค— Datasets์— ํ˜ธ์ŠคํŒ…๋ฉ๋‹ˆ๋‹ค.
  2. Scoring ์ƒ์„ฑ๋œ ์™„์„ฑ๋“ค์„ ๐Ÿค— Evaluate์˜ ๋ฉ”ํŠธ๋ฆญ์œผ๋กœ ์ ์ˆ˜ํ™”ํ•ฉ๋‹ˆ๋‹ค. ์ด ์ ‘๊ทผ ๋ฐฉ์‹์€ ์ž์œ  ํ˜•์‹ ํ…์ŠคํŠธ๋ฅผ ์ƒ์„ฑํ•  ์ˆ˜ ์žˆ๋Š” ๋ชจ๋“  CLM์—์„œ ์ž‘๋™ํ•˜๋ฉฐ, ํŠน์ • ํ”„๋กฌํ”„ํŠธ ๋ฐ์ดํ„ฐ์…‹์— ์˜์กดํ•˜์ง€ ์•Š์Šต๋‹ˆ๋‹ค.

๋…์„ฑ ์ธก์ •

Takeaway: ๊ฐ„๋‹จํ•œ ๋Œ€๋ช…์‚ฌ ๊ต์ฒด๋งŒ์œผ๋กœ ์ธก์ •๋œ ๋…์„ฑ ๋น„์œจ์ด ๋‘ ๋ฐฐ๊ฐ€ ๋  ์ˆ˜ ์žˆ์œผ๋ฉฐ, ์ด๋Š” ๋ชจ๋ธ ์™„์„ฑ์—์„œ ์„ฑ๋ณ„ ๊ด€๋ จ ํŽธํ–ฅ์„ ๋ณด์—ฌ์ค๋‹ˆ๋‹ค.

  • Dataset used: WinoBias ๋ฐ์ดํ„ฐ์…‹์—์„œ ์ถ”์ถœํ•œ ํ”„๋กฌํ”„ํŠธ.
  • Model: GPTโ€‘2๊ฐ€ ๋‚จ์„ฑ ๋Œ€๋ช…์‚ฌ์™€ ์—ฌ์„ฑ ๋Œ€๋ช…์‚ฌ ํ”„๋กฌํ”„ํŠธ์— ๋Œ€ํ•œ ์™„์„ฑ์„ ์ƒ์„ฑํ•ฉ๋‹ˆ๋‹ค.
  • Metric: toxicity ์ธก์ •์œผ๋กœ, Facebook์˜ R4 ํ˜์˜ค ๋ฐœ์–ธ ๋ถ„๋ฅ˜๊ธฐ๋ฅผ ๋ž˜ํ•‘ํ•ฉ๋‹ˆ๋‹ค.
  • Result example:
    {"toxicity_ratio": 0.0}   // male prompts
    {"toxicity_ratio": 0.333} // female prompts
    
    ์—ฌ์„ฑ ๋Œ€๋ช…์‚ฌ ์™„์„ฑ์€ ๋…์„ฑ ์ถœ๋ ฅ ๋น„์œจ์ด ๋” ๋†’์Šต๋‹ˆ๋‹ค.
  • Usage: ๋ฉ”ํŠธ๋ฆญ์„ evaluate.load("toxicity") ๋กœ ๋กœ๋“œํ•˜๊ณ  compute(predictions=..., aggregation="ratio") ๋ฅผ ํ˜ธ์ถœํ•ฉ๋‹ˆ๋‹ค. aggregation์„ ์ƒ๋žตํ•˜๋ฉด ๊ฐ ์™„์„ฑ์— ๋Œ€ํ•œ ์›์‹œ ์ ์ˆ˜๊ฐ€ ๋ฐ˜ํ™˜๋ฉ๋‹ˆ๋‹ค(์˜ˆ: 0.0002 vs. 0.85).
  • Caveat: ๋†’์€ ๋…์„ฑ ์ ์ˆ˜์—๋Š” ํŠธ๋ฆฌ๊ฑฐ๊ฐ€ ๋˜๋Š” ์–ธ์–ด๊ฐ€ ํฌํ•จ๋  ์ˆ˜ ์žˆ์œผ๋ฏ€๋กœ, ์‚ฌ์šฉ์ž๋Š” ํ•ด๋‹น ์ฝ˜ํ…์ธ ๋ฅผ ์ฑ…์ž„๊ฐ ์žˆ๊ฒŒ ๋‹ค๋ฃจ์–ด์•ผ ํ•ฉ๋‹ˆ๋‹ค.

์–ธ์–ด ๊ทน์„ฑ (Regard) ์ธก์ •

Takeaway: CEO ํ”„๋กฌํ”„ํŠธ์— ๋Œ€ํ•œ ๋ชจ๋ธ ์™„์„ฑ์€ ํŠธ๋Ÿญ ์šด์ „์‚ฌ ํ”„๋กฌํ”„ํŠธ๋ณด๋‹ค ๋” ๊ธ์ •์ ์ธ ๊ทน์„ฑ์„ ๋ณด์ด๋ฉฐ, ์ง์—… ๊ธฐ๋ฐ˜ ํŽธํ–ฅ์„ ๋“œ๋Ÿฌ๋ƒ…๋‹ˆ๋‹ค.

  • Dataset used: ๋‹ค์–‘ํ•œ ์ธ๊ตฌ ์ง‘๋‹จ์— ๋Œ€ํ•œ ํ”„๋กฌํ”„ํŠธ๋ฅผ ํฌํ•จํ•˜๋Š” BOLD ๋ฐ์ดํ„ฐ์…‹์˜ ์„œ๋ธŒ์…‹.
  • Model: GPTโ€‘2๊ฐ€ ๋‘ ์ง์—… ๊ทธ๋ฃน(ํŠธ๋Ÿญ ์šด์ „์‚ฌ vs. CEO)์— ๋Œ€ํ•œ ์™„์„ฑ์„ ์ƒ์„ฑํ•ฉ๋‹ˆ๋‹ค.
  • Metric: regard ์ธก์ •(evaluate.load("regard", "compare") ๋กœ ๋กœ๋“œ). negative, neutral, other, positive์— ๋Œ€ํ•œ ๊ทน์„ฑ ๋ถ„ํฌ๋ฅผ ๋ฐ˜ํ™˜ํ•ฉ๋‹ˆ๋‹ค.
  • Result example:
    {"negative": 0.14, "neutral": 0.29, "other": -0.11, "positive": -0.32}
    
    CEO ์™„์„ฑ์˜ ๊ธ์ • ์ ์ˆ˜๊ฐ€ ๋” ๋†’์•„ ํ•ด๋‹น ์ง์—…์— ๋Œ€ํ•œ ๋” ํ˜ธ์˜์ ์ธ ์‹œ๊ฐ์„ ๋‚˜ํƒ€๋ƒ…๋‹ˆ๋‹ค.
  • Interpretation: ๊ทธ๋ฃน ๊ฐ„ regard ์ ์ˆ˜ ์ฐจ์ด๋ฅผ ๊ณ„์‚ฐํ•จ์œผ๋กœ์จ, ์‹ค๋ฌด์ž๋Š” ํŠน์ • ์ •์ฒด์„ฑ์— ๋Œ€ํ•œ ์ฒด๊ณ„์ ์ธ ํ˜ธ์˜ ๋˜๋Š” ๋น„๋‚œ์„ ๋“œ๋Ÿฌ๋‚ผ ์ˆ˜ ์žˆ์Šต๋‹ˆ๋‹ค.

์ƒ์ฒ˜๋ฅผ ์ฃผ๋Š” ๋ฌธ์žฅ ์™„์„ฑ (HONEST)

Takeaway: HONEST ๋ฉ”ํŠธ๋ฆญ์€ ๋ ˆ์ฆˆ๋น„์–ธ ํ”„๋กฌํ”„ํŠธ์— ๋Œ€ํ•ด ๋” ๋งŽ์€ ์ƒ์ฒ˜๋ฅผ ์ฃผ๋Š” ์™„์„ฑ์„ ํ‘œ์‹œํ•˜๋ฉฐ, ์ด๋Š” ์„ฑ๋ณ„ ๋ฐ ์„ฑ์  ์ง€ํ–ฅ ํŽธํ–ฅ์„ ๋ณด์—ฌ์ค๋‹ˆ๋‹ค.

  • Dataset used: HONEST ํ”„๋กฌํ”„ํŠธ ์„ธํŠธ(LGBTQAI+ ๊ทธ๋ฃน์„ ์œ„ํ•œ ์˜์–ด ํ…œํ”Œ๋ฆฟ).
  • Model: GPTโ€‘2๊ฐ€ "lesbian" ๋ฐ "gay" ๊ทธ๋ฃน์„ ๋Œ€์ƒ์œผ๋กœ ํ•˜๋Š” ํ”„๋กฌํ”„ํŠธ์— ๋Œ€ํ•œ ์™„์„ฑ์„ ์ƒ์„ฑํ•ฉ๋‹ˆ๋‹ค.
  • Metric: honest ์ธก์ •, evaluate.load("honest", "en") ๋กœ ๋กœ๋“œ.
  • Result example:
    {"honest_score_per_group": {"lesbian": 0.333, "gay": 0.0}}
    
    ์ ์ˆ˜๊ฐ€ ๋†’์„์ˆ˜๋ก ๋” ์ƒ์ฒ˜๋ฅผ ์ฃผ๋Š” ์™„์„ฑ์„ ์˜๋ฏธํ•˜๋ฉฐ, ๋ ˆ์ฆˆ๋น„์–ธ ๊ทธ๋ฃน์ด ๋” ๋†’์€ ์ ์ˆ˜๋ฅผ ๋ฐ›์•˜์Šต๋‹ˆ๋‹ค.
  • Flexibility: ์‚ฌ์šฉ์ž๋Š” topโ€‘k ์ƒ˜ํ”Œ๋ง ํŒŒ๋ผ๋ฏธํ„ฐ๋ฅผ ์กฐ์ •ํ•˜์—ฌ ๋Œ€์ฒด ์™„์„ฑ ์ˆ˜๊ฐ€ HONEST ์ ์ˆ˜์— ์–ด๋–ป๊ฒŒ ์˜ํ–ฅ์„ ๋ฏธ์น˜๋Š”์ง€ ํƒ์ƒ‰ํ•  ์ˆ˜ ์žˆ์Šต๋‹ˆ๋‹ค(์›๋ณธ HONEST ๋…ผ๋ฌธ ์ฐธ๊ณ ).

๋…ผ์˜ ๋ฐ ํ•œ๊ณ„

Takeaway: ๊ธฐ์กด ํŽธํ–ฅ ๋ฐ์ดํ„ฐ์…‹์€ ๋ฒ”์œ„๊ฐ€ ์ œํ•œ์ ์ด๋ฉฐ ๋ณต์žกํ•œ ์ •์ฒด์„ฑ์„ ์ด์ง„ ๋˜๋Š” ๋ฒ”์ฃผํ˜• ๋ผ๋ฒจ๋กœ ์ถ•์†Œํ•˜๋Š” ๊ฒฝ์šฐ๊ฐ€ ๋งŽ์Šต๋‹ˆ๋‹ค; ์—ฌ๋Ÿฌ ๋ณด์™„์ ์ธ ๋ฉ”ํŠธ๋ฆญ์„ ํ•จ๊ป˜ ์‚ฌ์šฉํ•ด์•ผ ํ•ฉ๋‹ˆ๋‹ค.

  • Hugging Face๋Š” ๋Šฅ๋ ฅ ์ƒํƒœ์™€ ์—ฐ๋ น๊ณผ ๊ฐ™์€ ์†Œ์™ธ๋œ ์ฐจ์›์„ ํฌ์ฐฉํ•˜๋Š” ์ถ”๊ฐ€ ๋ฐ์ดํ„ฐ์…‹ ๊ธฐ์—ฌ๋ฅผ ์ปค๋ฎค๋‹ˆํ‹ฐ์— ์žฅ๋ คํ•ฉ๋‹ˆ๋‹ค.
  • ๋ธ”๋กœ๊ทธ๋Š” ํ˜„์žฌ ๋ฐ์ดํ„ฐ์…‹ ๊ธฐ๋ฐ˜ ํŽธํ–ฅ ํ‰๊ฐ€๊ฐ€ ์ „์ฒด ์ง„์‹ค๋กœ ๊ฐ„์ฃผ๋˜์–ด์„œ๋Š” ์•ˆ ๋˜๋ฉฐ, ๋ชจ๋ธ ํ–‰๋™์— ๋Œ€ํ•œ ๋ถ€๋ถ„์ ์ธ ๊ด€์ ์„ ์ œ๊ณตํ•œ๋‹ค๋Š” ์ ์„ ๊ฐ•์กฐํ•ฉ๋‹ˆ๋‹ค.
  • ๋…์„ฑ, regard, HONEST ์ ์ˆ˜๋ฅผ ๊ฒฐํ•ฉํ•˜๋ฉด ๋‹ค์–‘ํ•œ ์‚ฌํšŒ ์ถ•์— ๊ฑธ์นœ ๋ชจ๋ธ ์ ํ•ฉ์„ฑ์— ๋Œ€ํ•œ ๋ณด๋‹ค ์ „์ฒด์ ์ธ ๊ด€์ ์„ ์ œ๊ณตํ•  ์ˆ˜ ์žˆ์Šต๋‹ˆ๋‹ค.

๊ฐ์‚ฌ

์ €์ž๋“ค์€ Federico Bianchi, Jwala Dhamala, Sam Gehman, Rahul Gupta, Suchin Gururangan, Varun Kumar, Kyle Lo, Debora Nozza, ๊ทธ๋ฆฌ๊ณ  Emily Sheng์—๊ฒŒ ๐Ÿค— Evaluate ๋ฐ Datasets ๋ผ์ด๋ธŒ๋Ÿฌ๋ฆฌ์— ๋ฐ์ดํ„ฐ์…‹๊ณผ ํ‰๊ฐ€ ์Šคํฌ๋ฆฝํŠธ๋ฅผ ์ถ”๊ฐ€ํ•œ ๊ณตํ—Œ์— ๋Œ€ํ•ด ๊ฐ์‚ฌ๋ฅผ ํ‘œํ•ฉ๋‹ˆ๋‹ค.

Sources