VocabOwl: 分析科學單字量挑戰
VocabOwl 是一款詞彙評估工具,旨在估算使用者在約 171,476 個英文單字中掌握了多少個。該應用程式利用基於分層抽樣的 100 題挑戰,來提供使用者總詞彙量的「科學估算」。
方法論與計算邏輯
VocabOwl 根據單字頻率將英文分為五個不同的難度等級,以進行分層抽樣。總詞彙量估算值是透過將每個等級內的準確率乘以該等級的單字總數,然後將這些總數相加而得。
難度等級定義如下:
- Core Basics: ~3,000 單字
- Intermediate: ~7,000 單字
- Advanced: ~10,000 單字
- Expert: ~25,000 單字
- The Obscure: ~40,000+ 單字
數學上的差異
批評者指出計算中存在一個根本性的結構錯誤。雖然該工具聲稱能估算約 170,000 個單字的知識量,但定義的分層總計僅約 85,000 個單字。因此,即使使用者回答所有問題都正確,得到的估算值也僅約 85,000 個單字,這實際上將最高可能得分限制在聲稱總詞彙量的 50%。
使用者體驗與測試設計缺陷
使用者回報了幾項關於可用性以及測試題目有效性的問題,這表明結果可能會因為題目設計不佳而導致虛高。
題目設計與「投機取巧」
多位使用者注意到多選題的選項是可預測的,讓使用者在不知道單字的情況下也能猜出正確答案:
- Pattern Recognition: 使用者觀察到正確答案通常是選項中最長的一個。
- Antonym Patterns: 許多題目遵循一種結構:一個正確答案、一個直接相反的詞、以及兩個無關的選項,這讓使用者可以排除隨機選項,將勝率提高到 50%。
- Circular Definitions: 一些定義被批評為循環定義(例如,將 "lethargic" 定義為 "affected by lethargy")。
- LLM Bias: 有建議認為這些單字是由 LLM 生成的,因為樣本嚴重偏向與演講、說服以及單字本身相關的概念。
UX Friction
使用者對介面的回饋強調了過多的點擊動作,使用者指出,必須先點擊定義,然後再點擊另一個提交按鈕,這破壞了 100 題測試的流程。
社群批評與建議改進方向
技術使用者與語言學家建議了幾種提高 VocabOwl 評估準確度與效率的方法。
Adaptive Testing
與其使用固定的 100 題測試,使用者建議實施如 Elo 或 Glicko-2 的自適應演算法。這將允許系統透過即時調整單字的難度,更快速地地校準使用者的技能水平,避免使用者在已經達到進階程度時,仍需費力處理「簡單」單字。
Reducing Guessing Bias
為了防止透過運氣或應試技巧導致的分數虛高,使用者強烈建議增加一個「我不知道」的選項。這將確保使用者不會因為對不認識的單字有 25% 的隨機成功率而被計入分數。
Stratification Validity
部分使用者質疑難度等級的有效性。例如,像 "metamorphosis" 和 "kinetic" 這樣的單字被標記為 "expert",儘管它們是小學和高中科學課程中的常見術語。相反地,some "intermediate" 單字被認為過於生僻。
"我第一次嘗試就答對了全部 100 題,完全沒有查閱任何資料!令人困惑的是,這竟然只得到一個『科學估算』,說我認識約 85,000/~170,000 個單字?"