Anthropic 教育報告:AI 流暢度指數
Anthropic 推出了 AI 流暢度指數(AI Fluency Index),這是一項基準衡量標準,旨在追蹤個人如何隨著時間發展出有效使用 AI 的技能。研究顯示,AI 流暢度最常見的表現形式是增強型協作——將 AI 視為思考夥伴——並且與那些進行迭代優化而非直接接受初始輸出的使用者之間有最強的相關性。
4D AI 流暢度框架
為了量化流暢度,Anthropic 利用了由 Rick Dakan 教授與 Joseph Feller 教授開發的 4D AI 流暢度框架。該框架定義了 24 種體現安全且有效的人機協作行為。
在此研究中,研究人員專注於 Claude.ai 與 Claude Code 對話中 11 種可直接觀察到的行為。其餘 13 種行為(例如對 AI 在工作中的角色保持誠實,或考慮分享輸出的後果)發生在聊天介面之外,需要透過定性評估進行未來的研究。
方法論
- 樣本量: 9,830 場匿名對話。
- 時間範圍: 2026 年 1 月的 7 天窗口期。
- 工具: 使用 Anthropic 的隱私保護工具 Clio 進行分析。
- 驗證: 結果已針對不同星期幾及多種語言的一致性進行了驗證。
關鍵發現:迭代與辨別力
迭代作為流暢度的驅動力
迭代與優化——在先前對話的基礎上進行構建以改進工作——是所有其他流暢度行為中最強的單一相關因素。
- 普遍性: 85.7% 的樣本對話展現了迭代與優化。
- 影響力: 與非迭代對話(1.33)相比,涉及迭代的對話展現了兩倍以上的流暢度行為(平均增加 2.67 種行為)。
- 評估: 進行迭代的使用者更有可能質疑模型的推理過程(5.6 倍),且更有可能識別出缺失的上下文(4 倍)。
「人工製品悖論」(Artifact Paradox)
當使用者建立人工製品(Artifacts,如程式碼、文件或互動式工具)時,其行為會轉向更高的指令性但較低的批判性評估。
- 增加的指令性: 在基於人工製品的對話中(樣本佔 12.3%),使用者更有可能澄清目標(+14.7pp)、指定格式(+14.5pp)以及提供範例(+13.4pp)。
- 降低的辨別力: 儘管指令性更高,這些使用者卻較少可能識別缺失的上下文(-5.2pp)、檢查事實(是否正確)(-3.7pp)或質疑模型的推理(-3.1pp)。
Anthropic 建議這可能是因為精美且具備功能感的輸出會讓使用者假設工作已經完成,或者因為使用者透過聊天紀錄中不可見的外部手段(例如執行程式碼)來評估人工製品。
培養 AI 流暢度的建議
根據數據模式,Anthropic 指出了使用者改進的三個主要領域:
- 優先考慮迭代: 將初始回應視為起點。使用者應提出後續問題並針對不準確之處提出異議,以優化輸出。
- 批判性地評估精美的輸出: 當輸出看起來很專業時,使用者應有意識地停下來驗證其準確性與推理過程,因為精美的視覺效果往往與較低的批判性評估率相關。
- 定義協作條款: 僅有 30% 的使用者明確告訴 AI 如何與他們互動。鼓勵使用者設定期望,例如要求 AI 「如果我的假設錯誤,請提出異議」或「帶我了解你的推理過程」。
研究限制
Anthropic 指出關於 AI 流暢度指數的幾點注意事項:
- 人口統計偏誤: 樣本由 Claude.ai 的早期採用者組成,可能無法代表一般大眾。
- 範圍: 研究僅追蹤了 24 個框架行為中的 11 種;倫理與負責任的使用行為未被納入。
- 衡量方式: 研究對行為採用二元分類(存在/不存在),這可能會錯失細微差別。
- 隱含性評估: 使用者可能在心理上或透過外部手段進行事實檢查,而未在對話中記錄下來。
- 相關性而非因果關係: 研究結果是相關性的,並未證明某種行為會導致另一種行為。
未來研究方向
Anthropic 打算透過進行隊列分析(cohort analyses)來擴大此研究,以比較新使用者與經驗豐富的使用者,並使用定性方法來評估非觀察性行為。此外,該實驗室計畫進一步探索 Claude Code 中的 AI 流暢度,以確定軟體開發人員是否展現出不同的流暢度模式。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch