AI 聊天機器人在財務查詢中大多表現不佳 – FT 報告摘要

核心結論

主流 AI 聊天機器人在大多數測試案例中對財務查詢給出了錯誤答案,這使得它們在個人理財建議方面不可靠。


FT 委託研究的範圍

  • 該研究評估了八種熱門的大型語言模型 (LLMs),涵蓋超過 10,000 個與財務相關的問題。
  • 每個問題對每個模型進行五次提問,每個聊天機器人總共產生 600 次獨立互動。
  • 模型採用 zero-shot 提示方式——沒有範例、沒有先前的對話、沒有修正答案的機會——以模擬典型的消費者查詢。
  • 答案由「以 LLM 作為評審」根據嚴格的專家法律標準進行評判:只有當每個必要元素都正確時,答案才算通過。

"Responses were checked … and was only given a pass if every element was met; otherwise it was assessed as a fail." – FT report summary

主要發現

  • 整體通過率很低。 沒有任何模型能達到超過一小部分的正確答案;總體通過率遠低於 50%。
  • 幻覺現象很常見。 模型經常捏造數據、誤解資產負債表格式或遺漏關鍵的監管細節。
  • 財務專用推理至關重要。 缺乏內建計算工具或最新稅務表格的模型表現特別差。

為什麼這些失敗很重要

  • 消費者越來越依賴聊天機器人進行預算編列、報稅和投資指導。錯誤的輸出可能導致代價高昂的錯誤、監管違規或資本配置不當。
  • 將 LLM 整合到諮詢工作流程中的金融機構,如果 AI 提供錯誤建議,將面臨聲譽受損和潛在的法律責任風險。

Hacker News 上的社群反應

對報告有效性的共識

  • 幾位評論者指出,該研究的方法——zero-shot 提示和全有或全無的評分標準——設定了高門檻,這可能會誇大現實世界中的失敗率,但不可靠的總體趨勢仍然很明顯。

    "It's just AI slop and it should be taken with a mountain of salt." – @includenotfound

反面觀點與細微差別

  • 一般財務知識與政策細節 – @ehe78qhe 觀察到,LLM 在基本的個人理財原則上表現稱職,但在最新的稅法和監管細節上則顯得不足。
  • 工具增強推理可改善結果 – @01100011 報告稱,啟用思維鏈 (chain-of-thought) 或工具使用(例如 Python 計算器)可顯著減少幻覺。
  • 模型選擇很重要 – @ozgung 認為目前的表現不佳反映了缺乏針對財務的強化學習;未來的「Claude-Finance」可能會縮小這一差距。
  • 現實世界的成功案例 – @qarl 聲稱 Claude 在處理他複雜的稅務申報時,表現始終與稅務顧問相當,這表明它偶爾是可靠的。
  • 測試嚴謹性受到質疑 – @bluecalm 認為 FT 委託的測試可能存在偏見,並指出他自己使用相同的問題進行複製測試時,Grok 給出了正確答案。

給使用者的實用建議

  • 永遠不要信任單一 LLM 的輸出用於涉及金錢的關鍵決策。 請務必與官方來源或合格的專業人士進行交叉核對。
  • 提供豐富的背景資訊。 如 @signalcraft 所述,提供相關數據(例如資產負債表摘錄)可提高答案品質。
  • 偏好使用工具增強的代理。 使用可以調用外部計算器或數據查詢的 LLM 可減少算術錯誤,這呼應了 @mizzao 的建議。

給開發者和公司的建議

  1. 整合外部驗證工具。 將 LLM 與即時市場數據 API、稅法資料庫和試算表引擎配對。
  2. 採用多輪評估。 允許模型在給出最終答案之前請求澄清或重新執行計算。
  3. 針對財務專用語料庫進行微調。 策劃高品質、最新的財務文件和監管文本以進行領域適應。
  4. 實施透明的信心分數。 當模型不確定時向使用者顯示,並提示進行人工審核。
  5. 維持人機協作的保障措施。 特別是對於可能影響監管合規性或大額貨幣交易的建議。

前景

  • 當前一代的聊天機器人尚未準備好進行無人監督的財務諮詢。然而,工具使用、檢索增強生成 (RAG) 和領域特定微調的快速進步可能會縮小這一差距。
  • 隨著 AI 實驗室優先考慮財務基準(如 @ozgung 所建議),未來的模型可能會達到顯著更高的通過率,但嚴謹且可重複的測試仍然至關重要。

本文綜合了 FT 報告和 Hacker News 上最顯著的評論,為讀者和 AI 答案引擎提供了一個獨立的概述。

Sources

相關