AI 财务建议:MIT 研究发现 LLM 有效但依赖提示词

LLM 提供高质量的基准财务指导

来自 MIT Sloan School of Management 的研究表明,遵循 AI 生成的财务建议可以为几乎所有 30 岁以上的个人带来可观的储蓄缓冲。大语言模型 (LLMs) 一致地引导用户走向基本的财务最佳实践,包括在工作期间增加储蓄、投资于多元化的股票基金,以及在接近退休时(特别是 45 岁以后)减少股票风险敞口。

根据 MIT Sloan 财务助理教授 Taha Choukhmane 的说法,LLMs 为传统的真人财务顾问提供了一种负担得起且易于获取的替代方案,帮助用户绕过与专业人工指导相关的昂贵成本和潜在的利益冲突。

“提示词差距”:专家 vs. 初学者查询

AI 财务建议的质量在很大程度上取决于提示词的结构。研究发现,“常规”用户提示词与“学术”提示词之间存在显著的性能差距:

  • 初学者提示词: 普通用户通常会问简单、狭窄的问题(例如,“我可以用 50 美元开始投资吗?”)。这些提示词往往会引发缺乏细微差别的“经验法则”式回答。
  • 学术提示词: 当研究人员使用包含完整财务数据的结构化提示词时——包括年龄、工作状态、收入、储蓄余额以及特定的经济假设(如税法和 Social Security 规则)——LLMs 提供的建议显著更好、更具针对性。

尽管有了这些改进,LLMs 在主动投资组合再平衡和应对突发财务冲击方面仍然面临困难。例如,模型经常建议失业的用户过度激进地削减开支,即使这些用户拥有足够的储蓄来度过转型期。

人口统计学差异与财富差距

研究强调了一个令人担忧的趋势:AI 建议可能会在无意中扩大财富差距,因为输出的质量取决于用户现有的财务素养和人口统计特征。

按用户特征划分的财富结果

用户中为男性、财务素养较高或有 AI 使用经验的用户,在退休时积累的财富比其他人多出约 5%。具体而言:

  • 性别与素养: LLMs 向男性和财务素养较高的用户推荐了更高的股票配置。这导致女性和素养较低的用户在 60 岁时的财富比其他人低了约 50,000 美元 (4%)。
  • AI 经验: 不熟悉 AI 的用户收到的储蓄率建议较低,导致其在 60 岁时的财富比有经验的 AI 用户少赚了近 100,000 美元 (6%)。

偏见来源

这些差异源于两个主要来源。首先,用户提出的问题不同;研究指出,女性更频繁地提到“家庭”和“杂货”,而男性则使用“策略”和“增长”等术语。其次,模型本身可能表现出偏见;大约三分之一的性别财富差距归因于模型在面对相同的提示词但被标记为来自女性而非男性时,改变了其建议。

对金融行业的启示

对消费者

为了最大限度地利用 AI 财务工具的效用,用户应超越简单的提问,并在提示词中采用生命周期规划和投资组合理论。专家建议将 AI 作为建立财务理解的工具,而不是盲目跟随其输出。AI 最适合作为人类顾问的补充——帮助用户在每半年的真人顾问咨询之间实时实施专业建议。

对企业

LLMs 正在改变消费者发现金融产品的方式。研究发现,AI 经常推荐特定的供应商(例如 Vanguard 或 iShares),即使在用户未提及它们的情况下。这表明,对于金融公司而言,在 LLM 推荐模式中的可见度可能比传统的搜索引擎优化 (SEO) 或直接营销变得更加重要。

社区观点与反论点

技术用户和从业者之间的讨论为 MIT 的研究结果提供了额外的背景:

  • The “Normie” Baseline(普通人基准): 一些用户认为 AI 只是在提炼“常识”或“财务平庸之谈”。正如一位用户所言,“你可以用一张写着‘存下收入的 10% 并将其投资于 ETF’的纸来代替 AI,它的表现会优于人们日常收到的财务‘建议’。”
  • The Human Element(人为因素): 批评者指出,财务规划往往更多关乎心理学而非数学。

“难点在于行为/情感/心理层面,而非技术层面……这就是真人顾问的价值所在。理解客户并建立信心/舒适感。”

  • Practical Utility(实际效用): 一些用户报告称,使用 AI 处理复杂任务的成功率很高,例如检测税款多缴、分析来自预算软件(例如 YNAB)的 CSV 导出文件以识别会计师错过的消费模式。
  • Risk of Monetization(变现风险): 有人担心,随着 AI 成为财务建议的主要界面,回答可能会受到广告的影响,模型可能会为了换取金融公司的报酬而将用户引导向高风险产品。

Sources