大西洋两岸的一波报道让监管机构两年来一直担心的问题得到了证实:当人们向人工智能聊天机器人询问有关他们的资金的问题时,答案错误的情况多于正确的情况。据英国《金融时报》报道,英国最近的一项研究发现,人工智能聊天机器人“大多数时候”对金融查询给出了错误的答案。

有关最新的 AI 重大新闻和分析,请访问 AI Buzz Wire

研究发现了什么

头条数据来自贸易出版物 Financial Reporter,该报在 9 月初援引 Saturn 的研究报道称,人工智能模型在 57% 的情况下给出了错误的财务建议。 IBS Intelligence 报告的错误率同样为 57%。雅虎财经的报道描述了与英国退休平台 PensionBee 相关的研究,而 BeInCrypto 报道称,该测试涵盖了大约 10,000 个答案。最初报道的不同归因表明该研究涉及多方;各网点的一致线索是故障率的规模。

这些错误并不是抽象的。美国抵押贷款专业人士强调了报道中的一个例子:一个聊天机器人告诉抵押贷款借款人,暂停还款不会影响他们的信用评分。它可以——而且对于一个根据这个答案做出重大财务决定的家庭来说,这种区别是昂贵的。

到了本周,这个故事已经成为主流。 《投资新闻》以“研究发现,人工智能聊天机器人在大多数情况下给出错误的财务答案”为标题进行了报道,《汤姆指南》警告读者,根据研究结果,人工智能可能会让他们付出金钱代价。

一种模式,而非异常值

英国的研究结果是在越来越多得出类似结论的研究之上进行的。此前 3 月份广泛报道的一项分析发现,ChatGPT 在金钱问题上给出错误答案的概率约为 35%。据报道,斯坦福大学和麻省理工学院的研究人员 8 月份发现,人工智能为女性提供的投资建议比男性更差。英国《金融时报》在 8 月份报道称,近一半的英国年轻人错误地认为人工智能财务建议受到监管——这种认知差距使得不准确的答案变得更加危险,而不是更少。

不管怎样,使用量仍在不断攀升。 NerdWallet 的年中数据报告发现,大量美国人已经在使用聊天机器人提供财务建议,这正是准确度调查结果引起消费者权益倡导者关注的原因,而不是被视为学术琐事。

为什么财务问题会破坏聊天机器人

财务建议位于大型语言模型最难发现的所有事物的交叉点。正确答案取决于现行的、特定司法管辖区的规则——税收起征点、信用评分机制、养老金法规——这些规则会因国家/地区的不同而变化。这些模型还倾向于用听起来自信的笼统来对冲,而用户通常不会提供决定通用指导是否适用于他们的个人背景(收入、现有债务、目标)。

金钱还存在一个独特的不对称问题:对一首诗的错误答案令人尴尬,但对付款假期的信用影响的错误答案可能会在几个月后造成真正的财务损失。

监管机构和用户应该从中得到什么

英国监管机构至少从 2025 年底开始就不受监管的人工智能财务指导向消费者发出警告,当时《卫报》报道了关于聊天机器人提供不准确财务建议的官方警告。新研究给出了这些警告的具体失败率。明智的解读并不是人工智能对个人理财毫无用处——模型可以很好地解释概念——而是教育和建议之间的界限对用户来说仍然模糊,只有在监管机构的规则手册中才清晰可见。

在聊天机器人对特定领域的金融问题的准确性大幅提高之前,该研究报道的实际指导很简单:将人工智能货币答案视为研究的起点,而不是决策本身,并在采取行动之前根据受监管的来源验证任何重要的信息——信贷影响、税收处理、养老金规则。

保持人工智能领先地位

如需持续报道人工智能行业最重要的发展,请添加书签 AI Buzz Wire,不错过任何重大新闻。

阅读更多人工智能新闻