Os principais chatbots de IA dão respostas erradas a questões financeiras com mais frequência, de acordo com um novo relatório de pesquisa da fintech Saturn do Reino Unido que testou 18 dos modelos de IA mais populares e encontrou uma taxa média de erro de 57%, informou o Financial Times na segunda-feira.
O relatório, intitulado “Autoridade Artificial”, chega num momento em que milhões de consumidores recorrem cada vez mais aos chatbots para obter orientação sobre pensões, impostos, dívidas e poupanças – questões em que uma única resposta errada pode ter consequências financeiras reais. À medida que os assistentes de uso geral são empurrados para um território regulamentado, estudos como este estão a tornar-se um teste de resistência recorrente às promessas do consumidor da indústria, e continuaremos a acompanhar os mais recentes desenvolvimentos da IA à medida que os reguladores respondem.
Como o teste funcionou
A equipe de domínio da Saturn analisou 18 dos modelos de IA mais utilizados em 121 questões que abrangem pensões, impostos, dívidas e poupanças – as principais áreas onde os consumidores de varejo mais frequentemente procuram aconselhamento. Os modelos testados incluíram ChatGPT, Gemini, Claude e Copilot da Microsoft, de acordo com o resumo publicado no relatório.
Em média, os modelos cometeram erros 57% das vezes, disse Saturn. A empresa enquadrou as conclusões como abrangendo "relativas a erros e falhas na protecção do consumidor" e utilizou-as para argumentar que a lacuna de aconselhamento do Reino Unido - a lacuna entre as pessoas que podem aceder a aconselhamento financeiro regulamentado e aquelas que não podem - não será colmatada apenas por chatbots não regulamentados.
Até o melhor modelo errou com frequência
Os resultados não foram uniformes, mas mesmo o melhor desempenho falhou muitas vezes. De acordo com o relatório do FT, o modelo com melhor desempenho foi o Claude Opus 5 da Anthropic rodando em modo de raciocínio – e ainda cometeu erros em 39% das respostas.
Esse detalhe pode vir a ser a conclusão mais importante do relatório. Os modos de raciocínio, que permitem aos modelos deliberar antes de responder, são a principal resposta da indústria à alucinação e ao erro, e os modelos de fronteira apresentam rotineiramente bons resultados em exames profissionais em finanças e direito. Uma taxa de erro de 39% em questões financeiras práticas sugere que os benchmarks do tipo exame e as consultas dos consumidores do mundo real medem coisas muito diferentes.
As descobertas também geraram resistência. Os comentaristas do Hacker News questionaram a metodologia e a seleção do modelo, observando que vários dos erros de exemplo do relatório vieram de modelos menores de nível gratuito. Mas a média de 57% e o valor de 39%, o melhor da categoria, são afirmações publicadas pela Saturn e pelo FT, e o alerta central do relatório - de que os consumidores não devem tratar a produção do chatbot como aconselhamento regulamentado - não foi contestado.
Um aviso que os reguladores já ouviram antes
O relatório chega em meio ao crescente desconforto oficial sobre os chatbots em questões financeiras. Os consumidores do Reino Unido já foram alertados sobre os chatbots de IA que prestam aconselhamento financeiro impreciso num alerta amplamente divulgado publicado pelo The Guardian no final de 2025, e os reguladores financeiros em toda a Europa e nos Estados Unidos sinalizaram desde então o aconselhamento gerado por IA como uma área emergente de risco para o consumidor.
A própria posição da Saturn confere ao relatório uma vantagem particular: a empresa desenvolve ferramentas de IA para aconselhamento financeiro e publicou as conclusões não como uma rejeição da IA nas finanças, mas como um argumento para acertar as barreiras de protecção. O seu argumento é que os chatbots mal governados já estão a preencher a lacuna de aconselhamento por defeito, e que a escolha que os reguladores enfrentam é entre orientação supervisionada por IA e orientação não supervisionada por IA – e não entre IA e aconselhamento humano.
A contribuição da Saturn para esse debate é um argumento sobre a concepção de políticas: a empresa diz que uma mudança do que chama de regulamentação excessiva para a colocação de barreiras práticas em grandes modelos de linguagem reduziria mais rapidamente a lacuna de aconselhamento, ao mesmo tempo que protegeria as pessoas de orientações não regulamentadas de IA. Em outras palavras, em vez de manter a IA totalmente fora do aconselhamento financeiro, crie implantações supervisionadas e restritas que possam atender com segurança clientes cujos consultores humanos são muito caros para alcançar.
Esse enquadramento é importante porque a lacuna de aconselhamento é a justificação mais forte da indústria para estar neste espaço. No Reino Unido, a maioria das famílias está fora do limiar em que o aconselhamento financeiro regulamentado é considerado economicamente viável, que é precisamente o da população que agora pergunta aos chatbots sobre pensões e dívidas.
O que os consumidores devem levar embora
Até que os modelos melhorem ou os reguladores intervenham, a orientação prática da investigação é simples:
- Trate as respostas do chatbot sobre impostos, pensões, dívidas e poupanças como um ponto de partida para investigação, e não como aconselhamento.
- Verifique qualquer valor específico – limites, taxas, subsídios – em relação a uma fonte oficial antes de agir sobre ele.
- Seja especialmente cauteloso com modelos de nível gratuito, que podem ser mais antigos ou menores do que as versões principais promovidas por um laboratório.
- Para decisões consequentes, um consultor humano regulamentado continua a ser o único canal com responsabilidade legal associada.
A questão mais ampla que o relatório levanta é aquela que a indústria da IA enfrentará repetidamente em 2026: a capacidade que impressiona em demonstrações e benchmarks ainda pode ficar aquém do nível de fiabilidade que os domínios regulamentados exigem. A consultoria financeira é simplesmente a primeira área onde essa lacuna foi quantificada de forma tão nítida.
Fique à frente da IA
Acompanhar como a IA está remodelando as finanças, a pesquisa e a regulamentação? Leia mais notícias sobre IA no AI Buzz Wire — cobertura independente de IA, todos os dias.
---
Fique à frente da IAReceba as últimas notícias, análises e avanços sobre IA — tudo em um só lugar.
Leia mais notícias sobre IA →