Telegram

ИИ-модели ChatGPT, Claude, Gemini, Grok и Copilot ошибаются в 57% ответов на финансовые вопросы, — FT со ссылкой на исследование Saturn

На сложных вопросах, где нужно больше одного вычисления, доля ошибок выросла до 88%, а у отдельных моделей — до 99%. Модели ошибались в расчётах, упускали предстоящие изменения налогового законодательства и выдумывали несуществующие правила. Цена таких ошибок измеряется деньгами. Бесплатная Claude Haiku 4.5 ошиблась в правилах налогообложения пенсий: вкладчику, последовавшему совету, грозил штраф 17 500 фунтов стерлингов от налоговой службы Великобритании HMRC. Точнее отвечали платные и более новые версии. Лучший результат из 18 протестированных моделей показала Claude Opus 5 в режиме рассуждения, но и она ошибалась в 39% ответов. При этом спрос на ИИ-советы растёт: по данным британского регулятора FCA, каждый пятый взрослый в стране готов доверить ИИ финансовые решения. В Saturn призывают FCA быстрее заняться регулированием таких консультаций. #Технологии

Источник: IF News