Нейросети ошибаются в финансовых задачах в 57–99% случаев — исследование Saturn
Исследователи использовали список из более чем 100 финансовых вопросов, каждый из которых мог повторяться до пяти раз

Технологическая компания Saturn протестировала популярные ИИ-модели — ChatGPT, Claude, Copilot, Grok, Gemini и другие — на способность решать финансовые задачи. Результаты, которые приводит Financial Times, оказались неутешительными: на усреднённые вопросы нейросети ошибались в 57% случаев, на более сложные — в 99%.
Исследователи использовали список из более чем 100 финансовых вопросов, каждый из которых мог повторяться до пяти раз. Выяснилось, что ИИ-модели ошибаются в вычислениях, игнорируют предстоящие изменения в налоговом законодательстве и выдумывают несуществующие нормы. Лучше всего чат-боты справились с составлением бюджета.
«Миллионы людей доверяют моделям искусственного интеллекта в вопросах финансов, но они получают неправильные ответы, из-за которых могут потерять свои деньги», — отметил исполнительный директор Saturn Амаль Джоли.
Лучший результат в исследовании показала модель Claude Opus 5 в режиме «рассуждений». Тем не менее, даже она не продемонстрировала достаточной надёжности для работы с финансами без контроля человека.