Нейросети ошибаются в финансовых задачах в 57–99% случаев — исследование Saturn

Исследователи использовали список из более чем 100 финансовых вопросов, каждый из которых мог повторяться до пяти раз

Нейросети ошибаются в финансовых задачах в 57–99% случаев — исследование Saturn
Фото: Динар Фатыхов

Технологическая компания Saturn протестировала популярные ИИ-модели — ChatGPT, Claude, Copilot, Grok, Gemini и другие — на способность решать финансовые задачи. Результаты, которые приводит Financial Times, оказались неутешительными: на усреднённые вопросы нейросети ошибались в 57% случаев, на более сложные — в 99%.

Исследователи использовали список из более чем 100 финансовых вопросов, каждый из которых мог повторяться до пяти раз. Выяснилось, что ИИ-модели ошибаются в вычислениях, игнорируют предстоящие изменения в налоговом законодательстве и выдумывают несуществующие нормы. Лучше всего чат-боты справились с составлением бюджета.

«Миллионы людей доверяют моделям искусственного интеллекта в вопросах финансов, но они получают неправильные ответы, из-за которых могут потерять свои деньги», — отметил исполнительный директор Saturn Амаль Джоли.

Лучший результат в исследовании показала модель Claude Opus 5 в режиме «рассуждений». Тем не менее, даже она не продемонстрировала достаточной надёжности для работы с финансами без контроля человека.

Дмитрий Зайцев

Подписывайтесь на телеграм-канал, группу «ВКонтакте», канал в MAX и страницу в «Одноклассниках» «Реального времени». Ежедневные видео на Rutube и «Дзене».

ТехнологииITОбществоБизнес

Новости партнеров