Эксперимент с 1053 первокурсниками Bocconi показал: GPT-4o почти на балл поднимает оценку за короткое задание, а урок по причинному мышлению меняет не баллы, а сам способ думать.
Суть события
В ноябре 2025 года 13 секций вводного курса по менеджменту разделили на четыре группы: контроль, урок по причинному мышлению, доступ к GPT-4o и комбинацию двух подходов. Студентам дали одно и то же задание — в 180 словах предложить маркетинговые рекомендации для магазина мерча университета.
GPT-4o дал самый заметный прирост: средняя оценка выросла почти на целый балл по пятибалльной шкале. Ответы стали длиннее, содержали больше идей и лучше совпадали с тем, что сочли сильным три внешних эксперта. Иными словами, AI помог не только писать красивее, но и попадать в привычный шаблон хорошего ответа.
Детали
Урок по причинному мышлению сам по себе не поднял традиционные оценки. Наоборот, работы этой группы получили чуть более низкие баллы, но в них чаще появлялись объяснения, почему рекомендация должна сработать, при каких условиях она провалится и какие допущения стоят за выводом.
Комбинация урока и GPT-4o не дала дополнительного прироста по обычным оценкам, зато сохранила эффект на разнообразие идей. Это важная развилка: AI повышал polish, а обучение — глубину рассуждений. Вместе они не складывались в простую формулу «больше AI = лучше учимся».
Контекст
Авторы исследования показали и неприятную деталь: больше идей, логичность и вариативность коррелировали с более высокими баллами, а более сильная проверяемость, подробные объяснения механики и большая оригинальность — наоборот, часто шли в минус. Рубрика, похоже, награждает не мысль как таковую, а хорошо упакованную мысль.
Именно поэтому этот кейс так похож на более широкий спор о том, что измеряет оценка. Похожую логику AI-рынок уже видел в разборе AI Digest про саморазвивающиеся исследовательские системы: продукт может выглядеть убедительно, но вопрос в том, что за ним реально стоит.
Здесь и главный пробел: не было отложенного теста без ChatGPT. Значит, мы видим улучшение продукта, а не доказательство лучшего обучения.
Что дальше
Если университеты хотят, чтобы AI помогал учиться, а не просто сдавать задания, им придется менять критерии оценки. Награда должна идти не только за гладкий текст, но и за причинность, проверяемость и альтернативные подходы.
Для студентов вывод простой и немного язвительный: если задание можно полностью причесать AI, значит, оно и раньше оценивало не совсем то, что вы думали. А для преподавателей это повод пересобрать рубрику до того, как AI сделает это за них.