← All posts / Research

拿最高分的技能,正是 AI 最擅長偽裝的技能:Bocconi 大學 1,053 人 GPT-4o 隨機對照實驗解析

米蘭 Bocconi 大學將 1,053 位大一新生隨機分為四組——GPT-4o、因果推理訓練、兩者兼有、兩者皆無。ChatGPT 讓分數提高 0.86 分,但評分標準獎勵的是符合常規的答案、懲罰的是原創性——而原創性恰恰是人類思考者最難被取代的特質。

拿最高分的技能,正是 AI 最擅長偽裝的技能:Bocconi 大學 1,053 人 GPT-4o 隨機對照實驗解析

頂尖成績究竟在測量什麼?米蘭 Bocconi 大學與 OpenAI 合作、於 2026 年 8 月底發表的隨機對照實驗,給出了迄今最精確的答案——而且令人不安:在標準學術作業上獲得最高分的技能,正好是前沿大型語言模型最能以假亂真的技能。

這項研究正式標題為《Training novices to think, or giving them LLMs? Evidence from an RCT》(訓練新手思考,還是直接給他們 LLM?來自隨機對照實驗的證據),由 Bocconi 管理與技術系的 Alfonso Gambardella 與 Myriam Mariani 領銜,共同作者來自杜克大學、加州大學柏克萊分校、SDA Bocconi 以及 ION 管理科學實驗室——其中數位為 OpenAI 附屬研究人員。這是有史以來規模最大的生成式 AI 課堂隨機化實驗之一。

實驗設計

2025 年 11 月,一門管理學入門課程的 13 個班級被隨機分為四組:對照組、接受因果推理短課程的組別、可使用搭載 GPT-4o 的 ChatGPT Edu 的組別,以及兩者兼有的組別。全部 1,053 位經濟、財務與管理學系大一新生面對同一道題目:在 180 字以內,提出提高 Bocconi 大學校友對校園紀念品認知與使用率的方案。這是典型的「新產品行銷」作業——正如作者所指出的,正是 LLM 最擅長的那種結構良好的問題。

因果推理課程刻意保持精簡:引導學生理解連貫的因果邏輯、可證偽性,以及一個 proposed 行動究竟如何、在什麼條件下才可能導致預期結果——也就是「這為什麼會有效?在什麼情況下會失效?」的機制思考。

評分採盲評:人工評分者在不知道每份作業屬於哪一組的情況下,以 1 到 5 分制評分。因果推理品質、點子多樣性等次要指標,則由 OpenAI 與 Anthropic 的模型輔助評估。

GPT-4o 對數字的影響

使用 ChatGPT 的效果接近整整一個成績等級的跳升:分數平均提高約 0.86 分(對照組均值為 2.09 分,改善幅度約 41%)。AI 輔助的答案平均多出約兩個點子、邏輯更連貫,且更接近領域專家的建議方向。而且這不只是表面打磨:即使控制了論證品質、點子數量、多樣性與文本特性之後,仍有一個可測量的殘餘優勢。作者將其歸因於內容品質的提升——而非學生知識的增長。

相比之下,因果推理課程完全沒有提高傳統分數。該組的作業平均分甚至略低。但這些學生更常解釋一個提案「為什麼」應該有效、在什麼條件下可能失敗,而且產出的點子與同儕明顯不同。課程與 GPT-4o 結合並未進一步拉高傳統分數,不過在因果推理指標上兩者互補,課程組的點子多樣性也得以維持。

真正的問題出在評分標準

整項研究最具挑釁性的發現,藏在成績的相關結構裡。點子更多、論證更連貫、單一答案內部多樣性更高,都與更高分數相關。但更強的可證偽性、更詳細的機制解釋、與其他學生答案更大的差異性,反而與更低分數相關。

換句話說,評分標準獎勵的是「結構良好、停留在預期解答空間內」的答案——並悄悄懲罰了因果推理課程刻意培養的獨立思考特徵。作者的結論相當直白:如果多樣性與原創性應該被計入,就必須明確寫進評分標準。現行評分制度測量的是打磨、結構與完整性——恰好是 AI 輔助最閃耀的維度——卻對學習與理解視而不見。

這種錯位正是 AI 能成為高效作弊工具的原因。當評量工具獎勵的東西恰是模型可以憑空生成的東西時,最終成品就不再能說明學生真正理解了什麼。

這項研究無法回答的問題

作者對研究限制相當謹慎。實驗沒有後續測試讓學生在沒有 ChatGPT 的情況下展示所學,因此 GPT 優勢究竟反映真正的學習、還是僅僅產出更好的成品,仍是開放問題。實驗只涵蓋單一大學的新生、一道狹窄的行銷題目,且隨機化是以 13 個班級為單位而非以學生個人為單位。還有一個顯而易見的利益衝突:OpenAI 提供了被研究的技術、數位作者任職或曾任職於 OpenAI,其教育副總裁 Leah Belsky 還為新聞稿提供了「新技術與用心教學相輔相成」的引言。

更廣泛的文獻則不那麼樂觀。一項涵蓋超過 50 萬筆美國大學成績的研究發現,ChatGPT 問世後,頂尖成績增幅最大的是作業占比高的寫作與程式課程。多項對照實驗顯示,AI 被收走之後,受試者表現反而不如對照組——其中以主要用 GPT 直接获取答案的人下滑最陡。一項追蹤 26,000 多名中國學生 30 個月的研究也發現類似模式:作業變得更好更快,考試成績卻下滑,長期升學考結果低了 18–24%——唯一的例外是那些儘管有 AI、仍花費與非使用者相同時間做作業的學生。

為什麼這件事遠超出課堂之外

這些發現直指每一個用制式標準評估人的組織。如果招募、升遷、提案與專案審批都按可預測的評分表打分數,AI 就能迅速縮小初級員工與專家之間的差距——因為「產出預期答案」如今成了最便宜的部分。真正想要獨立思考的公司與大學,將需要能在結構上獎勵它的評量系統:原創性、可證偽的推理、對多種路徑的考量,而不只是最打磨光滑的常規答案。

Bocconi 團隊並不把結果框架為對 AI 的判決,而是一個設計挑戰:正因為 LLM 存在,更需要持續教授基本原理,因為因果推理訓練與 AI 使用是互補而非互相抵銷的。這項研究留下的那個不舒服的問題,是射向所有評分者的:在一個機器可以隨選產出「預期答案」的世界裡,你確定你的評分表測量的,仍是你以為自己在測量的東西嗎?