推出 TutorMoments:評估 LLM 在教育中的框架
今天,我們推出了 TutorMoments 的預覽版本,這是一個評估尖端 LLM (大型語言模型)在教育中能否平衡其中一項最困難的權衡的框架:何時幫助學生,何時讓學生自己完成工作。這項框架旨在評估 LLM 在教育中的教學能力,特別是在數學教學方面。
TutorMoments 的工作原理
TutorMoments 是基於真實的一對一數學輔導課堂的重現評估。經驗豐富的數學教師會審閱收集到的輔導課堂記錄,並標記出輔導老師需要在幫助學生和讓學生自己完成工作之間做出選擇的時刻。然後,TutorMoments 會將記錄到該決策點的內容交給語言模型,並讓模型接管模擬課堂中的輔導老師角色,與另一個語言模型模擬的學生進行互動,以觀察 LLM 輔導老師的行為。
初步結果
經過初步評估,我們發現 LLM 模型傾向於過度幫助學生,提供過多的支持,並且很少鼓勵學生進行更深入的思考。當我們明確地告知模型需要平衡幫助和讓學生自己完成工作的時候,模型的表現會有所改善,但仍然無法達到人類輔導老師一致地適應學生的需求的水平。不同的 LLM 模型在做出這項決策的可靠性方面存在很大的差異。
未來展望
作為我們致力於開放研究的一部分,我們將發布一份去識別化的輔導課堂記錄數據集、運行我們的重現管道的程式碼,以及模型輔導老師在評估過程中的重現內容,以便其他研究人員重現我們的結果。我們希望 TutorMoments 能夠為教育工作者、研究人員和建構 AI 輔導老師的團隊提供一個更尖銳的方式來評估模型對教育決策的處理能力,並幫助領域內的研究人員建構出能夠適應每個學生的輔導老師。
在傳統的數學教學中,一個好的輔導老師會先問學生:“你對這個問題了解多少?”這不是輔導老師不願意幫助學生,而是輔導老師需要診斷學生的知識水平,並提供適當的支持。立即提供支持可能會剝奪學生的學習機會,而有時候,輔導老師需要讓學生自己完成工作,以鞏固他們的理解。語言模型雖然被訓練成幫助他人,但在輔導課堂中,這可能會剝奪學生的學習機會。因此,如何評估 LLM 在教育中的教學能力是一個非常重要的課題。
