13 分鐘閱讀

AI 家教是神器還是拐杖?五個實驗、三個國家,把「AI 進教室」這件事拆給你看


以下為虛構對話,人物與情節為創作,科學內容來源標註於文末。

▌一碗麵和一句出處不明的名言

「授人以魚不如授人以漁。」Dg 把手機轉過來給 K 看,「孔子說的。所以 AI 只要教方法不教答案,學生就沒問題了。」

「論語裡沒有這句。」K 沒抬頭,「出處不明,通常被掛在老子頭上,也掛過《淮南子》。」

「重點是道理對。」

「道理對不對,要看數字。」

門開了。Liy 端著保溫袋走進來,把麵放在桌角,站著沒走。K 的咖啡在旁邊,冷了。

Dg 立刻換了一種姿勢坐好。

「土耳其一所高中,」K 說,「近千個學生,隨機分三組。一組用一般的 ChatGPT,一組用改過的版本,只給提示、不給答案。第三組只有課本。」

「然後?」

「練習的時候,一般版進步 48%,提示版進步 127%。」

Dg 攤手。「那不就結案了。AI 有用。」

「還沒撤掉。」

▌沒有防護欄的意思

「那篇論文的標題,」K 說,「叫『沒有防護欄的生成式 AI 會傷害學習』。」

Liy 把保溫袋的提把繞在手上。「防護欄在哪裡?」

Dg 搶答:「不是真的欄杆,是比喻。就是——限制。像圍起來一樣。」

「圍住學生嗎?」

「圍住 AI。」

「所以 AI 在裡面,學生在外面。」Liy 說,「那學生要怎麼用它?」

Dg 張嘴,然後閉上。

K 的手指在桌面停了一下。冷氣的風從側面掃過來。

「防護欄是指提示詞。」K 說,「同一個 GPT-4,加一段指令,要它只給老師設計過的提示,不准直接給解法。硬體沒有變,模型沒有變,變的是它被允許說什麼。」

「那不是欄杆,」Liy 說,「那是規定。」

「對。」

「規定通常沒有欄杆的樣子。」她說,「我阿爸貼在牆上那張『用餐時間九十分鐘』也沒有欄杆。」

Dg 想接話。他沒接上。

▌撤掉之後

「所以撤掉會怎樣。」Dg 終於問。

「把 AI 收走,全部人裸考。」K 說,「一般版那組,比從來沒用過 AI 的那組還低 17%。」

「……低?不是只有沒進步而已?」

「低。」

Dg 靠回椅背。「所以他們練習的時候看起來會,考試的時候不會。」

「研究者的用詞是『拐杖』。」

Liy 這時候才把保溫袋放下。「誰的腳斷了?」

「沒有人的腳斷了,」Dg 說,「是說他們靠著它走路——」

「拿拐杖的人腳沒問題?」

「沒問題。」

「那他們拿拐杖幹嘛。」

Dg 停住。他看了 K 一眼。K 沒有要救他的意思。

「因為拿著比較快。」Dg 說得很慢,像是一邊講一邊確認自己在講什麼,「練習的時候比較快,成績比較好看。可是走路那個能力……沒有在長。等到拐杖被拿走,才發現腳其實比一開始還弱。」

K 點了一下頭。沒說話。

「提示版那組呢?」Dg 追問。

「退步效應大致被抵銷掉了。」

「同一個模型。」

「同一個模型。」

Dg 盯著自己那杯早就冷掉的咖啡。「所以問題不是給不給 AI,是給哪一種 AI。」

「嗯。」

Liy 把保溫袋收好,走到門口,回頭看了一眼桌上那碗還沒動的麵。「那碗會冷。」她說,「冷掉再熱,跟一開始就熱的不一樣。」門在她身後關上。


同樣是給學生用 AI,賓州大學的實驗發現成績會退步 17%,哈佛的實驗卻發現效果是傳統課堂的兩倍。這不是研究互相打架,而是在告訴我們一件更麻煩的事:AI 有沒有用,取決於它被設計成什麼樣子。而現在全世界的教育系統,正在用真的學生做這個實驗。


🔑 關鍵亮點

  • 同一個工具,不同設計,結果完全相反:直接給答案的 AI 讓學生練習時進步 48%,但撤掉 AI 後考試退步 17%;只給提示不給答案的 AI,練習進步 127%,而且沒有退步後遺症。
  • 全球 88% 大學生已經在用 AI,但只有 29% 覺得老師有能力指導他們——這個落差,比使用率本身更值得擔心。
  • 南韓花了約 14 億美金推 AI 數位教科書,四個月後被國會修法降級為輔助教材,採用率從 37% 掉到不到 20%。
  • 愛沙尼亞選了完全相反的順序:先訓練老師,再開放學生帳號,進度慢得多,但至少沒有翻車。

兩個實驗,兩種相反的結論

賓大實驗:AI 是一根很好用的拐杖,然後你就不會走路了

先講那個讓 AI 教育樂觀派最頭痛的研究。

賓州大學華頓商學院的 Hamsa Bastani 團隊,在土耳其一所高中找了近千名學生,做了一場標準的隨機對照試驗(RCT)。學生被分成三組:一組用「GPT Base」——基本上就是你我平常用的 ChatGPT 介面;一組用「GPT Tutor」——同樣是 GPT-4,但被下了指令,只給老師設計過的提示,不直接給答案;還有一組是對照組,就只有課本跟筆記。

練習階段的結果毫不意外:用 GPT Base 的學生成績進步 48%,用 GPT Tutor 的進步 127%。AI 有用,這件事沒有爭議。

問題出在下一步。研究團隊把 AI 收走,讓所有人裸考。

GPT Base 組的成績,比從來沒用過 AI 的對照組還要低 17%。

這篇論文 2025 年 6 月刊登在 PNAS,標題直接寫著「沒有防護欄的生成式 AI 會傷害學習」。研究者的說法很傳神:在沒有防護欄的情況下,學生把 GPT-4 當成練習時的「拐杖」,之後自己走路就走不動了。

AI 家教實驗示意圖

同一個模型,換一套提示詞,學習結果就完全不同。差別不在技術,在設計。

哈佛實驗:所以問題不在 AI,在怎麼設計 AI

但如果你只看賓大的研究就下結論「AI 進教室是災難」,那你會被哈佛的實驗打臉。

哈佛的 Greg Kestin 與 Kelly Miller 團隊,分析了 194 名修習 Physical Sciences 2(給生命科學主修生上的物理課)學生的學習成果。實驗設計是交叉式的:兩組學生在連續兩週各上一堂課,一週是傳統的「主動學習」課堂(instructor-guided active learning,這已經是物理教學界公認的最佳實務了),另一週則是客製化的 AI 家教。

結果是 AI 家教組贏,而且贏得不少——效果量落在 0.7 到 1.3 個標準差之間,大約是主動學習課堂的兩倍。更意外的是,學生自陳在使用 AI 上課時投入程度與學習動機都明顯更高。這篇論文 2025 年 6 月刊於 Scientific Reports

關鍵在哪?這個 AI 家教的設計,用的是跟課堂教學完全相同的教學法原則——它不是一個「什麼都回答你」的聊天機器人,而是一個被教學專家調校過的東西。

Kestin 自己講得很清楚:AI 家教不該替學生「思考」,而是要幫他們建立批判思考能力。

兩個實驗合起來看,結論其實一致:AI 不是變數,AI 的設計才是變數。 這也是為什麼接下來的國家級案例會這麼慘烈——因為政策制定者買的是「AI」,不是「被設計過的 AI」。


全球四萬五千人調查:學生跑在前面,制度落在後面

2026 年 7 月初,Digital Education Council(DEC)發布了《AI in Higher Education Global Survey 2026》,收集了 45,398 份回覆,其中 27,284 份來自學生、18,114 份來自教師,橫跨 35 個國家,是目前規模最大的同類調查之一。

⚠️ 請注意:這是大學生與大學教師的調查,不是中小學。以下數字不能直接套用到國高中場景。

數字本身很有意思:

88% 的學生在學習中使用 AI,77% 的教師在教學中使用 AI,後者比 2025 年成長了 16 個百分點。

但真正的問題不在使用率,在認知落差

  • 只有 29% 的學生認為自己的老師有能力指導他們使用 AI(美加地區更低,僅 17%)
  • 有 64% 的教師自認接受過 AI 素養訓練
  • 57% 的學生說,他們的作業與評量對 AI 使用的指引不足;只有 31% 的教師覺得學校在制定 AI 政策時有真正納入他們的意見

這是一個很典型的組織失能場景:每個人都覺得自己準備好了,也都覺得別人沒準備好。

學生對 AI 的自我評估也很分裂。61% 認為 AI 讓他們能把力氣花在更深的思考上,31% 因此敢挑戰更難的題目——這是正面的。但另一邊,22% 說沒有 AI 很難做事,20% 說產出品質得靠它撐,19% 直接承認依賴 AI 讓自己記得更少

把這 19% 跟賓大的 17% 退步幅度放在一起看,你會有一種毛骨悚然的一致感。

調查數據視覺化

使用率的成長曲線很漂亮,指導能力的曲線沒跟上——這才是報告點名的核心問題。


國家級豪賭:南韓四個月翻車,愛沙尼亞慢慢走

如果說前面是實驗室,接下來兩個案例就是真的把國家押上去。

南韓:花 14 億美金,換來四個月

南韓的 AI 數位教科書計畫在 2025 年 3 月全面進入教室,政府投入超過 1.2 兆韓元,出版社再投入 8 千億韓元,合計約 14 億美金。

四個月後,也就是一個學期,AI 教科書就被剝奪了「教科書」的法定地位,改列為「輔助教材」,用不用由各校自行決定。國會的修法把教科書的法律定義限縮為紙本書與電子書,明確排除「使用智慧資訊技術的學習支援軟體」。

崩盤速度非常快:採用率從第一學期的 37%,掉到九月開始的新學期只剩 19%。

問題出在哪?全國各地的學生、教師與家長抱怨教科書有事實錯誤、有資料隱私風險、增加孩童螢幕時間,而且讓師生的工作量都變重。另外一個關鍵數字:韓國教師工會 2024 年 12 月針對 2,626 名教師的調查中,98.5% 認為自己受到的訓練不足。家長端則有 56,505 人連署反對(2024 年 5–6 月)。

教育部買了工具,但沒有買時間。

愛沙尼亞:先訓練老師,再給學生帳號

愛沙尼亞的「AI Leap」(TI-Hüpe)走的是相反路線。

官方公告的第一階段規模是 20,000 名 10–11 年級高中生與他們的 3,000 名教師,從 2025 年 9 月 1 日新學年開始。這個計畫刻意致敬三十年前把電腦與網路帶進全國學校的「虎躍計畫」(Tiger Leap)。

制度設計上有兩點值得注意:

第一,順序。教師訓練排在前面,學生的 AI 學習應用程式開放在後。這跟南韓「先全面上線再說」的做法正好相反。

第二,產品方向。AI Leap 與 OpenAI 合作開發,走的是「不給答案、只提問」的路線,而且明訂資料不用於模型訓練。

⚠️ 數字需要保守看待:坊間報導常說「全國 154 所高中都在用、兩萬名學生都在用、訓練了 4,900 位老師」。但比對官方資料,20,000 是目標人數而非實際啟用數;2026 年 3 月的官方數字顯示實際約 7,700 人啟用帳號,其中 47% 每週使用。2026 年 1 月官方受訪內容是「已有超過 100 所」(全國共 154 所),不是全部。本文採用較保守的說法。

對照表:兩種國家級策略

面向 南韓 AI 數位教科書 愛沙尼亞 AI Leap
上線方式 2025 年 3 月全面進教室 2025 年 9 月分階段啟動
投入規模 約 14 億美金(政府+出版社) 公私協力,未公開總額
順序 學生與教師同時 教師訓練先行,學生帳號後開
產品設計 個人化學習系統,供應商多元 與 OpenAI 合作,強調提問而非給答案
教師準備度 98.5% 教師自認訓練不足 教師訓練為第一階段核心
目前狀態 降級為輔助教材,採用率不到 20% 第一階段推進中,實際啟用約 7,700 人
資料政策 家長抗議資料蒐集,56,505 人連署 明訂資料不用於模型訓練

兩者最大的差別不是技術,是節奏。


一年四萬美金的無師學校

如果國家隊走得慢,市場會跑得比較快嗎?

Alpha School 是一間主打「沒有老師」的私立學校——學生每天用 AI 系統進行約兩小時的核心學科學習,其餘時間做專案與生活技能訓練。校內沒有傳統教師,取而代之的是被稱為「Guides」(引導員)的角色。

擴點速度很驚人。奧克拉荷馬州的新校區 8 月開學,年學費 $40,000(部分州最高到 $75,000)。大波士頓地區則計畫開三個校區——Boston、Lexington 與 Jamaica Plain,年學費約 $65,000,每校首年招生 25 到 40 人。

⚠️ 時效提醒:截至本文整理時,Boston 與 Jamaica Plain 兩校已獲校務委員會核准,Lexington 尚未核准,能否如期秋季開學仍未確定。

引導員的年薪可以突破 $100,000,去年應徵人數超過 8 萬。

這個模式最有趣的地方在於它其實沒有真的取消教師這個功能——它只是把「教學」跟「陪伴/督導」拆開,前者交給 AI,後者留給人,然後付人更多錢。這跟哈佛研究者說的「讓 AI 教入門材料,把寶貴的課堂時間留給高階能力訓練」,結構上驚人地相似。

只是價格標籤上多了兩個零。


法律終於追上來了

2026 年,美國有四個州通過了要求學區制定 AI 政策的法律:愛達荷(SB 1227)、馬里蘭(SB 720/HB 1057)、奧克拉荷馬(SB 1734),以及維吉尼亞的新法。共通結構是:州教育部發布指引,學區必須訂出對齊的 AI 政策。

奧克拉荷馬的法案細節特別值得看,因為它處理的正是南韓翻車的那幾個點:

  • AI 不得作為打成績、處分等高風險決定的主要依據(注意用詞——是限制「主要依據」,不是完全禁止)
  • 學區必須每年向家長揭露使用了哪些 AI 工具、蒐集了哪些學生資料
  • 家長可以讓孩子退出AI 工具的使用,且不得因此受到學業處罰

另外,愛達荷與俄亥俄州都把 2026 年 7 月 1 日訂為全州學區政策到位的期限。

同一時期,兩個國際級的動作也值得記一筆:UNESCO 在 2026 年 7 月 21 日發布了多語言版的《教師 AI 能力框架》;OpenAI 則推出 ChatGPT for Teachers,免費開放給美國認證的 K-12 教師使用至 2027 年 6 月

教育 AI 政策地圖

立法通常落後技術好幾年。這次落後的時間,短得反常。


❓ 常見問題 FAQ

Q1:所以學生到底該不該用 ChatGPT 寫作業? 從賓大的研究看,關鍵不在「用不用」,而在「用的時候 AI 給你什麼」。如果 AI 直接給答案,你練習時的成績會好看,但技能沒有真的長出來——撤掉工具就現形。如果你能自己設定規則(例如:只准 AI 給提示、不准給完整解法),實驗證據顯示那個負面效應大致可以被抵銷。

Q2:哈佛的研究說 AI 家教效果是課堂兩倍,那大學是不是可以少開幾堂課? 研究者自己明確反對這個推論。他們的論點是:AI 適合用來教「第一次接觸的入門材料」,好讓寶貴的課堂時間拿去做進階問題解決與協作。這是分工建議,不是替換建議。而且該研究是單一課程、194 人的規模,還不足以支撐制度層級的結論。

Q3:南韓失敗是不是代表 AI 教育行不通? 比較合理的讀法是:南韓失敗在推行方式,不在 AI 本身。98.5% 的教師自認訓練不足、家長對資料蒐集的疑慮沒有被處理、教材本身有事實錯誤——這三件事任何一件單獨發生都足以讓政策翻車,何況同時發生。

Q4:那個 88% 學生使用率,可以拿來講中學生的狀況嗎? 不行。DEC 這份調查的對象是大學生與大學教師。中學生的使用行為、認知發展階段、監護人角色都不一樣,直接套用會失真。要談中小學,得找中小學的資料。

Q5:愛沙尼亞模式可以複製嗎? 愛沙尼亞的規模優勢很難忽略——全國只有 154 所高中。「先訓練老師再開放學生」這個順序原則本身是可以借鏡的,但「用一個國家的規模做一次統一部署」這件事,在大多數國家不可行。


結論:問題從來不是「要不要用 AI」

把這五組證據攤開來看,會發現一條相當清楚的線。

第一,設計決定結果。 同一個 GPT-4,換一套提示詞,一個讓學生退步 17%,另一個讓學生進步 127%。這意味著「學校要不要導入 AI」是個假議題,真議題是「導入的是哪一種 AI」。

第二,人的準備度比工具的準備度重要。 南韓的工具早就上線了,老師沒有。愛沙尼亞的工具晚了半年,但老師先到位。目前為止,第二種做法沒有翻車。

第三,制度正在補課,而且補得比預期快。 美國四州的立法、UNESCO 的能力框架、退出權與資料揭露條款——這些都是 2026 年才密集出現的東西。教育政策通常慢技術好幾年,這次的時差短得反常,某種程度上正是因為南韓的教訓夠痛。

還沒有答案的部分也很多。我們目前沒有大規模、長期的追蹤資料,能告訴我們「從高中就開始用 AI 學習的一代人」到了大學會是什麼樣子。愛沙尼亞的第一批完整經歷 AI Leap 的學生預計 2027 年春天畢業——那可能是第一份真正有意義的縱貫資料。

在那之前,最誠實的說法大概是:我們正在拿一整代學生做一場沒有對照組的實驗,而且大部分人還沒意識到自己在實驗裡。


🔎 延伸搜尋


📚 參考資料來源