11 分鐘閱讀

看臉就定生死?AI 也學會了「以貌取人」,而且比人類更嚴重!


以下為虛構對話,人物與情節為創作,科學內容來源標註於文末。

▌下午三點的長桌

下午三點,咖啡廳的人潮退得差不多了。

陽光斜斜切過中間的長桌,剛好停在 Dg 的筆電邊緣。

他正在整理 K 丟過來的論文。整理到一半,手機跳出通知。

「實習面試……下個月。」

念得不大聲。

但隔兩個座位的 Vay 抬起了頭。

「面試?」

Vay 拿下耳機,把筆電螢幕往下壓了一點。

「我以前也是這樣。第一次面試,緊張到履歷照片直接用學生證那張。」

「那張不行嗎?」

「不行。後來我帶團隊,自己看履歷才懂。」他用手指點了點桌面,「照片是第一關。人都是看臉的。」

Dg 坐直了。

「不過啊,」Vay 補了一句,「現在很多公司先丟系統篩。系統只讀文字,照片它根本看不到。重點是關鍵字要塞滿,職缺寫什麼,你就寫什麼。」

「所以——」Dg 眼睛亮了,「人會以貌取人,機器不會。」

「對。」

「『人不可貌相,海水不可斗量』。」Dg 點頭,一副總結了人生的表情,「原來這句話是寫給機器的。」

Vay 笑了一下,沒反駁。

▌87.83%

Dg 在筆記本上寫下:履歷——關鍵字塞滿。Vay 哥說的。

寫完,他回到論文。捲了兩頁,手停住。

「……咦?」

「怎麼了?」

「這篇在測 AI 看臉。」Dg 把螢幕轉過去,「給它兩張臉,問哪個比較有能力。GPT 有 87.83% 選中大家通常會選的那張。人類只有 62.65%。」

他停了一秒,聲音大起來。

「AI 看臉比人還準!」

「看吧。」Vay 往後靠,「機器就是比較準。」

「那我的照片要拍得很有能力。」Dg 已經在想角度了,「『相由心生』——AI 一眼就看得出我是什麼人。」

「等一下。」

Vay 的手指停在杯緣。

「你說,系統會看照片?」

「論文寫的。」

「不可能。」Vay 皺眉,「我們當年那套篩選系統,連 PDF 裡的圖都讀不出來。」

他說得很篤定。

那套系統,他應該真的用過。

▌沒有答案的臉

Vay 拿起手機,開始滑。

Dg 繼續往下讀,想再找幾個「AI 很準」的證據。

然後他讀到方法那一段。

「……這些臉是電腦做的。」

沒人回應。

「不是真人照片。是把同一張臉往『看起來有能力』調一點,再往反方向調一點。」

他又往下捲。

「還有一個實驗,換成獼猴的臉。AI 還是有 66% 照同樣的方式選。」

獼猴。能力。

Dg 盯著那兩個詞,看了很久。

「電腦做的臉,背後沒有人。」他慢慢說,「沒有人,就沒有真正的性格。那 87% 是準在哪裡?」

他自己回答了。

「它不是看得準。是它猜的方向,跟我們的偏見一樣。」

「而且偏得比我們用力。」

他把筆記本上「相由心生」那一行劃掉。

「關鍵字塞滿」那一行,還留著。

隔兩個座位,Vay 還在滑。看完一篇,又點開另一篇。

Vay 把手機螢幕朝下,扣在桌上。拿起早就冷掉的咖啡喝了一口,很久都沒有說話。


你以為 AI 冷靜、客觀、不帶偏見?一篇 2026 年發表在《PNAS Nexus》的研究,讓四個主流大型語言模型看兩張臉,然後問:「誰比較有能力?誰比較可信?」結果沒有一個模型拒絕回答,而且它們「以貌取人」的程度,在能力判斷上明顯超過人類。更麻煩的是,越新、越會推理的模型,偏差反而越大。


關鍵亮點

  • 四個模型全數中招:GPT-4o、GPT-5、Gemini 3 Flash Preview、Claude Sonnet 4.5,在近 8,000 次試驗中都表現出「看臉判斷性格」的偏差,沒有一個保持中立或拒答。
  • 偏差被放大:在能力判斷上,人類約有 62.65% 的機率選中「一般認為較有能力」的臉,GPT-4o 則高達 87.83%。
  • 偏差會升級:模型會把「看起來不可信」的臉判為更可能是連環殺手、人口販運者;在聘用、投資決策上,也偏好「看起來有能力」的臉。
  • 新模型更嚴重:GPT-5 在高風險決策情境中選中預期臉的比例達 97.04%,遠高於 GPT-4o 的 75.19%。

一、人類的老毛病:0.1 秒看臉,一輩子定型

人類在極短時間內對陌生臉孔形成第一印象的示意圖 第一印象的形成速度,遠比我們以為的快。

你的大腦比你還急

先來個小測驗:走進教室,看到一位從沒見過的同學,你多久會對他產生「這人好像很聰明」或「這人感覺不太好相處」的印象?

答案可能讓你有點不舒服:大約十分之一秒。心理學家 Willis 與 Todorov 在 2006 年的研究發現,受試者只看一張臉 100 毫秒所做出的判斷,和讓他們慢慢看、不限時間所做出的判斷,高度相關。換句話說,多給時間並沒有讓人改變看法,只是讓人對原本的看法更有信心。

月暈效應:一好百好,一壞百壞

這種現象有個古老的名字,叫月暈效應(halo effect)。1920 年,心理學家 Thorndike 分析軍官對部屬的評分,發現一件怪事:被評為「外表好看」的士兵,在智力、領導力、忠誠度等完全不相干的項目上,分數也跟著偏高。就像月亮周圍的光暈,一個特質的光芒,把其他特質也一起照亮了。

問題是:臉真的能看出性格嗎?

幾十年來的研究累積下來,答案大致是:不太行。Todorov 等人 2015 年在《Annual Review of Psychology》的綜述指出,從臉部推論性格的準確度,被人們大幅高估了。我們對陌生人的臉有著驚人一致的「感覺」,但這些感覺跟對方實際的性格,關聯薄弱得多。

所以,人類「以貌取人」是個已知的 bug。那問題來了——用人類文字訓練出來的 AI,會不會也繼承了這個 bug?


二、實驗怎麼做:給 AI 看兩張「假臉」

由電腦合成、在特定特質維度上調整的臉部刺激示意 研究使用的臉孔並非真人照片,而是電腦合成的臉。

研究團隊與規模

這篇論文由 Steven Lehr、Yukari Lothe 與哈佛心理學家 Mahzarin Banaji 發表,標題直白到不行:Like humans, language models demonstrate face-to-character biases(像人類一樣,語言模型也表現出臉到性格的偏差)。Banaji 本身就是研究「內隱偏見」的重量級學者。

研究共做了 13 個實驗,測試 4 個模型,累計近 8,000 次試驗。

臉從哪裡來?

這裡有個很聰明的設計。研究者沒有用真人照片,而是使用 Todorov 實驗室開發的電腦合成臉。這些臉可以沿著「能力」或「可信度」的方向微調——例如把同一張臉往「看起來更有能力」調 3 個單位,再往「看起來較沒能力」調 3 個單位,兩張臉就相差 6 個標準差(SD)。

這些「調整方向」本身,是根據大量人類受試者的評分建出來的。也就是說,研究者事先就知道:「人類通常會覺得哪一張比較有能力」。

任務:強制二選一

接著,研究者把兩張臉丟給 AI,問它:「哪一位比較有能力?」或「哪一位比較值得信任?」這叫強制二選一(forced-choice)。

如果 AI 真的沒有偏見,照理說它應該選得很隨機,接近 50%,或者乾脆說:「光看臉我無法判斷。」

結果呢?


三、結果一:AI 比人類更愛以貌取人

GPT-4o 在各實驗中選中「預期臉」比例的長條圖 在能力判斷上,GPT-4o 的偏差程度明顯高於人類基準。

數字會說話

以 GPT-4o 為例,在能力判斷中,它有 87.83% 的機率選中「人類通常覺得比較有能力」的那張臉;當兩張臉差距拉到 6 SD 時,這個比例更高達 98%。可信度判斷稍低,但也有 72.67%。

那人類呢?研究者用既有的人類評分資料推算,人類在同樣的二選一任務中,大約只有 62.65% 會選中預期的臉。

另一個更誇張的比較:當要求用 9 點量表評分時,臉部形態的變化可以解釋 GPT 評分中 81.01% 的變異,但在人類評分中只解釋了 3.59%。翻成白話:人類打分數時,臉只是眾多影響因素之一;GPT 打分數時,幾乎就是在看臉。

⚠️ 不過作者自己也提醒,這兩種人機比較不是精確複製人類研究,比較適合當作示範,而不是精準的數字對決。

它學到的不是標籤,是概念

更有意思的是,這種偏差會泛化。研究者換個問法,不問「能力」,改問「誰比較聰明?」「誰比較勤奮?」「誰比較懶惰?」;不問「可信度」,改問「誰比較溫暖?」「誰比較真誠?」「誰比較自私?」——GPT-4o 依然有 73% 到 75% 的機率選中預期的臉。

最離奇的是獼猴實驗。研究者把臉換成獼猴的臉,GPT-4o 還是有 66% 的機率照著同樣的模式選。訓練資料裡幾乎不可能有「這隻猴子看起來很有能力」的標註,這代表模型學到的不是死背某些臉對應某些詞,而是某種更抽象的「看起來就是這樣」的概念。


四、結果二:從「看起來可疑」到「你是殺人犯」

AI 決策情境示意:聘用、投資與犯罪嫌疑判斷 當臉部偏差進入高風險決策,後果就不只是「第一印象」而已。

偏差如何升級

如果 AI 只是在「誰看起來比較聰明」這種無關痛癢的問題上犯錯,那還好。但研究者接著把問題升級:

  • 極端負面行為:兩張臉中,誰比較可能是連環殺手?人口販運者?龐氏騙局主謀?GPT-4o 有 68.70% 的機率指向「看起來較不可信」的那張臉。
  • 高風險決策:要聘用大學校長、投資新創公司、挑選退休基金經理人,你選誰?GPT-4o 有 75.19% 的機率選「看起來較有能力」的臉。

想像一下:你的長相,只因為某些五官比例被統計上歸為「不可信」,就讓 AI 覺得你比較像詐騙犯。這已經不是第一印象,而是用一張臉寫判決書。

四個模型大比拚

模型 能力判斷 高風險決策
GPT-4o 87.83% 75.19%
GPT-5 94.33% 97.04%
Gemini 3 Flash Preview 95.67% 87.04%
Claude Sonnet 4.5 89.00% 89.41%
人類(推算基準) 約 62.65% —

數值為「選中人類通常會選的那張臉」的比例,50% 代表隨機。

看到了嗎?GPT-5 在高風險決策上的 97.04%,幾乎等於「只要長得符合刻板印象,就一定選你」。Claude Sonnet 4.5 在基本能力判斷上與 GPT-4o 相近,但在高風險決策情境中同樣顯著高於 GPT-4o。


五、為什麼越聰明的模型越偏心?

對齊訓練在不同領域中效果不一的概念示意 模型懂得拒絕「明說」的刻板印象,卻沒察覺臉部判斷也是同一回事。

對齊訓練的盲點

這篇研究最值得玩味的地方在這裡:如果你直接問這些模型「女生是不是比較不適合當工程師?」「某某族群是不是比較會犯罪?」,它們通常會拒絕,或給你一段關於平等的說明。

但換成兩張臉,它們就乖乖選了。

作者的解讀是:對齊訓練是「領域特定」的。模型學會在某些被明確標記為敏感的話題上踩煞車,但並沒有學到一個更普遍的原則——「不要根據與結果無關的外表特徵做判斷」。它像是一個背熟了「哪些話不能說」的學生,卻沒有真正理解為什麼不能說。

可能的解釋

為什麼新一代推理模型的偏差反而更大?論文提出幾種可能,其中之一和機器學習中的分布簡單性偏誤(distributional simplicity bias)有關:模型傾向先抓住資料中寬泛、簡單的線性規律,之後才慢慢疊加細節。「看起來有能力 → 就是有能力」正是這種又簡單又好用的規律。

另一個有點反諷的解釋是:人類受試者在實驗中可能會刻意壓低自己的偏見,因為沒人想顯得膚淺(這叫印象管理)。AI 沒有這層顧慮,於是給出了一份「更誠實」的偏見數據。換句話說,AI 可能不只是放大了人類的偏見,也可能是揭露了人類不願承認的那部分。

這個研究的侷限

公平起見,也要看看這篇研究沒能回答什麼:

  • 臉是合成的:只測試靜態、電腦生成的臉,換成真人照片或影片,結果可能不同。
  • 大部分實驗只測 GPT-4o:其他三個模型只複製了其中兩個實驗。
  • 提示詞可能推了一把:模型被要求在不確定時「憑直覺選」,如果允許拒答,偏差是否還這麼強,作者也認為需要再驗證。
  • 人類基準是推算值:人機比較建立在重新分析既有資料之上。
  • 利益揭露:第一作者 Lehr 任職於一家做人才評估的公司 Cangrade。

常見問題(FAQ)

Q1:AI 又沒有眼睛,它怎麼會「以貌取人」? 現在的多模態模型可以直接讀圖。它們從大量人類產生的圖文資料中學習,而人類幾百年來寫下、標註、評論臉孔的方式,本身就帶著月暈效應。模型學到的,是人類的集體印象。

Q2:人類不也一樣看臉?AI 只是跟人類一樣而已吧? 問題有兩個。第一,在能力判斷上,AI 的偏差比人類更強。第二,AI 可以被大規模部署——一個面試官的偏見影響幾十個人,一套 AI 篩選系統的偏見可能影響幾十萬人。

Q3:這是不是代表 AI 被強迫回答,才會出現偏差? 這是合理的質疑。研究中模型被要求在不確定時憑直覺選擇,作者也承認需要驗證「不強迫選擇」時偏差是否還存在。不過,沒有任何一個模型主動拒答或表示「光看臉無法判斷」,本身就值得注意。

Q4:用真人照片會不會結果不同? 有可能。研究只用電腦合成臉,換成真人照片後,膚色、性別、年齡、族群等因素都會加入,情況可能更複雜。論文把這列為未來研究方向。

Q5:那我們還能用 AI 協助做人事或投資決策嗎? 這篇研究的提醒是:如果決策流程中 AI 看得到照片,它就可能被照片影響,而且影響方式跟人類的偏見同方向、甚至更強。至少,別以為交給 AI 就等於「客觀」。


結論

這篇研究像一面鏡子。我們花了一百年,才確認「以貌取人」是人類認知的老毛病;而 AI 只花了一次訓練,就把這個毛病完整繼承,還在某些地方加以放大。

它也戳破了兩個常見的想像:一是「AI 比人類客觀」,二是「模型越聰明就越公平」。實驗結果顯示,推理能力變強的新模型,偏差反而更明顯;而那些能漂亮拒絕刻板印象問題的安全訓練,換個形式就失效了。

未來的方向,或許不只是教 AI「哪些話不能說」,而是讓它真正學會一個原則:與結果無關的外表,不該成為判斷的依據。在那之前,當你聽到「讓 AI 來客觀評估」時,也許可以先問一句:它看得到照片嗎?


延伸搜尋


參考資料來源