AI 幫你做完 41 份文件審查,那接下來呢?當「省下的時間」變成一個經濟學問題

以下為虛構對話,人物與情節為創作,科學內容來源標註於文末。
▌一、四十一份文件
「『凡是能被自動化的,終將被自動化。』」Dg 把筆電轉過來,「馬克思說的。」
「不是。」
「⋯⋯那是誰?」
「網路。」K 沒抬頭,「而且馬克思寫的是機器如何改變勞動的組織方式,不是預言什麼會消失。你連方向都反了。」
Dg 把筆電轉回去,決定跳過這一段。
「總之,昨天 OpenAI 發表 GPT-6 Astra,然後有一家法律科技公司示範——四十一份財務文件,幾分鐘核完。裡面藏了四個錯,全被抓出來,包括營收附註裡五十萬英鎊的落差。」
「嗯。」
「這個工作原本要花一整個下午。」
「有時候不只。」K 終於把咖啡放下,「財報交叉核對。把草稿裡的每個數字,回頭跟原始附表對過一遍。沒有創意,只有耐心。」
「所以文書工作已經死了。」
「同一份新聞稿裡還有另一個數字。」
Dg 停住。
「三。」K 說,「百分之三。」
窗外有機車經過。
▌二、四十跟三
「那家公司用自己的基準測試評估這個模型。財報核對這一項,比前一代進步接近四成。把測試擴大到整套法律任務之後,平均進步大約百分之三。」
「⋯⋯這兩個數字打架吧。」
「不打架。它們量的不是同一件事。」
Dg 皺眉,「可是四十跟三差太多了。」
「所以那個落差才是重點,不是四十。」K 用指節敲了一下桌面,「規則明確、答案可以驗證、輸入輸出都結構化——這種任務上,進展很猛。離開這個範圍,曲線立刻平掉。」
「那為什麼會這樣?模型又不知道自己在做法律還是做別的。」
「因為工作不是由單一任務組成的。」
K 從旁邊抽出一疊紙。
「二〇二三年有一份研究估過。平均而言,一個職業裡大約百分之十五的任務會被語言模型直接影響。把相關的軟體工具算進來,會超過三成。」
「才十五?」
「『才』?」K 看了他一眼,「你想想這代表什麼。假設那百分之十五快了十倍。」
Dg 算了一下,然後表情變了。
「⋯⋯剩下的八十五就變成新的瓶頸。」
「對。」
「所以不是 AI 不夠強。是工作本身長這樣。」
「嗯。」
▌三、被搬走的樓梯
Dg 沉默了幾秒,然後想起來自己還有一招。
「不過——『凡不能殺死我的,使我更強大。』尼采。所以人類被 AI 逼一逼,反而會升級成更高階的職位,這不是好事嗎。」
「尼采那句是寫在《偶像的黃昏》裡的格言,講的是個人面對苦難的態度,不是勞動市場的結構調整。」K 說,「而且你這個推論剛好漏掉最脆弱的那一群。」
「哪一群。」
「新人。」
Dg 沒接話。
「那家公司做得很清楚——AI 負責窮盡式比對,每個數字對過一遍,不會累、不會跳行、不會在第三十七份文件的時候想著晚餐。最終判斷保留給專業人士。」
「聽起來很合理啊。」
「合理。但重心整個往上移了。」K 說,「一個資淺法務原本的一天,是大量的『找出不一致』,加上少量的『判斷這個不一致要不要緊』。現在前面那塊被壓縮掉了。」
「那不是很好嗎,直接做有價值的部分。」
「判斷力是從哪裡來的?」
Dg 張了嘴,又閉上。
「靠做完幾百份枯燥的核對,慢慢長出『這個數字怪怪的』的直覺。」K 把紙推回去,「重複性工作被移走的時候,訓練場也一起被移走了。」
冷氣壓縮機在角落啟動。
「已經有觀察報告注意到,在可自動化任務密集的領域,入門級職缺的招聘速度變慢了。」
▌四、他自己說的版本
「那總體數據呢。」Dg 問,「應該慘不忍睹吧。」
「安靜得很。」
「⋯⋯安靜?」
「二〇二四到二五年的實證研究,沒有看到全經濟範圍的立即性取代。看到的是任務重新分配、品質提升、企業內部生產力上升。」K 說,「丹麥有一份研究把聊天機器人的採用調查連上行政資料,對個人收入跟工時的影響,精確估計為零。」
「零。」
「同一批資料裡,工作場所的任務重組確實發生了,也生出了新的相關職位。」
Dg 盯著自己的筆電螢幕看了很久。
「所以⋯⋯」他慢慢地說,「不是有沒有工作的問題。是同一個工作被拆開,有些部分縮到快不見了,有些部分被放大成整個職位。人數看起來沒變,但裡面的東西已經換掉了。」
K 沒有立刻回應。
「而那個省下來的下午,」Dg 繼續,「跑去哪裡,不是模型決定的。」
「是誰決定的。」
「⋯⋯公司。市場。」
「嗯。」
只有一個字。Dg 知道這是什麼意思。
他伸手去拿滑鼠,把已經寫好一半的貼文標題全選、刪掉,重新打了一行短很多的字。然後點開那份基準測試的說明頁,從第一段開始讀。
咖啡在旁邊涼掉了,他沒去動它。
先說一下那場記者會發生了什麼事
一個新模型,和一句被引用到爛的話
2026 年 9 月 3 日,OpenAI 發布了 GPT-6 Astra。
這是繼 2026 年 7 月的 GPT-5.6 Sol 之後的新一代旗艦模型,官方定位是「世界最強的電腦操作模型」。釋出節奏走的是現在業界的標準劇本:先透過企業計畫 Daybreak 開放給特定客戶,接著才擴及 ChatGPT 的各種付費方案、API,以及 AWS Bedrock 與 Microsoft Azure。定價方面,每百萬 tokens 輸入 10 美元、輸出 50 美元。
以上都是相當常規的產品發布資訊。真正讓這場記者會被大量轉載的,是 OpenAI 總裁 Greg Brockman 說的一句話:
Welcome to the AGI era.
(歡迎來到 AGI 時代。)
被追問這是否等於正式宣告通用人工智慧已經到來時,他沒有給出明確定義,而是把判斷權推回給聽眾——他表示會讓每個人自己決定這算不算數,但就他個人而言,他認為已經到了。
他同時提到一件事:OpenAI 與微軟合約中原本存在的「AGI 觸發條款」現在已經不存在了,AGI 對他來說,已經從一個合約上的技術定義,轉變成比較接近使命或精神層面的概念。
為什麼這篇文章不打算跟著吵 AGI
「AGI 到了沒」是個很好吵、但幾乎不可能吵出結果的題目,因為在座每個人心中的定義都不一樣——Brockman 自己也承認了這一點。
所以這篇文章想換一個問法。
在那場記者會之後,OpenAI 陸續釋出了一批應用案例,其中一個特別具體:瑞典的法律科技公司 Legora,用 Astra 完成了一項原本要耗掉專業人員整個下午的工作。這個案例沒有 99.9% 那種聳動的數字,卻比任何一個基準測試分數都更接近一個實際的問題——當一項具體的專業工作真的被 AI 接手了一半,剩下的那一半會變成什麼樣子?
從這裡開始講,會比從「AGI 到了沒」開始講,有用得多。

發布會的頭條是一句宣言,但值得細看的通常是後面附的那些應用案例。
41 份文件、4 個陷阱,和一個消失的下午
這個任務原本長什麼樣子
先解釋一下這件事到底在做什麼,因為它比聽起來無聊,也比聽起來重要。
財務報表的「交叉核對」(financial-statement tie-out),簡單說就是:把一份財報草稿裡的每一個數字,回頭跟支撐它的原始附表逐一比對,確認沒有哪個數字在傳抄過程中變形。這是會計師事務所與法務團隊的日常,沒有創意可言,需要的是耐心、細心,以及大量的下午。
根據 OpenAI 在 2026 年 9 月 3 日發布的客戶案例,Legora 讓 GPT-6 Astra 一次讀進 41 份文件,交叉檢查每一筆餘額,並且把每一次檢查都記錄下來供人覆核。測試團隊事先在文件裡埋了 4 個錯誤,其中最刁鑽的一個是藏在營收附註中的 50 萬英鎊落差。
四個,全中。

一次讀進 41 份文件並逐筆比對,是這個案例最關鍵的技術門檻——過去多數法律 AI 展示在十份文件之後就會開始遺漏引註。
為什麼「41 份」這個數字值得注意
重點其實不在 41 這個數量本身,而在於一次處理。
科技媒體 startuphub.ai 在報導中點出一個容易被略過的細節:多數法律 AI 展示品在超過十份文件之後就會開始出錯或掉引註,所以能不能「一口氣吃下整批文件並且維持可稽核的輸出」,才是實務上的分水嶺。同一則報導也補充,Astra 保留了前代模型答對的所有項目,另外多抓出約 50 個先前被漏掉的檢查點。
換句話說:不只是更快,而且沒有為了快而犧牲原本的正確率。這在自動化的歷史裡並不是理所當然的事。
40% 與 3%:同一份新聞稿裡的兩個數字
一個誠實得有點意外的限定語
如果故事只講到這裡,結論會很簡單:文件審查工作要消失了。
但 OpenAI 自己的案例頁面裡就寫著另一個數字。Legora 使用自家的「代理式推理基準」(Benchmark for Agentic Reasoning, BAR)來評估 Astra,在這個財報核對的工作流程上,表現比前代模型提升接近 40%;然而把測試範圍擴大到 BAR 涵蓋的全部法律任務之後,平均提升只有大約 3%。
40% 和 3%,出現在同一段文字裡。
這個落差不是矛盾,而是整件事最有資訊量的地方。它告訴我們:AI 目前的能力提升高度任務特定。在那些「規則明確、答案可驗證、輸入輸出都結構化」的任務上,進展非常猛烈;一旦離開這個舒適圈,曲線立刻平掉。
這個現象在別的指標上也看得到
如果覺得單一案例說服力不夠,Astra 發布時公布的其他分數也呈現同樣的形狀:
| 測試項目 | 分數 | 這代表什麼 |
|---|---|---|
| ExploitBench(資安漏洞利用) | 100% | 目標明確、成功與否可自動判定 |
| ARC-AGI-3(廠商特製評測介面) | 99.9% | 保留不透明推理狀態、支援長對話壓縮 |
| ARC-AGI-3(標準公平基準) | 62.7% | 同一個模型,換個評測環境掉了近 40 個百分點 |
| OSWorld 2.0(電腦操作) | 72.6%(前代 65.7%) | 更接近真實桌面工作,進步幅度明顯縮小 |
| 「設計工作」類任務 | 50.0% | 開放性高、沒有單一正確答案 |
| 「自動化工作」類任務 | 41.4% | 最貼近真實職場的綜合表現 |
看完這張表,你大概會發現一件事:越像「考試」的任務分數越高,越像「工作」的任務分數越低。
回頭看記者會上那句「Welcome to the AGI era」,它本身沒有造假,Astra 的確在多項指標上大幅超越前代。但把它放進上面這張表裡看,感受會相當不同——41.4% 這個數字,離「大多數具經濟價值的工作都超越人類」還有相當距離。
值得一提的是,ARC Prize 共同創辦人 Mike Knoop 在驗證這些分數後的評語相當克制:他認為這是朝 AGI 方向「質性上的一大步」,但同時明確表示目前仍缺乏足夠證據可以稱之為 AGI,並指出「開放式發明」的能力尚未被解決。

同一個模型在不同性質任務上的表現差異,比模型世代之間的差異還大。
經濟學家看到的畫面:位移,而不是消失
目前的實證證據長什麼樣
科技新聞的節奏是以「發布日」為單位,勞動市場的節奏是以「季」甚至「年」為單位。所以如果想知道 AI 到底對工作做了什麼,得去看另一批人的資料。
Law & Economics Center 在 2026 年初整理的實證文獻回顧,結論相當一致:截至 2024–2025 年,沒有證據顯示出現全經濟範圍的立即性勞動取代。研究看到的是另一種東西——任務重新分配、品質提升、企業內部生產力上升,而不是大規模裁員。
亞特蘭大聯邦準備銀行 2026 年 3 月的工作論文則直接調查企業高階主管,估算出的 AI 相關勞動生產力成長約為 0.6%。這份研究也提到,2026 年因 AI 導致的就業減少估計約 50 萬人,其中約半數來自高技術服務業——但作者自己補了一句相當重要的話:這些數字建立在既有企業的回答上,如果新技術同時帶動新公司成立、把勞動力吸引到調查涵蓋不到的年輕企業,實際淨效果可能更小。
最耐人尋味的一份研究來自丹麥。Humlum 與 Vestergaard(2026)把聊天機器人的採用調查連結到丹麥的行政資料庫,結果發現:對個人收入與工時的影響,精確估計為零。然而在同一批資料裡,導入 AI 的工作場所確實出現了任務重組,也確實生出了新的 AI 相關職位。
零效果,加上明顯的內部重組。這兩件事同時成立,正是「重新分配」這個詞的具體樣貌。
為什麼總體數字這麼安靜
一個常見的誤解是:既然實驗顯示生成式 AI 能讓某些任務快 40%、甚至 56%,那總體生產力應該要飛起來。
問題在於,沒有人的工作是由單一任務組成的。
Eloundou 等人 2023 年那篇被引用到爛的《GPTs are GPTs》給了一個具體的量級:平均而言,一個職業裡約 15% 的任務會被 LLM 直接影響;若把 LLM 驅動的軟體工具一起算進來,這個比例會超過 30%。研究同時估計,約有 19% 的職業有一半以上的任務屬於高暴露度。
注意「暴露度」這個詞的定義——它衡量的是技術上有沒有可能讓某個任務省下一半以上時間,不是「這件事實際上會不會被自動化」。研究作者自己就寫得很清楚:社會、經濟、法規等因素意味著技術可行性不等於自動化結果。
把這兩件事拼起來就通了:即使 AI 在某項任務上快十倍,只要那項任務只佔你一天工作的 15%,剩下的 85% 就會立刻變成新的瓶頸。這是為什麼 Legora 案例會出現「單一工作流程進步 40%、整套任務只進步 3%」——它不是 AI 不夠強,而是工作本身的結構就長這樣。
被重新分配的不只是任務,還有「誰有資格做判斷」
兩種完全不同的命運
哈佛商學院一份研究把生成式 AI 對職業的影響拆成兩類,這個區分比「會不會被取代」有用得多:
- 傾向被自動化的職業:任務被簡化,對專業技能的需求下降,勞動需求跟著萎縮。
- 傾向被擴增的職業:需求上升,而且技能要求變得更複雜。
同一個技術,兩種相反的結果,差別在於任務的性質是「結構化」還是需要判斷與整合。
亞特蘭大聯準會那份調查也觀察到相同方向的組合變化:常規文書職位下降,工程師、資料分析師等技術性職位的相對需求上升。
回到那 41 份文件
現在把這個框架套回 Legora 的案例,會看到一個很具體的畫面。
在這個新流程裡,AI 負責的是「窮盡式比對」——把每一個數字跟每一份附表對過一遍,不會累、不會跳行、不會在第 37 份文件時想著晚餐。而 Legora 明確保留給人的,是對每一項結果做出判斷。OpenAI 的案例頁面把這種「保持人在迴路中」的設計,描述為該公司把平台從法律業務延伸到審計、稅務、法遵與風險管理時的核心原則。
所以工作沒有消失,但它的重心整個往上移了。
原本一位資淺法務或審計人員的一天,可能包含大量的「找出不一致」加上少量的「判斷這個不一致要不要緊」。現在前者被壓縮,後者變成工作的全部。
這聽起來像升級,某種意義上也確實是。但它帶來一個尷尬的問題:判斷力是從哪裡來的?
過去很多專業的養成路徑,正是靠著做完幾百份枯燥的核對,慢慢長出「這個數字怪怪的」的直覺。如果入門階段的重複性工作被移走,訓練場也一併被移走了。這件事目前還沒有足夠的長期資料可以下定論,但 2025–2026 年的觀察報告已經注意到一個早期訊號:在可自動化任務密集的領域,入門級職缺的招聘速度變慢了。

當 AI 接手了初階比對工作,專業養成的階梯也少了一截。
那接下來呢:三個值得盯著看的問題
一、省下的時間去了哪裡
這是最基本、也最少被問的問題。
一個下午變成幾分鐘,那多出來的那個下午,是變成了更多案件量、更低的收費、更早下班,還是變成了「反正 AI 很快,那我們接三倍的案子」?
不同的答案會導向完全不同的社會結果,而這個答案通常不是由技術決定的,是由組織與市場決定的。
二、誰來為 AI 的判斷負責
Legora 的做法是把最終判斷留給專業人士,這也是目前法遵環境下唯一站得住腳的設計。但當一次比對產生上百個檢查點,人類覆核者實際上能覆核到什麼程度?
這裡有一個常被忽略的風險:當機器的正確率高到某個程度,人的覆核就會逐漸退化成蓋章。這不是假設,是自動化研究裡的老問題。
三、如果現在的數字只是起點呢
必須誠實面對的一點是:以上所有實證研究,看的都是 2024–2025 年的資料,也就是 GPT-6 Astra 這一代模型出現之前的世界。
Astra 在 OSWorld 2.0 上把任務耗時從約 75 分鐘壓到約 40 分鐘;英國 AI 安全研究機構的測試也顯示,它能持續處理複雜問題約 30.9 分鐘,而前代模型約為 3.6 分鐘。持續作業能力提升近十倍,這種變化能不能在下一輪勞動市場資料裡看到,現在誰也說不準。
換句話說:目前的「調整而非取代」結論是有保存期限的。
❓ 常見問題
Q1:所以 AI 到底會不會讓人失業?
以目前的實證資料來看,2024–2025 年並未出現全經濟範圍的立即性取代,多數研究看到的是任務重新分配。但這不代表沒有變化——常規文書類職位確實在減少,同時技術性職位需求上升。比較準確的說法是:整體就業人數目前還撐得住,但工作的內部結構已經在改寫。
Q2:那個 99.9% 的分數是造假嗎?
不是造假,但它需要脈絡。同一個模型在 ARC-AGI-3 上,用廠商特製的評測介面得到 99.9%,用標準公平基準則是 62.7%。差別在於評測環境是否允許保留記憶狀態、如何串接工具。這說明所謂「AGI 分數」有相當大一部分取決於外部系統設計,而不只是模型本身的推理能力。
Q3:Legora 那個 40% 和 3%,哪個才是真的?
兩個都是真的,只是測量的東西不同。40% 是單一財報核對工作流程的改善幅度,3% 是整套法律任務基準的平均改善幅度。這個落差本身就是重要資訊:AI 的能力提升目前高度集中在特定類型的任務上。
Q4:如果我念的是人文社科,這件事跟我有關嗎?
從研究框架來看,關鍵不是科系,而是未來的工作內容裡有多少比例屬於「結構化、規則明確、答案可驗證」的任務。哈佛商學院的研究指出,傾向被擴增的職業技能要求反而變得更複雜——需要判斷、整合、溝通與承擔責任的部分,短期內仍是人的地盤。
Q5:為什麼實驗室裡的生產力提升,在總體經濟數據上看不太到?
因為沒有人的工作只由一項任務構成。研究估計平均一個職業約有 15% 的任務會被 LLM 直接影響,即使那部分快十倍,剩下的部分就會成為新瓶頸。亞特蘭大聯準會估算的 AI 相關勞動生產力成長約為 0.6%,遠低於單項任務實驗的數字,原因就在這裡。
結論:把問題問對,比把答案猜對重要
「AI 會不會取代人類工作」是一個吸引人但幾乎無法回答的問題,因為它把幾百種性質完全不同的活動塞進同一個籃子裡。
Legora 的 41 份文件之所以值得討論,不是因為它證明了什麼末日預言,而是因為它同時展示了兩件事:在某一類任務上,機器已經明確比人快、比人穩;而在同一份新聞稿的下一段,那個 3% 提醒我們這類任務在整體工作中佔的比例仍然有限。
真正的變化發生在中間地帶——工作被拆開、重組、重新分配,有些部分被壓縮到幾乎不存在,有些部分反而被放大成整個職位的核心。而這個重組過程裡最脆弱的環節,可能不是資深專業人士,而是那些原本要靠重複性工作長出判斷力的新人。
技術的曲線正在加速,但制度、訓練管道與責任歸屬的調整速度,向來慢得多。回到 9 月 3 日的那場記者會——Brockman 把「算不算 AGI」的判斷權交給了聽眾,這個動作本身或許就是答案:與其等一個定義被宣布,不如去看那些具體的、正在被拆開重組的工作。下一輪勞動市場資料出爐時,我們大概才會知道,2026 年這個秋天到底是不是一個轉折點。
🔎 延伸搜尋
📚 參考資料來源
- Legora reviewed 41 documents in minutes with GPT-6 Astra(OpenAI 官方案例)
- Today in AI: GPT-6 Astra Reviews 41 Files in Minutes(startuphub.ai)
- GPT-6 Astra Financial Document Review: Legora Case Study Analysis
- GPTs are GPTs: An Early Look at the Labor Market Impact Potential of Large Language Models(Eloundou, Manning, Mishkin & Rock, 2023)
- AI, Productivity, and Labor Markets: A Review of the Empirical Evidence(Law & Economics Center)
- Artificial Intelligence, Productivity, and the Workforce(Federal Reserve Bank of Atlanta 工作論文, 2026)
- Generative AI and the Reorganization of Labor Demand
- Displacement or Complementarity? The Labor Market Consequences of Generative AI(Harvard Business School)
- The Projected Impact of Generative AI on Future Productivity Growth(Wharton Budget Model)