AI 如何永久改變數學與科學 -- Terence Tao

我認為,我們應該讓「失敗」成為學習過程中一件正常的事情。我們應該讓大家知道,每一個成功的問題解答背後,往往都有數十次錯誤的嘗試。這並不是因為嘗試解決問題的人不夠聰明,而是因為失敗本來就是學習與探索過程的一部分。 幾個世紀以來,科學與數學已經發生了很大的變化。 傳統上,科學主要建立在兩種研究典範之上:理論與實驗。 科學家首先提出一套理論。例如,克卜勒可能提出行星如何運動的理論,牛頓則提出重力理論。接著,人們進行實驗或蒐集觀測資料,看看實際發生了什麼,再比較理論預測與實驗結果是否吻合。 數學則稍有不同,因為數學幾乎完全建立在理論之上。純數學很少進行我們通常所說的「實驗」,但仍然有一些著名的例外。 例如,高斯曾經計算大量質數,建立一組數據,並利用這些資料觀察質數分布的規律,進而預測我們今天所稱的質數定理(Prime Number Theorem)。 後來,科學研究又出現了第三種重要方法:模擬(simulation)。 有些研究不一定需要真的進行龐大而昂貴的實驗。例如,我們可以利用超級電腦模擬颶風,而不需要在真實世界中製造一場颶風。 再後來,大數據(Big Data)出現了。 研究者不再只是進行少量實驗,來驗證或否定某一個特定理論,而是可以取得數百萬位元組,甚至 PB(petabyte)等級的龐大資料,從中尋找規律、辨識模式,甚至嘗試從巨量資料中歸納出自然法則。 這逐漸形成另一種新的科學研究模式。

然而現在,所有這些科學研究方式都正在發生變化,因為我們多了一項新的工具——人工智慧(AI)。 過去,不論採用哪一種研究方式,核心工作都必須由人類科學家完成。 有人必須親自進行實驗;有人必須進行理論計算;有人必須執行模擬;也有人必須分析龐大的資料。 當然,我們早就可以使用電腦協助完成其中一些工作,但即使如此,仍然需要人類撰寫程式、建立資料分析工具,而且需要相當程度的專業知識。 如今,情況正在改變。 我們已經有自動化實驗室,可以自動進行實驗;也可以讓程式設計代理工具替我們執行模擬;資料分析同樣可以逐漸自動化。 甚至連「理論研究」也開始可以部分自動化。 例如,我們可以把一個數學問題交給 AI,告訴它某些假設與公理,然後詢問: 「從這些假設與公理出發,可以推導出什麼結果?」 這些工作如今可以大規模進行,而且速度遠超過過去。一套 AI 系統潛在地可以進行遠多於任何單一人類科學家所能完成的理論分析。 然而,速度並不是我們唯一追求的東西。 用比較慢的方法做科學,其實也有它的價值。 一名科學家可能花上好幾個小時,用紙筆一步一步推導;可能親自在野外進行實驗;也可能花很多時間除錯模擬程式。 在這些過程中,他所得到的往往不只是原本想尋找的那個答案。 他可能發現新的現象,發現不同問題之間的關聯,也可能察覺目前的問題與過去文獻中某個研究有相似之處。 而且,他還可以把自己在探索過程中所理解到的事情傳達給其他人。 於是,我們面臨一個非常有趣的矛盾。

一方面,AI 變得愈來愈強大、能力愈來愈好、犯的錯誤也愈來愈少。表面上,它正在完成許多我們認為科學家應該完成的工作:進行實驗、分析資料、撰寫論文。 但是,這可能需要付出某種代價。 AI 本身可能因此變得愈來愈有能力,但人類科學家卻不一定因此變得更會做科學。 甚至可能沒有人能夠清楚說明剛才究竟發生了什麼事情:為什麼這項科學發現很有趣?為什麼這個證明是新的?它真正重要的特徵是什麼?它與其他研究又有什麼關係?

因此,我們可能必須重新思考: 科學究竟是什麼? 我們真正希望從科學中得到什麼? 科學存在的目的究竟是什麼? 以及,當我們把 AI 工具大量應用到科學研究時,是否有可能其實正在最佳化一個錯誤的目標? 我以前曾經用過一個比喻。 做科學有一點像去爬山健行。 你聽說山裡有一道非常漂亮的瀑布,因此決定和幾個朋友一起去尋找它。 一路上,你需要研究地圖,也可能會迷路。 但是,在迷路的過程中,你可能意外發現另一個有趣的地方,於是把它記錄下來。 甚至在前往原本那座瀑布的途中,你可能在遠方看到另一座更加壯觀的瀑布。你現在還不知道怎麼到達那裡,但是未來或許會有另一位登山者找到通往那裡的道路。 因此,抵達目的地並不是整趟旅程唯一有價值的事情。 前往目的地的整個探索過程,本身同樣非常重要。 但是 AI 工具有點像一架直升機。 它可以直接把你載到那座瀑布。 你從直升機下來,看到了瀑布,然後再搭直升機飛回去。 你的確非常有效率地完成了原來的目標。 可是,你完全不知道該怎麼走到那裡。 你也沒有看到沿途其他有趣的現象,更沒有機會發現那些原本並不在你的問題之中的新事物。 所以,雖然從技術上來說,你更加有效率地完成了任務,但在這個過程中,我們也可能失去了一些非常重要的東西。

機器學習與大型語言模型

現代人工智慧主要建立在一類稱為機器學習(Machine Learning)的演算法之上。機器學習的一項基本工作,就是從資料中尋找可以預測的模式。 最簡單的例子之一就是迴歸(regression)。 假設我們有一些輸入與輸出資料。例如,我們觀察不同動物吃多少食物,以及牠們的體重增加多少。 我們可以把餵食量畫在圖表的一個座標軸上,把體重畫在另一個座標軸上。如此就會得到許多資料點。 如果運氣很好,這些資料點大致排列在一條直線附近,我們就可以找出一條最符合資料的直線。 這條線便可以用來進行預測。 例如,給一隻狗某個數量的食物,我們就可以根據這條關係預測牠的體重大約會增加多少。 但真實世界通常沒有這麼簡單。 很多問題同時具有大量輸入與大量輸出,而且它們之間的關係可能極為複雜。 然而,即使如此,資料往往仍然存在某種「形狀」或結構。今天我們已經發展出許多巧妙的方法,可以偵測這些結構,並尋找某種曲線或數學關係來描述輸入與輸出之間的關聯。

驅動聊天機器人等系統的大型語言模型(Large Language Model,LLM),從最基本的角度來看,做的事情就是: 預測一句話中的下一個詞。 例如,我說: 「玫瑰是紅色的,紫羅蘭是__色的。」 你大概可以猜到下一個詞是「藍」。 我們可以把這件事情想像成一個巨大無比的資料空間:輸入是無數個尚未完成的句子,而輸出則是應該接在後面的詞。 模型的工作,就是從這個極高維度的空間中找出某種規律,預測接下來最有可能出現哪一個詞。 當然,有時候並不存在唯一答案。 例如: 「你好,我的名字是__。」 後面可以接無數個不同的名字。因此,模型不一定是在尋找唯一正確的答案,而是在尋找最合理、最可能出現的答案。 其實手機上的自動完成文字功能早就在做類似的事情。當你輸入一段文字時,手機會建議下一個詞。有時候猜得很準,有時候卻非常荒謬。 如果只是一直重複按下自動完成,最後通常會產生一堆毫無意義的句子,就像讓猴子坐在打字機前亂打字一樣。 然而,大型語言模型真正令人驚訝的地方在於: 當你用足夠龐大的資料訓練它——可能是數兆等級的資料點——並投入巨大的運算資源與數個月的訓練時間之後,情況突然變得完全不同。 即使讓模型不斷產生下一個詞,它所產生的內容仍然可以保持連貫。 它不再像猴子亂敲打字機,而開始像一個真正的人在說話。 而我們其實還沒有完全理解,為什麼會出現這種現象。 其中一種可能的解釋是:英語以及其他自然語言本身包含大量我們並沒有明確意識到的隱藏規律。 我們當然知道一些語言規則,例如文法。 但語言中還存在大量沒有明文寫下來的規則,而人類可以自然地學會它們。 一個小孩即使從來沒有人正式教他什麼是名詞、什麼是動詞,他仍然可以透過不斷接觸語言,自然而然學會英文單字應該按照什麼順序排列。 看起來,我們也可以讓人工智慧模型透過大量資料,學習到類似的語言模式。 當模型掌握足夠的語言規律之後,我們甚至可以問它數學問題: 「2 加 3 等於多少?」 它會回答「5」。 至少對於簡單的數學問題,它已經能夠學會給出正確答案。 一旦模型具備一定程度的語言能力,我們還可以讓它反覆檢查自己的工作。 我們可以要求它一步一步進行推理,要求它在回答之前再次檢查結果。 透過這些方法,它犯錯的機率可能降低,也因此看起來變得更加「聰明」,甚至能夠完成許多相當複雜的任務。

但從根本上來說,它仍然是在猜下一個應該出現的詞。 它並不一定真正建立在對現實世界深刻理解的基礎之上。 更準確地說,它對英文以及其他吸收過的語言模式掌握得非常好,因此能夠模仿那些以聰明方式說話的人。 而這種模仿能力已經強大到足以讓它完成真正有用的工作。 例如,我們現在可以要求大型語言模型嘗試提出某個數學問題的證明。 有時候,它提出的證明完全是胡說八道。 但是,如果讓它重複嘗試足夠多次,再加入足夠的檢查機制,最後確實可能得到正確答案。 這是一種非常奇特的解題方式。 它與我們傳統想像中的「智慧」幾乎完全不同。 我們通常認為智慧應該建立在對問題的深刻理解、嚴謹的方法以及第一原理的推導之上。 AI 卻有點像一個知道非常多事情、但稍微喝醉了的人。 他不停地拋出各種想法,其中有些可能非常荒謬。 可是,只要給予足夠的引導,我們仍然可以從這些大量的嘗試中,萃取出真正有用的結果。

人類擅長深度,AI 擅長廣度

關於 AI 在科學以及其他領域中的角色,我發現許多討論往往採用一種過於一維的思考方式。 我們會把問題分成: 簡單的問題、困難的問題、非常困難的問題。 然後問: 「人類最多可以解決多困難的問題?」 「AI 最多又能解決多困難的問題?」 最後比較到底誰比較厲害。 但根據我實際使用 AI,並比較 AI 與人類解決問題的方法之後,我發現兩者其實具有很強的互補性。 人類專家擅長的是深度,而 AI 擅長的是廣度。 例如,一位人類數學家面前可能有成千上萬個問題可以研究,但他通常只會挑選其中一兩個。 他會選擇那些很困難、但又沒有困難到完全不可能解決的問題。 因為光是在試圖對這些問題取得一點進展的過程中,就可能產生許多新的洞見。 而這些洞見又可以分享給學生、合作夥伴以及其他研究者,讓其他人繼續發展。 相反地,如果我們把 AI 直接丟到真正極端困難、完全沒有標準方法可以使用的問題上,目前它的表現仍然很差。 在這些問題上,它往往只是在隨機猜測。 可是,AI 在廣度方面卻非常出色。 假設我們一次交給 AI 一千個不同難度的問題。 其中有些問題確實太困難,AI 解不出來。

但其中可能有一些問題,其實現有的數學方法已經足以解決,只是沒有人注意到。也許在某一本 1970 年代出版、現在很少有人閱讀的期刊中,就存在一個關鍵方法,可以解決今天的某個問題。人類專家不一定知道那篇論文的存在。即使知道,也不一定有足夠的時間與耐心,把所有可能的方法與所有問題逐一配對嘗試。但是 AI 可以這麼做。它可以大量嘗試不同的方法。有些嘗試會非常愚蠢。但是,有些嘗試真的可能成功。透過大量不同組合的探索,我們開始發現,AI 偶爾真的可以找到所有人類研究者都錯過的解答。

還有另一種情況也非常有趣。有時候,專家之間已經形成某種共識,而這個共識可能是錯的。例如,大家都認為某個數學問題的答案應該是肯定的,因此幾乎沒有人認真研究答案是否可能是否定的。AI 卻不一定具有這種先入為主的觀念。因此,它有時候就像多了一雙獨立的眼睛,從不同方向重新檢查問題。結果,一些原本被認為非常困難的問題,竟然可能存在出乎意料的簡單解法。事後回頭看,我們甚至可能會想:
「這個方法其實人類自己也應該想得到。」
AI 現在開始展現出一種新的能力:當我們把大量問題同時交給它時,它可能解出其中一定比例的問題。假設我們交給它 1,000 個問題,它只成功解決 5%。5% 聽起來似乎不高。但那仍然代表:50 個問題被解決了。因此,如果單純以「解決問題的數量」衡量,某些 AI 工具在某種意義上已經可能超越單一的人類數學家。當然,這 50 個被解決的問題,不一定是我們最希望解決的那 50 個。它們可能只是隨機散布在一千個問題之中的 50 個。但是,即使如此,這仍然是一項非常令人印象深刻的新能力。未來我們真正需要思考的,是如何把 AI 這種大規模、廣泛探索問題的能力,與人類原本擅長的長時間深入研究少數重要問題的能力結合起來。真正有價值的方向,或許並不是讓 AI 取代人類科學家,而是讓這兩種截然不同的能力彼此互補。

為什麼更快不一定更好

未來,數學與科學界必須找到一種方法,把 AI 能夠大規模解決問題的能力,與人類原本擅長的、針對少數重要問題進行長時間深入研究的能力結合起來。克卜勒發現著名行星運動定律的故事,就是一個非常好的例子。它讓我們看到,在科學研究中,探索的過程本身究竟有多麼重要。克卜勒得知哥白尼所提出的行星運動理論之後,開始研究太陽系的結構。哥白尼當時已經大致估算出地球與太陽的距離、火星與太陽的距離,以及其他行星軌道的相對大小。

克卜勒注意到,這些行星軌道大小之間的比例,似乎與幾何學中的某些比例具有相似之處。最後,他提出了一個非常漂亮的幾何構想。當時已知的行星共有六顆,因此可以想像有六個球面,每一個球面代表一顆行星的軌道。在這六個球面之間,恰好可以放入五種正多面體,也就是我們今天所說的柏拉圖立體(Platonic solids),包括正十二面體、立方體、正四面體等等。克卜勒認為,如果依照某種順序,把五種正多面體一層一層嵌入六個行星軌道的球面之間,就可以完美解釋為什麼太陽系中的行星會具有這樣的軌道大小。這是一個極其優美的幾何理論。

但是後來,克卜勒取得了第谷·布拉赫(Tycho Brahe)非常高精度的天文觀測資料。取得這些資料的過程本身並不容易,甚至充滿爭議。當克卜勒真正拿這些高精度資料來檢驗自己的理論時,卻發現:他的漂亮理論並不完全符合觀測結果。第谷的資料精確到足以讓那些細微的差異無法被忽略。也正是在不斷嘗試讓理論符合觀測資料的過程中,克卜勒逐漸發現,火星與地球的軌道根本不可能是完美的圓。它們必須是另一種形狀。

克卜勒花了很多年的時間研究這個問題。從他的著作中可以看到,他曾經嘗試過許多不同的方法。他試著讓圓的中心偏離太陽,也試過各種其他幾何安排。最後,他嘗試了橢圓。突然之間,一切都吻合了。這個故事顯示出理論與實驗之間非常重要的互動關係。我們可以提出一個理論,但如果理論與資料不符合,那麼這個理論可能就不是一個好的理論。然而,事情其實又沒有這麼簡單。

在克卜勒之前,人們對哥白尼日心說的一項重要批評,就是哥白尼自己的模型在預測行星位置方面,原本甚至還不如當時最好的地心模型。當時的地心模型經過希臘、阿拉伯以及印度學者長時間的發展,不斷加入各種修正與精細調整,因此已經可以相當準確地預測行星的位置。相比之下,哥白尼最初提出的日心模型,在預測能力上反而比較差。因此,與資料吻合得最好,並不一定是判斷一個科學理論價值的唯一標準。一直到克卜勒修正日心模型,發現行星軌道不是圓,而是橢圓之後,日心模型在預測精確度上才真正超越地心模型。這告訴我們一件非常重要的事情:

科學問題並不總是能夠立即得到回饋,告訴你自己究竟做對了還是做錯了。

假設克卜勒與哥白尼當時就擁有 AI,他們要求 AI 建立一套宇宙模型。那麼,很可能會發生一件非常諷刺的事情:AI 也許產生了正確方向的日心模型,但是因為它在最初階段的預測精確度比地心模型差,因此這個模型可能立刻就被系統淘汰掉。可是,我們今天知道,真正正確的方向恰恰是日心模型。問題在於,一個新的科學理論往往需要時間。我們必須慢慢理解它,看看它如何與我們對行星、運動、重力以及其他自然現象的知識結合。因此,我真正擔心的一件事情反而是:AI 可能太快了。AI 有可能產生所謂的過度擬合(overfitting)也就是說,它可以建立一個極其複雜的模型,這個模型與真正發生的物理機制其實沒有太大關係,卻能夠非常精確地符合我們目前手上的資料。但是一旦離開原來的資料範圍,這個模型就失去預測能力。所以,如何把 AI 真正整合進科學發現的過程,將是一項重要挑戰。AI 當然可以加速科學研究中的許多個別步驟。我們可以更快進行實驗、更快撰寫程式,也可以更快完成論文。但是:

每一個步驟都變快,並不代表科學整體一定會以相同比例加速。

真正的危險在於,我們可能把 AI 用來最佳化錯誤的東西。表面上,我們可能得到大量令人驚訝的成果:更多實驗、更多計算、更多論文、更多證明。可是最後卻可能發現,科學並沒有以我們原本期待的方式真正向前發展。儘管如此,擁有這些 AI 工具仍然比完全沒有它們更好。真正的問題是:我們仍然正在學習,究竟應該如何最有效、最有意義地使用它們。 AI 可以產生證明,但誰來理解這些證明? 數學研究的一項核心工作,就是解決問題以及證明定理。而一個數學證明從誕生到真正成為人類知識的一部分,其實會經歷一個完整的生命週期。第一步,是過去,這通常非常困難。而且即使產生了一個證明,也不代表它一定正確。因此接下來還必須進行第二步:驗證證明。也就是仔細檢查它到底對不對。過去,這同樣是一項非常耗費時間的工作。然而現在,這兩項工作都正在快速自動化。AI 可以產生愈來愈多問題的候選解答,也可以協助檢查這些證明,而其中確實有不少證明是正確的。但是新的問題也隨之出現:證明開始變得愈來愈長。而且 AI 寫出來的證明,往往並不好讀。

AI 產生的證明可能花大量篇幅解釋一個非常簡單、甚至幾乎不需要解釋的步驟,卻只用很短的篇幅處理整篇論文真正最重要、最困難的部分。其中一個原因可能是:AI 並不知道哪一個步驟真正困難。對 AI 而言,透過大量運算處理每個步驟,所花費的「心理努力」並沒有像人類那樣明顯不同。但人類數學家的情況完全不一樣。如果一名數學家花了幾個星期甚至幾個月,才突破某個關鍵步驟,那麼當他撰寫論文時,自然會知道:「這裡才是最重要的地方。」因此,他會花更多篇幅解釋這一步。這就是為什麼,一個數學證明不只是要「正確」,還必須被重新組織、重新撰寫,使其他人真正能夠閱讀與理解。接下來,還有另一個重要階段:

其他數學家必須對這個結果產生興趣。

他們必須覺得:「這個結果真的很有意思。」「它可以幫助我解決自己的問題。」或者:「它讓我終於理解為什麼某個現象會成立。」這也是傳統同儕審查(peer review)制度的重要功能之一。我們把論文送給審查者。如果審查者認為這項結果正確、重要而且值得發表,論文才會被接受。因為一篇論文即使在技術上完全正確、文字也寫得很清楚,仍然可能只是在回答一個根本沒有人關心的問題。最後,一項研究成果還必須經過更長時間的整理。

它必須被充分消化、重新整理,最後進入教科書,再傳授給下一代學生。而一個證明最初被發現時的版本,通常並不適合直接放進教科書。最初的證明可能非常沒有效率。它的推導順序也可能並不自然。研究者在發現答案時,也許先走了很多彎路,最後才找到解法。因此,後來還需要有人花很多時間仔細思考:
這個證明真正最合理的邏輯順序是什麼?
我們必須重新組織、刪除不必要的部分、凸顯真正關鍵的想法,使整個證明按照最自然的方式呈現。這有一點像剪輯紀錄片或電影。拍攝時得到的素材順序,通常不是觀眾最後看到的順序。真正好的作品,需要經過重新整理與剪輯。

「證明消化不良」:AI 帶來的新問題

目前我們正在看到一個非常有趣的現象。AI 工具正在大幅加速數學研究生命週期的前半段,但是後半段並沒有以相同速度加快。我們現在可以產生大量證明。我們也可以驗證其中很多證明。但是,真正理解這些證明、整理它們、找出其中最重要的概念,最後把它們變成適合放入教科書的知識,這些工作仍然主要由人類完成。因此,我們開始面臨一種可以稱為:「證明消化不良」(proof indigestion)的現象。

突然之間,我們手上出現大量等待理解的問題解答。這些成果理論上都應該有人去閱讀、理解、整理,最後納入人類的知識體系。可是數量實在太多了。我們被大量的新結果淹沒。於是,我們不得不開始進行篩選。哪些值得先看?哪些真正重要?哪些應該進一步研究?哪些應該整理進教科書?這是過去數學界幾乎從未真正面對過的問題。

以前,一個重要問題被解決是非常罕見的事情。如果某個重大問題突然有人提出解答,相關領域的專家可能會立刻放下手上的工作,趕快去閱讀這篇論文,希望盡快理解它。因為這樣的成果非常稀有,也非常珍貴。但現在,我們正在開始被大量可能的解答所淹沒。甚至連我自己,也不得不逐漸放棄「掌握自己研究領域所有最新發展」這件事情。有時候,新成果真的太多了。我已經無法保證自己可以閱讀每一項最新出現的研究。

其實,在 AI 出現之前,這個問題就已經開始發生。但是 AI 大幅加速了內容產生的速度,使這個問題變得更加嚴重。因此,未來我們需要的不只是更強的 AI。 我們還需要更好的:整理、篩選與判斷機制。從某個角度來說,這是一個「好問題」。它有點像食物太多,多到吃不完。這當然比完全沒有食物好。但是 食物多到根本無法消化,仍然是一個需要解決的問題。 AI 現在能做到什麼,以及我們可能失去什麼? 近年來,AI 在數學方面的能力變得愈來愈強。對於像我這樣,過去幾年一直持續關注 AI 發展的人來說,可以很清楚地看到一個穩定的進步過程。大約四年前,AI 能夠解決的主要還是國中程度的數學問題。後來,它開始能夠處理高中數學。再接下來,它開始能解決高中數學奧林匹亞競賽等級的題目。之後,它又逐漸進展到可以處理某些研究所資格考試程度的問題。現在,它甚至開始能夠解決少數尚未解決的數學問題,例如一些過去可能由保羅?艾狄胥(Paul Erd?s)提出、但一直沒有太多人認真研究的小型問題。其中很多可以說是數學研究中的「低垂果實」——也就是相對容易取得的成果。

然而,最近已經出現一兩個案例,AI 成功解決了一些人類數學家確實曾經非常努力嘗試、卻始終沒有解決的問題。有時候,人類研究者可能集體走錯了方向。AI 因為具有與人類不同的偏見與思考傾向,反而能夠把幾種不同的方法拼湊起來,形成一個相當巧妙的解答。而且這些 AI 發現的方法,已經開始產生後續影響。例如,在與單位距離問題(unit distance problem)相關的一些問題上,人類數學家已經開始採用 AI 所找到的方法,進一步解決鄰近的問題。我個人覺得這是一件非常令人興奮的事情。

但對我的一些同事而言,這可能相當令人擔憂。尤其是那些沒有持續追蹤 AI 近年發展的人,可能會突然感到非常震驚。如果一位數學家對 AI 的印象仍然停留在 2023 年的 ChatGPT,那麼他可能記得,當時只要問 ChatGPT 一個困難的數學問題,它常常會給出完全錯誤甚至荒謬的答案。但今天的情況已經很不一樣。基本技術或許仍然屬於同一類型,但是人們已經找到許多降低錯誤率的方法,使這些系統開始真正具有實用價值。

我們真的知道 AI 有多厲害嗎?

不過,目前仍然存在一個很大的問題:這些成果究竟有多大的可重複性,我們其實並不清楚。許多令人印象深刻的 AI 數學成果,是由私人公司完成的。這些公司通常不會完整公開究竟投入了多少運算資源。為了解決某一道數學問題,他們究竟花了多少錢?是十萬美元的運算成本?還是一百萬美元?我們並不知道。我們甚至不知道真正的成功率是多少。例如,一家公司宣布:

「我們的 AI 解決了這個困難的數學問題。」

但是,它是不是只嘗試了這一道問題?還是其實嘗試了十道問題,只有一道成功?或者嘗試了一百道問題,最後挑出唯一成功的那一道?這些資訊非常重要。所以,儘管目前的成果確實令人印象深刻,我們仍然缺乏足夠資料來判斷:未來 AI 解決研究級數學問題,是否真的會變成一件經常發生的事情?還是只有在投入十萬美元、花上幾個月時間,再配上一個十人團隊的情況下,才偶爾能夠得到這樣的成果?

也許真正適合 AI 方法的問題,只占我們關心的數學問題中的 1%。目前我們還不知道答案。因此,現在已經有人開始嘗試用更科學的方法建立基準測試,真正衡量 AI 的數學能力。其中一項較新的測試稱為 FrontierMath。這類測試會使用研究等級的數學問題來測試最新模型。題目本身已經有答案,但是解答不公開給模型。根據這類測試的結果,目前最好的模型已經可以解決其中相當一部分中等難度的研究級數學問題。這意味著,AI 已經開始真正進入過去被認為只有專業數學研究者才能處理的領域。

AI 開始接手研究中的日常工作

在實際研究工作中,我認為我們每天進行的大量例行工作,現在已經有一定比例可以交給 AI 完成。當然,這些工具有時候仍然相當昂貴。某些 AI 系統為了解決一道問題,可能需要花費數百美元的運算成本。而且,即使花了這些錢,也不保證一定成功。有時候,它消耗了大量運算資源,最後仍然得不到任何有用的結果。但是在程式設計領域,我們已經開始看到非常明顯的變化。許多專業程式設計師表示,使用這些 AI 工具之後,他們撰寫程式的效率可能提高:5 倍、10 倍,甚至 100 倍。這當然是一件非常驚人的事情。

但是,同一批人也開始察覺另一個問題。他們發現自己正在逐漸失去:

不用 AI、完全靠自己撰寫程式的能力。

更嚴重的是,有時候 AI 產生的程式已經複雜到連使用者自己都沒有能力完整審查。於是,我們再次遇到一種交換:我們得到了速度。但是,也可能失去某些能力。所以:速度並不是一切。

為什麼人與人的合作仍然重要?

我非常喜歡數學研究中的合作。事實上,我到了職業生涯相當後期,才真正意識到合作對我的數學能力有多麼重要。我所學到的許多數學知識,其實是在研究所畢業之後,透過與不同領域的數學家及科學家合作而學會的。我把自己知道的東西教給他們。他們也把自己知道的東西教給我。透過這種交流,我自己的知識領域也變得愈來愈廣。如果你與某位合作夥伴一起工作了很長時間,有時候會出現一種非常特殊的默契。這有點像你和非常親近的朋友或家人相處很久之後,彼此熟悉到甚至可以接完對方還沒有說完的句子。

研究合作也可能達到這種程度,你才剛提出一個想法,甚至還沒有把整句話講完,對方就已經理解你的意思,並且可以立刻沿著這個方向繼續發展。人們當然也嘗試過用 AI 進行類似的合作。我們確實可以和 AI 對話。但它有時候會犯錯。有時候,它也會過度迎合使用者,只告訴你它認為你想聽的答案。而且,目前與 AI 的互動仍然比較像是一種個人與工具之間的互動。我曾經試過和其他研究者面對面合作,同時讓 AI 加入討論。但是 AI 有時候反而會打斷原本自然的討論節奏。

目前的 AI 還沒有辦法像人類研究夥伴那樣流暢地參與真正的學術對話。也許未來可以。另一個重要差異是共同記憶。如果你和一位合作夥伴今天討論一個問題,明天再見面的時候,可以很快從昨天停止的地方繼續。甚至有些合作夥伴幾年沒有見面,再次碰面時,仍然可以重新接起多年前討論過的問題。AI 現在雖然也具有一定程度的上下文能力,可以記住某些事情、做筆記,某種程度上模擬這種記憶,但是我們還沒有辦法像與長期合作夥伴相處那樣,真正與 AI 建立深度的思想默契。至少目前還做不到。

AI 最適合當助手,而不是取代思考

就我自己而言,目前我並不常使用 AI 直接進行真正核心的問題解決。到目前為止,我發現 AI 在次要研究工作方面特別有用。例如:文獻搜尋、檢查數學證明、撰寫程式,以及替我已經寫好的文章進行校對,看看有沒有地方可以寫得更精簡、更嚴謹。在這些事情上,它非常有幫助。但是在真正深入思考問題的時候,我目前仍然比較喜歡與人類合作。我與 AI 工作的節奏,仍然不像我與人類研究夥伴合作時那麼自然。當然,這也可能只是目前技術發展階段的限制。 未來的 AI 也許會變得更善於對話,甚至在人機互動方面愈來愈接近真正的人類合作夥伴。

如果 AI 取代研究生,下一代科學家從哪裡來?

目前,我們正處於一個有些危險的轉折點。這個問題甚至會影響整個科學研究體系以及研究經費的結構。一方面,AI 讓我們能夠以前所未有的速度產生科學研究的「成果」——或者至少是看起來像科學成果的東西。論文可以更多。證明可以更多。程式可以更多。資料分析可以更多。但是,這可能需要付出一項非常嚴重的代價:

我們可能正在消耗培養下一代科學家的種子。

例如,我們通常會給研究生一些訓練性質的研究問題。這些問題不一定是世界上最困難的問題。它們的目的,是讓年輕研究者第一次真正參與研究。學生透過這些問題學習:如何閱讀文獻、如何提出問題、如何嘗試失敗的方法、如何修正自己的想法、如何撰寫論文,以及如何獲得第一次研究成果與學術認可。這些經驗也是他們建立研究生涯的重要訓練。可是,偏偏就是這一類研究問題,現在正逐漸成為 AI 最有能力處理的問題。AI 已經可以重現許多研究生程度的論文。從純粹的「生產效率」來看,我們可能會問:既然 AI 可以做,為什麼還要讓研究生花幾個月去做?問題是:如果我們用 AI 取代研究生完成這些工作,那麼 AI 的確可以替我們產生研究生程度的論文,但是我們卻不會因此得到下一代科學家。這才是真正的危險。

研究生做那些看似不那麼重要、甚至效率很低的工作,其真正價值不只是那篇論文本身。那個過程是在培養一個未來的科學家。如果我們只衡量最終產出的論文數量,就很容易完全忽略這項價值。

科學不能只有產出,還需要「消化」

還有另一個相關的問題。如果我們沒有持續把 AI 產生的大量成果加以理解、整理與消化,使它們真正成為下一代人類與 AI 可以繼續使用的知識基礎,那麼科學社會最終甚至可能陷入停滯。我們也許會非常擅長利用現有技術,把所有已知方法最佳化到極致。但是,我們可能不再真正產生非常原創的新觀念。換句話說:AI 可以幫助我們更快地利用既有知識,但如果人類不再真正理解與吸收這些知識,下一次真正的概念突破又從哪裡來?因此,我們需要更公開、更深入地討論:基礎科學究竟是什麼?它有什麼用途?為什麼即使在 AI 時代,我們仍然需要由好奇心驅動的研究?為什麼我們仍然需要一個由人類組成的科學共同體,允許人們慢慢探索?有時候,這些探索可能非常緩慢。有時候甚至看起來沒有效率。它們當然不像最新的 AI 模型那麼快速。但是,這個過程本身仍然具有價值。

科學的價值不只是科技產品

我們也應該把科學研究中獲得的洞見,更積極地分享給社會大眾。今天的一般民眾很容易看到科學帶來的最終產品。我們有手機。我們有網際網路。我們有 GPS。我們每天都在使用科學與科技帶來的成果。但是很多人並沒有看到這些成果背後漫長的過程。他們也未必理解:對數學與科學具有基本理解,其實可以讓我們周遭的世界變得比較不那麼令人害怕,也變得更加清楚。今天很多人生活在某種焦慮之中。世界變得愈來愈複雜。科技、經濟、社會與資訊的變化都非常快速,人們經常覺得自己無法理解周遭正在發生的事情。

過去,我們在談論科學的重要性時,往往太強調那些「硬性的成果」:新的科技、新的產品、更快的電腦、更好的醫療技術,以及各種可以量化的產出。但是,我們比較少談到科學所具有的另一種較柔性的價值。科學可以使人的思考變得更加清晰。學習科學,不只是為了製造產品。學習數學,也不只是為了得到一個答案。科學訓練我們如何面對不知道的事情,如何提出問題,如何檢驗自己的想法,如何接受錯誤,以及如何根據新的證據改變原來的看法。這些都是非常重要的能力。而在 AI 愈來愈強大的時代,這些能力可能不但沒有變得不重要,反而變得更加重要。因此,這些科學所帶來的價值,仍然值得我們繼續支持與維護。