當(dāng)下,AI for Science正經(jīng)歷從“工具輔助”到“范式重構(gòu)”的認(rèn)知升級。一方面,DeepMind、微軟、中科院等機(jī)構(gòu)相繼推出面向材料、生物、物理領(lǐng)域的科學(xué)大模型,試圖用通用架構(gòu)覆蓋跨學(xué)科的科學(xué)推理任務(wù);另一方面,越來越多的研究者意識到,將通用大模型直接應(yīng)用于科學(xué)發(fā)現(xiàn),正遭遇日益明顯的邊際效益遞減。一個日益強(qiáng)烈的共識正在形成:AI for Science的真正瓶頸,不在模型大小,而在數(shù)據(jù)本身——更確切地說,是高質(zhì)量、可閉環(huán)的真實(shí)實(shí)驗(yàn)數(shù)據(jù)的系統(tǒng)性稀缺。
圍繞這一共識,當(dāng)前學(xué)術(shù)與產(chǎn)業(yè)界形成了若干方向的分歧。在數(shù)據(jù)層面,“合成數(shù)據(jù)能否替代真實(shí)實(shí)驗(yàn)”成為爭論焦點(diǎn);在基座選擇層面,“通用大模型微調(diào)”與“原生科學(xué)專用基座”兩派各執(zhí)一詞;在科研范式層面,“AI輔助人類”與“AI自主發(fā)現(xiàn)”的邊界正在模糊——當(dāng)一個系統(tǒng)既能預(yù)測也能設(shè)計實(shí)驗(yàn)并執(zhí)行驗(yàn)證時,它是否已經(jīng)改變了科學(xué)發(fā)現(xiàn)本身的定義?這一追問直指AI4S的終極命題:AI究竟是科學(xué)家的工具,還是科學(xué)發(fā)現(xiàn)的主體?
在本次會上,王軒澤給出了他的系統(tǒng)判斷。
第一,歸納與外推的本質(zhì)沖突。 統(tǒng)計學(xué)習(xí)假設(shè)訓(xùn)練集與測試集同分布,模型本質(zhì)是在高維空間平滑插值,而科學(xué)發(fā)現(xiàn)要求推斷分布之外的新知識。第二,因果結(jié)構(gòu)的學(xué)習(xí)需要主動干預(yù)。 觀測數(shù)據(jù)只能揭示相關(guān)性,無法區(qū)分因果方向,智能體必須設(shè)計實(shí)驗(yàn)、施加干預(yù),這種“做中學(xué)”的能力是當(dāng)前被動吸收文本的模型所不具備的。第三,負(fù)向信息的系統(tǒng)缺失。 科學(xué)論文僅記錄成功實(shí)驗(yàn),超過90%的失敗案例、邊界失效被排除在外,模型從未“見過”物理世界的極限狀態(tài),無法建立對約束的認(rèn)知。真正的科學(xué)發(fā)現(xiàn)需要從“歸納”跨越到“演繹”——從觀測抽象定律,再依定律推導(dǎo)新現(xiàn)象并實(shí)驗(yàn)檢驗(yàn),這一循環(huán)中的“演繹”和“實(shí)驗(yàn)檢驗(yàn)”環(huán)節(jié),正是當(dāng)前AI完全缺失的。
合成數(shù)據(jù)的信息閉合與真實(shí)實(shí)驗(yàn)的不可替代性
王軒澤對當(dāng)前業(yè)界熱衷的合成數(shù)據(jù)路線提出學(xué)術(shù)質(zhì)疑。合成數(shù)據(jù)本質(zhì)是已有理論框架的“自我復(fù)制”,構(gòu)成信息閉合——任何生成數(shù)據(jù)的信息量不可能超過訓(xùn)練數(shù)據(jù)蘊(yùn)含的總量,這是信息論的基本約束。合成數(shù)據(jù)面臨雙重困境:一是理論近似偏差隨迭代指數(shù)級放大;二是完全依賴人類既有假設(shè),無法產(chǎn)生框架之外的新知識,反而可能強(qiáng)化偏見、鎖定認(rèn)知“舒適區(qū)”。王軒澤強(qiáng)調(diào),真實(shí)世界的數(shù)據(jù)獲取是主動探索未知空間的信息獲取過程——要求智能體設(shè)計實(shí)驗(yàn)、施加干預(yù)、觀測結(jié)果并更新信念,這正是科學(xué)方法的精髓,也是當(dāng)前大模型范式所缺失的核心環(huán)節(jié)。
系統(tǒng)化路徑:搭建高通量實(shí)驗(yàn)室補(bǔ)齊高質(zhì)量數(shù)據(jù)
正是基于對合成數(shù)據(jù)局限的深刻認(rèn)識,王軒澤明確提出:行業(yè)必須系統(tǒng)性地搭建高通量自動化實(shí)驗(yàn)平臺,以補(bǔ)齊AI for Science所急需的高質(zhì)量真實(shí)實(shí)驗(yàn)數(shù)據(jù)。他指出,當(dāng)前科學(xué)數(shù)據(jù)的稀缺并非簡單的“數(shù)據(jù)不夠”,而是數(shù)據(jù)生產(chǎn)的范式出了問題——傳統(tǒng)人工實(shí)驗(yàn)成本高、周期長、通量低,且結(jié)果記錄不統(tǒng)一,難以形成可供AI訓(xùn)練的標(biāo)準(zhǔn)化數(shù)據(jù)集。高通量自主實(shí)驗(yàn)室的核心價值在于:以低成本、高效率、標(biāo)準(zhǔn)化的方式持續(xù)產(chǎn)生具有完整記錄(包括失敗案例和邊界條件)的真實(shí)物理數(shù)據(jù),為模型訓(xùn)練提供信息論意義上“增量”的信息來源。這是打破合成數(shù)據(jù)“信息閉合”的唯一可行路徑。
讓AI成為能夠自主進(jìn)化的"科學(xué)家”
AI 是工具還是科學(xué)發(fā)現(xiàn)主體?
對于“AI是工具還是科學(xué)發(fā)現(xiàn)主體”這一問題,王軒澤的思考指向了一個更深層的判斷:當(dāng)前業(yè)界關(guān)于AI4S的討論,大多仍停留在“AI能幫科學(xué)家做什么”的框架內(nèi),這本身就已經(jīng)預(yù)設(shè)了人類的中心地位。然而,科學(xué)史反復(fù)告訴我們,每一次真正的范式革命,都不是在舊框架內(nèi)提升效率,而是重新定義“誰在從事科學(xué)”以及“什么算作科學(xué)發(fā)現(xiàn)”。
從這個視角看,AI4S的終極命題不是“AI能否輔助科學(xué)”,而是“科學(xué)發(fā)現(xiàn)是否必須由人類完成”。王軒澤指出,科學(xué)方法的核心——提出可證偽假設(shè)、設(shè)計控制實(shí)驗(yàn)、根據(jù)結(jié)果修正理論——本質(zhì)上是一套可形式化的認(rèn)知程序,并非人類的特權(quán)。當(dāng)前AI缺失的并非“科學(xué)直覺”這類神秘主義概念,而是三個可以明確定義的工程能力:一是將物理約束編碼為可微分的歸納偏置,而非依賴數(shù)據(jù)隱式學(xué)習(xí);二是建立從實(shí)驗(yàn)結(jié)果到理論修正的閉環(huán)反饋通道,而非單向的預(yù)測輸出;三是具備自主設(shè)計實(shí)驗(yàn)方案并評估其信息增益的決策能力。這三個能力一旦在工程上實(shí)現(xiàn),科學(xué)發(fā)現(xiàn)的主體就不再是人類的獨(dú)有屬性,而是人機(jī)協(xié)同的分布式認(rèn)知過程。
他認(rèn)為,完整的科學(xué)發(fā)現(xiàn)遵循“提出假設(shè)→設(shè)計實(shí)驗(yàn)→執(zhí)行測量→分析結(jié)果→修正理論”的閉環(huán),這一閉環(huán)中的“實(shí)驗(yàn)檢驗(yàn)”和“理論修正”環(huán)節(jié),正是當(dāng)前AI完全缺失的。真正的范式變革發(fā)生在AI能夠自主設(shè)計實(shí)驗(yàn)、執(zhí)行測量、解釋結(jié)果并據(jù)此修正自身理論框架的那一刻——這要求的不只是更大的模型或更多的數(shù)據(jù),而是一種全新的認(rèn)知架構(gòu),能夠?qū)ⅰ案深A(yù)”和“反饋”內(nèi)化為推理過程的一部分。
AI for Science的終極價值,正在于它可能成為探索AGI本質(zhì)的“試驗(yàn)場”——科學(xué)發(fā)現(xiàn)所需的假設(shè)生成、實(shí)驗(yàn)干預(yù)、結(jié)果驗(yàn)證和理論修正,恰恰構(gòu)成了一幅智能體與環(huán)境交互、獲取反饋、迭代認(rèn)知的完整圖景。這條從真實(shí)世界獲取數(shù)據(jù)、建立因果理解、實(shí)現(xiàn)自主發(fā)現(xiàn)的漫漫長路,或許才是通往AGI最真實(shí)、也最艱難的道路。
提供CDN加速/云存儲服務(wù) 備案號:津ICP備2025040835號-1