允中 發自 凹非寺
量子位 | 公眾號 QbitAI
今年8月,谷歌首席科學家Jeff Dean宣佈離職,創辦AI4S公司Discovery Loop論文。
同樣是今年,OpenAI、Anthropic、英偉達等科技巨頭相繼官宣入局AI4S這一方向論文。
這批“跨界”大廠玩家的目標高度一致:不只做科研輔助工具,而是打造能自主跑完“假設→設計實驗→執行驗證→迭代最佳化”完整科研迴圈的“AI科學家”論文。
不只這些科技巨頭,有許多公司已經更早入場論文。成立於2024年的中國企業深度原理,是全球最早押注AI自主科研方向的公司之一。
這一賽道背後是一片廣闊的“金礦”論文。一旦AI能夠實現自主閉環科研,AI就能從“賣軟體”升級為新材料、新藥物等萬億實體產業的生產力基座。
國家戰略層面也重視這個賽道論文。AI驅動科學發現已被納入我國新一輪科技強國戰略。
行業越熱論文,一個問題就越繞不開:怎麼評價這些“AI科學家”們到底做得好不好?
舊的衡量標尺論文,已經不夠用了
長期以來,行業通用的衡量AI科研水平的標尺是HLE這類閉卷知識考試論文。
它們本質上是隻看最終答案的考卷,只看答案,不會看答案生成的過程論文。
獲得高分的這類AI科研工具,通常讓它做一個實際實驗就會暴露問題:它們可能可以流暢的引用文獻,但無法停下來審視反思異常資料,也可能給出看似頭頭是道,實際上無法執行的實驗方案論文。
8月19日,一篇名為《Measuring AI Scientists: From Exams to Discovery》的論文釋出,第一次為“AI進行真實科研的水平”提出了系統完整的評價正規化,正式填上了這個衡量標尺的缺口論文。
展開全文
論文由中國AI4S企業深度原理(Deep Principle)聯合微軟研究院、斯坦福大學、FutureHouse、Edison Scientific、艾倫人工智慧研究所、加州大學伯克利分校等全球頂尖產學機構共同完成論文。
全球最大材料開源資料專案Materials Genome和庫Materials Project創始人Kristin Persson、FutureHouse和Edison Scientific的創始人,近期《Nature》期刊Co-Scientist論文核心作者Andrew White、 科研智慧體評測標杆ScienceWorld核心開發者Peter Jansen、2023年Nature上AI4S review的第一作者Yuanqi Du、 Terminal Bench的最後通訊作者Ludwig Schmidt等AI4S泰斗級學者奠定了框架的學術權威性;
深度原理作為唯一的中國產業代表,以真實研發管線跑出來的一線經驗,讓這套框架具備落地的可操作性論文。
文章中甚至出現諾貝爾化學獎得主Frances Arnold的署名,一個不以AI見長且幾乎不在AI4S界出現的科學家的名字,表明科學界的“權威”對這個方向的日益重視論文。
2026年,從科技大廠到創業公司,各類玩家紛紛入場AI科研賽道,行業競爭加劇論文。這一評測體系在這個時機出現,有其必然性。
如何系統、完整的評價AI的科研水平
論文的核心創新,是提出了發現回合(discovery episode)的評估體系論文。
這一體系的核心邏輯是用“綜合考核”的形式,全程記錄AI在整個科研週期裡的每一步決策,最終對整條軌跡的科學性、嚴謹性和有效性進行綜合評分論文。
考核方式和以前的“應試”邏輯迥然不同論文。
圍繞科研閉環的三個階段:科研假說、方案執行、實驗結果解讀,這個評估體系分別建立了評判維度,最終還要進行“全流程閉環測試”,衡量AI產出真實科研發現的綜合能力論文。
△論文指出知識評測和發現評測的差別,並定義“發現回合”包含的評估要點
這套體系還重新定義了失敗資料的價值:失敗的實驗資料恰恰是訓練和評估AI科研的核心資產論文。
人類科學家能從失敗中總結經驗、規避彎路,AI做科研也應該學會從失敗中獲得經驗論文。
而且,這個考核還對AI科研結果的真實性和獨立性提出了高要求,確保實驗結果是“貨真價實“的新發現,不是無法實證的“自宣稱成果”論文。
深度原理的MIRA論文,就是這套體系的現實樣本
在這篇標準論文釋出之前,頭部玩家已經在產品中跑通了閉環邏輯,深度原理的MIRA平臺就是其中最典型的產業樣本論文。
普通科研AI的定位是“答題工具”,科研人員給出明確問題,AI返回對應答案論文。
MIRA的設計邏輯與普通科研AI截然不同,它搭建了覆蓋“假設生成→模擬計算→實驗驗證→知識沉澱”的完整閉環系統,用三層架構實現真實科研團隊的完整協作邏輯論文。
上層是分工協作的多智慧體小隊論文,可以統一規劃和排程科研程序;
中層是打通高效能運算與自動化實驗室的雙執行引擎論文,實現乾溼實驗室聯動;
底層是可沉澱、可複用的科研記憶體系,讓每個專案的資料和試錯結論都能留存,成為後續研究的基礎論文。
△AI Scientist Mira實際操作頁面
這套設計的產業價值,已經被公開基準測試印證論文。
在化學、能源、材料綜合評測Research Claw Benchmark和藥物發現評測Science Agent Arena中,MIRA均位列第一,且完成單項任務的平均成本也同樣處於行業最優水平(最低),同時在效能和成本兩個維度形成優勢論文。
△MIRA在Research Claw Benchmark等評測中的結果
△Science Agent Arena藥物發現榜單:MIRA以81.1%的綜合分位列第一
深度原理此前推出的React-OT模型,可在0.4秒內計算化學反應過渡態,奠定了平臺底層的高精度計算能力論文。
MIRA正是在這類專業模型的基礎上,進一步串聯起科研全流程論文。這一演進路徑,恰是整個AI4S行業從工具到平臺、從單點到閉環的縮影。
作為這套評測體系的核心產業共創方,深度原理已依託MIRA與自建高通量實驗平臺的乾溼閉環,在鋰電、工業冷卻液、新能源材料等賽道佈局多條自研管線,由AI主導全週期科研,真實沉澱閉環資料,讓平臺與評測框架形成持續的互相驗證與迭代論文。
跨越乾溼實驗室的完整科研實踐資料,是幫助AI快速掌握假設邊界、規避重複試錯的核心資產,預計未來也將成為下一階段AI for Science發展的關鍵基礎設施論文。
結語
這一標準正規化的釋出,是AI for Science賽道的一個里程碑節點,給所有奔跑的玩家劃出了清晰的評判標尺論文。
但檢驗這個新標尺的資料卻不易得論文。只有像深度原理和Edison Scientific這些擁有化學、材料、生物全流程研發能力、並且是AI native的公司才有可能做到。
過去的上半場,行業比拼的是“誰懂得更多”——大廠拼基座、拼引數、拼考試分數,用越來越難的題庫,證明模型的知識厚度論文。
這些努力奠定了AI科研的基礎,但也逐漸摸到了天花板論文。
接下來的下半場,比拼的將是“誰能真的做出東西”論文。
今年以來,從海外大廠陸續入局,到Jeff Dean創立Discovery Loop,再到國內深度原理等企業的科研閉環實踐,整個行業都在朝著“讓AI真正走完從假說到發現的完整閉環”這個方向前進論文。
如今,AI科研的評價標準越來越接近科學本身的邏輯,AI離真正成為可信科研生產力的那天,已經越來越近了論文。