端到端論文生成系統:假結論檢出率92%,自動跑實驗、畫圖、直出論文初稿

端到端論文生成系統:假結論檢出率92%,自動跑實驗、畫圖、直出論文初稿

Spark-to-Paper 是一套端到端研究論文生成系統,以 13 個可組合技能的形式執行在現有程式設計助手內部,無需單獨部署的智慧體平臺或外部編排服務論文。從一句研究想法出發,系統自動完成文獻檢索、實驗設計、實驗執行、論文寫作、證據驅動的結論修訂、可編輯論文圖生成,直至輸出可直接編譯的完整 LaTeX 專案。

在 8 個受控研究課題上,Spark-to-Paper 引文有效率達 99.5%,圖形元素可編輯率達 96.4%;對 36 條人為注入的假結論,檢出率從單遍生成的 14% 提升至 92%,對抗式評審精確率達 74%論文。平均每篇論文使用 11.9M token,成本 8.1 美元,耗時 3.2 小時。

端到端論文生成系統:假結論檢出率92%,自動跑實驗、畫圖、直出論文初稿

論文:

Hugging Face論文

目前,介紹該系統的論文已被 Hugging Face Papers 標記為當日第一論文

AI 科研的痛點問題

CodingAgent 的發展重塑了傳統科研流程,成為 AI 輔助科研的新正規化:智慧體負責科研任務規劃、方案生成與任務執行等全流程工作,顯著提升了科研效率論文

但由於科研流程本身的複雜性和當前大模型能力的侷限性,AI 科研仍面臨兩大痛點,制約著實際應用論文

展開全文

其一是工具碎片化:文獻閱讀、假設提出、程式碼編寫、實驗試錯、引數調優等工作散落在多個平臺,各環節產物難以銜接,即使使用程式設計助手 (Claude Code / Codex),也缺少一套把「從想法到論文」完整串起來的端到端流程論文

其二是科研幻覺:大模型存在固有幻覺問題,面對複雜、長鏈條的科研任務,容易出現文獻引用、實驗數字、因果推導等錯誤 —— 引用查不到、數字沒有出處、實驗結果與結論相悖時「假裝無事發生」,嚴重破壞科研工作的可復現性與嚴謹性論文

Spark-to-Paper論文

從想法到論文的端到端科研工作流

Spark-to-Paper 沒有再造獨立的智慧體平臺,而是直接複用程式設計助手已有的讀檔案、程式碼執行、資訊搜尋與工具呼叫能力,把科研過程拆成 13 個可組合技能論文。每個技能只規定任務目標、約束條件、可用工具與交付標準,具體執行由程式設計助手根據當前專案狀態自主完成;一條輕量級流水線負責指定任務順序。全部技能共享同一個專案目錄,透過檔案化產物協作,前一步的輸出就是後一步的輸入,文獻、研究藍圖、程式碼、實驗結果、圖片與修改記錄全部保留 —— 任何一步出現問題,都可以從對應產物繼續修改,而不是整篇重新生成。

從一句短想法出發,系統先將其擴充套件為結構化研究提案,再依次完成規劃、引文、寫作、修訂、評審、畫圖與組裝,最終輸出包含手稿、參考文獻、圖表與模板配置的完整 LaTeX 專案,可直接編譯論文。組裝階段按目標會議或期刊模板自動處理章節順序、引用格式與文件結構,編譯後透過確定性檢查,確保沒有未解析引用與 LaTeX 錯誤。

實驗環節同樣由系統自動完成:規劃階段預先確定資料集、基線、指標、消融與結果表格結構(數值留空),形成流程內的輕量級預註冊;寫作完成後,系統從論文的主張反推缺失證據,在程式碼與資料可用時自動執行最小實驗集,記錄日誌、指標檔案、表格與圖,並用實測結果回填正文、重繪結果圖,同時聯動修訂摘要、引言、結果與結論論文

論文圖則按角色走兩條路徑:結果圖直接讀取實測資料、由繪圖程式生成並匯出向量 PDF;方法圖與示意圖先用影像模型產出視覺草圖,再由程式設計助手重建為可編輯的網頁檔案並迭代校準,最終匯出向量 PDF論文

端到端論文生成系統:假結論檢出率92%,自動跑實驗、畫圖、直出論文初稿

Spark-to-Paper 總體執行流程

Spark-to-Paper 核心技術

基於技能的模組化流水線

13 個技能由輸入路由與八個階段組織論文。輸入判斷起點並選擇結果完整性模式 —— 無實測結果時進入提案模式,數字必須留空;有實測資料時進入資料感知模式,定量結論須有結果支撐。規劃、引文、寫作、修訂、評審、畫圖、組裝構成核心論文生成流程;實驗執行按需觸發,將實測證據寫回論文。整個流水線中,模型負責需要理解與判斷的決策,可核驗操作由確定性程式完成,兩者各司其職。

預註冊式實驗設計與證據驅動修訂

實驗規劃與實驗報告嚴格分離:在觀測結果之前,規劃階段即固定資料集、基線、指標、消融與結果表格結構;實驗階段按需執行最小證據集,昂貴計算或外部資料獲取必須由具體主張與資源可用性背書論文。實驗完成後,系統依據實測證據複審手稿,將論點分類為支援、部分支援、未支援、被反駁或需進一步確認,並相應保留、弱化、刪除、移入侷限性或觸發補充實驗;陰性、無效或不顯著的結果予以保留而非省略,摘要、引言、結果與結論聯動更新,確保全文與最終證據一致。

完整性檢查、長程自省與失敗邊界

確定性 Gate 對可驗證屬性逐項把關:藍圖結構、引用一致性、記法統一、圖檔案齊備、LaTeX 編譯成功,以及提案模式下「未觀測結果必須留白」等規則,都以程式而非模型判斷執行論文

語義層面的問題由兩級模型自省處理:自我審查在每次編輯後區域性檢查論點漂移與前後一致性;對抗式評審從理論正確性、實驗設計與系統有效性等角度對整篇論文進行多輪獨立審查,每條評審意見必須引用具體段落,並從三個方向核驗 —— 問題是否真實存在、是否已在別處回答、是否超出論文聲稱範圍;無法反駁的意見才進入修訂,評審持續到一輪內不再產生新問題論文

針對「反覆實驗否定同一研究方向」的自我反駁迴圈,系統將實驗 — 批評 — 修訂迴圈上限設為 7 輪論文。超過上限仍無法支撐核心目標時,終止該軌跡並生成失敗報告,記錄原始想法、試過的方法、實測結果與證據不足的原因,隨後從新的想法重新開始。失敗軌跡被保留為研究產出,但不會被包裝成成功論文。

端到端論文生成系統:假結論檢出率92%,自動跑實驗、畫圖、直出論文初稿

完整性檢查、自我審查與自我反駁迴圈

可編輯圖生成

論文圖按角色走兩條路徑:實驗結果圖讀取實測輸出、由繪圖程式生成原生向量 PDF,數值與實驗結果嚴格繫結;方法圖與解釋性圖先由影像模型生成視覺草圖,再以草圖作為視覺規範,由 Coding Agent 以生成 HTML 的形式重建文字、形狀、連線與佈局,經渲染對比迭代校準後匯出向量 PDF,重建不可靠時回退到柵格圖論文。生成式模型負責視覺設計,實驗結果圖完全由資料決定,最終產物保持可編輯。

端到端論文生成系統:假結論檢出率92%,自動跑實驗、畫圖、直出論文初稿

結果圖與方法圖採用兩條不同的可編輯生成路徑

應用實踐與評測結果

受控評測論文:與人類預印本及現有科研智慧體對比

在 8 個受控研究課題上,Spark-to-Paper 引文有效率達 99.5%,高於人類撰寫預印本的 97.8%、AI Scientist 的 93%、AI Scientist-v2 的 91%、Agent Laboratory 的 96% 與單遍生成基線的 81%論文。圖形元素可編輯率達 96.4%,對比之下,人類預印本僅為 58%,AI Scientist 與 Agent Laboratory 釋出產物中的可編輯圖元素為 0%。

在防幻覺消融評測中,對固定注入的 36 條假結論,單遍生成僅檢出 14%,加入門禁後升至 69%,疊加自我審查達 81%,完整堆疊達 92%;對抗式評審精確率 74%,意味著多數評審意見對應真實可核驗的問題論文

效率方面,完整系統平均使用 11.9M token、成本 8.1 美元、耗時 3.2 小時;單遍生成基線為 0.11M token、0.66 美元、16 分鐘,但引文有效率僅 81%論文。Spark-to-Paper 以更多的推理與檢查成本,換取更可靠的引用、可追溯的實驗結果與可編輯的論文產物。

端到端論文生成系統:假結論檢出率92%,自動跑實驗、畫圖、直出論文初稿

Spark-to-Paper 在 Hugging Face Papers 頁面被標記為當日第一

開放與共建

歡迎每一位開發者、科研人員與領域專家參與共建,在程式碼倉庫中提交反饋或貢獻內容,我們會持續迭代最佳化論文。Spark-to-Paper 的程式碼與資源已開源,GitHub、專案網站、論文與 Hugging Face 頁面連結如下。

端到端論文生成系統:假結論檢出率92%,自動跑實驗、畫圖、直出論文初稿

GitHub:

專案網站論文

論文論文

Hugging Face論文

本站內容來自使用者投稿,如果侵犯了您的權利,請與我們聯絡刪除。聯絡郵箱:835971066@qq.com

本文連結://jnhjhw.com/tags-%E8%BF%BD%E5%B9%B3.html

🌐 /