還在手搓論文poster?自進化設計Harness直接出

還在手搓論文poster?自進化設計Harness直接出

AutoDesign:

讓 Harness 學會自我進化

未來多智慧體系統的發展,需要模型引數與 Harness 協同進化,不能忽略任何一端論文

還在手搓論文poster?自進化設計Harness直接出

AutoDesign For AutoDesign 示例:透過自進化迭代的最終 DesignHarness,在 40 分鐘內為本論文生產了海報論文。整個過程呼叫了 253 次工具,進行了 11 輪編輯迴圈,最終在 3 美元的成本內完成了海報設計。

多模態輸入輸出任務需要一個能夠長程執行的 Agent System:以 Coding 作為基礎行動能力,結合工具呼叫、視覺感知與反饋、環境互動,以及持續的自我修改和迭代,逐步達到人類專家處理真實複雜任務的水平論文。在這個系統中,模型引數提供思考、推理與行動的基礎能力;Harness 則負責組織流程、約束行為,讓模型能夠更高效、更準確地完成長程任務。

當前,模型訓練已經形成了較成熟的工業化 Pipeline:透過大規模資料學習引數,再借助後訓練和強化學習約束行為論文。相比之下,Harness 的迭代最佳化仍有許多問題尚未研究清楚:每次迭代應該修改哪些模組和元件?改動範圍應該多大?接受一次更新的機制和標準是什麼?Evaluator 應該如何設計?面對主觀任務,又該使用什麼指標?出現效能回退時如何定位和處理?如何提出新的方案,並保證系統沿著正確方向持續演進?

展開全文

AutoDesign 選擇多模態設計這一長程複雜任務,研究 Harness 的自進化問題論文

還在手搓論文poster?自進化設計Harness直接出

技術報告標題:AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design

專案主頁論文

程式碼倉庫論文

技術報告論文

Demo論文

由於開源社羣此前缺少一套整合多種指標和跨學科標準的海報 Benchmark,我們同時構建了 PosterBench 及完整的 Evaluation Protocol,從七個維度評價生成結果:事實來源真實性、內容覆蓋度、資訊密度、視覺質量、版式正確性、整體可讀性和美學表現論文

這套評價體系採用 Hybrid Evaluation:主觀質量由 VLM Judge 評估,版面越界、文字重疊、元素比例等可以明確計算的問題,則由 Rule-based Python 演算法檢測論文。PosterBench 包含 100 篇論文,並提供由 10 篇論文組成的 PosterBench-mini,方便快速測試和比較。

除 Design Agent 主賽道外,我們還開源了固定 DesignHarness 的 CodingHarness 賽道,並透過不同子賽道控制變數,分別評價 CodingHarness、模型本身以及 DesignHarness 的質量論文

基於我們提出的 MetaHarness Optimization 方法論文,AutoDesign 在 Paper-to-Poster 任務中的得分隨著自迭代持續提升:49 → 53.2 → 68.8 → 69.7 → 73.5 → 76.3 → 78.6 → 80.9

多種模型接入 DesignHarness 後,平均提升 12.4 分;在相同 Agent 和模型配置下,AutoDesign 比 Claude Design 高 7.45 分論文。在一次完整的海報設計中,Agent 共呼叫 253 次工具,進行了 11 輪編輯迴圈,並將總成本控制在 3 美元以內。也進一步證明了自進化得到的 DesignHarness 是可泛化到不同模型不同的 Coding Harness 上的。

還在手搓論文poster?自進化設計Harness直接出

AutoDesign 透過自主最佳化與人工引導持續進化 DesignHarness,使各類 Coding Agent 提升 5.0–19.6 分,最高達到 81.5 分論文

AutoDesign 方法論細節

AutoDesign 將模型周圍的 DesignHarness 作為持續學習和最佳化的物件論文。DesignHarness 由五類元件構成:上下文與記憶、工具與規範、執行執行時、任務編排,以及評估與反饋。它們共同決定系統如何讀取多模態來源、呼叫工具、生成作品、發現問題並完成交付。

還在手搓論文poster?自進化設計Harness直接出

AutoDesign 透過巢狀的內外迴圈實現自進化論文。在內迴圈中,Designer 根據來源上下文呼叫工具,生成可編輯的 HTML,並結合渲染結果、規則驗證和 VLM Critic 的反饋進行區域性修訂。

在外迴圈中,MetaHarnessOptimizer 彙總多個任務中的 Rollout 軌跡、工具呼叫、渲染診斷和 Evaluator 反饋,識別反覆出現的失敗模式論文。隨後,Optimizer Code Agent 針對一個明確的 Harness 元件提出有邊界的程式碼更新。為了保證收益可以歸因,每次外迴圈只允許修改一個元件;候選更新只有在提升訓練任務表現,且不導致獨立 Development Set 退化時,才會被接受並寫入下一版 DesignHarness。

“一次只修改一個元件” 和 “使用獨立開發集” 是我們從大量實驗中總結出的兩個重要原則論文。前者避免多個改動同時發生,導致 Credit Assignment 混亂;後者防止系統只記住訓練任務。二者共同保證每次被接受的更新都能沉澱為可審計、可複用的設計經驗,而不是一次性的 Prompt 調整。

因此,最終得到的 DesignHarness 不是一組固定 Prompt,而是一套可複用的設計生產系統論文。它能夠構建來源上下文、協調工具呼叫、生成並檢查可編輯輸出,同時保留可追溯的執行證據,支援後續修訂和下一輪系統演化。

還在手搓論文poster?自進化設計Harness直接出

Design Harness 利用 Critic 反饋迭代生成和修改作品,構成內迴圈;外迴圈則透過在設計任務中執行該 Harness、評估輸出、提出單個元件的更新,並決定接受或拒絕候選更新,持續最佳化 Design Harness論文。整個過程可自主執行,也可選擇性地加入人工指導。

為什麼選擇 “論文到學術海報” 作為驗證場景論文

我們將 Paper-to-Poster 作為主要驗證任務論文。與側重風格和視覺氛圍的商業海報不同,學術海報需要把長篇、多模態論文壓縮成單頁傳播媒介,同時保證事實可追溯、核心結果完整、圖表和數值準確,版式可讀且內容可編輯。一張海報即使視覺精緻,只要寫錯數值或遺漏核心貢獻,就無法承擔科學傳播的功能。因此,Paper-to-Poster 是檢驗設計智慧體能否完成長程設計、檢查和修訂的嚴格場景。

好不好論文,不能只靠 “看起來不錯”

為了使用統一、獨立的標準評估最佳化後的系統,我們釋出了 PosterBench論文。主賽道覆蓋五個學科的 100 篇論文,PosterBench-mini 則提供由 10 篇論文組成的低成本測試集。評測從七個維度衡量生成結果:事實忠實性、內容覆蓋度、資訊密度、視覺證據、佈局、可讀性和美學表現。

PosterBench 採用規則演算法與 Rubric-based VLM Judge 相結合的評測方式論文。規則演算法負責檢查文字溢位、元素重疊、空間利用率和數值一致性等可程式化問題;VLM Judge 則結合論文來源,評價視覺表達和科學傳播質量。此外,我們還透過系統盲測的人類評審,檢驗自動評價與人類偏好的一致性。

PosterBench 是一套在最佳化完成後使用的凍結評測協議,並不直接作為驅動內外迴圈更新的打分器論文。這一隔離可以降低系統針對最終評測過擬合的風險。

還在手搓論文poster?自進化設計Harness直接出

Benchmark 的規則驅動評測演算法視覺化,以及它們分別監測了哪些部分、具體是如何監測的論文

AutoDesign 還提供了可本地部署的客戶端論文。Agent 生成內容後,系統會將結果載入到視覺化畫布中,使用者可以透過三種方式繼續編輯,編輯完成後,系統支援匯出 PPTX、PDF 等格式。

與 Coding Agent 進行多輪對話論文,即時修改內容;

選中並圈出需要調整的區域論文,以多個 Comment 的形式向 Agent 提出修改要求;

使用傳統設計軟體中的手動編輯功能,調整顏色、配色、字型和間距,或者插入、刪除圖片論文

在 PosterBench Main Track 的相同 Claude Code + Claude 4.8 設定下,AutoDesign 獲得 78.32 分,超過閉源商業系統 Claude Design 7.45 分論文。將學習得到的 DesignHarness 接入七組控制變數實驗的 Coding Agents 後,平均分從 54.99 提升至 67.39,平均提高 12.4 分。而我們還人類評測做了系統盲測人評:收集了 933 個有效判斷,AutoDesign 的 Bradley–Terry(離線版本的 ELO 測試,跟各種 Arena 方式一樣)AutoDesign 的勝率估計為 64.0%,同樣在受評系統中居首。

還在手搓論文poster?自進化設計Harness直接出

未來展望:從一張海報開始論文

但不止於海報

AutoDesign 作為我們研究路線的第一個專案,未來,我們會從海報繼續擴充套件到 PPT、網頁和學術演講影片等多模態內容論文。當前系統已經能夠一鍵將論文轉化為這四種傳播媒介,但方法論和效果仍有最佳化空間。

更長期的問題是:能否讓一個 multimodal-in、multimodal-out 的 Agent System,將人類偏好和任務經驗持續積累為系統級能力,並實現 Recursive Self-Improvement?我們的下一個專案將繼續探索這一方向,希望構建一個能夠持續自我進化的系統,同時避免類似 Reward Hacking 的評測投機,並將這種能力泛化到不同的生產級任務中論文

還在手搓論文poster?自進化設計Harness直接出

歡迎體驗程式碼,提 issues,PRs,一起參與這套系統下一階段的共建論文

本站內容來自使用者投稿,如果侵犯了您的權利,請與我們聯絡刪除。聯絡郵箱:835971066@qq.com

本文連結://jnhjhw.com/post/70463.html

🌐 /