llmsresearch/paperbanana

Open source implementation and extension of Google Research’s PaperBanana for automated academic figures, diagrams, and research visuals, expanded to new domains like slide generation.

解決的問題

PaperBanana 自動化生成出版級的學術圖表與統計圖表。它消除了為 AI 研究論文設計複雜方法論圖與繪製資料的繁瑣手動工作,確保圖表符合專業美學規範(如 NeurIPS 的標準)。

工作原理

該系統使用由最多七個專業代理組成的多代理流水線:

  1. 輸入優化:輸入優化器使用上下文增強器與標題精煉器,將原始文字結構化,並將標題精煉為精確的視覺規格。
  2. 線性規劃:檢索器尋找相關參考範例,規劃器創建圖表的詳細文字描述,風格師應用美學指南(顏色、佈局、排版)。
  3. 迭代優化:可視化器渲染圖像,批評者根據來源上下文評估圖像,並提供修改反饋。此循環重複進行,直到圖像令人滿意或達到上限。

對於統計圖表,系統透過 VLM 產生 matplotlib 程式碼,以從 CSV 或 JSON 檔案渲染資料。

適用對象

需要為學術出版物生成專業圖表、方法論圖與資料圖表的 AI 科學家與研究人員。

主要亮點

  • 多提供者支援:支援 OpenAI、Google Gemini、Azure OpenAI 與 Atlas Cloud。
  • 迭代優化:具備「自動精煉」模式,批評者代理會循環優化,直到輸出達到品質標準。
  • 靈活輸入:支援原始文字、PDF 檔案(支援頁面選擇)與參考草圖影像,用於指導佈局。
  • 批次處理:可從清單檔案生成多個圖表或圖表,並自動拼接為複合圖。
  • PaperBanana Studio:包含本地 Gradio Web UI,用於管理流程與瀏覽輸出。
  • 會議風格套件:內建並可自訂 NeurIPS、ICML、ACL 與 IEEE 等會議的風格指南。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案