llmsresearch/paperbanana
Open source implementation and extension of Google Research’s PaperBanana for automated academic figures, diagrams, and research visuals, expanded to new domains like slide generation.
解决的问题
PaperBanana 自动化生成出版级别的学术图表和统计图表。它消除了为 AI 研究论文设计复杂方法论图和绘制数据的繁琐手动工作,确保图表符合专业美学规范(如 NeurIPS 的标准)。
工作原理
该系统使用由最多七个专业代理组成的多代理流水线:
- 输入优化:输入优化器使用上下文增强器和标题精炼器,将原始文本结构化,并将标题精炼为精确的视觉规格。
- 线性规划:检索器查找相关参考示例,规划器创建图表的详细文本描述,风格师应用美学指南(颜色、布局、排版)。
- 迭代优化:可视化器渲染图像,批评者根据源上下文评估图像,并提供修改反馈。此循环重复进行,直到图像令人满意或达到上限。
对于统计图表,系统通过 VLM 生成 matplotlib 代码,以从 CSV 或 JSON 文件渲染数据。
适用人群
需要为学术出版物生成专业图表、方法论图和数据图表的 AI 科学家和研究人员。
主要亮点
- 多提供商支持:支持 OpenAI、Google Gemini、Azure OpenAI 和 Atlas Cloud。
- 迭代优化:具备“自动精炼”模式,批评者代理会循环优化,直到输出达到质量标准。
- 灵活输入:支持原始文本、PDF 文件(支持页面选择)和参考草图图像,用于指导布局。
- 批量处理:可从清单文件生成多个图表或图表,并自动拼接为复合图。
- PaperBanana Studio:包含本地 Gradio Web UI,用于管理流程和浏览输出。
- 会议风格包:内置并可自定义 NeurIPS、ICML、ACL 和 IEEE 等会议的风格指南。
相关
- 项目
- 项目
- 项目
- 项目
- 项目