当前位置: 首页 > news >正文

科研人福音!PaperOrchestra 把实验日志变投稿论文,文献综述图表全包

AI能替你写论文了?谷歌这个多智能体框架,从实验记录直接生成投稿级论文!

研究背景

做AI研究的人都懂那种痛苦:实验跑完了,数据也有了,但把这些东西整理成一篇像样的论文,往往比做实验本身还费劲。文献综述要翻几百篇paper、图表要一个个画、LaTeX格式要反复调……这个"最后一公里"问题,其实一直没有被很好地解决。

现有的自动化写作工具要么太窄——只能做文献综述(比如AutoSurvey2、LiRA),要么太死板——必须绑定在特定的实验流水线里才能用(比如AI Scientist)。换句话说,你没办法拿着自己的实验记录去用这些工具,它们根本不接受"散装输入"。

谷歌这篇论文提出的PaperOrchestra,想做的事情很直接:给它一份想法摘要和实验日志,它帮你输出一篇能投会议的完整LaTeX论文——包括文献综述、图表、公式,全套齐活。

为了衡量这件事做得好不好,他们还顺带搭了个PaperWritingBench,从CVPR 2025和ICLR 2025共200篇论文中反向工程出原始材料,建了业内第一个标准化的论文写作评测集。

相关工作

这个领域可以粗略分成两派。

一派是端到端的AI科研框架,代表是AI Scientist系列。它们的思路是把"提出假设→跑实验→写论文"整个科研循环全部自动化。但问题在于,写作模块跟它们自己的实验流水线是死死绑在一起的,没法单独拿出来用,更没法接受人类研究者自己提供的材料。

另一派是专注于文献综述的系统,比如AutoSurvey2和LiRA,它们在生成长篇综述方面做得不错,但目标是写"调研报告",而不是写"研究论文"。它们不懂怎么从自己的工作出发去定位研究空白、对比baseline,缺乏写一篇完整论文所需要的"自我意识"。

PaperOrchestra的定位就是填这个缝:既能接受非结构化的散装输入,又能输出完整的投稿级论文,还能生成概念示意图——这是之前所有系统都做不到的组合。

核心方法

整个框架分五步走,其中第二步和第三步并行执行:

Step 1 生成大纲:Outline Agent读入所有输入材料,产出一个JSON格式的结构化大纲。这个大纲包含三部分:可视化计划(要画什么图)、文献检索策略(宏观背景和具体方法论的检索方向)、以及章节写作计划(每个章节写什么、要引哪些文献)。这一步相当于给后续所有agent铺路。

Step 2 生成图表:Plotting Agent根据可视化计划,同时生成数据统计图和概念示意图。它用了一个叫PaperBanana的闭环优化模块,会用视觉语言模型反复检查生成的图有没有问题,不行就改、改完再生成,直到满意为止。

Step 3 文献综述:Literature Review Agent执行Step 1定好的检索策略,做的是"先用LLM搜,再用Semantic Scholar API验证"的双重核查流程。找到的文献会做去重、截止日期过滤,最后自动生成.bib文件,并完成Introduction和Related Work两个章节的初稿。

Step 4 正文写作:Section Writing Agent拿着前面所有产出,补全剩余章节——Abstract、Methodology、Experiments、Conclusion,同时把生成的图表无缝嵌进LaTeX源文件里。

Step 5 迭代精炼:Content Refinement Agent用AgentReview系统模拟同行评审,拿到反馈后对LaTeX源文件做针对性修改。有个关键细节:只有总分提升(或持平但细分项净正增益)才接受修改,一旦分数下降就立刻回滚——相当于给写作加了个"版本控制"。

整个流程的输入输出可以用一个公式表达:

P=(Ptex,Ppdf)=W(I,E,T,G,F)P = (P_{\text{tex}}, P_{\text{pdf}}) = W(\mathcal{I}, \mathcal{E}, \mathcal{T}, \mathcal{G}, \mathcal{F})P=(Ptex,Ppdf)=W(I,E,T,G,F)

I\mathcal{I}I是想法摘要,E\mathcal{E}E是实验日志,T\mathcal{T}T是LaTeX模板,G\mathcal{G}G是会议要求,F\mathcal{F}F是可选的现有图表(不提供就全部自动生成)。

实验效果

评测维度比较全面,有自动评分、也有真人评估。

在人工并排评比(SxS)中,11位AI研究员对40篇论文进行了人工评估。结果是:PaperOrchestra在文献综述质量上比AI基线高出50%–68%的绝对胜率差,在整体论文质量上高出14%–38%。和人类写的原版论文相比,文献综述方面还能打出43%的平局/胜率——相当能打。

模拟接收率方面,在ScholarPeer评审系统下,PaperOrchestra的CVPR论文模拟接收率达到84%,ICLR达到81%,而人类原版论文是86%和94%——差距很小。

引用覆盖率上,竞品baseline平均只引9–14篇文献,F1分数看起来还不错,但那是因为分母小——实际上P1(好引但非必引)的召回率几乎是0。PaperOrchestra平均引用45–48篇,更接近人类写作的~59篇水平,P1召回率比最强基线高出12–14个百分点。

消融实验挖出了两个有意思的结论:一是即便只给非常粗糙的"稀疏想法"作为输入,文献综述质量几乎没有下降,说明Literature Review Agent的自主检索能力很强;二是Content Refinement Agent的迭代精炼让论文接收率提升了19%(CVPR)和22%(ICLR),总分分别提升0.88和1.61分,这一步的收益非常可观。

论文总结

写论文这件事,最难的不是有想法,而是把想法变成一篇有逻辑、有文献支撑、有图表佐证的完整稿件。PaperOrchestra用多智能体分工的方式,把这个过程拆解成可以并行、可以迭代优化的若干步骤,证明了从"实验日志"到"投稿级论文"的全程自动化,在今天的技术条件下已经是可行的——而且质量能跟人类写的论文打个有来有回。

http://www.jsqmd.com/news/616240/

相关文章:

  • macos简单配置openclaw嚷
  • 三菱PLC搭配雅马哈四轴机械手在线检测收料案例解析:融合CAD电气图纸、CClink与串口通讯...
  • OpenClaw+Phi-3-mini-128k-instruct:智能问卷分析与报告生成工具
  • JavaScript中WebWorker实现多线程计算避开主线程
  • Docker部署Ollama模型桃
  • 【GraalVM静态镜像内存优化终极指南】:20年JVM专家亲授3大内存压缩技法,启动速度提升87%的私密实践
  • SQL中如何使用窗口函数实现Top N推荐系统
  • CAN + 以太网 + Wi-Fi + BLE + TCP/IP + MQTT +HTTP协议层级
  • OpenClaw异常检测技能:基于SecGPT-14B的流量行为分析
  • 高性能客服系统技术内幕:通过 SpinWait 自旋等待结构体提升高频消息分发性能舶
  • 30分钟掌握OpenClaw:千问3.5-9B新手训练营
  • 手把手教你玩转实名认证:商城运营必备技能
  • 实时行情系统设计:从协议选择到高可用架构,再到数据源选型睬
  • 【数据库系统】数据库系统概论——第十二章 数据库管理系统
  • HSA:FcRn中和抗体筛选化学发光检测试剂盒:FcRn-lgG半衰期延长工程化抗体筛选
  • AI最强模型发布却说太危险不能公开:这次不是演习
  • 2026年青白江西装定制排行:3家品牌核心参数全维度对比 - 优质品牌商家
  • OpenClaw学习助手:Qwen3.5-9B生成Anki记忆卡片与错题集
  • 2026年口碑好的品质高端酒店真实评价推荐 - 行业平台推荐
  • 营销自动化数据驱动 - 多源数据 OLAP 架构演进们
  • 节能模式:OpenClaw+Qwen3.5-9B定时任务CPU优化方案
  • 2025届毕业生推荐的降AI率助手解析与推荐
  • 2026年特种车商业险服务商盘点:3家正规机构的核心差异 - 优质品牌商家
  • 2026年口碑好的UV喷码机推荐厂家精选 - 行业平台推荐
  • ESP32驱动A7608SA-H LTE Cat.1模组全栈固件库
  • 汽车质量体系_1
  • 【PHP低代码表单安全生死线】:92%开发者忽略的3类注入漏洞(含OWASP Top 10映射表+自动检测脚本)
  • 探秘自适应巡航控制算法ACC
  • OpenClaw自动化运维助手:Qwen2.5-VL-7B处理服务器日志与告警
  • 2026年4月高温合金实力厂家推荐,真空设备/100kg真空感应熔炼炉,高温合金源头厂家有哪些 - 品牌推荐师