AI-Scientist 自动生成科研图表:从 run_0 到带图 PDF 的出图流水线
2026/9/12 15:40:54 网站建设 项目流程

AI-Scientist 自动生成科研图表:从 run_0 到带图 PDF 的出图流水线

【免费下载链接】AI-ScientistThe AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery 🧑‍🔬项目地址: https://gitcode.com/GitHub_Trending/ai/AI-Scientist

昨晚实验跑完,你盯着终端里最后一行 loss,下一件事本该是画图:拉曲线、对齐配色、调坐标、导出格式——全是重复活。AI-Scientist 的出图流水线正是从这一步接手的:只要你的 run 目录里有标准 JSON,训练曲线和样本图就能自动生成,一路做到带配图的论文 PDF。

按下回车之后,它替你干了什么

你跑一次experiment.py,训练轨迹和指标就按固定格式落进run_0/plot.py扫一眼当前目录,自动拼出曲线图和样本图;再往上,launch_scientist.py还能替你改代码、跑想法、写稿、编译出 PDF——你只负责看结果。

跟着一跑——2D Diffusion 从 run_0 到出图

基线跑通

先把模板数据准备好,然后跑基线:

cd templates/2d_diffusion python experiment.py --out_dir run_0

它会在run_0/下写两个关键文件:final_info.json(每个数据集的评估损失、KL 散度、训练耗时)和all_results.pkl(完整训练轨迹加采样点)。跑完再执行python plot.py,脚本会自动找出当前目录里所有run_*文件夹并加载这两类数据,产出两张图:

  • train_loss.png:circle / dino / line / moons 四个数据集的 2×2 训练损失子图,曲线自带 hanning 窗平滑;
  • generated_images.png:每个数据集生成的样本散点,多组 run 会自动排成多行对比。

全程没有改一行图代码——配色由generate_color_palettetab20色板按 run 数量自动分配,平滑窗长、子图排布都是写死的默认值,够用且不突兀。

让 AI-Scientist 接手

图表是中间产物,它的完整闭环是把图表塞进论文。设好模型 API key 后:

python launch_scientist.py --model gpt-4o-2024-05-13 --experiment 2d_diffusion --num-ideas 2

这条命令之后它自己走完:生成想法并做新颖性检查,然后逐条把 templates/2d_diffusion 复制到results/下的时间戳文件夹,调用 LLM 改 experiment.py 和 plot.py 去跑新实验、出新图,最后按 latex/template.tex 写稿、编译 PDF,再让 GPT-4o 审一遍,审稿意见落在review.txt。每个想法一个独立文件夹:log.txt记录全过程,图表、tex 稿、PDF 齐全,直接归档。

你八成会想改的 3 个地方

换配色。plot.pygenerate_color_palettecmap字符串你只需要改一个词:'tab20'换成'Set1''viridis',所有图自动跟着换。

调坐标范围。损失曲线前 200 步太抖、想只展示收敛段,就在set_title附近加一行axs[row, col].set_ylim(0, 2);x 轴同理用set_xlim

换导出格式。每个plt.savefig("train_loss.png")的后缀改成pdfsvg即可,矢量格式进 LaTeX 不失真。

速查表

我想……跑什么 / 改哪里
跑基线并出图python experiment.py --out_dir run_0然后python plot.py
一键出论文(含图)python launch_scientist.py --model gpt-4o-2024-05-13 --experiment nanoGPT --num-ideas 2
多卡并行跑想法上一条命令加--parallel 2
换图表配色plot.py 里generate_color_palettecmap
调坐标范围同文件对应axs上加set_ylim/set_xlim
换导出格式savefig文件名后缀

跑通之后,值得试的 3 个进阶玩法

  • 给上一条命令加--improvement:审稿后它会自动按意见改写再编译一版,改进稿和二次审稿(review_improved.txt)都留在同一个文件夹。
  • 想批量看自动审稿的稳定性,翻 review_iclr_bench/iclr_analysis.py,它能把几百篇 ICLR 论文的评分跑出来。
  • 你的方向不在三个官方模板里?照templates/的结构写一份自己的:experiment.py负责把结果对齐成final_info.json加结果包,plot.py就能直接接进去,细节以仓库 README 为准。

跑通第一条命令后,翻翻templates/里 grokking、nanoGPT 的experiment.py,看哪种数据流对得上你的实验。

【免费下载链接】AI-ScientistThe AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery 🧑‍🔬项目地址: https://gitcode.com/GitHub_Trending/ai/AI-Scientist

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询