AI-Scientist 自动生成科研图表:从 run_0 到带图 PDF 的出图流水线
【免费下载链接】AI-ScientistThe AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery 🧑🔬项目地址: https://gitcode.com/GitHub_Trending/ai/AI-Scientist
昨晚实验跑完,你盯着终端里最后一行 loss,下一件事本该是画图:拉曲线、对齐配色、调坐标、导出格式——全是重复活。AI-Scientist 的出图流水线正是从这一步接手的:只要你的 run 目录里有标准 JSON,训练曲线和样本图就能自动生成,一路做到带配图的论文 PDF。
按下回车之后,它替你干了什么
你跑一次experiment.py,训练轨迹和指标就按固定格式落进run_0/;plot.py扫一眼当前目录,自动拼出曲线图和样本图;再往上,launch_scientist.py还能替你改代码、跑想法、写稿、编译出 PDF——你只负责看结果。
跟着一跑——2D Diffusion 从 run_0 到出图
基线跑通
先把模板数据准备好,然后跑基线:
cd templates/2d_diffusion python experiment.py --out_dir run_0它会在run_0/下写两个关键文件:final_info.json(每个数据集的评估损失、KL 散度、训练耗时)和all_results.pkl(完整训练轨迹加采样点)。跑完再执行python plot.py,脚本会自动找出当前目录里所有run_*文件夹并加载这两类数据,产出两张图:
train_loss.png:circle / dino / line / moons 四个数据集的 2×2 训练损失子图,曲线自带 hanning 窗平滑;generated_images.png:每个数据集生成的样本散点,多组 run 会自动排成多行对比。
全程没有改一行图代码——配色由generate_color_palette从tab20色板按 run 数量自动分配,平滑窗长、子图排布都是写死的默认值,够用且不突兀。
让 AI-Scientist 接手
图表是中间产物,它的完整闭环是把图表塞进论文。设好模型 API key 后:
python launch_scientist.py --model gpt-4o-2024-05-13 --experiment 2d_diffusion --num-ideas 2这条命令之后它自己走完:生成想法并做新颖性检查,然后逐条把 templates/2d_diffusion 复制到results/下的时间戳文件夹,调用 LLM 改 experiment.py 和 plot.py 去跑新实验、出新图,最后按 latex/template.tex 写稿、编译 PDF,再让 GPT-4o 审一遍,审稿意见落在review.txt。每个想法一个独立文件夹:log.txt记录全过程,图表、tex 稿、PDF 齐全,直接归档。
你八成会想改的 3 个地方
换配色。plot.py里generate_color_palette的cmap字符串你只需要改一个词:'tab20'换成'Set1'或'viridis',所有图自动跟着换。
调坐标范围。损失曲线前 200 步太抖、想只展示收敛段,就在set_title附近加一行axs[row, col].set_ylim(0, 2);x 轴同理用set_xlim。
换导出格式。每个plt.savefig("train_loss.png")的后缀改成pdf或svg即可,矢量格式进 LaTeX 不失真。
速查表
| 我想…… | 跑什么 / 改哪里 |
|---|---|
| 跑基线并出图 | python experiment.py --out_dir run_0然后python plot.py |
| 一键出论文(含图) | python launch_scientist.py --model gpt-4o-2024-05-13 --experiment nanoGPT --num-ideas 2 |
| 多卡并行跑想法 | 上一条命令加--parallel 2 |
| 换图表配色 | plot.py 里generate_color_palette的cmap |
| 调坐标范围 | 同文件对应axs上加set_ylim/set_xlim |
| 换导出格式 | 改savefig文件名后缀 |
跑通之后,值得试的 3 个进阶玩法
- 给上一条命令加
--improvement:审稿后它会自动按意见改写再编译一版,改进稿和二次审稿(review_improved.txt)都留在同一个文件夹。 - 想批量看自动审稿的稳定性,翻 review_iclr_bench/iclr_analysis.py,它能把几百篇 ICLR 论文的评分跑出来。
- 你的方向不在三个官方模板里?照
templates/的结构写一份自己的:experiment.py负责把结果对齐成final_info.json加结果包,plot.py就能直接接进去,细节以仓库 README 为准。
跑通第一条命令后,翻翻templates/里 grokking、nanoGPT 的experiment.py,看哪种数据流对得上你的实验。
【免费下载链接】AI-ScientistThe AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery 🧑🔬项目地址: https://gitcode.com/GitHub_Trending/ai/AI-Scientist
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考