一张科学插图要多少钱?AutoFigure API消耗与时间成本完整分析清单
【免费下载链接】AutoFigure项目地址: https://gitcode.com/gh_mirrors/au/AutoFigure
AutoFigure 是一款用大语言模型自动生成出版级科学插图的开源系统。本文完整拆解它生成一张插图的API 消耗与时间成本:官方基准约 0.5 美元、3 万 tokens、20 分钟,并附上一份可直接套用的省钱清单。
一句话答案:0.5 美元、3 万 Tokens、约 20 分钟
项目官方在 README 末尾给出了明确基准(README.md):
使用官方推荐配置(文本模型
gemini-3.1-pro-preview+ 图像模型gemini-3.1-flash-image-preview),每次运行约花费 $0.50,消耗约 30,000 tokens,耗时约 20 分钟。
| 成本项 | 官方基准值 | 主要影响因素 |
|---|---|---|
| 💵 API 费用 | 约 $0.50 / 张 | 迭代次数、输入文本长度 |
| 📦 Token 消耗 | 约 30,000 / 张 | 论文文本可达 1.2 万+ tokens |
| ⏱️ 时间成本 | 约 20 分钟 / 张 | 迭代轮数、模型响应速度 |
为什么需要这么多消耗?因为 AutoFigure 不是"一次生成",而是一个评审-迭代循环,下面逐轮算给你看。
成本从哪来?Review-Refine 迭代循环拆解
整个生成管线由 autofigure/generator.py 的figure_generator_pipeline驱动,默认配置在 autofigure/config.py:
| 配置项 | 默认值 | 作用 |
|---|---|---|
max_iterations | 5 | 最多迭代 5 轮 |
quality_threshold | 9.0 | 评分达到 9 分立即提前终止 |
min_improvement | 0.2 | 提升不足 0.2 分视为收敛 |
一次完整运行的 LLM 调用账单(按"打满 5 轮"的上限估算):
- 初始生成:1 次调用,基于描述/论文生成第一版 SVG 代码
- 初始评审:1 次调用,多模态模型"看图打分"(0-10 分)+ 给出修改意见
- 迭代循环:每轮 = 改进 Agent 1 次 + 评审 Agent 1 次,5 轮共10 次
- 隐藏项:SVG 渲染失败时会自动修复,重试上限 2 次(
MAX_REPAIR_RETRIES)
也就是说,上限约 12 次 LLM 调用,且每次调用都要携带论文原文 + 参考图 + 上一版代码 + 评审意见,上下文逐轮累积——这就是 3 万 tokens 的来源。
好消息是循环有"早退机制"(generator.py):一旦最优版本评分 ≥ 9.0 就立即结束,简单插图往往 2-3 轮即可达标,实际消耗低于上限。
三种使用模式的成本差异
调用agent.generate()(autofigure/agent.py)时,不同入口的成本结构不同:
| 模式 | 额外消耗 | 说明 |
|---|---|---|
| 📝文本生图 | 基准 ≈ $0.50 | 只走生成+迭代循环 |
📄论文生图generate_from_paper() | +1 次 LLM 调用 | 先由 extractor.py 从 PDF/Markdown 提取方法论;论文原文平均12,732 tokens(FigureBench 数据),输入越长越贵 |
✨AI 美化enable_enhancement=True | +1~N 次调用 | enhancer.py 的code2prompt模式先让 LLM 读代码写提示词(1 次),再生成enhancement_count张美化图(默认 1 张,可调到 3 张) |
💡关键结论:同样的提示词,把topic从paper(均值 12,732 tokens)换成textbook(仅 352 tokens),输入成本可下降 97% 以上。复杂度越低,消耗越少。
时间成本拆解:20 分钟花在哪了
- 串行执行:每轮迭代必须"生成 → 本地渲染 PNG → 评审"依次完成,无法并行,这是时间的主要来源
- 本地环节免费:SVG→PNG 渲染(cairosvg)、文件读写都在本地完成,不消耗任何 API
- 模型速度差异:评审用的是多模态大模型(需"看图"),响应比纯文本慢;网络环境(如国内直连海外 API)也会影响总时长
- 提前终止省时间:简单插图 2-3 轮达标即可退出,实际耗时可能只有 8-12 分钟
如果你使用 Web 界面(./start.sh启动后访问 localhost:6002),还要留意共享配额:use-quota-manager.tsx 实现了三重限制——每日请求数、每日 Token 数、每分钟 Token 数(TPM)。配置自己的 API Key 后可绕过全部限制(hasOwnApiKey直接放行),配额值由 env.example 中的环境变量控制。
5 个省钱省时技巧(实操清单)
- 降低迭代上限:把
max_iterations从 5 调到 3,Token 与时间几乎减半,多数插图质量足够 - 调低质量阈值:
quality_threshold=8.0可让循环更早退出(agent.py 支持覆盖) - 选对内容类型:能用
blog/textbook就不要用paper,输入 token 差异达 30 倍以上 - 美化按需开:
enhancement_count保持 1,需要 3 个候选图时才调高;不用美化就别传enable_enhancement - 自带 Key 跑 Web 端:避开共享配额的 TPM 限速等待(触发后需等 60 秒)
模型与服务商选择对成本的影响
官方推荐组合(README.md):
| 服务商 | 文本/SVG 模型 | 图像美化模型 | 特点 |
|---|---|---|---|
| OpenRouter | google/gemini-3.1-pro-preview | gemini-3.1-flash-image-preview | 通用入口 |
| Bianxie | 同上 | 同上 | 国内友好,无需外卡 |
| 同上 | 同上 | 直连官方 |
三家服务商跑的都是同一套 Gemini 模型,价格差异主要来自渠道,而非模型。若预算敏感,优先确认渠道费率;若追求稳定,选网络可达性最好的渠道即可。
快速上手
git clone https://gitcode.com/gh_mirrors/au/AutoFigure cd AutoFigure pip install -e . playwright install chromium配置好 API Key 后,用Config(max_iterations=3, quality_threshold=8.0)即可开始"经济模式"运行。更多参数见 autofigure/config.py 与 CITATION.cff。
总结
| 结论 | 数据 |
|---|---|
| 一张出版级插图成本 | ≈ $0.50(约 3.5 元人民币) |
| 时间成本 | ≈ 20 分钟,简单图 8-12 分钟 |
| 最大成本变量 | 迭代轮数(上限 12 次 LLM 调用) |
| 最省钱姿势 | max_iterations=3+ 简单 topic + 自带 Key |
相比约几百元/张的人工绘图外包,AutoFigure 单张不到 5 美元且 20 分钟交付——对论文修改期需要反复重绘插图的场景,性价比优势非常直接。建议先用 3 轮经济档试跑,满意后再为关键插图放开 5 轮满配。
【免费下载链接】AutoFigure项目地址: https://gitcode.com/gh_mirrors/au/AutoFigure
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考