1. 为什么大家都在 LMArena 蹲 Gemini 3:匿名对战到底怎么玩
最近 AI 圈最热闹的事,莫过于 LMArena 上突然冒出来的两个神秘模型:lithiumflow 和 orionmist。名字看着像随手编的代号,但社区里几乎一致认定,这就是 Gemini 3 系列在正式发布前的盲测版本。原因也不复杂——lithiumflow 的视觉理解强得离谱,有人丢一张模拟时钟的图片过去,它能准确读出指针指向的时间,这个任务很多模型都会翻车;还有人让它写游戏逻辑,它直接用数学算法把代码优化了一遍,一次成型。orionmist 整体稍弱一点,但多了联网搜索能力,两者分工很像 Pro 和 Flash 的搭配。
LMArena 本身是加州大学伯克利分校做的开放评测平台,核心玩法是匿名对战:你提一个问题,系统随机分配两个模型分别回答,你投票选更好的那个,投完票才揭晓模型身份。这种设计最大程度消除了品牌偏见,你只能凭回答质量判断。也正因为匿名,厂商才愿意把未发布的模型放上来跑分,Grok 4、GPT-5、nano-banana 发布前都在这里露过脸。
对普通用户来说,这意味着什么?意味着你不需要任何内测资格、不需要申请白名单、不需要付费订阅,打开浏览器就能提前和可能是 Gemini 3 的模型对话。整个过程零门槛,连注册都可以跳过。下面我把从访问入口到模型选择、再到对话评测和结果对比的完整流程拆开讲,每一步都给可复制的操作,你跟着做就行。
2. 访问 LMArena 与模式选择:Battle 模式才是抽到 Gemini 3 的关键
先说访问。浏览器直接输入 https://lmarena.ai ,回车。页面加载后你会看到输入框,不需要登录就能直接开聊。如果你希望保存聊天记录、方便后续对比,可以点右上角登录,支持谷歌账号一键登录,几秒钟搞定。不登录也完全不影响体验,只是刷新后记录会丢。
进入官网后,注意看界面上的模式选项,这是整个流程里最关键的一步。LMArena 提供几种模式:
| 模式 | 作用 | 能否遇到 lithiumflow/orionmist |
|---|---|---|
| Battle | 随机匿名对战,两个模型分别回答 | 能,这是唯一入口 |
| Side by Side | 指定两个模型对比 | 不能,模型需已公开 |
| Direct Chat | 直接选定某个模型对话 | 不能,模型需已公开 |
划重点:想遇到 lithiumflow 和 orionmist,必须选 Battle 模式。这两个模型还没公开发布,只会出现在随机对战里,就像抽卡,不是每次必中,但多试几次总能抽到。Battle 也是 LMArena 的默认模式,进去一般就在这个界面。
选好模式后,在输入框里输入你的问题,发送。界面会显示 Assistant A 和 Assistant B 两个匿名模型,分别给出回答。这时候你还不知道谁是谁,只能看回答质量。接下来投票,选项有四个:Left is Better、Right is Better、It's a tie、Both are bad。这里有个小技巧,测试阶段建议选 It's a tie,因为投票后系统才会揭晓模型身份,选平局可以让你在揭晓后继续追问、继续测试同一个模型,不用重新抽。
如果第一次没遇到目标模型,别气馁。点左侧菜单栏的 New Chat,系统会重新随机分配模型。实测下来,多试几次命中率不低,有人第三次就遇到了 orionmist。整个过程不需要任何配置,纯靠点击,这也是 LMArena 对小白最友好的地方。
3. 可复制的评测配置:用固定 Prompt 复现 Gemini 3 的能力对比
虽然 LMArena 是网页操作,但如果你想认真评测、复现对比结果,光靠随手提问是不够的。你需要一套固定的测试用例,这样每次抽到不同模型时,才能横向比较。下面我给一份可以直接复制使用的评测配置清单,包含三类 Prompt,分别测视觉、编程和联网能力。
第一类,视觉理解测试。准备一张包含多个元素的图片,比如带指针的时钟、包含文字的截图、或者复杂图表。Prompt 可以这样写:
请描述这张图片中的所有细节,包括:1) 图中主要物体及其位置关系;2) 如果有时钟,请读出准确时间;3) 如果图中有文字,请逐字转录。请用中文回答。lithiumflow 在这类任务上表现突出,尤其是时钟读数这种很多模型会翻车的场景。你可以把同一张图分别喂给抽到的模型,记录回答准确度。
第二类,编程能力测试。用一道需要算法优化的题目,观察模型是否一次性给出完整逻辑:
用 Python 实现一个贪吃蛇游戏的核心逻辑,要求:1) 使用面向对象设计;2) 蛇的移动用坐标队列实现;3) 食物生成不能与蛇身重叠;4) 给出完整可运行代码并附注释。社区反馈 lithiumflow 会用数学算法优化代码,一次写出完整游戏逻辑。你可以对比不同模型在代码完整性、注释质量和边界处理上的差异。
第三类,联网搜索测试。这类任务主要看 orionmist,因为它有联网能力:
请查询今天 AI 领域最重要的三条新闻,并给出每条新闻的来源链接和一句话摘要。如果模型能给出实时信息,说明联网生效;如果只给训练数据里的旧内容,说明没联网。把这三类 Prompt 存到本地文本里,每次抽到新模型就粘贴一遍,记录结果,你就能得到一份自己的对比表。
另外,如果你在本地用 API 方式做批量评测,需要配置 Base URL、Key 和 Model ID 三件套。以 TaoToken 为例,Base URL 是 https://taotoken.net/api ,Key 在控制台创建,Model ID 按你实际要测的模型填。配置文件可以写成这样:
{ "base_url": "https://taotoken.net/api", "api_key": "sk-你的密钥", "model": "gemini-3-pro-preview", "temperature": 0.7, "max_tokens": 4096 }注意,LMArena 网页端不需要这套配置,但如果你想把评测流程自动化、批量跑 Prompt,API 方式会更高效。两种方式可以配合使用:网页端抽卡体验,API 端批量复现。
4. 验证请求与成功结果:怎么确认你抽到的就是 Gemini 3
抽到模型只是第一步,关键是确认你遇到的是不是真的 Gemini 3 系列。投票后系统会揭晓模型名称,如果显示 lithiumflow 或 orionmist,那基本就是目标。但揭晓之后,你还需要做几个验证动作,确认它的能力符合社区描述。
第一个验证动作,切换模型复现对比。揭晓身份后,不要急着关掉,继续追问同一个问题,观察回答是否稳定。然后点 New Chat 重新抽,如果又抽到同一个模型,用同样的 Prompt 再问一遍,看结果是否一致。稳定输出高质量回答,说明不是偶然。
第二个验证动作,视觉任务复现。找一张带时钟的图片,分别发给 lithiumflow 和其他模型,对比读数准确率。lithiumflow 能准确报出时间,这是它最明显的特征之一。如果抽到的模型在时钟任务上频繁出错,那大概率不是它。
第三个验证动作,联网能力检测。问一个需要实时信息的问题,比如今天的日期加某条新闻。orionmist 能联网搜索,会给出带来源的实时回答;lithiumflow 没有联网能力,只会基于训练数据回答。这个差异可以帮你区分两者。
成功结果的标志是什么?一是揭晓名称显示 lithiumflow 或 orionmist;二是视觉任务准确率高,尤其是时钟读数;三是编程任务能一次给出完整可运行代码;四是 orionmist 能返回实时信息。满足这些,基本可以确认你体验到的就是 Gemini 3 预发布版本。
实测下来,整个流程最耗时的部分不是操作,而是抽卡。有时候连续几次都抽不到,这时候别放弃,点 New Chat 继续。社区里有人抽了十几次才遇到,也有人第三次就中。耐心一点,反正免费,多试几次成本很低。
5. 常见报错与排查:401、local proxy failed、OAuth 报错怎么处理
虽然 LMArena 网页端操作简单,但如果你同时用 API 方式做评测,可能会遇到一些报错。下面整理几个高频问题和排查方法。
第一个,401 Unauthorized。这个报错通常出现在 API 调用时,原因是 Key 无效或没带上。排查步骤:检查请求头里 Authorization 字段格式是否为Bearer sk-xxx,注意 Bearer 后面有一个空格;检查 Key 是否复制完整,有没有多余空格;检查 Key 是否已过期或被删除。如果用的是 TaoToken,去控制台重新创建一个 Key,替换后重试。
第二个,local proxy failed。这个报错一般和本地网络环境有关,不是 LMArena 本身的问题。排查步骤:检查本地是否设置了系统代理,如果有,尝试关闭后重试;检查防火墙是否拦截了请求;如果是公司网络,可能需要换一个网络环境。注意,这里说的是本地网络配置排查,不涉及任何特殊工具。
第三个,reading choices 报错。这个通常出现在解析 API 返回结果时,原因是返回结构和你代码里解析的字段不一致。排查步骤:先打印完整返回 JSON,看实际结构;确认 choices 字段是否存在,有些模型返回的是 candidates 或 content;检查是否因为 max_tokens 设置过小导致返回被截断。把返回结构打印出来对照,基本能定位。
第四个,OAuth 报错。这个出现在登录 LMArena 时,尤其是用谷歌账号一键登录。排查步骤:检查浏览器是否禁用了第三方 Cookie,OAuth 流程需要它;尝试换一个浏览器或无痕模式;如果公司账号有限制,换个人账号登录。登录不是必须的,如果一直报错,直接跳过登录用匿名模式也能体验。
第五个,模型不出现。这不是报错,但很多人会困惑。lithiumflow 和 orionmist 只在 Battle 模式随机出现,如果你在 Side by Side 或 Direct Chat 里找,永远找不到。确认你在 Battle 模式,然后多点几次 New Chat。
如果你在配置 API 时用到 Claude Code 或类似工具,需要写全三件套:Base URL 填 https://taotoken.net/api ,Key 填控制台创建的密钥,Model ID 填你要用的模型名。三者缺一不可,少一个就会报 401 或 model not found。配置文件建议用 JSON 或 TOML 格式,路径和字段名保持一致,避免解析错误。
6. 从体验到落地:把 LMArena 评测结果用起来的实用建议
体验完 Gemini 3 预发布版本后,很多人会问:然后呢?我的建议是,把 LMArena 当成一个持续跟踪模型能力的窗口,而不是一次性尝鲜。具体怎么做,分享几个实用思路。
第一,建立自己的评测记录表。每次抽到新模型,把 Prompt、回答质量、响应速度、是否联网记下来。积累一段时间后,你会对各家模型的能力边界有直观感受。这个表不需要多复杂,一个 Markdown 表格就够。
第二,把评测结果和实际项目结合。比如你在做视觉相关的应用,lithiumflow 的时钟读数能力说明它在图像理解上有优势,可以考虑在正式发布后接入;如果你需要联网搜索,orionmist 的方向更合适。提前在 LMArena 上验证能力,比等发布后再试错成本低得多。
第三,关注模型发布节奏。Gemini 3 在 LMArena 上跑分,说明发布临近。社区里有说 10 月 22 日的,有说 11 月 12 日的,也有说年底的。不管哪个时间点,提前在 LMArena 上熟悉它的能力特征,等正式发布时你就能快速判断它适不适合你的场景。
第四,如果你想把评测流程自动化,可以用 API 方式批量跑 Prompt。TaoToken 的 API 入口是 https://taotoken.net/api ,配合前面给的 JSON 配置,你可以写一个脚本,把三类测试 Prompt 批量发给不同模型,自动记录结果。这样比手动在网页上抽卡效率高得多。需要创建 Key 的话,去控制台操作就行;想先体验模型对话,可以直接用模型对话入口;如果是长期编码或 Agent 场景,Coding Plan 会更合适。
最后说一个我踩过的坑:一开始我在 Side by Side 模式里找了半天 lithiumflow,怎么都找不到,后来才反应过来必须用 Battle 模式。这个点很容易被忽略,但恰恰是能不能遇到 Gemini 3 的关键。记住,Battle 模式,多点 New Chat,耐心抽卡,你一定能遇到。