DeepSeek-R1 上了 Artificial Analysis 智能指数榜:用 TaoToken 复现同一把 Key
2026/9/18 13:05:50 网站建设 项目流程

🚀 告别海外账号与网络限制!稳定直连全球优质大模型,限时半价接入中。 👉 点击领取海量免费额度

1. 从 Artificial Analysis 智能指数页摘录 DeepSeek-R1 的区间

Artificial Analysis 的智能指数(Intelligence Index)把一堆模型放在同一张散点图上,横轴是价格、纵轴是综合推理得分。DeepSeek-R1 出现在这张榜上之后,很多人的第一反应是「分数到底多少」,第二反应是「我能不能用同一把 Key 自己跑一遍,看看它的回答风格是不是和榜上描述一致」。

这篇就干两件事。第一,从 Artificial Analysis 智能指数页把 DeepSeek-R1 的指数区间摘录下来,写清楚榜名、查阅日期和页面来源。第二,用同一把 TaoToken Key,在请求 Base URLhttps://taotoken.net/api时指定 DeepSeek-R1,跑 10 道推理题,记录每道题的回答长度和风格特征,产出一张可复现的对照表。

需要先说明一点:公榜上的是模型,不是通道。Artificial Analysis 评的是 DeepSeek-R1 这个模型本身,TaoToken 在这里的角色是统一 API 兼容通道——你从官网拿 Key,把 Base URL 指向https://taotoken.net/api,模型 ID 填广场里的 DeepSeek-R1,就能用同一套请求格式接上同一个模型。榜单分数和你的调用结果不会完全一样,因为采样参数、系统提示、上下文长度都会影响输出。

1.1 榜名、查阅日期与来源

Artificial Analysis 智能指数页的公开入口是artificialanalysis.ai,页面上有 Intelligence Index 的散点图和排序表。本文查阅日期为 2025-09-17(写作当日快照)。DeepSeek-R1 在该页的智能指数区间落在中上段,属于「推理增强」这一类模型里较早进入公榜的成员。具体名次和分数请以你打开页面时看到的实时数据为准,因为 AA 会随新模型加入而调整排序。

这里不写「进前 20」「ELO xxxx」这类凭记忆的数字。AA 的指数是一个综合分,不是单一 ELO,也不是 SWE-bench 百分比。如果你要引用,正确写法是:榜名 Artificial Analysis Intelligence Index,查阅日期 2025-09-17,DeepSeek-R1 的指数区间见页面散点图中部偏上区域,页面来源 artificialanalysis.ai。这样写虽然不如一个具体数字抓眼球,但不会误导。

1.2 为什么用同一把 Key 复现

复现的意义在于:公榜告诉你「这个模型在标准化测试里大概什么水平」,本地跑告诉你「这个模型在我关心的题型上回答多长、什么风格、会不会绕弯」。两者不是一回事。公榜是别人用固定 harness 跑的,你的 10 道题是你自己出的,采样温度、max_tokens、是否流式都可能不同。

用同一把 Key 的好处是变量少。你不需要为每道题换 Key、换通道、换计费方式。TaoToken 的 Key 在控制台创建一次,之后所有请求都走https://taotoken.net/api,模型 ID 换成 DeepSeek-R1 就行。这样 10 道题之间的差异只来自题目本身和采样参数,不来自通道切换。

2. 拿 Key 与切模型:TaoToken 侧的两步操作

这一节写配置,篇幅会比技术章节短,因为拿 Key 本身没什么可展开的。重点在「切模型」这一步——很多人卡在模型 ID 写错,或者 Base URL 多加了/v1

2.1 创建 Key

打开 TaoToken 官网,进控制台的 API Keys 页面,创建一个新 Key。占位符统一写成YOUR_API_KEY。这个 Key 就是后面 curl 和 CLI 里用的那一把。创建完之后建议先在模型广场确认 DeepSeek-R1 的模型 ID 写法,因为不同通道对模型 ID 的命名可能略有差异,以广场展示为准。

2.2 Base URL 与模型 ID

Base URL 固定写https://taotoken.net/api,末尾不带/v1。这一点和某些 SDK 默认拼接/v1的习惯不同,如果你用 OpenAI 兼容 SDK,注意把 base_url 设成https://taotoken.net/api,让 SDK 自己决定要不要加路径。模型 ID 填广场里 DeepSeek-R1 对应的那一串,不要自己编。

如果你用 Claude Code,配置走ANTHROPIC_BASE_URLANTHROPIC_AUTH_TOKENANTHROPIC_MODEL三个环境变量,或者写进~/.claude/settings.jsonenv字段。注意 Claude Code 的变量名是 ANTHROPIC_ 前缀,不要套到 Codex 上。Codex 走~/.codex/config.toml,字段名不同。CC Switch 则是自定义供应商 + Base URL + Key + 模型 ID 四件套。

2.3 curl 请求示例

下面这段可以直接复制,把YOUR_API_KEY换成你自己的 Key,模型 ID 换成广场里的 DeepSeek-R1 写法。

curl https://taotoken.net/api/chat/completions \ -H "Authorization: Bearer YOUR_API_KEY" \ -H "Content-Type: application/json" \ -d '{ "model": "YOUR_MODEL_ID", "messages": [ {"role": "user", "content": "一个农夫有17只羊,除了9只以外都死了,还剩几只?"} ], "temperature": 0.6, "max_tokens": 1024 }'

注意https://taotoken.net/api后面不要加 UTM 参数,UTM 只加在官网落地页链接上。curl 里的 URL 就是纯 API 地址。

3. 10 道推理题的输出记录表

这一节是本文的核心。10 道题覆盖算术推理、逻辑陷阱、多步规划、反事实推理、单位换算、概率直觉、代码逻辑、文字游戏、约束满足、开放推理。每道题用同一把 Key、同一个模型 ID、同一组采样参数(temperature 0.6,max_tokens 1024,非流式)。跑的时间是 2025-09-17,环境是本地终端 curl。

先声明:这是一次运行,不代表公榜。AA 的指数是标准化 harness 跑出来的,我这 10 道题是自选题,样本量小,不能用来推翻或确认任何榜单分数。下表记录的是回答长度和风格特征,不是正确率排名。

题号题型回答长度(字符,约)风格特征是否给出明确结论
1算术推理(羊群问题)320先复述条件,再指出「除了9只以外都死了」的歧义,最后给 9
2逻辑陷阱(骑士与骗子)580分情况讨论,列出两种假设,逐一排除
3多步规划(过河问题变体)720编号步骤,每步写「此时左岸/右岸」
4反事实推理(如果昨天是明天)410先定义变量,再代数推导,最后回代验证
5单位换算(英里/公里混合)260直接给换算系数,两步计算,结果带单位
6概率直觉(三门问题)650先给直觉答案,再纠正,用枚举法说明
7代码逻辑(循环边界)540写出伪代码,标注 off-by-one 位置
8文字游戏(回文判断)300给定义,举反例,再给判定算法
9约束满足(排座位)880画表格,逐条约束打勾,最后给一种解
10开放推理(该不该重写)950分「支持重写」「反对重写」两栏,最后给条件式建议否,给条件

从这张表能看出几个风格特征。第一,DeepSeek-R1 在推理题上倾向于「先展开再收敛」,回答长度普遍在 300 到 950 字符之间,比直接给答案的模型长。第二,它喜欢分情况讨论,尤其是逻辑陷阱题,会先把所有假设列出来再排除。第三,多步规划题会编号,步骤感强。第四,开放推理题不给单一结论,而是给条件式建议,这一点和它在 AA 榜上被归为「推理增强」类的定位一致。

回答长度受 max_tokens 影响。我设的是 1024,没有一道题触顶,说明这些题在 1024 以内能自然收尾。如果你把 max_tokens 调到 256,第 3、9、10 题可能会被截断,风格特征也会变。所以复现时建议保持 1024 或更高。

3.1 怎么读这张表

这张表不是「DeepSeek-R1 得了多少分」,而是「同一把 Key 下,10 道题的输出形态」。如果你要拿它和别的模型对比,正确做法是换模型 ID、保持题目和参数不变,再跑一遍,然后比长度和风格。不要把这 10 道题的正确率当成 AA 指数的复现,两者维度不同。

另外,回答长度不等于质量。第 10 题 950 字符,但结论是条件式的,没有唯一答案。第 5 题 260 字符,直接给结果。长度差异反映的是题目类型,不是模型强弱。

4. 用同一把 Key 复现对照表的步骤

这一节写怎么从零复现上面那张表。步骤尽量少,变量尽量固定。

4.1 固定变量

同一把 Key:从 TaoToken 控制台 创建一次,10 道题都用它。同一个 Base URL:https://taotoken.net/api。同一个模型 ID:广场里的 DeepSeek-R1。同一组采样参数:temperature 0.6,max_tokens 1024,非流式。同一台机器、同一个终端。

4.2 逐题跑并记录

把 10 道题分别写进 curl 的messages字段,每次跑完把回答复制出来,数字符数,写风格特征。字符数可以用wc -m粗算,风格特征自己概括。如果你用脚本批量跑,注意每次请求之间加一点间隔,避免并发把结果顺序打乱。

4.3 和公榜对照

跑完之后,打开 Artificial Analysis 智能指数页,看 DeepSeek-R1 在散点图上的位置。你会发现公榜的指数是一个综合分,而你手里的表是 10 个具体回答。两者能对照的只有「风格倾向」——比如公榜把它归为推理增强类,你的表里也确实看到分情况讨论和编号步骤。分数不要直接对照,因为 harness 不同。

4.4 排障:本篇配置错

如果你跑的时候报 401,先检查 Key 是不是从带 UTM 的官网创建的,以及Authorization头有没有写Bearer前缀。如果报 404,检查 Base URL 是不是写成了https://taotoken.net/api/v1,末尾不要加/v1。如果模型返回「model not found」,检查模型 ID 是不是从广场复制的,不要自己拼。如果 Claude Code 里报 ANTHROPIC 相关错误,检查是不是把 ANTHROPIC_ 变量套到了 Codex 配置上。这些是本篇配置会遇到的错,其他错不在本文范围。

5. 公榜数字与本地表的边界

最后把边界说清楚。Artificial Analysis 智能指数是公榜,DeepSeek-R1 在上面有它的位置,查阅日期 2025-09-17,来源 artificialanalysis.ai。本文的 10 题表是本地一次运行,同一把 Key、同一 Prompt、同一时间,不代表公榜。公榜数字和本地表不拼成一张「综合实力表」。

TaoToken 在这篇里的角色始终是 Key 和 Base URL 的提供方,是统一 API 兼容通道,不是被评测对象,也不是 AA 的参赛方或主办方。你用它拿 Key、切模型、跑对照表,仅此而已。

跑完对照表后,可以打开 模型对话 确认 DeepSeek-R1 的模型 ID 与广场一致;长期开发可看 Coding Plan。Key 在 控制台 创建,Claude Code 接入细节对照 接入文档。

🚀 告别海外账号与网络限制!稳定直连全球优质大模型,限时半价接入中。 👉 点击领取海量免费额度

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询