摘要
腾讯技术岗目前采用 4—17 级专业职级体系。不同职级之间不仅有薪资差异,对工程能力、复杂问题处理能力和技术影响范围的要求也不同。对于测试开发岗位,2026 年腾讯公开招聘中已经出现模型训练、部署、推理、评测以及 Agent CLI 测试等要求。本文整理腾讯技术职级与薪资结构,并结合当前岗位要求,梳理测试开发社招及 AI 测试方向的面试重点。
腾讯测试开发社招现在需要准备什么?
除了 Python、接口自动化、测试平台、性能测试,还要不要准备 RAG、大模型评测和 Agent 测试?
可以先从腾讯技术岗位的职级和能力结构看起。
腾讯 2019 年将原有的“6 级 18 等”专业职级体系调整为4—17 级,共 14 个专业职级。2024 年起,专业职级不再在企业微信中公开展示,但职级体系仍用于员工职业发展和能力评价。
一、腾讯技术职级与薪资参考
下面按照技术研发岗位公开报薪样本平均值整理。
金额为人民币税前万元,折算月薪按照年度工资计算;年度总包还可能包含奖金和年度股权激励。
公开报薪样本更适合观察不同职级的收入量级,不能直接作为腾讯统一薪资标准。
例如样本中 6 级高于 7 级、8 级高于 9 级,原因可能来自业务线、城市、岗位、入职年份、绩效以及股票授予差异。
因此:
不同职级的样本收入差,不等于一个员工晋升后的实际涨幅。
二、腾讯不同技术职级分别看什么能力
职级提升对应的不只是工作年限。
对于软件开发、测试开发等技术岗位,可以从任务执行、独立负责、复杂工程问题、技术影响范围四个阶段理解。
4—5级:稳定完成工程任务
这一阶段主要建立工程基础。
测试开发岗位通常需要具备:
- 测试分析与测试设计;
- 接口测试;
- Linux;
- SQL;
- Python 或 Java;
- 基础自动化测试;
- 常见问题定位。
能力重点:
能够独立完成明确的测试和开发任务。
6—8级:独立负责业务或模块
到了这一阶段,要求开始从“完成任务”转向“负责结果”。
一个业务模块交过来,需要能够自己完成:
需求分析 → 风险识别 → 测试方案 → 自动化 → 问题定位 → 上线保障。
测试开发的能力也会从单点工具使用逐渐扩展到:
业务质量 + 自动化 + 测试开发 + 工程效率。
9—11级:解决复杂工程问题
9 级以上,对技术方案和复杂问题处理能力的要求进一步提高。
评价重点不再只是会不会 Selenium、Pytest、JMeter,而是:
- 为什么采用这个技术方案;
- 大规模用例如何稳定运行;
- 测试数据如何治理;
- 自动化平台如何持续维护;
- 性能瓶颈如何定位;
- 如何衡量质量平台的投入产出;
- 如何推动跨团队质量问题解决。
2022 年腾讯人才评估体系调整后,9—11 级的晋升评审权限也逐步下放至部门和业务线。
对于测试开发岗位,这一阶段通常会更多涉及:
测试平台、质量基础设施、稳定性、性能工程、效能工具和复杂系统质量保障。
12级及以上:专业深度与技术影响范围
腾讯 2025 年 ESG 报告继续采用专业通道 + 管理通道的双通道职业发展体系。
专业通道覆盖技术、产品/项目、设计、市场、专业五大职业族群,并进一步划分为多个专业发展子通道;管理通道则包括基层、中层和高级管理岗位。
因此技术人员并不需要通过“带团队”才能继续提升专业职级。
高阶专业岗位主要看两件事:
能够解决多复杂的问题,以及解决方案能够影响多大的业务范围。
三、腾讯薪资怎么看:固定工资、奖金和股票分开算
2024 年 7 月,腾讯调整薪酬结构,将原本年底发放的固定“服务奖”平均融入 12 个月月薪。
腾讯当时说明,服务奖本质属于固定薪酬的一部分;调整后,年终奖金更多回归业绩激励。
所以现在看腾讯 Offer,不能继续简单按照:
月薪 × 13 + 年终奖
计算全年收入。
更适合拆成三个部分:
| 收入组成 | 看什么 |
|---|---|
| 固定现金 | 每月稳定工资 |
| 绩效奖金 | 奖金目标与绩效规则 |
| 股票 | 授予金额与年度归属 |
级别越高,股票和浮动收入对总包的影响通常越值得关注。
比较 Offer 时,可以直接确认:
固定现金是多少、奖金怎么算、股票几年归属。
四、腾讯测试开发岗位正在加入 AI 质量保障
对于测试开发人员,2026 年更值得关注的是测试对象正在发生变化。
腾讯技术工程事业群在2026 年 9 月 20 日更新的“基模生产平台 QA”岗位中,已经直接列出了:
- 模型训练流程测试;
- 模型部署测试;
- 模型推理测试;
- 模型评估;
- 自动化平台和测试工具建设;
- Agent CLI 端到端测试;
- 复杂平台质量保障。
岗位同时要求扎实的编码能力,以及独立开发测试工具的能力。
这类岗位的测试对象已经从传统 Web、App、接口系统继续扩展到:
模型平台、LLM 应用和 Agent 系统。
传统测试能力没有消失。
接口、数据库、Linux、网络、缓存、消息队列、自动化和性能测试仍然属于测试开发基本能力。
在这套基础上,又增加了一层:
AI 系统质量保障。
五、腾讯测试开发社招主要准备哪些内容
社招测试开发和校招最大的差别之一,是面试会花更多时间验证:
你实际做过什么,以及为什么这么做。
技术知识仍然会问,但项目经验、工程方案和问题处理通常会被连续追问。
可以按照五个方向准备:
| 能力方向 | 重点 |
|---|---|
| 项目与质量 | 测试策略、质量风险、线上问题 |
| 测试开发 | 自动化、测试工具、测试平台 |
| 系统能力 | Linux、网络、DB、Redis、MQ |
| 性能稳定性 | 压测、监控、故障定位 |
| AI 测试 | RAG、LLM、Agent、模型评测 |
六、腾讯测试开发社招项目面试题
以下问题按照当前测试开发岗位能力要求整理,不是腾讯官方题库。
① 介绍一个你主导过的测试开发项目
回答不要停留在:
“项目使用了 Python、Pytest、Jenkins。”
更适合按照:
项目背景 → 质量问题 → 你的职责 → 技术方案 → 难点 → 结果
展开。
常见追问:
- 为什么要做这个项目?
- 哪部分是你独立设计的?
- 最大的技术问题是什么?
- 方案还有什么缺陷?
- 如果重新设计一次,会改哪里?
② 一个新业务上线,怎么设计测试策略
可以从以下几个方向拆:
业务风险 → 核心链路 → 接口与数据 → 异常场景 → 性能 → 安全 → 自动化 → 上线监控
社招面试更关注的是:
能不能从业务风险推导测试方案。
③ 线上接口突然大量超时,怎么排查
可以按照调用链定位:
客户端 → 网络 → 网关 → 应用 → Redis → MySQL → RPC → 下游服务
再结合:
CPU、内存、线程池、连接池、慢 SQL、GC、缓存命中率和下游 RT 分析。
七、自动化与测试平台面试题
④ 如何设计一套接口自动化测试框架
至少要考虑:
用例管理 → 数据驱动 → 请求封装 → 环境管理 → 断言 → 执行 → 日志 → 报告 → CI/CD
高级岗位还可能继续问:
- 如何并发执行;
- 如何隔离测试数据;
- 如何降低用例耦合;
- 如何治理失败用例;
- 如何做 Mock;
- 如何做失败归因。
⑤ 自动化覆盖率是不是越高越好
不是。
自动化价值更适合综合考虑:
业务风险 × 执行频率 × 场景稳定性 × 自动化成本
高频、稳定、核心回归场景通常更值得自动化。
低频、高变化、高维护成本的场景,不一定适合追求自动化覆盖率。
⑥ 测试平台做出来以后,怎么证明有价值
可以从几个指标回答:
- 回归时间;
- 自动化覆盖;
- 缺陷发现阶段;
- 人工投入;
- 用例执行次数;
- 线上漏测;
- 故障恢复时间;
- 平台使用率。
社招测开需要的不只是“做过平台”,还要能够说明:
平台解决了什么工程问题。
八、后端与系统工程面试题
这部分通常围绕测试工作中的真实技术场景展开。
可以重点准备:
⑦ Redis 缓存穿透、击穿、雪崩分别是什么?
⑧ Kafka 出现消费积压,怎么定位?
⑨ 如何测试消息重复、丢失和乱序?
⑩ 一条 SQL 突然变慢,怎么排查?
⑪ MySQL 索引什么时候可能不生效?
⑫ 分布式系统的数据一致性怎么测试?
⑬ TCP 三次握手解决什么问题?
⑭ HTTP、HTTPS、Cookie、Session、Token 有什么区别?
测试开发岗位回答这些问题时,可以再多走一步:
这个机制如何设计测试场景验证。
九、性能与稳定性面试题
⑮ 一个接口从 100ms 变成 2s,怎么定位
先确定时间花在哪里:
客户端 ↓ 网络 ↓ 网关 ↓ 应用 ↓ 缓存 / 数据库 ↓ RPC ↓ 下游服务再结合 Trace、日志和监控定位具体瓶颈。
⑯ 如何设计一次容量压测
完整的压测至少包括:
目标 → 流量模型 → 用户模型 → 测试数据 → 环境 → 监控 → 瓶颈 → 容量结论
QPS、TPS、RT、P95、P99 这些指标也需要理解具体应用场景。
十、AI 测试已经需要单独准备
腾讯当前的基模生产平台 QA 已经明确涉及模型训练、部署、推理、评估以及 Agent CLI 测试。
准备 AI 测试面试时,不需要只背大模型名词。
测试开发更应该理解:
AI 系统怎么运行,以及每一层应该怎么测。
⑰ RAG 是什么,RAG 系统怎么测试
典型 RAG 链路:
用户问题 ↓ Query 处理 ↓ Retriever ↓ 召回 ↓ Reranker ↓ 上下文 ↓ LLM ↓ 回答测试也可以分层。
检索层:
Recall、Precision、Hit Rate、MRR、NDCG。
生成层:
正确性、相关性、完整性、Faithfulness、幻觉。
系统层:
延迟、并发、稳定性、Token 成本、安全和权限。
⑱ Embedding 模型换了以后,怎么判断效果更好
不能只通过几个问题人工体验。
可以建立固定测试集,对比:
- Recall@K;
- MRR;
- NDCG;
- Top-K 命中率;
- 最终问答正确率。
这样才能判断模型升级到底改善了什么。
⑲ 为什么 RAG 会使用混合召回
向量检索更擅长语义匹配。
关键词检索对错误码、型号、ID、专有名词和精确字段更敏感。
因此实际系统经常采用:
Vector Search + Keyword Search → Merge → Rerank
测试时还需要验证:
召回、融合、去重和排序。
十一、Agent 测试怎么问
⑳ 一个 AI Agent 应该怎么测试
Agent 和普通聊天机器人不同,它不仅输出文本,还可能自主选择和调用工具。
完整链路可能包括:
用户任务 ↓ 任务理解 ↓ 规划 ↓ Tool / MCP 选择 ↓ 工具执行 ↓ Observation ↓ 再次决策 ↓ 任务完成Agent 测试至少需要验证:
- 工具选择是否正确;
- 参数是否正确;
- 调用是否成功;
- 失败后能否恢复;
- 是否出现死循环;
- 是否重复调用;
- 是否越权;
- 多轮上下文是否丢失;
- 最终任务是否真正完成。
十二、LLM 输出不固定,自动化断言怎么做
㉑ 大模型每次回答不一样,怎么自动化测试
传统接口测试经常采用:
assert actual == expected大模型输出通常不能完全依赖 Exact Match。
可以组合:
结构校验 + 规则判断 + 关键词 + 语义相似度 + 事实校验 + LLM Judge + 人工抽检
不同场景采用不同评估方法。
例如 JSON 输出可以重点做 Schema 校验;
知识问答可以重点检查事实正确性和 Faithfulness;
开放式生成则更适合综合评分。
㉒ LLM-as-a-Judge 能不能直接作为测试结果
不能单独作为绝对标准。
Judge 的结果可能受到:
- Judge 模型能力;
- Prompt;
- 输出顺序;
- 回答长度;
- 参考答案;
- 模型偏好
影响。
工程上更适合组合:
确定性规则 + 传统指标 + LLM Judge + 人工评测
十三、大模型升级以后怎么做回归测试
㉓ 模型从旧版本升级到新版本,怎么验证
可以建立固定 Benchmark,对比:
| 指标 | 测试内容 |
|---|---|
| 任务成功率 | 任务是否完成 |
| 正确率 | 结果是否正确 |
| 幻觉率 | 是否出现无依据内容 |
| Tool Success Rate | 工具调用成功率 |
| 延迟 | P50 / P95 / P99 |
| Token | 调用成本 |
| 安全 | 注入、越权、敏感信息 |
| Bad Case | 历史问题是否回归 |
模型升级的结论应该能够回答:
哪些能力提升了,哪些能力发生了退化。
十四、算法和编码仍然是测试开发基本功
AI 测试能力增加以后,Python、Java、数据结构和算法并没有变得不重要。
测试开发依然属于工程技术岗位。
社招可以重点准备:
- 数组与字符串;
- 哈希表;
- 链表;
- 栈与队列;
- 二叉树;
- 二分查找;
- 滑动窗口;
- DFS / BFS;
- 时间复杂度和空间复杂度。
对于测试开发来说,代码能力直接决定了:
能不能把测试思路真正工程化。
十五、2026 年测试开发能力结构
从腾讯当前公开 QA 岗位可以看到,测试开发的能力边界正在继续扩展。
过去比较典型的路线是:
测试基础 → 自动化测试 → 测试开发 → 测试平台
现在部分 AI 业务已经继续延伸到:
测试基础 → 编程开发 → 自动化 → 测试平台 → 系统工程 → AI 系统测试
其中 AI 测试主要包括:
大模型评测、RAG 测试、Agent 测试、Tool / MCP 调用测试以及模型应用的性能、安全和稳定性。
腾讯当前公开招聘已经把模型生产流程和 Agent 产品列入 QA 工作内容,这类能力正在从“了解 AI”逐渐进入实际的软件质量保障工作。
对于准备腾讯以及其他大厂测试开发社招的人来说,可以按照五个方向检查自己的能力:
测试基础、编程开发、自动化与平台、系统工程、AI 测试。
这五部分连起来,基本就是当前测试开发岗位比较完整的一套能力结构。