📋 目录
- 一个反常识的开场
- 5滴水:不是玄学,是纳米级的因果链
- 还有更离谱的:牛打嗝、亡灵和红色小帐篷
- 为什么最难修的故障,反而没人能修
- 用了AI之后,工程师为什么更累了
- 光刻挑战赛:把维护变成竞技
- 赛门铁闸:从7个9到8个9
- ASML的生意:设备只是入口,服务才是长期收入
- 中国市场的真实位置
- 这跟做企业系统有什么关系
- 写在最后
一个反常识的开场
先说一个可能会让你重读一遍的事实:
光刻机的精度是纳米级的——大约是头发丝直径的万分之一。但让它出错的,可能只是5滴水。
这不是段子。《硅谷101》这期节目探访了ASML上海总部,走进光刻挑战赛现场,亲身体验了决赛考题。看完你会发现一件事:造出世界上最精密的机器是一回事,让它每天稳定运转是另一回事,而后者的难度被严重低估了。
先纠正一个常见误解:这期节目的主角不是光刻机本身,是维护光刻机的人。他们要解决的问题是:理论上成立的光路,实际搭建未必顺利;照着图纸组装,也可能遇到图纸上没写的零件问题。
在不同机型、不同使用方式下,会有没有标准答案的故障。
这是全片的核心命题,也是这篇要讲清楚的东西。
5滴水:不是玄学,是纳米级的因果链
这个案例来自《造光者》(Focus: The ASML Way,作者马克·海因克,ASML授权三年深度采访数百位内部人士)。
台积电凤凰城厂区的现场主任威姆·帕斯讲过一次他遇到的最棘手案例:
“厂区内有一台浸润式机台经常出现莫名其妙的故障;每次重新开机后的两小时都会生产出有瑕疵的晶片,然后又恢复正常,仿佛什么事也没发生过。”
注意这里的诡异之处:故障是"每次重启后两小时",然后自动恢复。而且恢复之后不留任何痕迹。
排查了几个月才找到原因:机器停止运转时,有5滴水珠落在胶层上,导致胶层膨胀数奈米。
这几点水造成的膨胀让晶片图案出现偏移。等到水分蒸发后,胶层恢复原状,机器"看起来"完全正常——所以你找不到任何出错的蛛丝马迹。
为什么这个案例值得反复讲
把因果链拆开看,这一步惊险的地方在于每一环都合理,只有连起来才致命:
| 环节 | 状态 | 单独看严重吗 |
|---|---|---|
| 水滴落在胶层上 | 发生 | 不严重,工况里常见的微量水汽 |
| 胶层膨胀数奈米 | 发生 | 不严重,在材料形变公差内 |
| 晶片图案偏移 | 发生 | 致命——良率直接崩 |
| 水分蒸发,胶层复原 | 发生 | 看起来是"故障自愈" |
这是一条典型的"小偏差被放大"链路:每一步都在正常范围内,累积到第3步就越过了产线红线。
用做系统的语言类比:某个服务的重试逻辑在正常情况下只会多打一次日志;但如果它和另一个超时配置叠加,就会在特定请求组合下把缓存打穿——两个单独都没问题的配置,组合起来就是故障。
更早的一个同类故事:氧气让镜子自己变干净
ASML还遇到过另一个反直觉现象:工程师发现"每次打开真空系统更换零件时,EUV光源的反射镜竟然会自动变干净"。什么都没做,一打开就干净了。
团队里的化学家推测是氧气跑进去了。经过一系列测试证实了这个猜测:在原本清洁用的氢气中,只要再加入一点氧气,光源的反射镜就能持续运作更久。
这个案例的价值在于:它把"玄学"翻译成了"没找到的物理机制"。现象是真的,解释是缺的——找到缺失变量,污染问题就解决了。
还有更离谱的:牛打嗝、亡灵和红色小帐篷
书里还记了几个更离奇的事故,我挑三个最有代表性的。
英特尔:牛放屁和打嗝导致良率下降
英特尔有一段时间,晶圆厂每天良率都莫名其妙下降几小时。
研究人员想破头才发现,元凶是附近乳牛场排放的甲烷气体。每天凌晨1点到2点之间风向改变,甲烷穿过空气过滤系统溜进无尘室,导致良率下降。
英特尔的解决方案非常直接:花3座牧场的钱请它们搬走。此后所有为晶圆厂选址的人都知道,要特别注意厂区附近有没有牧场。
亚利桑那某厂:请萨满巫师
大约20年前,亚利桑那某座晶圆厂的曝光机频频出问题。厂内工程师说:“从技术角度完全无法解释,不只是ASML设备出状况,所有系统都有问题。”
厂长认为"晶圆厂一定是被诅咒了",于是请来一位萨满巫师。
萨满到现场后发现问题所在:工厂入口处的水泥方尖碑看起来很像墓碑。他指出"想安抚亡灵,最好先把那些东西拿掉";接着穿上无尘衣检查生产线,检查完对厂长说"亡灵喜欢红色",然后默默离开。
现场刚好有一个ASML镜头包装箱是亮红色的。厂长把纸箱折成一个小帐篷放在曝光机上。
不可思议地,所有问题都奇迹般消失了。那个红色小帐篷在机台上放了好多年,没人敢动它。后来这家晶圆厂订购车台时,还特别向ASML提出要求:能不能在第二台机器上也放一个红色小帐篷。
ASML的回应是:“Of course no problem!”
一个必须记住的判断
这三个故事有一个共同的正确读法:它们不是"晶圆厂搞玄学",而是"系统复杂到超出人的直觉范围时,人会退回到经验性动作"。
萨满的做法,本质上是做了一次变量隔离实验——把"看起来可疑的变量"(方尖碑)移除,看问题是否消失。红色帐篷也是同样的逻辑,只是变量选得更荒诞。
这里有一个值得警惕的陷阱:变量隔离实验在变量选择错误时,会产生"我做了什么所以有效"的错误归因。方尖碑被移走可能真的有用,但也可能只是恰好赶上了某次维护窗口期。
真实系统里做变更时,这条特别重要:如果你没有对照组,你无法区分"是我的改动生效了"和"问题自己恰好消失了"。很多企业的"最佳实践"就是这么来的——包括那条"改完就好了,所以我们把它写进了规范"。
为什么最难修的故障,反而没人能修
ASML的书里提到,公司史上最忙乱的一年,新建物流中心"5L"完全瘫痪,所有进出货卡住,机台出不了货。客户打电话问"我的机台在哪",才让公司惊觉事态严重。
这反映了他们"技术至上"的文化盲点:因为能做出最顶尖的EUV机台,就以为任何事情都难不倒他们。结果在最基础的物流交货上跌了一跤。
书里还记了一个数字:曝光机是最快的设备,每小时可产生300片晶圆,而晶圆上的每颗晶片价值达25万美元。
曝光机通常能维持98%至99%的运作率(定期保养的情况下)。也就是说,即使一切正常,那1%到2%的停机造成的损失也是天文数字。
这个数字给了你看问题的一个新角度:
| 状态 | 设备状态 | 良率影响 | 谁在管 |
|---|---|---|---|
| 正常 | 98%-99% 运作 | 1%-2% 损失 | 计划保养 |
| 异常可抢救 | 线缆松脱、螺丝未锁紧、工具掉落、镜头指纹刮痕 | 可控 | 现场工程师 |
| 异常难查 | 5滴水导致的胶层膨胀 | 反复出现,无痕迹 | 跨学科团队+数月排查 |
| 异常无解 | 良率莫名下降几小时 | 每日损失 | 只能请牧场搬走 |
这张表说明一件事:故障的"可诊断性"比"严重性"更决定成本。螺丝松脱严重但好查,5滴水轻微但难查——后者才是真正吞掉利润的地方。
用了AI之后,工程师为什么更累了
这是全片最有价值的部分,也是很多"AI+行业"叙事里被刻意回避的部分。
节目里的原话是:
“即使用上AI,工程师也没有因此更轻松:他们既要用真实案例’养’AI,也要验证和取舍AI给出的方案。”
以及那个最扎人的提问:
“如此先进的机器,为什么有些维护操作仍只能靠人手?当AI能查资料、辅助诊断,工程师的门槛为何没有降低?”
这不是"AI没用",而是一个更精确的判断:AI改变的不是门槛的高度,是门槛的位置。
这张图的重点在右侧那条回路:工程师的工作不是"用AI",而是"给AI喂它没见过的东西"。
这解释了一个反常现象——为什么在AI能力最强的晶圆厂,维护工程师的门槛没有降低。因为AI的能力上限,取决于你有多少已知的真实案例;而真实案例永远来自那些AI帮不上忙的时刻。
一个具体的判断:你的组织引入AI之后,有没有一条机制把"AI解决不了的案例"系统性地沉淀下来?如果没有,AI的能力会停滞在"已解决过的问题"上,而真正值钱的那部分问题——第一次遇到的那种——永远还是靠人。
什么工作仍然只能靠人
节目里给出的答案很明确:不同机型、不同使用方式下的故障,没有标准答案。
这句话需要拆开理解:
- 有标准答案的:说明书上的操作、更换步骤、常规保养——这些AI能查、能教、能自动化
- 没有标准答案的:这台机器在这个特定工况下出了这个特定现象——这需要把"这个机型+这条产线+这批晶圆+这个季节的气候"作为一个整体来理解
第二种能力,是十几年积累的情境化直觉。它不是知识,是"我见过类似的"。
这个判断对企业AI项目的直接含义:如果你打算用AI替代专家,第一个要问的是——你要替代的到底是"查资料"还是"在具体情境下判断"?前者AI今天就能做,后者AI还差得远。把预算和期望放对位置,是这类项目最常见的失败原因。
光刻挑战赛:把维护变成竞技
节目探访的是ASML上海总部的光刻挑战赛。这个设计的巧妙之处在于:它把"维护"这件平时看不到的工作,变成了可比赛、可量化、可传播的东西。
决赛考题看起来跟专业毫不相关:搭光路、拼积木。
但这些考题设计的每一项都对应真实维护工作的难点:
| 考题形式 | 对应的真实工作难点 |
|---|---|
| 理论上成立的光路 | 实际搭建未必顺利——纸面正确≠现场可行 |
| 照着图纸组装 | 会遇到图纸上没写的零件问题 |
| 限时完成 | 产线停机的每一分钟都是真金白银 |
这背后是一个我认为极有价值的认知:专业能力的本质,不在知识量,在"把抽象问题在具体约束下解决"的能力。搭光路考的不是光路理论,是空间感和手上功夫——这两种东西无法靠读书获得。
把维护做成竞赛,这个做法可以直接借鉴到任何行业的技能传承上。让新人通过"动手做对一件事"获得正反馈,比通过考试获得正反馈更接近真实工作。
赛门铁闸:从7个9到8个9
Waymo安全研究团队用"nines"(9)来比喻可靠性提升的难度,这个框架我认为值得整个AI行业都记住:
从90%提升到99%或许相对容易,但继续把可靠性再提高1个"9",所需投入会远高于此前。
| 可靠性等级 | 表述 | 意味着 |
|---|---|---|
| 90% | 7个9 | 100次里失败10次 |
| 99% | 2个9 | 100次里失败1次 |
| 99.9% | 3个9 | 1000次里失败1次 |
| 99.99% | 4个9 | 1万次里失败1次 |
从7个9到8个9,难度是指数级上升的。
这解释了为什么做AI应用的公司常常在90%这一档卡住:demo能跑、试点能用、规模化就崩。因为从"大部分时候好用"到"几乎总是好用",需要的是完全不同的工程投入——而这部分投入通常在预算里被漏掉了。
用上面的类比:你的AI系统在90%的时候,只需要找到正确的路径;在99.9%的时候,需要为每一种异常都准备一条明确的下线或转人工路径。后者的成本不是前者的一倍,是数倍。
ASML的生意:设备只是入口,服务才是长期收入
理解了维护为什么难,就理解了ASML的商业模式为什么长这样。
2026年第二季度财报(2026年7月15日发布):
| 指标 | 数值 |
|---|---|
| 季度净销售额 | 93.26亿欧元 |
| 毛利率 | 54.0% |
| 净利润 | 29.18亿欧元 |
| 装机售后服务销售额 | 27.62亿欧元 |
| 2026全年净销售额预期 | 430亿-450亿欧元(上调后) |
| 2026全年毛利率预期 | 54%-56% |
注意售后服务那一行:27.62亿欧元,占季度销售额的近30%。
这个比例说明了什么?卖设备是一次性的,维护是永久的。而且维护收入是"被装机量锁死"的——每卖出一台设备,就锁定了一份长达十年以上的服务合同。
CEO Christophe Fouquet在财报里提到产能规划:2026年约65台低数值孔径EUV产能基础上,2027年增加30%产能,正在研究2028年再增加30%。
这个产能数字隐含的信息比表面更多:一台EUV设备售价超过1.5亿欧元,产线交期已经排到几年之后。在这个行业里,最稀缺的不是技术,是产能。
中国市场的真实位置
这个部分对做产业研究的人特别有用,我核实了2026年的关键数据,并纠正一些常见误解。
| 时间 | 中国大陆市场占ASML总营收 |
|---|---|
| 2025年Q4 | 36%(当季) |
| 2025全年 | 33%(全年第一大市场) |
| 2026上半年 | 约16%(29亿欧元) |
| 2026全年预期 | 约20%(CFO Roger Dassen) |
注意这个趋势:占比在下降,且是政策驱动的下降,不是需求驱动的。
伯恩斯坦高级分析师戴维·戴指出,预计未来24个月中国半导体设备支出将以每年约10%的速度增长——需求还在涨,但被管制卡住了供给。
三个必须知道的事实:
第一,ASML不向中国出售EUV。受多年出口管制限制,其中国业务集中在深紫外(DUV)系统和被允许的装机服务。
第二,中国在光刻机上的公开记录,是什么。上海微电子装备(SMEE)公开列出的SSX600系列,支持90nm、110nm和280nm关键及非关键层,在200mm或300mm产线上运行。另外还有面向先进封装、显示、LED、MEMS和功率器件的步进机。
但——这些公开材料不能证明中国已有国产EUV系统,或有先进浸没式DUV系统实现量产。未经验证的路线图宣称,不应当被当作已安装的制造能力。
第三,国内产业链的实际分工(这个分类很重要,很多报道搞混):
| 公司 | 定位 | 具体环节 |
|---|---|---|
| 上海微电子(SMEE) | 光刻机整机 | 前端IC光刻,先进封装,显示,特色器件 |
| 芯源微(Kingsemi) | 涂胶显影设备,不是光刻机 | 光刻前后处理,不替代曝光系统 |
| 北方华创(NAURA) | 相邻工序 | 刻蚀、PVD/CVD、ALD、炉管、清洗 |
| 中微(AMEC) | 相邻工序 | 等离子刻蚀与沉积 |
判断一家公司是不是"光刻机厂商",最直接的标准是:它能不能造出曝光系统本身。芯源微在光刻模块里不可或缺,但它和ASML不是同一层级的玩家。
还有一个正在发生的变量:MATCH法案(《技术控制多边对齐法案》)于2026年4月提交,明确旨在剥夺中国获得多数芯片制造技术的机会。该法案提出当日,ASML股价应声下跌。
如果MATCH法案通过,可能禁止中国企业购买ASML的DUV光刻机——而DUV可用于制造较不先进的半导体。
这跟做企业系统有什么关系
这期节目表面讲的是光刻机维护,实际上有四个东西可以直接搬到企业系统里。
一、"5滴水"模型:故障要按因果链查,不是按现象查
排查5滴水耗时几个月,是因为他们一直在查"哪里坏了",而答案在"哪里没问题"。
企业里的对偶场景:接口偶尔超时,第一反应是查那个接口。但真正的原因常常是某个"看起来无关"的配置——比如一条心跳间隔被调整过,或者某个下游服务的连接池上限变了。
可操作的检查清单(可以直接用):
| 检查项 | 具体问法 |
|---|---|
| 链路完整 | 从触发到结果的每一环是否都在正常范围内? |
| 时间窗口 | 问题是否总在特定时间/特定时段出现? |
| 对照组 | 有没有同样的配置在别处运行但不出问题? |
| 累积偏差 | 每一环单独看无害,但累积后是否越过了红线? |
最关键的一条:找那些"只在重启后X小时内出现"的现象——这类问题的根因几乎必然跟"重启会改变、运行中不会改变"的那个状态有关。
二、"养AI"是一条必须设计的流程,不是副产品
前面说过,AI在维护里的作用是"用真实案例养它"。这意味着组织里必须有一条机制:当AI解决不了问题时,人解决的过程要能被记录下来,成为AI的养料。
很多企业做AI项目时漏掉这一步——AI上线后就只看使用量,不看"AI解决不了的部分去哪了"。结果AI的能力很快触顶,因为它的成长被断供了。
一个具体做法:建立"AI未解决案例池",记录:输入是什么、AI给出了什么、实际怎么解决的、差异在哪。这池东西的价值不在于给AI训练,在于它是组织真实的能力地图。
三、边界上移的可靠性:每提升一个9,成本翻倍
这个框架对任何做规模化AI应用的团队都适用。
90%的做法:优化模型、调整提示词、加检索增强。
99%的做法:给每类异常准备明确的下线路径、准备人工兜底队列、准备回滚方案。
这两件事的工作量差距,通常在三倍以上。预算里如果只按前者算,规模化时必然崩。
具体建议:在做规模化的那一刻,先统计"最常见的失败case"前20种,为每一种准备一条明确处理路径。做完这件事,系统的可靠性会有一次台阶式提升——比继续优化模型有效得多。
四、技术自满是组织的病
ASML最忙乱的一年,物流中心完全瘫痪,客户打电话问"我的机台在哪"才惊觉。
这是"技术至上"文化盲点的典型样本——因为能做出最顶尖的EUV机台,就以为任何事情都难不倒他们。
这个病在企业里长什么样:技术团队做成了一件技术含量很高的事,于是默认"这证明我们团队很强",但从没验证过公司的业务流程、客户支持、数据链路是否能跟上。结果就是卡在"最后20%"的脏活上,进展全速卡死。
一个可用的自检:你的团队最近一次主动检查"我们之外的东西坏了怎么办",是什么时候?
写在最后
回到那个5滴水的故事。
全球最精密的机器之一,可能只需要5滴水就让它连续两小时产出瑕疵晶片——而且事后不留任何痕迹。
这不是在贬低工程能力,恰恰相反:它说明这台机器的维护工作已经困难到了人类直觉接不上的程度,需要靠跨学科、靠数月排查、靠几代人的经验积累才能应付。
而AI在这个环节能帮上多少?节目给的答案是:帮得上资料检索和初步定位,帮不上"这个特定现象我该往哪想"。
那么真正的问题就不是"要不要上AI",而是——
在AI成为你团队一员之后,那些AI帮不上忙的时刻,还是有人在吗?
本文的三处数据核实与补充(相对节目和通行说法):
| 说法 | 核实结果 |
|---|---|
| “光刻机精度纳米级,5滴水能让它罢工” | ✅ 案例属实,但需补正:这不是"机器罢工",是浸润式机台产出的晶片有瑕疵(重启后两小时内),机器本身不报错、恢复后无痕迹。台积电凤凰城厂区案例,源自《造光者》第17章 |
| “中国已掌握光刻机技术” | ⚠️需纠正:上海微电子公开规格为SSX600系列,支持90nm/110nm/280nm层。公开材料不能证明国产EUV或先进浸没式DUV已量产 |
| ASML中国市场地位 | ⚠️需纠正常见误读:2025年中国大陆占33%(全年第一大市场),2026年预期降至约20%,上半年实际约16%(29亿欧元)。这是政策驱动的下降,非需求下降——伯恩斯坦预计未来24个月中国设备支出仍年增约10% |
本文讨论的「故障排查判断清单」你手上有多少条?评论区贴出来,我逐条帮你补齐。