这个月去看上海的世界人工智能大会,本以为大模型、GPU芯片会是这次的主角,没想到各种具身机器人抢了风头,整个会场几百台两足、四足、轮式的机器人,不光能跳舞、打拳,还可以分拣快递、冲咖啡、情感陪伴,物理AI的概念一下子具象化了。
我在会场听不少技术大佬说同一个话题,机器人目前在尝试走进工厂和公共服务区域,但离走进家庭还有很长时间,其中一个重要原因是在scaling法则下,需要大量的数据去训练机器人各种精细动作和自主意识,也就是所谓的“世界模型”,但现在优质的训练数据非常稀缺,特别是多样化的视频数据。
为什么机器人是个“牵线木偶”?
如果你观察一个两三岁的孩子,你会发现他不需要任何人教他重力公式。他只是不断地观察、扔东西、看着水流过杯子,就能在脑子里建立起对物理规律的理解。
相比之下,现阶段的机器人大多像个“牵线木偶”,虽然能接入claude、chatgpt等顶级模型,但对物理世界规则一窍不通,需要工程师写好固定程序或者远程遥控,方式非常笨拙,比如人套上感应设备,手把手教机器人:这个杯子这样抓,那个门这样推,这样的训练可以教会机器人自己去操作。
这种真实模拟的数据质量最高,但问题是:它太贵了,而且完全没法规模化。根据Epoch AI在2025年的分析,目前全球最大的机器人模型训练所用的算力,竟然只有顶级语言模型的1%左右。原因不是没钱买显卡,而是没那么多高质量的“手把手教”的数据。
世界模型,从“死记硬背”到“脑内演练”
所谓“世界模型”,就是让机器人学会预测。简单来说,给模型一段当前的视频和它准备做的动作,它得在“脑子里”预判出下一秒会发生什么。
如果机器人预判到“我一推,杯子就会倒”,那它就理解了物理。这种能力不需要机器人真的去摔碎一万个杯子,它完全可以通过“观看”海量的真人视频来学习。
但这又带来了新的问题:你的世界模型上限,取决于它从未见过的那些视频,比如Youtube某个小博主拍的生活日常。
如果一个模型只见过实验室里干净整洁的场景,那它到了下雨天的马路上、到了杂乱的厨房里,瞬间就会变成“智障”。它需要见过无数种材质、光影、突发状况,而这种多样性,单靠实验室采集的一点点数据,很快就会枯竭。
互联网视频才是机器人真正的“精神食粮”
这时候,公开网络上的视频就成了唯一的救命稻草,比如Tiktok、Youtube、Bilibili等汇集大量真人视频的平台。
互联网上有几十上百亿段视频。有厨师拍的做饭Vlog,有路人随手拍的街景,有各种各样的手工制作教程。这些视频虽然没有机器人的动作标签,但它们包含了最珍贵的东西:物理常识。
一个机器人看了100万小时的人类生活视频后(比如Meta推出的V-JEPA 2就是这么干的),它会产生一种“语义理解”。它知道抹布是软的,石头是硬的,水流是连续的,杯子摔碎了是不可逆的。
根据某robot大厂工程师的经验,1小时的网络视频数据,在提供“世界知识”方面的价值,可能顶得上5分钟昂贵的远程操作数据。虽然转换率低,但胜在量大管饱。
难难难,怎么把这些数据“抓”下来?
公开视频数据采集说起来容易,做起来其实非常难。
很多团队在尝试建立PB级(Petabyte)的视频数据集时发现,现有的开源工具(比如常用的yt-dlp)在小打小闹时还好使,一旦规模上去了,瞬间就会崩溃。
这里有三个技术障碍:
1. 反爬阻碍
拥有高质量视频的平台(比如各大视频网站、社交平台)都有极强的反爬技术、地理位置限制和人机验证。
2. 成功率
很多开源工具在PB级规模下的提取成功率只有60%到75%左右。这意味着你不仅浪费了大量时间,还漏掉了最关键的那部分“长尾”数据——也就是那些稀有的、极具多样性的长尾场景。
3. 精准搜索
现在的机器人模型需要按“内容”找视频。比如我需要“一个人在雨中捡起湿透的纸盒”,传统的关键词搜索很难搜准,这需要的是基于视觉内容的搜索。
所以虽然公开视频数据对世界模型很重要,但想要采集大量数据并不容易。
Bright Data,给世界模型装上“数据水泵”
对于PB级别的公开视频数据,可能需要Bright Data这样的采集工具,很多人误以为它只是一个代理服务商,其实在物理AI很多公司,它已经成了基座模型训练的“底层设施”。
https://get.brightdata.com/weijun
Bright Data解决的是数据从“互联网”到“训练集”之间那段最难走的路,他们已经索引了超过100亿条互联网视频,90PB大小,并且支持通过Video Search API直接按内容进行精准搜索,你不再需要依赖那些词不达意的标题。
其次,在处理PB级的数据提取时,Bright Data能保持99%以上的成功率。这多出来的20%-30%成功率,往往决定了一个模型在处理极端情况(Edge Cases)时的鲁棒性。
最重要的是数据质量,获取原始数据只是第一步,Bright Data提供的自动化流程可以协助完成转码、质量过滤和去重,确保喂给模型的是高质量的“干货”,而不是低分辨率的垃圾片段。
小结
这次在世界人工智能大会上看到的这么多机器人,真正拉开差距的可能是构建世界模型的真实视频数据。在物理人工智能的竞赛中,算法的门槛正在变低,算力的差距可以用钱补,但高质量、大规模且多样化的数据,才是那个最终决定胜负的“定数”。
如果你的机器人只待在实验室里,它永远无法理解真实世界的复杂。而要把全世界的物理规律装进机器人的大脑,我们需要的不止是几千个G的视频,而是一套像自来水系统一样稳定、纯净、源源不断的数据基础设施。