具身智能正朝着“大一统”的方向发展。北京人形大模型项目的负责人鞠笑竹提到,团队在训练过程中经常出现所谓的“Aha Moment”,这使他看到了具身技术向通用人工智能(AGI)演进的潜力,由此坚定了快速迭代和系统化的技术攻坚策略。这种信心来源于对自身模型团队能力的认可,以及对具身技术快速发展规律的理解——在早期阶段,团队能够探索的方向和可能性更加广泛,而在面临更多看法分歧时,勇于选择非主流的想法更加重要。
本期节目请来了三位从大语言模型(LLM)领域转向具身大脑和世界模型研究的专家。北京人形多模态大模型的专家代勇表示,如果将具身智能的发展阶段与LLM的技术历史做对比,当前的具身智能并非处于GPT-1或GPT-3.5的阶段,反而更接近Bert。代勇解释道,Transformer架构问世后,技术界首先探索的便是Bert,它像是一个特定任务的解决方案。Bert框架下可针对各种任务进行微调,因此每个特定场景都会有其独特的微调模型。而GPT则是智能的一种“统一时刻”,它消除了Bert时期各种模型繁杂的现状,使得一个模型能够适应多种不同任务。
今日的具身智能与Bert时期颇为相似,因为它们正处于一个尚未达成一致的技术环境中,模型结构、训练方式和数据来源尚未统一。前华为AI首席专家唐都钰表示,在Bert时代的人往往并不意识到自己正处于这一阶段,研究员们会为了不同场景训练多样化模型,并通过更多数据提高Bert的能力。同时,由于Bert采用双向注意力机制,期初在理解任务上的表现可能优于GPT。
如今,具身智能行业对于大脑模型的路径存在不确定性与共识共存的现象。模型评估标准的缺失、落地场景高度依赖后训练,以及对VLA与世界模型技术路径的持续辩论,正如同Bert时代的情形。尽管如此,代勇对未来持乐观态度。他认为,从Bert到GPT的进程中,技术的无限可能反而激励了更多的探索热情,这是一个充满活力与创新的时期。唐都钰也指出,技术的不确定性为创业团队创造了更多机会。一旦技术发展趋于一致,竞争将更多地转向计算资源、工程能力和系统化。在技术尚未稳定的时刻,确实需要加大探索与创新的步伐。他也选择离开华为,筹备自己的创业项目,旨在建立一个“主动式物理因果大模型”,这将帮助实现多模态感知与底层执行的主动认知规划。
北京人形多模态大一统模型的负责人张怡对具身模型的未来展望为“大一统”。在8月20日的世界机器人大会(WRC)上,北京人形正式推出了自己的Pelican-Unify大模型,成为全国首个统一的具身世界模型,集成了视觉理解、动作控制与世界模型等多重能力。张怡认为VLA的技术不应被完全否定,而世界模型在短期内也难以反映现实,它们可以在新的技术探索中相互融合。通过探索,各项技术可以独立迭代,最终实现技术的逐步收敛。
代勇则将理想化的世界模型类比为“永动机”。如果真能够构建一个真正意义上的世界模型,便能依靠仿真完成所有训练,形成一个“数据→模型→更多数据→更强模型”的闭环,但这实际上是不切实际的,因为建立如此的世界模型需要庞大的数据积累和探索能力。技术不相信童话,智能不会凭空产生,具身智能需要的是有志于探索的人去不断发掘极致的落地场景,寻找合适的技术架构,积累高质量的数据,从而迎来自己的“GPT时刻”。
2026-08-24
2026-08-24