Lingbot-VLA
2026-09-20 16:00
计费规则:
模型库介绍

一、模型全概览

蚂蚁灵波科技围绕"感知—决策—模拟"三大核心能力,构建了完整的具身智能技术栈。截至 2026 年 9 月,已开源以下模型系列:

模型

类型

版本

首发时间

核心定位

LingBot-VLA

视觉-语言-动作

1.0 / 2.0

2026.01

机器人"通用大脑",跨本体、跨任务泛化

LingBot-VA

视频-动作世界模型

1.0 / 2.0

2026.07

边推演边行动的世界模型

LingBot-World

世界模拟器

1.0 / 2.0

2026.01 / 2026.07

实时交互式世界模型

LingBot-Video

视频基础模型

1.0

2026.07

MoE 视频生成,支撑世界模型

LingBot-Depth

空间感知/深度估计

1.0 / 2.0

2026.01 / 2026.07

让机器人"看清"物理世界

LingBot-Vision

视觉基础模型

1.0

2026.07

空间原生的具身视觉基座

LingBot-Map

流式三维重建

1.0

2026.04

单 RGB 摄像头实时 3D 重建

 

二、LingBot-VLA 1.0(视觉-语言-动作基座模型)

LingBot-VLA 1.0 由蚂蚁集团旗下蚂蚁灵波科技(Robbyant)于 2026 年 1 月 28 日正式开源,论文题为 "A Pragmatic VLA Foundation Model"(arXiv: 2601.18692)。该模型旨在为真实世界机器人操作提供通用基座,核心理念是"一脑多机"——一个模型适配多种机器人构型。

模型架构方面,LingBot-VLA 1.0 基于 Qwen2.5-VL 视觉语言模型骨干,采用 Mixture of Transformers (MoT) 架构将多模态理解能力与动作生成能力深度融合。具体而言,VLM 骨干负责编码多视角操作图像和自然语言指令,而专用的 Action Expert(动作专家)模块使用 Flow Matching 技术训练 Transformer 来生成连续的机器人动作轨迹。这种设计让模型既能理解复杂的语义指令,又能输出精确的运动控制信号。

深度蒸馏技术是 LingBot-VLA 1.0 的关键创新之一。模型通过 Vision Distillation for Depth 方法,将深度信息作为额外感知通道注入模型,使机器人能够更准确地理解三维空间关系。引入深度信息后,模型在复杂操作场景中的成功率显著提升,平均成功率攀升至 17.3%,刷新了真机评测的纪录。

训练数据方面,1.0 版本使用约 2 万小时的真实世界双臂远程操作数据进行预训练,数据来源于 9 种主流双臂机器人构型,包括 AgiBot G1、AgileX、Galaxea R1Pro、Franka 等。论文中首次展示了 VLA 模型的 Scaling Law:随着预训练数据从 3,000 小时逐步扩展到 20,000 小时,下游任务的成功率持续且显著提升。

性能表现方面,LingBot-VLA 1.0 在两大权威基准上取得了领先成绩。在 GM-100 基准(跨 3 个机器人平台、100 种任务)中,含深度信息的版本在清洁场景成功率达 88.56%、随机场景成功率达 86.68%,相比 Physical Intelligence 的 Pi 0.5 分别高出 5.82% 和 9.92%。在 RoboTwin 2.0 仿真基准(50 种任务)中同样表现优异,大幅超越 WALL-OSS 和 NVIDIA GR00T N1.6 等国际基线模型。

迁移效率方面,LingBot-VLA 1.0 展现了出色的少样本学习能力。仅需 80–150 条示教数据即可完成高质量的下游任务适配,这极大降低了将模型部署到具体机器人任务的门槛。

工程优化方面,模型训练框架相比现有 VLA 代码库实现了 1.5–2.8 倍的加速,支持 8–256 GPU 配置。模型权重、完整生产级代码和后训练代码均在 GitHub 上开源。

核心技术参数

参数

详情

参数量

~4B

骨干网络

Qwen2.5-VL

架构

Mixture of Transformers (MoT) + Flow Matching Action Expert

训练数据

~20,000 小时真实操作数据

机器人构型

9 种双臂机器人

关键创新

深度蒸馏、Flow Matching 动作头

论文

arXiv: 2601.18692

GitHub

github.com/robbyant/lingbot-vla

HuggingFace

inclusionAI/lingbot-vla

 

三、LingBot-VLA 2.0(新一代具身基座模型)

LingBot-VLA 2.0 于 2026 年 7 月 8 日正式开源,论文题为 "From Foundation to Application: Improving VLA Models in Practice"(arXiv: 2607.06403)。作为 1.0 的全面升级,2.0 版本在数据规模、模型架构、跨本体泛化能力上均实现了质的飞跃,标志着从"基础预训练"走向"可靠真机部署"的关键一步。

架构升级是 2.0 版本最核心的变化。骨干网络从 Qwen2.5-VL 升级为 Qwen3-VL-4B-Instruct,模型总参数量达到 6B。更重要的是,动作专家模块引入了稀疏 MoE(Mixture of Experts)层,使模型能够针对不同机器人构型和任务类型激活不同的专家子网络,在不增加推理计算量的前提下大幅提升模型表达能力。

统一动作空间是 2.0 版本的另一大创新。模型定义了 55 维跨本体动作槽位(Cross-Embodiment Action Slot),将 20 多种机器人构型的动作统一映射到同一表示空间。这一设计不仅支持传统的机械臂末端控制,还覆盖了头部转动、腰部弯曲、移动底盘运动和灵巧手抓取等全身自由度,真正实现了面向复杂场景的全身协同任务控制。

训练数据方面,2.0 版本的预训练数据总量达到 6 万小时,其中 5 万小时为覆盖 17 个主流机器人品牌、20+ 种构型的高质量真机操作数据,另有 1 万小时为第一视角(Egocentric)人类操作精炼数据。人类操作数据的引入使模型能够学习到更自然、更高效的操作策略,弥补了机器人数据在某些任务上的不足。

性能表现方面,LingBot-VLA 2.0 在 GM-100 评测中综合性能全面领先,超越了 Physical Intelligence 的 Pi 0.5 和 NVIDIA 的 GR00T N1.7。模型展现出更强的双臂协同操作能力和跨本体、多任务泛化能力。在多个真实机器人平台的测试中,2.0 版本相比 1.0 在任务成功率、操作稳定性和泛化范围上均有显著提升。

少样本迁移能力进一步强化。得益于更大规模、更多样化的预训练数据,2.0 版本在新任务适配时需要的示教数据更少,后训练流程更加高效。配合完整开源的后训练代码和工具链,开发者可以快速将模型部署到自己的机器人平台上。

生态建设方面,蚂蚁灵波联合觅蜂等数据采集合作伙伴,持续扩大数据覆盖面和质量。LingBot-VLA 2.0 的开源不仅包括模型权重,还提供了完整的训练框架、后训练代码和评测工具,旨在为行业提供可复用、标准化的具身智能产业基础设施。

核心技术参数

参数

详情

参数量

6B

骨干网络

Qwen3-VL-4B-Instruct

架构

MoE Action Expert + 统一动作空间

动作表示

55 维跨本体动作槽位

训练数据

60,000 小时(50k 真机 + 10k 人类操作)

机器人品牌

17 个

机器人构型

20+ 种(单臂/双臂/半人形/全人形/移动底盘+灵巧手)

论文

arXiv: 2607.06403

GitHub

github.com/robbyant/lingbot-vla-v2

ModelScope

Robbyant/lingbot-vla-v2-6b

 

四、LingBot-VA / VA 2.0(视频-动作世界模型)

LingBot-VA 是蚂蚁灵波技术体系中"世界模型"的核心组件,代表了具身智能领域对"如何让机器人理解并预测物理世界"这一根本问题的全新探索。论文题为 "Native Video-Action Pretraining for Generalizable Robot Control"(arXiv: 2607.08639)。

核心理念:传统 VLA 模型直接从视觉和语言输入映射到动作输出,而 LingBot-VA 在动作生成之前先"想象"未来世界会怎样变化——即先生成视频预测(世界模型),再基于预测结果推断最优动作。这种"先想后做"的机制让机器人能够应对更加复杂和动态的环境。

架构创新方面,LingBot-VA 2.0 的核心设计包括两大突破:(1)语义视觉-动作分词器(Semantic Visual-Action Tokenizer),将世界状态和机器人动作编码到统一的潜在空间中,使视频预测和动作生成可以共享表征;(2)前瞻推理(Foresight Reasoning),模型在生成当前动作的同时预测未来多步的环境变化,从而做出更具前瞻性的决策。

具身原生范式是 VA 2.0 区别于 1.0 的关键。1.0 版本从通用视频生成模型适配而来,而 2.0 版本基于自回归架构从零开始针对机器人控制场景进行预训练,不再依赖通用视频模型的先验,而是直接学习物理世界的因果规律。

控制频率提升是 VA 2.0 的重要工程突破。通过优化推理管线和异步控制机制,控制频率从 1.0 版本的 35 Hz 提升至 225 Hz,提速 6.5 倍。这意味着机器人可以更加实时地响应环境变化,在高速操作任务中表现更加稳定。

性能表现方面,在真实机器人操作评测中,VA 2.0 引入的几何线索和前瞻推理使任务成功率提升约 20%。模型展现出对未见过的物体和场景的良好泛化能力,验证了世界模型驱动的控制范式的有效性。

开源状态:LingBot-VA 及 VA 2.0 均已完全开源,代码和模型权重可在 GitHub 获取。

核心技术参数

参数

详情

架构

自回归视频-动作联合模型

关键创新

语义视觉-动作分词器、前瞻推理

控制频率

35 Hz (1.0) -> 225 Hz (2.0)

论文

arXiv: 2607.08639

GitHub

github.com/robbyant/lingbot-va

 

五、LingBot-World / World 2.0(世界模拟器)

LingBot-World 是蚂蚁灵波面向"世界模拟与数据生成"这一核心需求打造的基础模型,旨在为机器人训练、自动驾驶仿真和交互式内容创作提供高质量的虚拟世界生成能力。论文题为 "Infinite Worlds with Versatile Interactions"(arXiv: 2607.07534)。

1.0 版本(2026 年 1 月开源)主要解决了世界模型在长视频生成中的核心难题——"长时漂移"(Long-term Drift),即随着生成时间增长,画面逐渐模糊、结构变形甚至崩溃的问题。1.0 版本通过创新的时序一致性约束,支持最长 10 分钟的连续视频生成,同时保持场景的几何结构和物理合理性。

2.0 版本(World-Infinity) 于 2026 年 7 月正式开源,实现了四大核心升级:

  1. 无限时长生成:采用创新的因果预训练范式(Causal Pre-training),突破了传统世界模型的时间长度限制,可实现小时级的连续视频流生成,为长时间仿真和持续交互奠定了基础。
  2. 丰富交互能力:支持角色动作(攻击、射箭、施法、射击等)和环境事件(下雪、下雨等天气变化)的实时响应,用户可以随时通过输入改变世界的演化方向。
  3. 实时性能:模型规模 14B(140 亿参数),通过蒸馏技术优化推理速度,实现了 720p/60fps 的高清实时生成。在每秒生成 16 帧的情况下,端到端延迟低于 1 秒。
  4. 多样化输入:支持初始图像、历史视频上下文、相机位姿和分块文本提示等多种输入方式,为不同应用场景提供灵活的接入方式。

应用场景覆盖具身智能训练(为机器人提供大量模拟训练数据)、自动驾驶仿真(生成各种天气和路况下的驾驶场景)、游戏开发(实时生成交互式游戏世界)和创意内容制作等领域。

核心技术参数

参数

详情

模型规模

14B

分辨率/帧率

720p / 60fps

生成时长

小时级连续生成

延迟

< 1 秒(16fps)

论文

arXiv: 2607.07534

GitHub

github.com/robbyant/lingbot-world-v2

ModelScope

lingbot-world-v2-14b-causal-fast

 

六、LingBot-Video(视频生成基础模型)

LingBot-Video 是蚂蚁灵波全栈 2.0 技术体系中的视频生成基础模型,于 2026 年 7 月与其他 2.0 系列模型同期开源。它的核心定位是为具身智能生态提供高质量、高效率的视频生成能力。

架构设计方面,LingBot-Video 采用了 MoE(Mixture of Experts,混合专家)稀疏架构,这是其最重要的技术特征。模型总参数量达到 30B(300 亿),赋予了极强的表达能力和知识容量;但在每次推理时,MoE 路由机制仅激活约 3B(30 亿)参数,使得推理效率相比同等参数规模的 Dense(稠密)架构提升约 3 倍。

这种"大参数、小激活"的设计哲学很好地平衡了模型能力与部署效率之间的矛盾。对于需要实时或近实时生成视频帧的世界模型应用来说,推理速度是硬性约束,而 MoE 架构让 LingBot-Video 能够在满足实时性要求的前提下,利用更大规模的模型参数来学习更丰富的视觉规律。

在灵波生态中的角色:LingBot-Video 作为底层视频生成引擎,为 LingBot-World(世界模拟器)和 LingBot-VA(视频-动作世界模型)提供核心的视频预测和生成能力。可以说,LingBot-Video 是"让世界模型动起来"的技术基座。

技术意义:LingBot-Video 是全球首个面向具身智能的开源 MoE 视频基础模型,填补了机器人与视频生成交叉领域的空白。它的开源为学术界和产业界提供了一个强大的视频生成基座,可以在此基础上构建各种面向机器人的世界模型应用。

核心技术参数

参数

详情

总参数量

30B

激活参数

~3B(推理时)

架构

MoE(混合专家)稀疏架构

推理效率

相比 Dense 架构提升约 3 倍

定位

视频生成基础引擎

 

七、LingBot-Depth / Depth 2.0(空间感知模型)

LingBot-Depth 是蚂蚁灵波面向机器人空间感知需求开发的深度估计模型系列,解决的核心问题是"让机器人准确感知三维空间的深度信息"。深度信息是机器人进行精确操作、避障和导航的基础,而传统深度相机在镜面、玻璃、暗光等场景下往往失效,LingBot-Depth 正是为了填补这一感知盲区。

1.0 版本于 2026 年 1 月随 LingBot-VLA 1.0 同期开源,采用掩码深度建模(Masked Depth Modeling, MDM)技术,通过联合对齐 RGB 外观信息与深度信息,在深度缺失或噪声较大的区域进行智能补全。1.0 版本在 DIODE-Indoor 等基准上取得了 RMSE 0.132 的优秀成绩。

2.0 版本于 2026 年 7 月 7 日发布,实现了全面的技术升级:

  1. 数据规模跃升:训练数据从0 版本的约 300 万样本扩展到 1.5 亿规模,覆盖了更广泛的场景多样性。
  2. 基准成绩突破:在 16 项深度补全基准测试中夺得 12 项冠军,成为深度估计领域的 SOTA。DIODE-Indoor 块遮挡场景的 RMSE 相比 1.0 减半。
  3. 高难度场景处理:0 版本显著提升了对镜面反射、透明玻璃、细小物体等传统深度感知"盲区"的处理能力。与奥比中光 Gemini 330 双目深度相机协同优化后,室内场景相对误差(REL)降低超过 70%。
  4. 边缘清晰度:物体边界处的深度估计质量大幅提升,这对于机器人进行精细操作(如抓取薄物体、识别物体边缘)至关重要。

在灵波生态中的角色:LingBot-Depth 为 LingBot-VLA 提供关键的深度感知输入。VLA 模型中的深度蒸馏模块正是基于 LingBot-Depth 的能力,使决策模型能够"看到"更完整的三维空间信息。两者的结合构成了"感知->决策"的完整链路。

核心技术参数

参数

详情

训练数据(2.0)

1.5 亿样本

基准成绩(2.0)

16 项基准中 12 项第一

核心技术

掩码深度建模(MDM)

室内精度提升

REL 降低超 70%(配合双目相机)

GitHub

github.com/robbyant/lingbot-depth

 

八、LingBot-Vision(视觉基础模型)

详细版(~800 字)

LingBot-Vision 是蚂蚁灵波全栈 2.0 中的视觉感知基座,于 2026 年 7 月 7 日发布并开源。它的设计哲学是"空间原生"——不是简单地复用通用视觉模型,而是从机器人感知物理世界的实际需求出发,重新定义视觉预训练的目标和方法。

核心理念是"以边界为中心"的视觉预训练(Mask-based Pretraining)。传统的视觉预训练通常关注整体场景理解或物体识别,而 LingBot-Vision 将注意力集中在空间边界——物体轮廓、遮挡关系、深度不连续处等对机器人操作至关重要的几何信息上。这种设计直接针对机器人在密集场景中"看不清、分不清"的痛点。

效率与性能的平衡:LingBot-Vision 仅有 1B(10 亿)参数,但在多项空间感知基准上超越了参数量 7 倍的 DINOv3 模型,展现了极高的参数效率。这一特性对于需要在机器人端侧部署的感知模型来说尤为重要——更小的参数量意味着更低的推理延迟和更少的计算资源需求。

基准成绩:在 NYU 深度估计基准上,LingBot-Vision 的 RMSE 达到 0.296,刷新了 SOTA 记录。这表明该模型能够从单张 RGB 图像中准确推断场景的深度结构,为下游的深度估计、三维重建等任务提供了强大的视觉表征基础。

在灵波生态中的角色:LingBot-Vision 作为底层视觉编码器,为 LingBot-Depth 2.0(深度估计)、LingBot-Map(三维重建)等上层感知模块提供通用的视觉特征提取能力。它与 LingBot-Depth 的配合构成了完整的空间感知管线,最终为 LingBot-VLA 的决策提供精确的感知输入。

核心技术参数

参数

详情

参数量

1B

预训练策略

Mask-based(以边界为中心)

NYU 深度 RMSE

0.296(SOTA)

GitHub

github.com/robbyant/lingbot-vision

 

九、LingBot-Map(流式三维重建模型)

LingBot-Map 于 2026 年 4 月 16 日正式开源,是蚂蚁灵波在空间感知领域的又一重要贡献。它解决的核心问题是:如何在仅有普通 RGB 摄像头(无需激光雷达、深度传感器等昂贵硬件)的条件下,实时构建场景的三维结构。

架构创新:LingBot-Map 采用 Geometric Context Transformer 架构,在一个统一的 Transformer 框架内同时处理三项关键任务:(1)相机位姿估计(Camera Pose Estimation)——确定摄像头在空间中的位置和朝向;(2)密集几何线索提取——从图像中恢复像素级的深度和法线信息;(3)长程漂移校正——防止累积误差导致的三维结构失真。这种统一架构避免了传统管线中各模块独立优化带来的误差传播问题。

流式处理能力是 LingBot-Map 的核心优势。与传统的"先采集后重建"的离线方案不同,LingBot-Map 在视频采集过程中实时完成三维重建,支持 20FPS 的实时运行速度。更令人印象深刻的是,模型可以连续处理上万帧而不崩溃,这在实际应用中(如机器人持续导航、AR 设备长时间运行)至关重要。

精度对标离线方案:尽管是实时流式处理,LingBot-Map 的三维重建精度可以媲美需要大量离线计算的传统方案。测试表明,仅用一颗几十元的普通单摄像头绕建筑一圈,即可完成整栋楼的 3D 重建,效果令人瞩目。

应用场景广泛:LingBot-Map 的设计面向多种需要持续空间感知的场景——机器人导航(构建环境地图用于路径规划)、自动驾驶(实时理解道路三维结构)、AR/VR 眼镜(空间锚定和虚拟物体放置)等。

在灵波生态中的角色:LingBot-Map 为机器人提供了空间建图能力,与 LingBot-Depth(深度感知)、LingBot-Vision(视觉理解)共同构成了完整的空间感知体系。这些感知能力最终服务于 LingBot-VLA 的决策和控制。

核心技术参数

参数

详情

输入

单 RGB 摄像头

实时帧率

20 FPS

架构

Geometric Context Transformer

连续帧数

10,000+ 帧不崩溃

GitHub

github.com/robbyant/lingbot-map