东升国际官网

72倍推理提速、7分钟长视频天生!大晓机械人开源实时天生世界模型 Kairos 3.0-4B

8 分钟阅读
东升国际官网-相信品牌力量

近日 ,大晓机械人沉磅开源开悟世界模型3.0(Kairos 3.0)-4B 系列具身原生世界模型。作为业内首个实现 “多模态理解 — 天生 — 预测” 一体化的开源具身原生世界模型 ,该模型以 “物理因果一致、跨本体泛化、超长时交互、云侧实时天生、轻量化高效力、端侧本体节造” 为主题优势 ,机能全面领跑国内表主流具出身界模型。

Kairos 3.0-4B 是全球首个可端侧驱动具身智能本体节造的世界模型 ,也是行业内首个在?THOR 端侧平台达成 1:1.5?(视频天生功夫:视频时长)实时天生的具出身界模型。该模型部署于Jetson Thor T5000?端侧平台 ,算力可达517 TFlops ,不仅能在 3D 仿真环境中精准天活力械臂活动状态、实现活动轨迹的预测与规划 ,更可依附 THOR 端侧平台实现机械人本体的真实驱动与作业执行 ,让机械人真正从“会表演”走向“能干活”。

在全球权威具身智能 Benchmark 评测中 ,Kairos 3.0-4B 各项指标全面当先。在 A800 GPU Benchmark 中 ,基于模型能力和推理工具 ,Kairos 3.0-4B 的推理速度较 Cosmos 2.5 提升 72 倍 ,刷新全球具出身界模型机能纪录 ,充分验证了其硬核技术实力。

Kairos 3.0-4B 兼具通用世界模型能力与具身场景深度赋能优势。在通用场景下 ,该模型可天生高度还原的真实物理世界 ,以黄果树瀑布为例 ,其能精准出现天然光影成效 ,支持流畅运镜且无画面跳帧 ,云、水、叶片等元素均可实现动态演化 ;同时 ,模型深度适配具身智能需要 ,凭借双沉能力买通数字仿真与物理执行 ,以中国自研主题技术破解行业主题痛点 ,为具身智能规 ;涞靥峁┲魈庖 ,成为具备全球竞争力的具出身界模型标杆。

▎以原生世界模型架构 ,筑牢具身智能对物理世界的底层认知

当前 ,具身智能行业深陷数据稀缺且割裂的困境 ,传统天生式模型仅侧器沉频天生 ,不足对物理世界的深度认知 ,因而面对长时序交互不及、部署算力成本高昂、状态预测物理一致性差等行业瓶颈。

作为业内首个实现 “多模态理解 — 天生 — 预测” 一体化的开源具身原生世界模型 ,Kairos 3.0-4B 与市面上 “大模型改款” 的天生式模型有着性质区别。该模型并非在大说话或视觉模型后单一附加活动接口 ,而是从架构底层为机械人在真实世界的运前进行设计 ,以天然界根基物理法规与因果法规为认知根基 ,构建起跨本体的统一世界理解框架 ,彻底突破传统具身智能 “行为仿照” 的技术局限 ,将模型能力升级至 “物理级深度理解” 的全新维度。

多模态1.png

萦绕 “理解世界、天生世界、预测世界” 三大主题能力 ,Kairos 3.0-4B 将物理法规与因果思想链深度嵌入模型决策过程 ,让模型做到 “知其然更知其所以然”。其主题突破在于深度融合机械人真机交互、人类行为结构化与思想链文本三类关键数据 ,有效突破多元数据壁垒 ,大幅提升真实世界数据的复用效能 ,显著优化具身智能的尺度定律效能。

多模态2.png

得益于原生架构的优势 ,该模型不再依赖昂贵且稀缺的真机数据 ,而是通过内化物理法规、推演因果逻辑 ,在更优的模型与数据规模下 ,实现强泛化、长时序推理与靠得住的端侧部署。它能精准解析物体受力、沉心、摩擦等物理约束 ,实现复杂工作的推理、规划与可行性分析 ,兼容多模态传感器指令 ,高效理解机械人作为与人类行为逻辑 ,实现从 “执行指令” 到 “理解工作” 的性质逾越。

在复杂交互场景的实测中 ,机械人可安稳端起盛有水的托盘 ,活动过程中水面出现天然真实的水颠簸态 ;将托盘搁置桌面后 ,模型凭借工作思想链自主规划 ,精准判断牛奶苹果的摆放地位 ,有序将物品规整搁置于托盘之上。

物理因果一致性全面当先全球主流模型

在倒水、叠平衡石等拥有肯定难度的物理交互场景中 ,Kairos 3.0-4B 凭借原生世界模型的物理因果一致性优势 ,通过内化物理法规与因果思想链 ,实现了物理因果一致性全面当先主流具出身界模型 ,展示出对真实世界规定的深度理解与精准复现。

在倒水场景中 ,Kairos 3.0-4B 节造机械人将水从水杯倒入水槽时 ,水流速度安稳且液体总量严格匹配水杯容量 ,齐全切合质量守恒与流体动力学法规 ;而 Cosmos 2.5 与 Lingbot 在该场景中则出现水流速度过快的问题 ,甚至出现液体总量远超水杯现实容量的异常情况 ,物理逻辑严沉失真。

在叠平衡石场景中 ,Kairos 3.0-4B 精准复现了石头的刚性与力学平衡个性 ,每一块石头的堆叠都严格遵循沉力与支持结构的物理法规 ;Cosmos 2.5 天生的石头出现悬浮景象 ,Lingbot 的石头则失落刚性属性 ,最底层的石头甚至凭空隐没 ,物理一致性彻底崩塌。

7分钟长时连贯场景动态交互

在具身智能领域 ,长时序视频天生始终是造约技术落地的主题瓶颈。

凭借 “多模态理解 — 天生 — 预测” 一体化架构 ,大晓机械人推出的 Kairos 3.0-4B ,可结合Agent智能体技术 ,在长时序视频天生能力上实现颠覆性突破。Kairos智能体可将用户复杂交互指令进行层级化解析与结构化拆解 ,依附模型对序列间的时空演化、物理规定、场景动态及交互逻辑精密化预测 ,补全陆续世界信息 ,并通过自我反思机造实现关环迭代优化。最平天生长达 7 分钟的具身动态交互视频 ,且全程维持场景连贯与物理真实 ,为具身智能的训练与落地启发了全新蹊径。

在家庭场景 Demo 中 ,机械人实现全流程一镜到底的自主作业:吓仔序整顿桌面上的杯子与纸巾盒 ,规划相宜地位摆放物品 ,随后自主进入洗衣机 ,捡拾衣服 ,打开洗衣机、完裁缝物投放与洗濯操作 ;接着穿过客厅进入厨房 ,开启冰箱取出牛奶 ,打开壁橱取出麦片 ,并打开抽屉取出碗与勺子 ,将麦片和牛奶倒入碗中 ,自主实现早餐造备。整个过程无断点 ,真实展示了模型的流畅动态交互、物体属性鉴别、切合物理规定的受力操控、柔性衣物物理表征能力 ,并依附齐全工作思想链实现多场景自主规划与连贯执行 ,验证了模型在复杂家居环境下的物理认知、长时序推理与动态交互能力 ,后续将持续提升超精密操作能力。

这一能力让具身智能可能从容应对多场景下的复杂动态工作。无论是工业造作中的长流程装配 ,还是家庭服务中的持续交互 ,Kairos 3.0-4B 都能天生连贯、真实的场景仿照 ,显著提升模型的泛化能力与部署靠得住性 ,推动具身智能从尝试室走向产业一线。

以轻量化实现高效力推理速度

Kairos 3.0-4B 模型凭借架构创新与技术突破 ,在推理效能、算力亏损、部署适配三大维度均实现业界当先 ,同时彻底突破具身智能端侧实时部署的主题瓶颈。

Kairos 3.0-4B 在行业内率先实现云侧 1:1 实时推理 ,推理速度较 Cosmos 2.5 提升 72 倍。同时 ,它也是行业首个在 THOR 平大驾侧部署的具出身界模型 ,可在端侧实现高效实时推理。依附端侧部署 ,模型可直接输出机械人从上肢得手指再到下肢的全方位节造指令 ,省去中央转译环节 ,让机械人 “想到即可做到”。

在 A800 GPU 机能 Benchmark 中 ,Kairos 3.0-4B 凭借自研的混应功夫线性把稳力算子 ,实现了算力效能与推理速度的数量级突破 ,机能全面碾压主流具出身界模型。

推理速度上 ,Kairos 3.0-4B 实现10秒天生工作耗时仅 9.5 秒 ,比 Cosmos 2.5(687.2 秒)快约 72 倍 ,比 Wan 2.2(85 秒)快约 9 倍 ,比 Lingbot(1436 秒)快约 151 倍。

Kairos 3.0-4B 以 4B 轻量化参数实现 23.5GB 显存占用 ,与 5B 的 Wan 2.2 相当 ,远低于 14B 的 Cosmos(70.2GB)和 28B 的 Lingbot(46.1GB) ,在维持极致机能的同时 ,大幅降低部署门槛 ,美满适配具身智能端侧实时推理需要 ,突破 “大参数 = 高机能” 的行业固有认知。

多模态3.jpg

Kairos 3.0-4B 凭借极低的算力亏损与显存占用 ,在单卡、多卡环境下均实现业界当先的实时推理速度 ,美满适配英伟达、沐曦、海光、壁仞等多款 GPU。其高效力个性可直接满足具身智能系统低延长、高靠得住、端侧实时部署的需要 ,无需依赖昂贵的真机数据 ,即可实现强泛化与靠得住部署。

一脑多形 ,实现多本体泛化新高度

Kairos 3.0-4B 模型另一大主题优势是壮大的多本体泛化能力 ,彻底破解了传统具身模型 “一本体一训练” 的行业痛点 ,实现 “统一大脑适配多本体、多工作” 的高效落地。

Kairos 3.0-4B 支持跨本体工作一键天生 ,可无缝适配单臂、双臂、灵巧手等分歧状态的机械人本体 ,针对统一工作无需额表训练 ,即可急剧天生适配各本体的执行战术 ,实现世界知识的高效共享与迁徙 ,适配性拉满。在硬件兼容上 ,模型深度支持智元 - 精灵 G1、松灵 - PIPER、宇树 G1 等主流机械人硬件 ,突破分歧厂商、分歧状态设备的本体壁垒。

▎权威Benchmark机能全面领跑

Kairos 3.0-4B 模型在全球权威具身智能与世界模型评测基准中展示出压倒性的综合机能 ,在具身场景实现全面领跑 ,精准验证了其 “物理级深度理解 + 高效力架构” 的主题优势。

在具身场景中 ,Kairos 3.0-4B 在三项权威 Benchmark 中均实现机能领跑:

PAI-Bench-robot(物理 AI 具身综合基准):由佐治亚理工学院与卡内基梅隆大学结合开发 ,是物理 AI 领域首个针对具身场景的综合评测框架 ,覆盖 2808 个真实世界案例 ,被全球顶尖团队宽泛选取。

Kairos 3.0-4B以80.03分领跑 ,全面超过 Cosmos 2.5-2B(78.3 分)、阿里Wan 2.2-5B(78.6 分)、Cosmos ?2.5-14B(79.4分)及蚂蚁 Lingbot(79.96分) ,验证了其在具身工作执杏注物理交互不变性上的行业第一职位。

WorldModelBench-robot TI2V(文本到具身视觉天生基准):在CVPR 2025 Workshop提出 ,是首个专门评估世界模型文本到具身视觉天生能力的基准 ,通过 67K 人类标注数据精准检测物理一致性与指令遵循能力。

Kairos 3.0-4B以9.08分超过所有竞品 ,显著当先阿里Wan 2.2-5B(8.52分)、Cosmos 2.5-14B(8.94分) ,以及Cosmos 2.5-2B、蚂蚁Lingbot(均为9.04分) ,证明其在长时序物理场景理解与天生精度上确当先性。

DreamGen Bench (PA/IF)(机械人视频天生基准):由 NVIDIA GEAR Lab 开发 ,通过物理对齐(PA)与交互保真(IF)两项主题指标 ,直接评估模型天生数据的物理合理性与交互质量 ,是机械人领域的权威评测工具。

Kairos3.0-4B的PA得分为0.529 ,大幅当先阿里Wan 2.2-5B(0.314) ,提升近70% ;同时当先Cosmos 2.5-2B(0.418)、Cosmos 2.5-14B(0.495)、蚂蚁Lingbot(0.466) ,别离提升27%、7% 和14%。IF得分为0.609 ,同样全面超过竞品 ,相较于Cosmos 2.5-2B、阿里Wan2.2-5B、Cosmos 2.5-14B、蚂蚁Lingbot ,别离提升7%、12%、27%和7% ,直接验证了其物理因果一致性的主题优势。

多模态4.jpg

多模态5.png

*(上述精度测试基于开源模型复现 ,其中robot为对应具身子集的了局)

作为中国自研的原生具出身界模型 ,Kairos 3.0-4B 直击行业数据、算力、物理推理与落地部署等主题瓶颈。该模型既可作为高效数据仿真器 ,低成本、规 ;糯笱盗肥萏辶 ,有效破解真机交互数据稀缺的行业痛点 ;更能跳出纯仿真利用领域 ,直接驱动机械人本体实现各类实体工作 ,真正买通从虚构仿真到物理执行的全链路 ,让机械人占有聪明的“大脑” ,加快具身智能智慧跃迁 ,为具身智能的规 ;涞靥峁┲魈饧际踔С ,为全球具身智能行业发展贡献了当先的中国规划。

该技术成就已上传:

Code:?

https://github.com/kairos-agi/kairos-sensenova

Hugging Face:?

https://huggingface.co/kairos-agi/kairos-sensenova-common

【网站地图】