机器人世界模型与VLA基础模型进入密集发布期。原生具身模型、MoE架构、离散扩散强化学习等新方法涌现,模型能力从单摄像头导航、双臂操作扩展至全身协调控制。大晓开悟世界模型在RoboTwin等评测中超越Cosmos3,多款开源模型发布。日本启动国家级物理AI多模态基础模型开发,产业与学术合作活跃,数据规模与推理效率持续提升
7月17日进过日报
百度智能云携手小Lin说打卡2026WAIC,展示百度搭子、百度秒哒等智能体应用
百度智能云在2026WAIC现场携手@小Lin说,沉浸式展示「百度搭子」、「百度秒哒」等创新智能体应用,
7月17日
上海交大、百度智能云、地瓜机器人联合发布 dVLA-RL,首次打通离散扩散 VLA 强化学习
上海交通大学、百度智能云、地瓜机器人联合发布 dVLA-RL 强化学习训练框架,首次实现经典 PPO 算法与离散扩散 VLA 的适配,
7月11日
蚂蚁集团 Robbyant 发布 LingBot-VA 2.0,首个原生具身基础模型
蚂蚁集团旗下具身智能团队 Robbyant 发布 LingBot-VA 2.0,首个原生具身基础模型。
7月11日
北京智源发布世界基础模型 Orca,不预测 token 而建模世界下一状态
北京智源人工智能研究院(BAAI)发布世界基础模型 Orca,该模型不预测下一个 token、视频帧或机器人动作,而是通过抽象内部表征建模世界下一状态。
7月11日
Rohan Paul 介绍 LingBot-World 2.0:开源交互式视频世界模型,单次60分钟无质量衰减
Rohan Paul 介绍了 @robbyant_brain 新发布的 LingBot-World 2.0(也称 LingBot-World-Infin…
7月9日
蚂蚁灵波开源全球首个面向具身智能的MoE视频基模LingBot-Video
蚂蚁灵波科技正式开源LingBot-Video,这是全球首个基于MoE架构、面向具身智能的视频生成基础模型。
7月9日
最佳单摄像头机器人导航AI模型:Mistral 发布 Robostral Navigate
Mistral 于 7 月 8 日发布首款机器人导航模型 Robostral Navigate,参数量 8B。
7月9日
Robbyant 发布 LingBot-VLA 2.0:开源 6B 跨实体机器人视觉-语言-动作模型
Robbyant 推出 LingBot-VLA 2.0,一个 6B 参数的开源视觉-语言-动作(VLA)基础模型。
7月9日
LingBot-World 2.0 (Infinity) 开源:可交互小时级世界模型
Robbyant 开源 LingBot-World 2.0 (Infinity),一个交互式世界模型。
7月8日
RynnWorld-4D: 4D具身模型用于机器人
RynnWorld-4D 4D具身世界模型,用于机器人操作
7月8日
Odyssey超级智能在世界模型内成长
一种新型超级智能正在被构建,在世界模型内部成长
7月8日
Odyssey 的超智能路径:世界模型与自激进学习
Odyssey 指出 AI 社区过度关注静态训练,忽视动态环境对智能的塑造。
7月7日
数据规模跃升至1.5亿:蚂蚁灵波空间感知AI模型LingBot-Depth 2.0发布
蚂蚁集团旗下灵波科技7月7日发布空间感知模型LingBot-Depth 2.0,训练数据从300万扩充至1.5亿规模。
7月6日
AHA-WAM:异步快慢系统架构让世界模型"慢思考、快执行"
上海交通大学穆尧团队与百度智能云合作推出AHA-WAM,采用异步快慢系统架构,将视频生成(慢系统)与动作生成(快系统)解耦。
7月6日
生数科技世界行动模型 Motubrain 入选全球数字经济大会典型案例
生数科技的世界行动模型 Motubrain 在全球数字经济大会期间入选"人工智能赋能场景应用典型案例(2026)"。
7月5日
X-Humanoid 发布 TG-VLA:世界首个全尺寸全身 VLA 框架
X-Humanoid 推出 TG-VLA,号称世界首个全尺寸全身视觉-语言-动作(VLA)框架,旨在让整个人形机器人作为协调系统,而非仅手臂控制。
7月1日
日本应对劳动力短缺:为1000万台机器人开发的AI模型
日本经济产业省与NEDO正式委托Noetra和AIST开发"物理AI"多模态基础模型,可同时理解语言、图像、视频和传感器数据,
6月23日
爱立信全球副总裁蓝尚立:AI投资正从“大脑”转向“身体”,物理AI或将成为实现商业闭环的关键路径丨达沃斯声音
6月23日至25日,世界经济论坛第十七届新领军者年会(夏季达沃斯论坛)在辽宁大连举行。
6月23日
世界动作模型:一项综述论文
世界动作模型:一项综述
6月19日
世界模型站上智源大会C位 图灵奖得主把AI普及的时间往前拨了50年
6月12日,第八届北京智源大会在中关村国际创新中心开幕。
6月16日
Qwen-RobotWorld:具身智能体的无界世界
Qwen-RobotWorld以语言为统一动作接口,采用双流Multimodal Diffusion Transformer(MMDiT)架构,
6月16日
Qwen-RobotManip:对齐解锁机器人操作基础模型的规模化能力
Qwen-RobotManip 是通义千问基于 Qwen-VL 的视觉-语言-动作(VLA)基础模型,引入覆盖表示、运动和行为三维度的统一对齐框架。
6月12日
大晓机器人开悟世界模型在RoboTwin 2.0等具身智能评测中居首 超越Cosmos3
据获悉,大晓机器人开悟世界模型(Kairos)在RoboTwin 2.0、LIBERO-Plus、WorldModelBench Robot、Dream…
6月2日
物理AI爆发临近?英伟达发布“全能”世界模型 机器人、自动驾驶有望获强力助推
在今日举行的2026台北GTC大会期间,英伟达发布了Cosmos 3——一款基于突破性Transformer混合架构的物理AI世界模型。