HELM | arxiv 2026.04.20 | Paper Reading

HELM | arxiv 2026.04.20 | Paper Reading

HELM: Harness-Enhanced Long-horizon Memory for Vision-Language-Action Manipulation

作者提出的模型主要用于解决VLA模型在长时域操控任务上系统性失败问题,作者总结了导致失败的三个原因并提出模型去解决这个问题。并且发布了一个LIBERO-Recovery的失败恢复的扰动注入评估协议。

Read more
VPWEM | arxiv 2026.05.05 | Paper Reading

VPWEM | arxiv 2026.05.05 | Paper Reading

VPWEM: Non-Markovian Visuomotor Policy with Working and Episodic Memory

作者了提出的VPWEM总体上和MemoryVLA类似,通过工作记忆和情景记忆增强扩散策略。但是在实验上略有不同可以阅读来加深理解。

Read more
Latent Bridge | arxiv 2026.05.04 | Paper Reading

Latent Bridge | arxiv 2026.05.04 | Paper Reading

Latent Bridge: Feature Delta Prediction for Efficient Dual-System Vision-Language-Action Model Inference

作者了提出Latent Bridge,一种轻量级模型,用于预测不同时间步之间VLM输出的增量变化,使得动作头可以对预测的输出进行操作,而耗时的VLM骨干网络仅需周期性调用。

Read more
VISTA | arxiv 2026.02.12 | Paper Reading

VISTA | arxiv 2026.02.12 | Paper Reading

Scaling World Model for Hierarchical Manipulation Policies

VISTA的作者声称他们是和 π0.7 的思路一样并且比他们早2个月提出 的工作,同样用了一个世界模型去基于新颖场景生成多视角且物理一致性的子任务序列,并在每一步提供文本子任务描述与视觉目标图像

Read more
$\pi_{0.7}$ | arxiv 2026.04.16 | Paper Reading

$\pi_{0.7}$ | arxiv 2026.04.16 | Paper Reading

π0.7 : a Steerable Generalist Robotic Foundation Model with Emergent Capabilities

作者提出一种名为 π0.7 的新型机器人基础模型,该模型能够在广泛场景中实现强大的开箱即用性能。 π0.7 能够在未见过的环境中遵循多样化语言指令,包括使用各类厨房电器完成多阶段任务;实现零样本跨具身泛化,例如使机器人在未见过任务的情况下完成叠衣服;并能执行如操作意式咖啡机等高难度任务,其开箱性能可媲美经过专门强化学习微调的模型。

Read more
Memory-Augmented Vision-Language-Action Models in Embodied AI:Methodological Advances, Efficiency Challenges, and Future Directions | Reading Group

Memory-Augmented Vision-Language-Action Models in Embodied AI:Methodological Advances, Efficiency Challenges, and Future Directions | Reading Group

Memory-Augmented Vision-Language-Action Models in Embodied AI: Methodological Advances, Efficiency Challenges, and Future Directions

keywords: Memory, VLA

论文分享主题接着上次的主题主要探讨记忆在VLA系统中的设计,与我目前主攻研究的方向很契合,记忆系统的设计可能对其他方向的同学也能有所帮助

Read more
ReMem | arxiv 2026.03.13 | Paper Reading

ReMem | arxiv 2026.03.13 | Paper Reading

ReMem: Empowering Vision-Language-Action Model with Memory via Dual-Level Recurrent Queries

本文提出ReMem-VLA——一种配备两组可学习查询的循环记忆VLA模型:帧级循环记忆查询用于在连续帧间传递信息以支持短期记忆,块级循环记忆查询用于跨时间块传递上下文以实现长期记忆。这些查询通过端到端训练实现相关上下文的动态聚合与维护,在无需额外训练或推理成本的情况下隐式引导模型决策。此外,为增强视觉记忆,我们提出历史观测预测作为辅助训练目标。

Read more
SOMA | arxiv 2026.03.25 | Paper Reading

SOMA | arxiv 2026.03.25 | Paper Reading

SOMA: Strategic Orchestration and Memory-Augmented System for Vision-Language-Action Model Robustness via In-Context Adaptation

SOMA通过升级冻结的VLA策略实现无需参数微调的鲁棒上下文适应。具体而言,SOMA不微调VLA主干的前提下通过在线流程运行,包括对比式双记忆检索增强生成(RAG)、归因驱动的大型语言模型(LLM)编排器以及可扩展的模型上下文协议(MCP)干预,同时离线记忆巩固模块持续将执行轨迹提炼为可靠先验知识。实现异步离线记忆整合,持续精炼历史经验。

Read more
MemER | arxiv 2025.10.23 | Paper Reading

MemER | arxiv 2025.10.23 | Paper Reading

MEMER: SCALING UP MEMORY FOR ROBOT CONTROL VIA EXPERIENCE RETRIEVAL

MemER 摒弃了 “暴力扩展上下文长度” 的传统思路,转而让机器人学会 “主动筛选并记忆关键信息”。核心设计围绕 “分层政策” 与 “动态关键帧管理” 展开,保留了现有VLA模型的优势,同时针对性解决了长时序记忆的痛点。

Read more
RoboMME | arxiv 2026.03.04 | Paper Reading

RoboMME | arxiv 2026.03.04 | Paper Reading

RoboMME: Benchmarking and Understanding Memory for Robotic Generalist Policies

###密歇根大学、斯坦福大学和Figure AI联合完成的研究,创造了世界首个机器人记忆能力评估系统RoboMME,包含16个测试任务和77万训练步骤。

Read more
WeChatQQGoogle ScholarWeeklyLogRSS