过去,让机器人学会一个新任务,往往需要大量数据采集、轨迹标注和针对性的训练。


This is a AI post classified by Jev as AI research (research), kept by the AI Radar because it carries real work, not commentary.
过去,让机器人学会一个新任务,往往需要大量数据采集、轨迹标注和针对性的训练。 而 RoboICL 探索的是另一条路线: 不重新训练模型,而是让机器人从上下文中的示范里“现场学习”。 这里的 ICL,即 In-Context Learning(上下文学习)。 简单来说,就是: 给机器人看示范 → 理解任务规律 → 根据上下文推理 → 直接执行。 例如,在“模仿排序序列”的任务中,机器人首先观察人类或系统提供的一系列操作示范,理解不同物体之间的空间关系与操作顺序,然后尝试在新的场景中复现这一过程。 这背后的关键变化是: 机器人学习不再只是“记住训练数据”,而是开始尝试从少量示范中理解任务。 而当这种能力与大模型结合,问题就变得更加有意思。 大模型可以承担更高层次的任务理解与推理: 视觉观察 → 任务理解 → 动作规划 → 机器人执行 → 环境反馈 机器人因此不再只是执行预先定义好的动作,而是逐渐具备根据上下文调整行为的能力。 这也是 RoboICL 值得关注的地方: 如果机器人能够通过少量示范快速适应新任务,那么未来的机器人训练方式可能从:“为每个任务训练一个模型”逐渐走向:“让一个通用模型学会理解不同任务。” 这背后对应的,其实是具身智能一直在探索的核心问题: - 机器人能不能像人一样,通过观察和模仿快速学会一个从未见过的任务? - 从 ICL 到机器人,从语言模型
Posted by 青稞社区 (3.2k followers) 16 h ago · 9 likes · 1.1k views · view the original post on X. Kept by the AI Radar as AI research. Tools mentioned: mosi-ai.github.io.
More AI work like this
- SoupFold from KAIST: no single co-folding model wins everywhere, so learn simple… — @biogerontology
- We built AI that actually knows aging biology. Longevity-LLM (9B params) beats OpenAI… — @biogerontology
- We need more examples like this in the open-source RL ecosystem — @adithya_s_k
- "Verbalizing Subliminal Learning Effects Using Text Optimization" — @askalphaxiv
- “What Does Privileged Information Add to On-Policy Self-Distillation?” — @askalphaxiv
- “Score Centering Stabilizes Off-Policy Reinforcement Learning” — @askalphaxiv
- Banger paper from Google Cloud AI Research. — @dair_ai
- If you liked the MiMo-V2.6 livestreamed RL run, don’t forget to check out Marin’s… — @adi_baradwaj
Every post is read and classified by Jev (TypeSafe): what it is, which market it belongs to, and whether the link is a real tool. 31.3k posts from 4.7k X accounts over the last 14 days, 1.3k tools, 19 markets. Collected every 5 minutes, fully re-ranked every hour — last update 2026-09-19 21:10 UTC. Full method.