Zero-Shot、长记忆、抗干扰,DM0.5把VLA带进真实世界
Zero-Shot、长记忆、抗干扰,DM0.5把VLA带进真实世界今天原力灵机正式发布的 DM0.5 往前推进了一步。它不只是继续提高某些固定任务上的表现,而是围绕真实世界里的泛化问题做了一次系统突。 如果深入分析,就会发现 DM0.5 这几个核心提升,都是想解决一个问题:如何让具身模型从可控环境里的能力演示,走向开放环境里的稳定执行。
搜索
今天原力灵机正式发布的 DM0.5 往前推进了一步。它不只是继续提高某些固定任务上的表现,而是围绕真实世界里的泛化问题做了一次系统突。 如果深入分析,就会发现 DM0.5 这几个核心提升,都是想解决一个问题:如何让具身模型从可控环境里的能力演示,走向开放环境里的稳定执行。
来自浙江大学 APRIL 实验室、快手主站技术部和清华大学的研究团队提出了 MobileForge,试图把手机 GUI Agent 的适配过程变成一个 “无标注、自探索、自反馈、自优化” 的闭环系统。
本文是北京大学彭宇新教授团队联合福州大学柯逍教授团队在细粒度多模态动作质量评价领域的最新研究成果,相关论文已被 ICML 2026 接收为 Spotlight,并已开源。真实世界中的多模态数据往往并不完整。在动作质量评价任务中,视频、光流、音频等模态能够从不同角度描述动作执行过程,但在实际采集时,传感器故障、环境噪声、隐私限制等因素都会导致模态缺失。
一家法国公司完成了一轮 4.8 亿欧元(约 5.5 亿美元)的融资,估值一举冲到 55 亿欧元(约 63 亿美元)。这家公司叫 Alan。它做的恰恰就是最不被看好的健康保险。但它的故事之所以值得讲,是因为 Alan 根本不是一家「用了 AI 的保险公司」,它更像是一家「顺便卖保险的 AI 公司」。
多模态 Agent 的记忆系统,过去很容易被理解成一个升级版 RAG:图片、图表、PDF 进来之后,先抽取内容、做 embedding、写进向量库;用户提问时,再用 query 做检索,把命中的top-k图片、文档页或图表一并塞进上下文,再交给多模态模型回答。整个过程中,所有原始模态信息都会不加选择的塞给大模型。
现在,我依然会使用AI,但是我不再把AI的产出当成最终答案。AI可以帮我提高效率,却不能替我承担结果。它写错一个字、弄错一条信息,最后向客户解释的是我,被领导追责的也是我。该自己做的判断,一个都不能省。
葬AI身边的朋友常常有个疑问:为什么MiniMax M3做的不够好(问了很多在做模型测评的朋友,也是类似看法),但市场仍然觉得他们是第一梯队?我朋友@朱亦辉的解释是,MiniMax M3的核心科技是叙事能力,让外界觉得他们和Kimi是一个级别,达到一个强行双骄的效果。
最新世界模型 LingBot-World 2.0 正在试图实现的事情。「一个世界只需要几秒钟就能造出来」不再仅限于预制的世界,而是让每一次生成,都是一次全新的创造。这是一个秒级生成、支持实时交互的开源世界模型。
我最近又玩了一个新的视频制作平台,名叫 Flova,它的思路就是我上边说的这个方向。它不仅仅是一个调用单个模型的生成工具,而是一个面向 AI 视频 / AI 影视创作的全能六边形 Agent。
前言 好久没有给大家整理开源工具了,最近我又翻到几个挺有意思的 AI 项目~ 今天这篇不是很重的教程,每个项目我都简单说一下它是干嘛的、适合谁、我觉得值得看的一点。 感兴趣的小伙伴可以先收藏,后面真用