世界模型新比赛!北大、清华、北航、上交、中科大联合发布首个三视角具身世界模型榜单,新评测标准来了
世界模型新比赛!北大、清华、北航、上交、中科大联合发布首个三视角具身世界模型榜单,新评测标准来了当机器人拥有多个摄像头,它看到的世界是否仍然保持一致?
搜索
当机器人拥有多个摄像头,它看到的世界是否仍然保持一致?
训练一个顶级文生图模型,到底需要多少钱?
人类可以轻松想象一个还没做出的动作会带来什么:手一松,杯子会掉;往前一推,抽屉会合上。动作尚未发生,大脑已经预演了可能的结果。对机器人来说,具身世界模型(Embodied World Model)会根据当前观察和未来的动作,预测动作执行后的未来画面。
别无脑把Opus 5推理强度拉到max当冤大头。
让 Agent 上网查资料,已经不算新鲜事。
就在刚刚,全球首个3万亿参数级开源模型Kimi K3正式开源!https://github.com/MoonshotAI/Kimi-K3/tree/main。Moonshot AI宣布,发布Kimi K3的模型权重、技术报告,并开源支撑Kimi K3模型训练的关键Infra技术:MoonEP、FlashKDA和AgentEnv。
过去三年,3D Gaussian Splatting(3DGS)几乎成为实时3D场景重建与新视角合成的“默认答案”。
一个前沿模型,被要求随机生成一个奇数。
上周,龙虾之父Peter Steinberger 发了一条推文:我们还在讨论 Loop,还是已经转向 Graph 了?
刚读了一篇 AI4AI 论文《AI4AI at Scale》,来自 XYZ Agentic Team。还是第一次听到这个 Lab。他们用 AI4AI 的方式做出了两个很强的搜索 agent,也公开了方法。借这篇 paper 讲讲 AI4AI 到底怎么工作,下面尽量少堆术语。