ECCV 2026 | 智能助手何时该主动开口?Vinci2让第一视角AI助手从「有问必答」走向「主动服务」
ECCV 2026 | 智能助手何时该主动开口?Vinci2让第一视角AI助手从「有问必答」走向「主动服务」请想象这样一种居家场景:当你戴着 AI 眼镜在厨房准备晚饭,用刀切菜时,它会立刻提醒你注意安全;当你连续几天形成举着手机长时间录像的习惯时,它会主动建议你换一种更省力的记录方式。
搜索
请想象这样一种居家场景:当你戴着 AI 眼镜在厨房准备晚饭,用刀切菜时,它会立刻提醒你注意安全;当你连续几天形成举着手机长时间录像的习惯时,它会主动建议你换一种更省力的记录方式。
本文主要介绍来自该团队的最新论文 Teaching Vision-Language-Action Models What to See and Where to Look,目前该论文已经被 ECCV 2026 正式接收,相关代码和模型已全部开源。
近日,清华大学与香港科技大学的研究团队提出 LiveEdit,一种面向通用文本指令的实时流式视频编辑框架。该方法以因果、分块的方式处理持续到来的视频,在 4 步 / 视频块的推理条件下实现 12.66 FPS 的流式编辑,并能保持被编辑区域的准确性以及未编辑区域的一致性。
长视频理解,正在成为多模态大模型的重要能力。
大规模视频扩散模型,画面越来越真,却总在“物理定律”上栽跟头。
给图像生成模型一张人物参考图,它大概率能抓住身份特征。
以往的空间音频模型,要么受限于实验室的苛刻采集条件,要么被高昂的人工标注成本卡住脖子。而团队的核心洞察是:相机的自运动本身就是一种免费的监督信号。当相机转动时,声源在声场中的相对位置随之改变——这种变化无需人工标注,模型即可从中学习空间对应关系。这项工作入选CVPR 2025 Highlight,投稿论文前2%。
近日,来自清华大学等单位的研究团队提出了AutoMIA,一种自动生成镜像错觉艺术的 AI 设计方法,用户仅需任意指定两张图片,分别对应镜子前和镜子中的图案,AutoMIA就可以自动完成3维艺术品的设计,并且支持直接3D打印出来制作艺术品。
国防科技大学虚拟现实与视觉计算团队(SAW Lab)联合先进制导与控制技术国家级重点实验室等推出面向航拍几何 3D 视觉的统一大规模数据集与评测基准 「AirZoo」。
一个月前的CVPR现场,一家中国具身智能公司的展台被围得水泄不通。