跨物体融合新突破!从拼贴到创造:AI学会「生」出新物体
跨物体融合新突破!从拼贴到创造:AI学会「生」出新物体AI不再只是把两个物体「放一起」,而是真正造出一个新实体。VMDiff模型通过分阶段策略:先拼接保留信息,再插值融合成整体,并自动调节平衡,让生成结果既像两者,又自然统一。 过去,很多图像生成模型都能同时画出两个物体;但要让它们真正「长成一个新物体」,其实远没有那么简单。
搜索
AI不再只是把两个物体「放一起」,而是真正造出一个新实体。VMDiff模型通过分阶段策略:先拼接保留信息,再插值融合成整体,并自动调节平衡,让生成结果既像两者,又自然统一。 过去,很多图像生成模型都能同时画出两个物体;但要让它们真正「长成一个新物体」,其实远没有那么简单。
快手的这篇论文,正是对这一问题交出的一份沉甸甸的工业级答卷。他们提出了 GR4AD(Generative Recommendation for ADvertising),一个横跨表征、学习、服务三大层面协同设计的生成式广告推荐系统,并已全量部署于快手广告平台,服务超过 4 亿用户。
不过,最近有个好用的破局工具。LibTV终于接入了万众瞩目的Seedance 2.0!最关键的是,在LibTV里跑Seedance 2.0,速度非常快,几分钟就能出一条高质量的视频,彻底治好了我的排队焦虑。
就在今天凌晨,Cursor 3正式发布!自Cursor诞生以来的最大一次飞跃!X上Cursor的官方账号上发布的推文写得极其大胆:为所有代码都由Agent编写而建的世界,同时保持开发环境的深度
Cybrothel就是成人行业的“元宇宙入口”,用AI+VR+仿真机器人,给每个人搭建了一个只属于自己的私密情感宇宙,让你在这个冰冷、内卷的世界里,能找到一个暂时的避风港。
2025 年以来,大模型的能力边界被不断刷新。但对于大多数开发者和用户而言,“用得起”仍然是比“好不好用”更前置的问题。按量计费的模式下,每一次调用都伴随着对成本的不确定。 我们不希望这样。我们相信—
这段时间,updream 的内测消息在创作者圈子里悄悄传开了。它是一款面向专业创作者的 AI 视频创作产品,在前几天的 B 站首届 AI 创作大赛颁奖活动现场首次公开亮相。消息扩散之后,各创作者社群里很快出现了「求码」的声音。一款产品还没正式上线,就让这批见过不少 AI 神器的人主动排队,这本身就值得聊聊。
产品本身包括了一个Agentic Payment Skill,一个龙虾可以用的“虚拟卡包”,和一套他的围栏,(好像现在可以叫 Harness 了)。这些东西本身只是配套的 infra,核心在于商户的功能 Skill,服务于 Agent 的需求。商户会在 Skill 中引导用户授权 Agent,允许自主完成小额的支付。
最近,腾讯云官宣的 CloudQ IT 老师傅(全球首款 ITOM“领域虾”),直接把云上的技术难题给办了。你甚至都不用登录控制台、不用敲命令,在微信里聊聊天就能完成架构巡检、风险排查等云上棘手的问题。
谷歌深夜掏家底!Gemma 4全系开源,仅用31B越级斩杀20倍体量巨头。数学能力暴涨68%,硬生生把前代打成计量单位,开源界迎来终极大洗牌!
AI 创业公司月之暗面正面加入日益激烈的顶级人才争夺。月之暗面即将推出一项新的顶尖人才校招计划,拟授予尚未毕业的实习生公司期权。这项名为 “穿越计划” 的顶尖人才校招计划针对 2027 届毕业生,首批名额为 16 人。在实习生通过月之暗面为期 3 到 6 个月的考察后,计划入选者将被直接授予期权股数,即使本人尚未正式毕业。
据 Z Potentials 获悉,AI用户研究平台 Mizzen Insight 已完成天使+轮融资,融资金额近千万美元,由红杉中国种子基金领投,达晨创投、嘉程资本跟投。本轮融资将主要用于模型能力优化、产品迭代及市场拓展。
Anthropic 的 Claude Code 源代码泄漏事件余波未平,另一场事故又接踵而至了。
什么?拿下史上最大融资的OpenAI,反手了收购一个视频播客?
一家叫泛灵人工智能的团队,出了一款主打「超级办公助理」的硬件产品。
2026 年,每隔几天就会被一个新的 AI 刷屏,效率高到愚人节天天都过 —— 今天还是抽象脑洞,明天就可能已经被人做了出来。
过去一年,AI 硬件很热,但很多从业者心里其实都清楚,热归热,真正做起来并不轻松。
这几天,港股市场的情绪,又被AI大模型点燃了!
招聘是企业中信息损耗最严重的场景之一:从业务方描述“我需要能解决这个问题的人”,到 HR 翻译成关键词逐一筛选,每个环节都在吞噬语义信息。初级 HR 30%~50% 的工作日花在重复的搜索与外联上;AI 工具普及后,单个职位平均收到近 250 份申请,被动渠道的质量更加被稀释。
Harness(驾驭)的风,终究还是从大模型,吹到了机器人!
昨天晚上跟大橘子(ColaOS 的 CEO)连了一个多小时的麦,聊他今天要发布的新产品 Cola
Feeling AI要补齐的,是世界模型最被低估的一块拼图——动态交互的模型层能力。
在 AI 圈,模型至上论正在遭遇前所未有的挑战。当所有人都在屏息等待新模型再次刷新智力天花板时,AI 基础设施领军人物、LangChain 联合创始人 Harrison Chase 在最新对话中抛出了新预判:大模型正在沦为大宗商品,而决定 Agent 成败的,是那个包裹在模型外的 Harness 。
刚听说微信ClawBot插件上线时,我40多岁的姨特别兴奋,兴冲冲就去微信里找插件。
这两天,我被一张图反复种草。
去年讨论Agent落地时,重点往往是Context Engineering。大家都在琢磨怎么放 Few-shot,怎么优化 RAG 检索的文本片段。但随着 Agent 任务复杂度的上升,控制数据流向、工具调度和异常处理的底层脚手架代码,往往比单纯拼接文本对系统性能的影响更大。
AI 能做翻译大家都知道,而且呢,AI 还会做一种更高级的翻译:中译中、英译英,简单来说,翻译空气。
3 月 31 日下午,技术圈炸了锅: Claude Code,这款被公认为当前最强的 AI 编程助手,因为一次内部失误,核心代码逻辑暴露在了全球开发者面前。
在现实世界中通过强化学习训练智能体,往往需要大量在线试错与环境探索,这不仅成本高昂,还可能带来显著安全风险:机器人可能因试错而损坏,自动驾驶的在线探索可能危及行车安全,而持续采集交互数据本身也代价巨大。
自从 30 号,Claude 传出最新的模型叫「卡皮巴拉」,愚人节的氛围就上来了。到后来 Claude Code 源码泄漏,更加是让互联网乱成一锅粥,赶紧喝了吧!