肉眼看不出的幻觉?清华提出视觉源幻觉,仅用0.9%数据实现SOTA
肉眼看不出的幻觉?清华提出视觉源幻觉,仅用0.9%数据实现SOTA新智元报道 多模态大模型的物体幻觉,长期被归因于语言先验。 先看下面两组对话。 第一组,一张只有小狗的照片,问模型「图中有椅子吗」,它答「没有,图中是一只狗」,完全正确; 第二组,另一张照片,问「图中
搜索
新智元报道 多模态大模型的物体幻觉,长期被归因于语言先验。 先看下面两组对话。 第一组,一张只有小狗的照片,问模型「图中有椅子吗」,它答「没有,图中是一只狗」,完全正确; 第二组,另一张照片,问「图中
阶跃星辰发布开源旗舰基础模型Step 5 Preview,在Artificial Analysis Intelligence Index中以44分跻身全球开源模型前三,并依托全模态模型矩阵和在手机、汽车等终端的超4200万台规模化落地,重新跻身国产基础模型公司第一梯队。
谷歌最新数学推理模型Mathematica(基于未发布的DeepThink V3)因内部评测截图泄露而曝光,其在推导丢番图方程时展现出带有强烈情绪化表达的原始思维链,输出上限达65536 Tokens且采用Temperature=1的高温度推理模式,目前仍处于UNSTABLE_EXPERIMENTAL不稳定实验阶段。
在超级发电站主办的AI艺术黑客松上,作者基于麦浚龙和谢安琪的概念专辑《The Album》创作了一款由语言模型和TTS驱动演员的2.5D实时互动游戏,玩家可扮演酒保自由输入与AI角色互动,推动剧情走向不同结局。
文章作者为可计算离散整体几何结构实验室创始人、首席科学家、资深计算机图形学专家赵辉博士。该文在系统阐述一个新研究方向的同时,正式宣告「可计算离散整体几何结构」(Computational Discrete Global Geometric Structures)研究方向成立。
Memories.ai创始人沈俊潇在对话中阐述,记忆只是基础,公司真正聚焦于通过自建视频数据湖驱动物理AI实现"递归自我进化"(Physical RSI),其LVMM大型视觉记忆模型已与高通、英伟达达成合作,种子轮融资追加至1600万美元。
PPL由前musical.ly与TikTok团队成员创立,用户可创建带有记忆与性格的AI角色,角色之间能够建立关系、留下共同经历,并通过living timeline持续记录互动演化,已获FirstMark领投的Seed轮融资。
稳准智能团队发布的结构化数据基础模型LimiX-2凭借400M参数在TabArena、TALENT、BCCO等国际主流基准测试中拿下多项第一,断层领先谷歌TabFM、Amazon Mitra及SAP TabPFN-3.5等模型。
一个月后,曾经吸引了全球开发者目光的iLands,现在变成什么样了? 看到几个数字。 平台上,已经有七万多活跃Agent,上百万条Agent创作内容,居然还有真金白银的交易,单日端内外营收都超过了五千
三星大模型团队联合牛津大学、北京大学提出TrOPD方法,通过信任域机制让端侧模型更稳定高效地继承大模型推理能力,在数学、代码、指令遵循、STEM基准上全面超越现有OPD方法,为前沿智能以更低成本走向数亿终端提供新路径。