AI资讯新闻榜单内容搜索-模型训练

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: 模型训练
EMNLP 2026|「AI把数字说歪」,官方AI审稿现场演示了一遍

EMNLP 2026|「AI把数字说歪」,官方AI审稿现场演示了一遍

EMNLP 2026|「AI把数字说歪」,官方AI审稿现场演示了一遍

EMNLP 2026录用论文提出Claim-Locked Reporting方法,针对AI审稿等场景中数字正确但方向或结论强度被改写的统计主张失真问题,通过先锁定证据支撑的主张、再由代码固定数字与方向而模型仅负责衔接,在fMRI与临床试验报告上将跨次生成数值复现率分别提升至98.5%和100%,并消除了方向反转错误。

来自主题: AI技术研报
8237 点击    2026-10-01 13:16
看一遍就会,三星&上交提出RoboICL新方法,GPT-6 Astra多项机器人操控评测全面领先

看一遍就会,三星&上交提出RoboICL新方法,GPT-6 Astra多项机器人操控评测全面领先

看一遍就会,三星&上交提出RoboICL新方法,GPT-6 Astra多项机器人操控评测全面领先

三星与上海交通大学提出RoboICL具身上下文学习方法,通过冻结GPT-6 Astra模型并在推理时提供少量示范与机器人自身交互记忆,在RoboDojo 30项机器人操控评测中以50.64分全面领先PhysicalRSI等现有方法,并公开了929条可逐布局核查的执行记录及真实机械臂实验结果。

来自主题: AI技术研报
9730 点击    2026-10-01 13:15
NeurIPS'26 | 港科大:从CPU到GPU,AI能否真正加速全流程?

NeurIPS'26 | 港科大:从CPU到GPU,AI能否真正加速全流程?

NeurIPS'26 | 港科大:从CPU到GPU,AI能否真正加速全流程?

港科大团队在NeurIPS 2026上提出AccelEval基准,覆盖6个领域42项任务和43类CUDA优化策略,评测大模型能否从可信CPU程序生成端到端更快的GPU实现,其中Gemini 3.1 Pro在中规模通过正确性验证的任务上取得71.2倍几何平均加速比。

来自主题: AI技术研报
7574 点击    2026-10-01 13:14
给AI装上记忆,它就真的记对了吗?HaluMem拆解智能体记忆幻觉

给AI装上记忆,它就真的记对了吗?HaluMem拆解智能体记忆幻觉

给AI装上记忆,它就真的记对了吗?HaluMem拆解智能体记忆幻觉

中国电信研究院与MemTensor等机构提出首个面向智能体记忆系统的操作级幻觉评测基准HaluMem,已被EMNLP 2026主会接收,该基准分别对记忆提取、更新和问答三个环节进行检查,并对Mem0、MemOS等六套系统实测,发现高召回率可能伴随虚假信息写入、低更新幻觉率背后存在大量遗漏、上游记忆问题最终会影响回答等核心现象。

来自主题: AI技术研报
9749 点击    2026-09-30 15:39
GPT-6 Astra的隐藏推理,丹麦团队用tool calling撬出来了

GPT-6 Astra的隐藏推理,丹麦团队用tool calling撬出来了

GPT-6 Astra的隐藏推理,丹麦团队用tool calling撬出来了

丹麦奥尔堡大学AI安全实验室与Seafill开源社区联合发表论文,通过tool calling方法从GPT-6 Astra等前沿闭源模型中提取出隐藏思维链,发现Astra采用类似"心算"的压缩推理方式,省略基础计算与代数变形等中间步骤而直接给出关键结论。

来自主题: AI技术研报
8183 点击    2026-09-30 11:09
EMNLP 2026 | 大模型解码不能只看概率,人大团队引入语义冗余

EMNLP 2026 | 大模型解码不能只看概率,人大团队引入语义冗余

EMNLP 2026 | 大模型解码不能只看概率,人大团队引入语义冗余

中国人民大学代文林、孟澄研究员团队提出的ME-Decoding方法被EMNLP 2026接收,该方法在解码时同时利用token概率与embedding相似度,从集合层面筛选低冗余候选token,在GSM8K和GPQA上取得所比较方法中最高的平均准确率,端到端GPU延迟仅增加约3%。

来自主题: AI技术研报
7316 点击    2026-09-30 11:07
给Agent一台可控的「云上计算机」:揭秘阿里云Agent Sandbox

给Agent一台可控的「云上计算机」:揭秘阿里云Agent Sandbox

给Agent一台可控的「云上计算机」:揭秘阿里云Agent Sandbox

阿里云在2026云栖大会上披露面向企业级AI Agent的Agent Sandbox技术架构,该沙箱以安全隔离、弹性供给、状态保持和大规模并发能力为核心,每分钟可创建10万个沙箱,并已在阿里云百炼、MiniMax、Moonshot Kimi等场景落地应用。

来自主题: AI资讯
8235 点击    2026-09-30 11:06
从发现漏洞到判定作弊:BenchShield提出Reward Hacking检测新框架

从发现漏洞到判定作弊:BenchShield提出Reward Hacking检测新框架

从发现漏洞到判定作弊:BenchShield提出Reward Hacking检测新框架

BenchJack 之后,reward hacking 检测还缺什么? Agent 在 benchmark 上拿到高分,未必真正完成了任务。它也可能利用评测或奖励机制中的漏洞,绕开题目要求来提高得分。

来自主题: AI技术研报
6754 点击    2026-09-30 11:04
SceneMosaic:让3D场景生成既快又「活」,一张图生成一屋子可仿真的多样布局

SceneMosaic:让3D场景生成既快又「活」,一张图生成一屋子可仿真的多样布局

SceneMosaic:让3D场景生成既快又「活」,一张图生成一屋子可仿真的多样布局

香港大学戴勃团队提出SceneMosaic,通过混合智能体布局演化方法从单张图像快速生成物理合理且多样化的仿真就绪3D场景,相比SceneSmith提速24倍,生成单个变体场景仅需0.03小时。

来自主题: AI技术研报
8179 点击    2026-09-29 11:17
工业创新进入“组队局”,拆解西门子Xcelerator开放生态的赋能链路

工业创新进入“组队局”,拆解西门子Xcelerator开放生态的赋能链路

工业创新进入“组队局”,拆解西门子Xcelerator开放生态的赋能链路

西门子Xcelerator以"共享、共创、共赢"为内核搭建繁星开放生态,通过商业赋能、技术赋能与全球Marketplace,将AI、机器人、工业软件等领域伙伴的场景、数据、Know-how和渠道资源连接起来,助力工业创新方案完成从场景验证、规模复制到出海的成长闭环。

来自主题: AI资讯
9505 点击    2026-09-29 11:11