AI资讯新闻榜单内容搜索-Oli

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: Oli
无需再训练即可增强性能!港大团队提出GPC框架,实现机器人「策略组合」

无需再训练即可增强性能!港大团队提出GPC框架,实现机器人「策略组合」

无需再训练即可增强性能!港大团队提出GPC框架,实现机器人「策略组合」

在机器人学习领域,提升基于生成式模型的控制策略(Policy)的性能通常意味着投入巨额成本进行额外的数据采集和模型训练,这极大地限制了机器人能力的快速迭代与升级。面对模型性能的瓶颈,如何在不增加训练负担的情况下,进一步挖掘并增强现有策略的潜力?

来自主题: AI技术研报
8257 点击    2025-10-20 14:52
多轮Agent训练遇到级联失效?熵控制强化学习来破局

多轮Agent训练遇到级联失效?熵控制强化学习来破局

多轮Agent训练遇到级联失效?熵控制强化学习来破局

在训练多轮 LLM Agent 时(如需要 30 + 步交互才能完成单个任务的场景),研究者遇到了一个严重的训练不稳定问题:标准的强化学习方法(PPO/GRPO)在稀疏奖励环境下表现出剧烈的熵值震荡,导致训练曲线几乎不收敛。

来自主题: AI技术研报
7883 点击    2025-10-19 12:06
700万参数击败DeepSeek R1等,三星一人独作爆火,用递归颠覆大模型推理

700万参数击败DeepSeek R1等,三星一人独作爆火,用递归颠覆大模型推理

700万参数击败DeepSeek R1等,三星一人独作爆火,用递归颠覆大模型推理

来自加拿大蒙特利尔三星先进技术研究所(SAIT)的高级 AI 研究员 Alexia Jolicoeur-Martineau 介绍了微型递归模型(TRM)。这个 TRM 有多离谱呢?一个仅包含 700 万个参数(比 HRM 还要小 4 倍)的网络,在某些最困难的推理基准测试中,

来自主题: AI技术研报
10046 点击    2025-10-10 13:08
苹果再发论文:精准定位LLM幻觉,GPT-5、o3都办不到

苹果再发论文:精准定位LLM幻觉,GPT-5、o3都办不到

苹果再发论文:精准定位LLM幻觉,GPT-5、o3都办不到

论文提出的方法名为 RL4HS,它使用了片段级奖励(span-level rewards)和类别感知的 GRPO(Class-Aware Group Relative Policy Optimization),从而避免模型偷懒、只输出无错误预测。

来自主题: AI资讯
10273 点击    2025-10-07 22:11
a16z最新洞察:消费级AI公司将重新定义企业软件市场

a16z最新洞察:消费级AI公司将重新定义企业软件市场

a16z最新洞察:消费级AI公司将重新定义企业软件市场

最近读到a16z合伙人Olivia Moore的一篇分析文章《 The Great Expansion: A New Era of Consumer Software》,她把这种现象称为"Great Expansion"(大扩张),我觉得她抓住了一个非常关键的趋势。

来自主题: AI资讯
8521 点击    2025-10-03 14:56
千寻智能高阳团队最新成果:纯视觉VLA方案从有限数据中学到强大的空间泛化能力

千寻智能高阳团队最新成果:纯视觉VLA方案从有限数据中学到强大的空间泛化能力

千寻智能高阳团队最新成果:纯视觉VLA方案从有限数据中学到强大的空间泛化能力

最近,千寻智能的研究人员注意到,基于模仿学习的视觉运动策略中也存在类似现象,并在论文《Do You Need Proprioceptive States in Visuomotor Policies?》中对此进行了深入探讨。

来自主题: AI技术研报
9035 点击    2025-09-29 14:31
如何构建现代化的AI团队:90%的公司都在犯同一个错误

如何构建现代化的AI团队:90%的公司都在犯同一个错误

如何构建现代化的AI团队:90%的公司都在犯同一个错误

你有没有经历过这样的场景:公司高层突然宣布"我们现在是AI优先的公司",然后看着你说"去组建一个AI团队吧",但预算和人员编制却纹丝不动?如果你点头了,那你绝对不是一个人。从Shopify到Duolingo,再到Zapier,似乎每家科技公司都在宣布自己转型为"AI优先",仿佛这是一张通往未来的船票。但现实往往更加残酷:你被赋予了AI转型的重任,却没有额外的资源去实现它。

来自主题: AI资讯
10763 点击    2025-09-09 10:57
Midoo.AI 发布:AI Agent 能否破解教育行业千亿美金的「无解方程」?

Midoo.AI 发布:AI Agent 能否破解教育行业千亿美金的「无解方程」?

Midoo.AI 发布:AI Agent 能否破解教育行业千亿美金的「无解方程」?

用 AI 学语言,正成为越来越多人的选择。我们习惯于在手机里下一个 Duolingo 或 Babbel,利用碎片时间打卡闯关,仿佛离「掌握一门外语」的目标又近了一步。

来自主题: AI资讯
8836 点击    2025-09-04 12:22
大型语言模型稳定强化学习的新路径:几何平均策略优化GMPO

大型语言模型稳定强化学习的新路径:几何平均策略优化GMPO

大型语言模型稳定强化学习的新路径:几何平均策略优化GMPO

近年来,强化学习(RL)在大型语言模型(LLM)的微调过程中,尤其是在推理能力提升方面,取得了显著的成效。传统的强化学习方法,如近端策略优化(Proximal Policy Optimization,PPO)及其变种,包括组相对策略优化(Group Relative Policy Optimization,GRPO),在处理复杂推理任务时表现出了强大的潜力。

来自主题: AI技术研报
7969 点击    2025-08-13 16:03
让强化学习快如闪电:FlashRL一条命令实现极速Rollout,已全部开源

让强化学习快如闪电:FlashRL一条命令实现极速Rollout,已全部开源

让强化学习快如闪电:FlashRL一条命令实现极速Rollout,已全部开源

在今年三月份,清华 AIR 和字节联合 SIA Lab 发布了 DAPO,即 Decoupled Clip and Dynamic sAmpling Policy Optimization(解耦剪辑和动态采样策略优化)。

来自主题: AI技术研报
9156 点击    2025-08-13 11:27