首页 国内 国际 社会 军事 科技 财经 体育 娱乐
首页 采集科技文章 返回首页

阿里通义实验室智能计算团队推出新算法FIPO|fipo

4月7日,阿里通义实验室智能计算团队宣布推出新算法FIPO(Future-KL Influenced Policy Optimization),引入Future-KL机制,奖励关键Token,解决纯强化学习(Pure RL)训练中“推理长度停滞”难题。据该团队介绍,在32B规模的纯RL设定下,率先实现对o1-mini与同规模DeepSeek-Zero-MATH的性能反超。

📚 相关阅读

• 环比大涨74.4%!3月汽车产销回暖,新能源车出口增长1.3倍|中汽协|新能源汽车|新能源乘用车
• 英特尔正式提出“智能体PC”概念|普通用户|智能体pc
• 一年提速近两小时、从遥控到自主 、跑赢人类!人形机器人“半马”刷新纪录 真实世界大考才刚刚开始|齐天大圣
• 软银联合多家日企成立AI公司,拟推进日本国产AI基础模型研发|电气|ai公司
• 汽车公司上新越来越多,为何却更难塑造爆款?|新车|电动汽车|中国汽车|新能源汽车产业
• 捷达汽车启动品牌换新,首款纯电轿车M6将于下半年上市|新能源|产品规划|成都车展