首页 国内 国际 社会 军事 科技 财经 体育 娱乐
首页 采集科技文章 返回首页

阿里通义实验室智能计算团队推出新算法FIPO|fipo

4月7日,阿里通义实验室智能计算团队宣布推出新算法FIPO(Future-KL Influenced Policy Optimization),引入Future-KL机制,奖励关键Token,解决纯强化学习(Pure RL)训练中“推理长度停滞”难题。据该团队介绍,在32B规模的纯RL设定下,率先实现对o1-mini与同规模DeepSeek-Zero-MATH的性能反超。

📚 相关阅读

• 号称年入18亿美元的“一人公司”翻车,极致效率背后是极致脆弱?|马修|萨姆|翻译|斯宾塞|安德森|加拉格尔|埃利奥特
• OpenAI就第三方开发者库安全事件发声明:未发现用户数据泄露或系统遭入侵|应用程序|网络信息|openai
• 苹果首款折叠屏手机已在试产|富士康|新产品|苹果公司|iphone手机
• 国家网信办等五部门联合公布《人工智能拟人化互动服务管理暂行办法》|国家安全|网络信息安全
• 微盟发布垂类AI Skill,接入龙虾生态|电商平台|skill
• 小K播早报|兆瓦级氢燃料航空涡桨发动机首飞成功 苹果首款折叠屏手机已在试产|电池|苹果公司|知名企业