首页 国内 国际 社会 军事 科技 财经 体育 娱乐
首页 采集科技文章 返回首页

阿里通义实验室智能计算团队推出新算法FIPO|fipo

4月7日,阿里通义实验室智能计算团队宣布推出新算法FIPO(Future-KL Influenced Policy Optimization),引入Future-KL机制,奖励关键Token,解决纯强化学习(Pure RL)训练中“推理长度停滞”难题。据该团队介绍,在32B规模的纯RL设定下,率先实现对o1-mini与同规模DeepSeek-Zero-MATH的性能反超。

📚 相关阅读

• DeepSeek V4亮点:昇腾、寒武纪完成适配,国产AI芯片生态持续扩容|deepseek
• AI让内容产能翻5倍,但为什么好IP反而更稀缺?|李渊|ip|人工智能
• OpenAI或入局自研手机,AI终端创新有望带动消费电子产业链|openai|世界移动通信大会
• 埃塞俄比亚航空订购6架波音787梦想客机|波音公司|知名企业|国产大飞机
• OPPO Find X9 Ultra系列将启动海外销售,登陆26个国家和地区|法国|瑞典|意大利|oppo|ultra
• OpenAI发布Images 2 ;特斯拉中国车机将接入豆包大模型|数智早参|视障人士|知名企业|智能机器人|openai|特斯拉(公司)