首页 国内 国际 社会 军事 科技 财经 体育 娱乐
首页 采集科技文章 返回首页

阿里通义实验室智能计算团队推出新算法FIPO|fipo

4月7日,阿里通义实验室智能计算团队宣布推出新算法FIPO(Future-KL Influenced Policy Optimization),引入Future-KL机制,奖励关键Token,解决纯强化学习(Pure RL)训练中“推理长度停滞”难题。据该团队介绍,在32B规模的纯RL设定下,率先实现对o1-mini与同规模DeepSeek-Zero-MATH的性能反超。

📚 相关阅读

• 5月我国新能源汽车产销量同比两位数增长|中国汽车
• 理想高管与新车车展现场比拼俯卧撑|老汤|汤靖|理想汽车
• 我国火箭推进剂贮箱箱底实现量产,制作周期大幅缩短|焊缝|光板|超低温
• 别高估英伟达,别低估DeepSeek|内存|gpu|算力基础设施|deepseek
• 人形机器人半马开跑在即!去年的冠军“天工”今年将全自主参赛,无领航员、轨道及任何外部引导信号|雷达
• AI应用端震荡反弹 引力传媒涨停|蓝色光标|电力板块