首页 国内 国际 社会 军事 科技 财经 体育 娱乐
首页 采集科技文章 返回首页

阿里通义实验室智能计算团队推出新算法FIPO|fipo

4月7日,阿里通义实验室智能计算团队宣布推出新算法FIPO(Future-KL Influenced Policy Optimization),引入Future-KL机制,奖励关键Token,解决纯强化学习(Pure RL)训练中“推理长度停滞”难题。据该团队介绍,在32B规模的纯RL设定下,率先实现对o1-mini与同规模DeepSeek-Zero-MATH的性能反超。

📚 相关阅读

• 俄航天集团:俄计划逐步研发载人登陆火星的技术|星球|航天器|宇航员|载人登月
• 英特尔CEO:CPU正重归AI核心地位|陈立武|cpu|人工智能|知名企业
• OpenAI承诺投资逾3亿新元,在新加坡设海外首个应用AI实验室|美国|工程师|openai
• 腾讯云发布Xinference供应链投毒风险通告|密钥|云安全|知名企业|xinference
• SpaceX在星舰项目累计投入超150亿美元|原型机|spacex|飞船部署模拟卫星
• 丰田海南出行有限公司召回部分进口LX600汽车|座椅|乘员|总成|纯电动汽车|进口lx600