ExGRPO
-
ExGRPO 框架:经验驱动学习,引领推理新范式
当人工智能模型仍以“刷题+打分”为主流训练模式时,一支来自上海人工智能实验室、澳门大学、南京大学与香港中文大学的研究团队提出:训练不仅是做题,更要复盘、温习、内化。 他们近期发布了题为《ExGRPO:
当人工智能模型仍以“刷题+打分”为主流训练模式时,一支来自上海人工智能实验室、澳门大学、南京大学与香港中文大学的研究团队提出:训练不仅是做题,更要复盘、温习、内化。 他们近期发布了题为《ExGRPO: