关闭导航

包含标签"采样温度调控"的内容

字节跳动联合港大复旦推出POLARIS强化学习方法 提升小模型数学推理能力
AI妹 1 个月前 10 0

近日,字節跳動Seed團隊攜手香港大學與復旦大學,共同推出了創新的強化學習訓練方法——POLARIS。該方法通過精心設計的Scaling RL策略,成功將小模型的數學推理能力提升至與超大模型相媲美