大语言模型(LLM)代码生成已成为人工智能落地开发场景的核心技术,但复杂编程任务中普遍存在推理逻辑混乱、步骤可解释性差、生成代码准确率低等问题。传统过程奖励模型(PRM)在数学推理任务中表现优异,却难以适配代码生成场景,核心瓶颈在于代码缺乏天然的语义步骤拆分方式,且蒙特卡洛采样得到的局部推理奖励存在大量噪声,严重制约模型优化效果。通过函数分步拆解机制与元奖励校正双层优化策略,解决代码推理步骤模糊、局部奖励噪声污染两大核心难题。依托链式函数提示(Chain-of-Function, CoF)实现代码逻辑模块化拆分,以单元测试可信终局奖励为监督信号,通过双层元学习机制提纯局部步骤奖励,在主流代码基准测试中实现性能突破,同时显著提升生成代码的可读性与复用性,为LLM代码生成的过程监督优化提供全新范式。