引用本概念的论文(1) 带可验证物理的强化学习:用连续奖励对LLM进行后训练 Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards arXiv 2607.10474
共现相关概念 在引用本概念的论文中,与下列概念同时出现的次数(降序)。 Continuous Physics Reward method · 共现 1 Hybrid Verifier method · 共现 1 PDE Solver Code Generation problem · 共现 1 Zero-shot Compositional Transfer other · 共现 1 可验证奖励强化学习 method · 共现 1