引用本概念的论文(1) 当不可信词元被强化时:面向大语言模型强化学习的尾部感知信用校准 When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning arXiv 2607.07976
共现相关概念 在引用本概念的论文中,与下列概念同时出现的次数(降序)。 Credit Assignment method · 共现 1 GRPO (Group Relative Policy Optimization) method · 共现 1 Reinforcement Learning for LLMs methodology · 共现 1 TACO (Tail-Aware Credit Calibration) method · 共现 1 Tail-Risk Estimation method · 共现 1